Zagadnienie tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego rdzenia jego architektury. U podstaw leży tak zwana pętla odbieranie–układanie planu–wykonywanie, w której program najpierw rejestruje informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie realizuje wybraną akcję. Cały ten obieg powtarza się kilkakrotnie, aż do uzyskania zamierzonego efektu.
Sercem tego procesu jest model językowy, który odgrywa rolę własnego głosu konsultacyjnego agenta. To on interpretuje instrukcje użytkownika, dzieli złożone zadanie na mniejsze podzadania i proponuje kolejność ich wykonania. Otoczenie modelu stanowią pomocnicze narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent uruchamia wtedy, gdy potrzebuje konkretnych danych spoza swojej wiedzy treningowej.
Ciekawym składnikiem architektury jest tak zwana pamięć robocza, w której agent przechowuje tło bieżącego zadania. Dzięki niej nie gubi nici nawet wtedy, gdy procedura rozkłada się na kilka etapów i wymaga przełączania między różnymi źródłami informacji. To dokładnie ta umiejętność wyróżnia agenta od podstawowego skryptu, który wykonuje jedynie wcześniej ustaloną listę poleceń.
Oddzielną kwestią pozostaje sposób oceny własnych działań. Dobrze skonstruowany agent jest w stanie rozpoznać, że otrzymany wynik odbiega od oczekiwanego, i wrócić do poprzedniego etapu, by podjąć próbę innej ścieżki. Taka samokorekta zbliża działanie maszyny do ludzkiego nawyku sprawdzania własnej pracy przed jej złożeniem.