Kwestia tego, w jaki sposób agent AI podejmuje kolejne decyzje, dotyczy samego serca jego architektury. U fundamentu leży tak zwana pętla odbieranie–układanie planu–wykonywanie, w której program najpierw rejestruje informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie wykonuje wybraną akcję. Cały ten obieg odtwarza się wielokrotnie, aż do osiągnięcia zamierzonego efektu.
Sercem tego procesu jest model językowy, który odgrywa rolę własnego głosu konsultacyjnego agenta. To on odczytuje polecenia użytkownika, dzieli złożone zadanie na mniejsze podzadania i proponuje kolejność ich realizacji. Otoczenie modelu stanowią dodatkowe narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent wywołuje wtedy, gdy wymaga konkretnych danych spoza swojej pamięci treningowej.
Interesującym składnikiem architektury jest tak zwana pamięć operacyjna, w której agent trzyma tło bieżącego zadania. Dzięki niej nie gubi wątku nawet wtedy, gdy proces rozciąga się na wiele etapów i wymaga przełączania między różnymi źródłami informacji. To dokładnie ta zdolność odróżnia agenta od prostego skryptu, który odtwarza jedynie wcześniej zapisaną listę poleceń.
Oddzielną sprawą pozostaje sposób oceny własnych działań. Odpowiednio skonstruowany agent potrafi zidentyfikować, że otrzymany wynik odbiega od oczekiwanego, i wrócić do wcześniejszego etapu, by podjąć próbę innej ścieżki. Taka autokorekta przybliża działanie maszyny do ludzkiego nawyku sprawdzania własnej pracy przed jej oddaniem.