Andrew Ng, osnivač DeepLearning.AI i suosnivač Coursere, u izdanju newslettera The Batch od 4. rujna napisao je da je rad s agentima za kod trenutno vještina koja se najbrže mijenja u AI inženjerstvu. Njegova glavna tvrdnja ide protiv onoga što se najčešće vidi na društvenim mrežama: najbolji rezultati ne dolaze od zadatka koji agent odradi sam do kraja, nego od kratkog kruga u kojem čovjek stalno provjerava i preusmjerava.
To je važno jer se alati poput Claude Codea, Codexa i Cursora zadnjih godinu dana prodaju upravo obećanjem samostalnosti. Ng piše da je praktična korist od vrlo dugih samostalnih zadataka pojačana preko onoga što stvarno radi, i da se posao u praksi sastoji od niza malih koraka s provjerom na kraju svakoga.
Tri faze umjesto jedne naredbe
Ng posao dijeli na tri dijela. U planiranju se istražuje postojeći kod, piše specifikacija i plan izvođenja, pa se plan pregledava zbog sigurnosnih rupa i nepotrebne složenosti. U izvođenju se agentu namjerno određuje koliko samostalnosti dobiva, a rezultat se provjerava i automatski i ljudski. U trećem dijelu, postavljanju i nadzoru, objava ide kroz cjevovod koji je propušta tek kad prođu provjere, a agenti se koriste i za čitanje zapisa i prijavu problema.
Uz to navodi pet vještina: vođenje cijelog kruga, određivanje razine samostalnosti i sigurno pokretanje agenata, pregled napravljenog, prilagodbu agenta i okoline (dodaci, MCP poslužitelji, trajni kontekst) te razumijevanje osnova, prije svega kako agent barata kontekstom i kako tipično griješi.
Savjet koji iz toga izvlači je konkretan: trud ide u odluku što se gradi, u arhitekturu, u specifikaciju i u provjeru rezultata, a ne u sam kod.
Što je tvrdnja, a što mjerenje
Ng navodi da je razgovarao s desecima vrhunskih AI inženjera i da zaključke izvodi iz tih razgovora. To je njegov dojam iz prakse, ne mjerenje. U pismu nema brojki o tome koliko posla agenti naprave bez nadzora, ni usporedbe s radom bez njih, pa tekst vrijedi čitati kao stav čovjeka koji područje dobro poznaje, a ne kao rezultat istraživanja.
Vrijedi primijetiti i da DeepLearning.AI prodaje tečajeve upravo iz tih vještina, pa pismo nije neutralan pregled stanja nego i najava vlastitog programa.
Što pratiti
Zanimljivo će biti vidjeti pojavljuju li se nezavisna mjerenja koja bi usporedila dva načina rada: dugi samostalni zadatak naspram kratkog kruga s ljudskom provjerom. Dok toga nema, tvrdnja ostaje uvjerljiva, ali neprovjerena.