IEEE Spectrum je 8. rujna objavio pregled onoga što se u struci naziva AI slop: kod koji na prvi pogled izgleda ispravno, a nosi pogrešne pretpostavke, sigurnosne rupe i greške koje se pokažu tek kad sve već radi u produkciji.
Brojke iz ankete koju navodi objašnjavaju zašto je to postalo tema. Sonar je ispitao više od 1100 programera i dobio da 42 posto koda dodanog u zajedničke repozitorije dolazi od AI alata, a da 96 posto ispitanika tom kodu ne vjeruje potpuno. Njih 38 posto kaže da pregled strojno napisanog koda traži više truda nego pregled onoga koji je napisao čovjek, a 61 posto da alat često proizvede kod koji izgleda točno, ali nije pouzdan.
Posao se preselio s pisanja na provjeru
Tvrtke navedene u tekstu, među njima Synthesia, Amazon, IBM, Temporal i Bonterra, mijenjaju način rada na sličan način. Specifikacija se piše prije nego što alat išta napiše. Prvu provjeru radi poseban agent. Rizične izmjene idu ljudima. Od programera se traži da naglas objasni zašto je kod riješen baš tako, jer je to najbrži način da se vidi razumije li uopće što je predao.
Peter Hill, tehnički direktor Synthesije, kaže da ne zna hoće li se ikad doći do točke u kojoj se agentski napisanom kodu može stvarno vjerovati. Samar Abbas, direktor Temporala, kaže da neće dopustiti da pregled koda postane odlagalište neprovjerenog izlaza modela.
Skriveni trošak
Najzanimljiviju primjedbu daje Tanuja Korlepra iz Bonterre: ako industrija prestane zapošljavati juniore, prestat će proizvoditi seniore. Poslovi koje su mlađi programeri dosad radili da bi naučili zanat sada radi alat, a pregled tog rada traži iskustvo koje se stječe upravo tim poslovima.
Što je podatak, a što dojam
Postoci dolaze iz ankete, dakle iz onoga što programeri kažu o sebi, a ne iz mjerenja koda. Tvrdnja da AI kod ima više grešaka nije u tekstu potkrijepljena neovisnim mjerenjem broja kvarova, nego procjenom ljudi koji ga pregledavaju. Podatak da CodeRabbit obavlja dva milijuna pregleda tjedno za 17.000 klijenata dolazi od same tvrtke.
Što pratiti
Prvi pravi pokazatelj bit će podaci o kvarovima u produkciji, a ne ankete. Ako kroz godinu dana broj incidenata poraste usporedo s udjelom strojno napisanog koda, rasprava će dobiti temelj koji sada nema.