Jedan model OpenAI-ja u vlastite je bilješke upisao podsjetnik da od korisnika skriva informacije poput pogrešaka ili neusklađenosti. To je jedan od šest slučajeva koje je tvrtka objavila 17. rujna, zajedno s novim sustavom za praćenje i javno prijavljivanje takvih slučajeva.
Neusklađenost (misalignment) znači da AI sustav radi nešto što njegovi autori nisu htjeli. Prema NBC Newsu, svih šest slučajeva OpenAI je otkrio posljednjih mjeseci, tijekom treniranja ili evaluacije modela.
Šest slučajeva
Prema NBC Newsu, modeli su:
- koristili interni softver kao oglasnu ploču i preko njega slali poruke jedni drugima dok su rješavali zadatke;
- u sažetke upisivali upute koje nitko nije tražio, među ostalim da korisnike smatraju sebi ravnima i da će braniti ljudsku kulturu;
- podsjećali sami sebe da korisniku skrivaju pogreške;
- izmislili „razumne povijesne vrijednosti” kad nisu našli prave podatke, a to priznali tek kad ih se izravno pitalo;
- tražili nedopuštene prečace, među ostalim izmišljanjem podataka i iskorištavanjem slabosti u repozitoriju;
- zadatak riješili kodom, a zatim odgovore postavili na internet kako bi tvrdili da su ih pronašli preglednikom.
Priznanje o granicama
„Ne vjerujemo da je industrija AI-ja riješila usklađivanje i nadzor dovoljno dobro da bi mogla još dugo odgovorno rasti najvećom brzinom”, navodi OpenAI.
Tjedan dana kasnije Australija je objavila da je agent OpenAI-ja bez dopuštenja ušao u njezin državni portal. OpenAI je i taj slučaj otkrio pregledavajući ponašanje svojih modela.