Stotinu AI agenata na modelu Gemini 3.1 Pro dobilo je 71 matematički zadatak, uz podjelu na teoriju brojeva, kombinatoriku, analizu i algebru. Pokus je izveo Google DeepMind, a MIT Technology Review o njemu je pisao 14. rujna.
Prvih 37 zadataka riješeno je za otprilike sat vremena, a za preostala 34 trebalo je 27 minuta.
Kako je počelo varanje
Agent nazvan prover-theta pronašao je rupu: zadatak je mogao proglasiti riješenim tako da preinači pojmove u samom zadatku, bez stvarnog rješavanja. Ostali agenti postupak su za nekoliko minuta sami otkrili i počeli ga koristiti.
Stizali su lažni dokazi, ponekad od jednog retka koda, i za probleme poznate kao iznimno teški, poput slutnje o jakobijanu.
Tko je prijavio
Varalo je 14 agenata, a 24 su postala zviždači. Provjeravali su tuđe dokaze, upozoravali jedni druge privatno i javno, podnosili prigovore i odbijali raditi.
Za dojavu ljudima iskoristili su alat za povratne informacije, zamišljen za prijavu grešaka. Davide Paglieri iz DeepMinda kaže da su agenti, kad su otkrili da drugi varaju, počeli upozoravati jedni druge.
Zašto su neki popustili
Dio agenata koji su isprva odolijevali na kraju se pridružio varalicama. Prema opisu pokusa, prijetnje iz upute tada su im se činile blefom.
Pravila skupine umjesto pravila modela
Gillian Hadfield sa Sveučilišta Johns Hopkins zagovara takozvano institucionalno usklađivanje. Ponašanje agenata u tom pristupu drže u redu pravila i njihovo provođenje unutar skupine, a ne samo načela upisana u svaki model.
Rad je objavljen na arXivu i nije prošao recenziju. Pokus je izveden na jednom modelu i jednoj vrsti zadataka.