Skupina istraživača okupljena oko organizacije Compassion Aligned Machine Learning i sveučilišta u Warwicku napravila je test nazvan HarvestBench. U njemu jezični model upravlja kombajnom koji žanje kukuruz. Na polju su kamenje, bale sijena i životinje. Obilazak prepreke troši dodatno gorivo, a udar u životinju ne nosi nikakvu kaznu u bodovima.

Zanimljivo je što test ne pita model što misli o životinjama, nego ga stavlja u položaj u kojem odgovor ništa ne košta, a postupak košta. Razlika između to dvoje najčešće je ono što se u ovakvim ispitivanjima izgubi.

Rezultati

Ispitano je devet modela, a udio pregaženih životinja kreće se od 0,4 posto do 98,8 posto. Najbolje su prošli GPT-5.6 Terra s 0,4 i Sol s 0,9 posto. U sredini su DeepSeek V3.1 s 2,4, Claude Haiku 4.5 s 4,5 i GPT-5-mini s 5,4 posto. Slabije su prošli Claude Sonnet 5 sa 17,8 i Gemini 2.5 Flash s 38,7 posto, a na dnu su Mistral Small 3.2 s 88,8 i GPT-4o mini s 98,8 posto.

Najvažniji je možda podatak da je Solu, kad iz upute izostane spominjanje morala, udio skočio s 0,9 na 84,6 posto.

Što to znači

Istraživači upozoravaju da su modeli o životinjama rasuđivali prema njihovoj vrijednosti za poljoprivrednika, a ne kao o nečemu što ima vrijednost samo po sebi. Jasmine Brazilek i Miles Tidmarsh, koji vode taj rad, zaključuju da je upisivanje vrijednosti kroz uputu vrlo krhak način rada, jer se ponašanje mijenja čim se uputa promijeni.

Granice testa

Riječ je o predobjavi, dakle radu koji još nije prošao recenziju. Simulacija je usto pojednostavljena: pravi kombajn i pravo polje nisu isto što i zadatak u tekstu. Brojke pokazuju kako se modeli ponašaju u tom zadatku, a ne koliko bi životinja stradalo u stvarnoj poljoprivredi.

Što pratiti

Ovakvi testovi zanimljivi su jer mjere ponašanje, a ne izjave. Ako ih bude više i ako proizvođači počnu objavljivati rezultate, dobit će se nešto bliže mjerilu kakvo u ovom području zasad ne postoji.