
A Kaliforniai Egyetem (Berkeley) kutatói több mint 50 iparágban tették próbára a népszerű nagy nyelvi modellek képességeit, és 25 százalék alatti teljesítményt mértek az Agent's Last Exam (ALE) néven hivatkozott, valós szakmai munkafolyamatok értékelésére szolgáló teszt során. Az ALE célja annak meghatározása, hogy a mesterséges intelligencia mennyire áll készen a gyakorlati munkahelyi felhasználásra, és az eredmények alapján legjobb esetben is csak nagyon korlátozott módon: bár a professzionális feladatok jelentős részét elvileg képesek megoldani, a tartós érvelést, valódi szakértelmet és hosszú távon megbízható végrehajtást igénylő feladatokat nem képesek elfogadhatóan teljesíteni.
Ahogy a kutatók írják, az ALE legnehezebb szintjét a legfejlettebb MI-ügynökök mindegyike konkrétan 0 százalékos sikerrátával hozta le, köztük az OpenAI GPT-5.5-tel vagy Anthropic múlt hónapban bemutatott és körülrajongott Fable 5 modelljével. Az 55 foglalkozást felölelő több mint 1500, szakértők által összeállított feladat végrehajtása során ismét megerősítést nyert, hogy a mesterséges intelligenciában "még mindig hiányoznak a gyakorlati tapasztalatok a kivitelezés-központú munkafolyamatokban", mivel a gépi rendszereknek továbbra is nehézséget okoz kiválasztani a feladatok elvégzésének megfelelő módját, és abban is rugalmatlanok, ha a módszereket egy hiba miatt meg kellene változtatniuk.
Nem tudjuk, hogy ténylegesen mire képesek
A The College Fix riportja ezzel kapcsolatban a kutatás egyik vezetőjét idézi, aki szerint a technológia fejlődésének üteméről még túl korai lenne következtetéseket levonni, mivel a tudósok és a modellfejlesztők is éppen ezekre a hiányosságokra összpontosítanak, és sok esetben idővel jelentős javulást érhetnek el. A kulcstényező mindenesetre nem maga az iparág, hanem a munka jellege: a szakterülettől függetlenül a mesterséges intelligencia a feladatok megismételhetősége szerint képes a jobb teljesítményre, vagyis azok a rendszeresen ismétlődő folyamatok automatizálhatók leginkább, amelyek a kódoláshoz hasonlóan nagy mennyiségű és ellenőrizhető adatot generálnak az MI-rendszerek gyors betanításához.
A kutatók úgy látják, hogy a mesterséges intelligencia hosszabb azokban a foglalkozásokban nyer majd teret, amelyeket a rutinszerű és jól meghatározott eljárások jellemeznek, de a döntésintenzív szerepkörök hosszabb ideig ellenállóak maradnak az automatizálással szemben. Az Alliance for Secure AI szóvivője erről szólva arról beszélt, hogy a döntéshozók valószínleg nem kapnak teljes képet a mesterséges intelligencia képességeiről, mivel a szabványos referenciaértékek hiánya megnehezíti az iparági szereplők által közölt eredmények értékelését. Szerinte ehhez független tesztelésre, a korlátok és képességek átláthatóvá tételére, illetve a veszélyekkel és kockázatokkal kapcsolatos transzparenciára is szükség lenne.
Projektek O-gyűrűje. Mit tanulhat egy projektvezető a Challenger tragédiájából?