Újabb kutatás állapította meg, hogy egyelőre még az élvonalbeli mesterségesintelligencia-modellek is elég messze vannak attól, hogy képesek legyenek elfogadható módon ellátni az összetett munkahelyi feladatokat.

A Kaliforniai Egyetem (Berkeley) kutatói több mint 50 iparágban tették próbára a népszerű nagy nyelvi modellek képességeit, és 25 százalék alatti teljesítményt mértek az Agent's Last Exam (ALE) néven hivatkozott, valós szakmai munkafolyamatok értékelésére szolgáló teszt során. Az ALE célja annak meghatározása, hogy a mesterséges intelligencia mennyire áll készen a gyakorlati munkahelyi felhasználásra, és az eredmények alapján legjobb esetben is csak nagyon korlátozott módon: bár a professzionális feladatok jelentős részét elvileg képesek megoldani, a tartós érvelést, valódi szakértelmet és hosszú távon megbízható végrehajtást igénylő feladatokat nem képesek elfogadhatóan teljesíteni.

Ahogy a kutatók írják, az ALE legnehezebb szintjét a legfejlettebb MI-ügynökök mindegyike konkrétan 0 százalékos sikerrátával hozta le, köztük az OpenAI GPT-5.5-tel vagy Anthropic múlt hónapban bemutatott és körülrajongott Fable 5 modelljével. Az 55 foglalkozást felölelő több mint 1500, szakértők által összeállított feladat végrehajtása során ismét megerősítést nyert, hogy a mesterséges intelligenciában "még mindig hiányoznak a gyakorlati tapasztalatok a kivitelezés-központú munkafolyamatokban", mivel a gépi rendszereknek továbbra is nehézséget okoz kiválasztani a feladatok elvégzésének megfelelő módját, és abban is rugalmatlanok, ha a módszereket egy hiba miatt meg kellene változtatniuk.

Nem tudjuk, hogy ténylegesen mire képesek

A The College Fix riportja ezzel kapcsolatban a kutatás egyik vezetőjét idézi, aki szerint a technológia fejlődésének üteméről még túl korai lenne következtetéseket levonni, mivel a tudósok és a modellfejlesztők is éppen ezekre a hiányosságokra összpontosítanak, és sok esetben idővel jelentős javulást érhetnek el. A kulcstényező mindenesetre nem maga az iparág, hanem a munka jellege: a szakterülettől függetlenül a mesterséges intelligencia a feladatok megismételhetősége szerint képes a jobb teljesítményre, vagyis azok a rendszeresen ismétlődő folyamatok automatizálhatók leginkább, amelyek a kódoláshoz hasonlóan nagy mennyiségű és ellenőrizhető adatot generálnak az MI-rendszerek gyors betanításához.

A kutatók úgy látják, hogy a mesterséges intelligencia hosszabb azokban a foglalkozásokban nyer majd teret, amelyeket a rutinszerű és jól meghatározott eljárások jellemeznek, de a döntésintenzív szerepkörök hosszabb ideig ellenállóak maradnak az automatizálással szemben. Az Alliance for Secure AI szóvivője erről szólva arról beszélt, hogy a döntéshozók valószínleg nem kapnak teljes képet a mesterséges intelligencia képességeiről, mivel a szabványos referenciaértékek hiánya megnehezíti az iparági szereplők által közölt eredmények értékelését. Szerinte ehhez független tesztelésre, a korlátok és képességek átláthatóvá tételére, illetve a veszélyekkel és kockázatokkal kapcsolatos transzparenciára is szükség lenne.

Részletek a UC Berkeley oldalán »

Közösség & HR

Ezúttal lopásra hivatkozva büntetné az Egyesült Államok a kínai MI-fejlesztőket

Jönnek fel a kínai nyílt súlyú modellek, olvad a zárt forrású OpenAI és Anthropic előnye, így a Fehér Ház is beáll a versenytársaikat jogsértéssel vádoló amerikai vállalatok mögé.
 
Előrelátó tervezés és meghatározott menetrend segíti az incidensek minél gyorsabb elhárítását. Ehhez azonban sok feladatot és felelősséget kell tisztázni – még jóval azelőtt, hogy bekövetkezik a baj.

a melléklet támogatója a ONE Solutions

Egy kormányrendelet alapjaiban formálják át 2026-tól az állami intézmények és vállalatok szoftvergazdálkodási gyakorlatát.

Projektek O-gyűrűje. Mit tanulhat egy projektvezető a Challenger tragédiájából?

A Corvinus Egyetem és a Complexity Science Hub kutatói megmérték: a Python kódok közel harmadát ma már mesterséges intelligencia írja, és ebből a szenior fejlesztők profitálnak.

Rengeteg ország áll át helyi MI-platformra

Ön sem informatikus, de munkája során az információtechnológia is gyakran befolyásolja döntéseit? Ön is informatikus, de pénzügyi és gazdasági szempontból kell igazolnia a projektek hasznosságát? Mi közérthető módon, üzleti szemmel dolgozzuk fel az infokommunikációs híreket, trendeket, megoldásokat. A Bitport tizennegyedik éve közvetít sikeresen az informatikai piac és a technológiát hasznosító döntéshozók között.
© 2010-2026 Bitport.hu Média Kft. Minden jog fenntartva.