Claude Opus 5 négyszeresére növelte a legkeményebb MI-logikai teszt eredményét
Az Anthropic Claude Opus 5 modellje 30,2 százalékos eredménnyel új csúcsot ért el az ARC-AGI-3 benchmarkon, amely az MI-rendszerek logikai gondolkodási képességét méri. Ez több mint négyszerese az előző legjobb eredménynek.
Az Anthropic Claude Opus 5 modellje jelentős áttörést ért el az ARC-AGI-3 benchmarkon, amely az MI-rendszerek képességét méri az ismeretlen, korábban nem látott feladatok megoldásában. A modell 30,2 százalékos teljesítménnyel felülmúlta az OpenAI GPT-5.6 Sol (Max) korábbi 7,8 százalékos eredményét. Az ARC Prize elemzése szerint a teljesítménybeli ugrás az erősebb logikai gondolkodásnak köszönhető, amely lehetővé teszi az önálló felfedezést, tervezést és végrehajtást ismeretlen környezetben.
A tesztelés során az Opus 5 eddig nem tapasztalt viselkedést mutatott: feladatokat algebrai jelölésre alakított át és önállóan fogalmazott meg tükrözési egyenleteket. Az öt korábban megoldatlan feladat közül négy emberi szinten vagy afölött teljesített. A modell az ARC-AGI-2 teszten 90,4, az ARC-AGI-1-en pedig 97,5 százalékos eredményt ért el.
Az ARC-AGI-3 benchmark interaktív játék formájában működik, ahol a modellnek önállóan fel kell fedezni a szabályokat, meg kell terveznie a lépéseket és végre kell hajtania azokat. A benchmark kizárólag a nyelvmodell saját teljesítményét értékeli, külső szoftver-keretrendszer nélkül, mivel a jövőbeli AGI-rendszereknek függetlenül kell működniük.
Bár az Anthropic nem magyarázta meg a teljesítménybeli ugrást, a szakértők szerint a célzott adatcímkézés és megerősítéses tanulás valószínű tényezők. Az Opus 5 az ARC-AGI-3 nyilvános bejelentése után fejlesztésre került, ami lehetővé tette a benchmark-specifikus képességekre való célzott fejlesztést. Azonban más tesztek, mint a Witness privát benchmark, kisebb előrelépést mutatnak, ami arra utal, hogy az előrelépés részben a benchmark-specifikus optimalizálásnak is köszönhető.