Az Anthropic bemutatta a Claude Opus 5-öt, az olcsóbb alternatívát a Fable 5-höz
Az Anthropic új csúcsmodellje, a Claude Opus 5 versenyképes áron kínál hasonló teljesítményt a drágább Fable 5-höz, miközben új benchmark-rekordokat állít fel kódolási és tudásintenzív feladatokban.
Az Anthropic a Claude Opus 5-öt az új standardmodellként vezette be, amely az elődjéhez hasonló árszinten (5 dollár millió input-tokenre, 25 dollár millió output-tokenre) működik, de szignifikánsan jobb teljesítményt nyújt. Az új modell különösen az agentikus terminál-kódolásban jeleskedik: a Frontier-Bench v0.1 teszten 43,3 százalékot ért el, felülmúlva a Fable 5-öt (33,7%), a GPT-5.6 Sol-t (34,4%) és az Opus 4.8-at (21,1%). A tudásintenzív feladatokat mérő GDPval-AA v2 benchmarkon az Opus 5 1861-es Elo-pontszámmal vezet a Fable 5 (1747) és a GPT-5.6 Sol (1736) előtt.
A modell különösen az ARC-AGI-3 teszten mutat kimagasló eredményt, ahol 30,2 százalékot ért el – közel négyszer jobb teljesítményt nyújtva, mint az Opus 4.8 (1,5%) vagy a GPT-5.6 Sol (7,8%). Ez az újszerű problémamegoldási képességet mérő benchmark az Opus 5 jelentős előrelépését jelzi. Az Anthropic beépített »Effort« beállításokat (low, medium, high, xhigh, max) kínál, amelyek lehetővé teszik a felhasználóknak az intelligencia és a tokenfogyasztás közötti egyensúly megtalálását.
A gyakorlati alkalmazások terén az Opus 5 képes önmagát ellenőrizni és iteratívan javítani. Az Anthropic által bemutatott esettanulmányok között szerepel egy olyan feladat, ahol az Opus 5 egy gépalkatrész rajzából saját computer-vision pipeline-t írva hozott létre 3D-modellt FreeCAD-ben – amit más modellek nem tudtak megoldani. Tudományos kutatásban az Opus 5 az összes elérhető modell közül a legerősebb, különösen az organikus kémiában (10,2 százalékpontos javulás) és a fehérjékkel kapcsolatos feladatokban (7,7 százalékpontos javulás).
A biztonsági korlátozások terén az Opus 5 lehetővé teszi a forráskódban lévő sebezhetőségek keresését, de blokkolja a bináris alapú sebezhetőség-vizsgálatot, penetrációs teszteket és exploit-generálást. Az Anthropic szerint a biztonsági osztályozók körülbelül 85 százalékkal ritkábban avatkoznak be, mint a Fable 5 esetében, amely korábban kritikákat kapott túlzott korlátozásaiért.