NoézisAI-hírek magyarul
Modellek · The Decoder

Anthropic Claude Fable 5 minden benchmarkot vezetett, de sokszorosa az ára

Az Artificial Analysis új iparági benchmarkjaiban az Anthropic Claude Fable 5 modellje minden kategóriában első helyet szerzett, azonban költsége több százszorosát éri el az olcsóbb alternatíváknak hasonló feladatok elvégzésekor.

júl. 8.

Az Artificial Analysis benchmarking-platform hat új, iparágspecifikus teljesítménymutató-indexet közölt, amelyek a mesterséges intelligencia-modelleket pénzügy, jog, egészségügy, stratégia, mérnöki és közgazdaságtan területén tesztelik. Az Anthropic Claude Fable 5 az összes nyolc index közül az első helyet foglalta el, megelőzve az OpenAI GPT-5.5 és Google Gemini modelleit. A metodológia az amerikai O*NET-rendszerre épül, amely a valós munkafeladatokból származtatja az iparágspecifikus képességeket, például pénzügyi modellezést, szerződéselemzést vagy klinikai döntéstámogatást.

A nyílt forráskódú modellek közül a kínai GLM-5.2 vezet öt kategóriában, míg a DeepSeek V4 Pro a stratégia és operációs indexben mutat erős teljesítményt. Az eredmények összhangban vannak az LMArena független platform adataival, ahol a Claude Fable 5 szintén az első helyen áll a szöveg-, kód- és ügynök-arenákban. Az Anthropic az egyetlen laboratórium, amely mindhárom központi kategóriában vezet.

A költséghatékonyság azonban jelentős különbségeket mutat. A DeepSeek V4 Flash kevesebb mint 0,04 dollárért végez el feladatokat az összes hat indexben, míg a Claude Fable 5 a stratégia és operációs indexben 3,48 dollárt költségel feladatonként – több mint százszorosát a DeepSeek V4 Pro 0,03 dolláros árának, mindössze 12 pontos teljesítményelőny mellett. A GLM-5.2 0,26 és 0,58 dollár közötti költséggel a legjobb ár-érték arányt kínálja az nyílt forráskódú modellek között.

Az elemzés rámutat, hogy a vállalatok számára központi kérdés, hogy az Anthropic prémium modelljének teljesítménynövekedése indokolja-e a drasztikus árkülönbséget. Szakértők szerint a gyakorlatban a modellek kombinálása lehet az optimális megoldás: erőteljes orchestrator-modellek irányíthatják az olcsóbb munkavégző modelleket, vagy a frontier-modellek kezdeti fázisban szolgálhatnak a feladat megoldhatóságának feltérképezésére.

Forrás: The Decoder — „Anthropics Fable 5 dominiert in allen Benchmarks, kostet aber ein Vielfaches - The Decoder”

Ez az összefoglaló a fenti forrás alapján, mesterséges intelligenciával készült. Szerkesztőségi ellenőrzésen nem esett át; a részletekért olvasd el az eredeti cikket.

Még a modellek rovatból

Továbbiak →