NoézisAI-hírek magyarul
Modellek · BornCity

Google Gemini 4 Pro: 88% a DeepSWE-teszten

A Google új AI-modellje, a Gemini 4 Pro (kódnév: Argon) benchmark-teszteken jelentős eredményeket ért el. A modell 88 százalékos pontszámot szerzett a DeepSWE v1.1 teszten, és több más mérésben is jól teljesített.

szept. 19.

A Gemini 4 Pro, amely a »gemini-3.8-flash« technikai megjelöléssel jelenik meg a benchmark-platformokon, fejlesztői tesztekben már lenyűgöző eredményeket produkál. A DeepSWE v1.1 teszten 88 százalékot ért el, amely körülbelül két százalékponttal haladja meg az Astra összehasonlító modellt. A GDPval-AA v2 teszten 2.064 Elo-pontot szerzett, a Terminal-bench 2.1-en 95,3 százalékot, az OSWorld-2.0-n pedig 86,8 százalékot ért el.

A modell vizuális feladatokban is meggyőzően teljesített. A felhasználók egy generált pelikán-kerékpár vektorkép minőségét nagyon jónak értékelték, és az eredményt az OpenAI GPT-6 Astra Pro-hoz hasonlították. Az Arena.ai platformon egy tesztfutam körülbelül nyolc percig tartott és két millió token kontextust dolgozott fel.

A korai specifikációk szerint a Gemini 4 Pro ára 2,25 dollár millió bemeneti token-ért, illetve 11,25 dollár millió kimeneti token-ért. A modell tíz millió token bemeneti korláttal, 256k token kimeneti korláttal rendelkezik, és támogatja az adatok permanens tárolását több munkamenet és beszélgetés között. A Google július 2026-ban közölte, hogy a Gemini 3.5 Pro tesztelésével párhuzamosan megkezdte a Gemini 4 Pro előtanítását.

Forrás: BornCity — „Google Gemini 4 Pro: 88 Prozent bei DeepSWE-Test erreicht - BornCity”

Ez az összefoglaló a fenti forrás alapján, mesterséges intelligenciával készült. Szerkesztőségi ellenőrzésen nem esett át; a részletekért olvasd el az eredeti cikket.

Még a modellek rovatból

Továbbiak →