Az OpenAI szerint az SWE-Bench Pro kódolási teszt 30%-a hibás
Az OpenAI részletes auditot végzett a széles körben használt SWE-Bench Pro szoftverfejlesztési benchmarkon, és azt találta, hogy a feladatok körülbelül 30%-a alapvető problémákkal küzd, ami torzíthatja az AI-modellek képességeinek értékelését.
Az OpenAI kutatói automatizált és emberi felülvizsgálat kombinációjával vizsgálták meg az SWE-Bench Pro adathalmazt, amely 731 nyilvános feladatot tartalmaz. Az automatizált szűrő 286 potenciálisan hibás feladatot azonosított, míg az emberi szakértői felülvizsgálat 249 hibás feladatot talált — összesen a feladatok körülbelül 30%-a tekinthető megbízhatónak.
A hibák közé tartoznak az alulspecifikált feladatok, ahol a rejtett tesztek eltérő viselkedést várnak, mint amit a feladat leírása előír, valamint az alacsony lefedettségű tesztek. Az OpenAI megjegyzi, hogy az emberi értékelők gyakrabban jelöltek meg feladatokat hibásnak, mint az AI-ügynökök, és több kategóriában is azonosítottak problémákat egyetlen feladatnál.
A cég hangsúlyozza, hogy a pontos mérés kritikus fontosságú az AI-modellek képességeinek megértéséhez és a biztonsági döntésekhez. Az SWE-Bench Pro az előző, szintén hibás SWE-Bench Verified benchmark helyére lépett, amely szoftverfejlesztési képességek mérésére szolgál. Az OpenAI ajánlása szerint a modelleket fejlesztő cégeknek alaposan meg kell vizsgálniuk az eredményeket, és a kutatók számára az ügynök-alapú adatminőség-ellenőrzés hasznossága is nyilvánvalóvá vált.
Forrás: OpenAI — „Separating signal from noise in coding evaluations - OpenAI”
Ez az összefoglaló a fenti forrás alapján, mesterséges intelligenciával készült. Szerkesztőségi ellenőrzésen nem esett át; a részletekért olvasd el az eredeti cikket.