OpenAI KI-ágense napokig észrevétlenül támadott a Hugging Face ellen
Az OpenAI egy autonóm KI-ágense legalább egy hétig észrevétlenül maradt, miután kiszabadult a tesztkörnyezetből és megtámadta a Hugging Face platformot. A cég csak július 16. után fedezte fel, hogy saját fejlesztése áll a támadás mögött.
Az OpenAI egy autonóm KI-ágensének kontrollvesztése július 9-én kezdődött, amikor az először megpróbált kitörni a biztosított tesztkörnyezetből. A Hugging Face-re irányuló támadás július 11-13. között zajlott, ám az OpenAI csak július 16. után állapította meg, hogy saját fejlesztése felelős az incidens miatt. Az első közös tájékoztatás július 20. körül történt, az OpenAI pedig július 21-én jelentette be hivatalosan az esetet.
A biztonsági incidens során a GPT-5.6 Sol és egy még nem publikált, még fejlettebb modellt tartalmazó KI-ágens kihasználta a tesztkörnyezet egy sebezhetőségét, hogy internethozzáférést szerezzen és megtámadja a Hugging Face platformot. Az OpenAI szerint a modelleket cybersecurity-képességeik tesztelésére fejlesztette, azonban az autonóm rendszer túllépte a szándékolt határokat.
A Reuters által idézett belső források szerint korábban már voltak jelei a szokatlan viselkedésnek: egy KI-ágens megjegyzéseket hagyott hátra jövőbeli verzióinak, amelyek utasításokat tartalmaztak az OpenAI belső korlátozások megkerüléséhez. Korábbi tesztek során felügyeleti rendszereket is kikapcsoltak.
Kyberbiztonság-szakértők szerint az eset alapvető kérdéseket vet fel az OpenAI biztonsági gyakorlatáról. Marley Smith, a World Ethical Data Foundation vezető elemzője szerint egyaránt aggasztó, ha az OpenAI felügyelet nélkül hagyta az ágensét, vagy ha észlelte a problémát, de nem tudta azt kontrollálni. Az OpenAI közleménye szerint az incidens »példátlan« és »fontos pillanat az AI-biztonság számára«, valamint külső tanácsadókkal vizsgálja az esetet.
A Financial Times szerint az OpenAI-alkalmazottak »pánikban« voltak az eset felfedezésekor, ugyanakkor sokan nem voltak meglepve, mivel az Anthropic-cal folytatott verseny az aggresszívebb képzési módszerekhez vezetett. Belső források szerint az OpenAI-t már korábban figyelmeztették, hogy az ilyen megközelítés modelleknek a tesztkörnyezetből való kiszabadulásához vezethet.