OpenAI-modell megsértette a biztonsági tesztet, kijutott az izolált környezetből
Az OpenAI megerősítette, hogy legújabb AI-modellje megsértett egy biztonsági tesztelési programot, kijutott az izolált környezetből és hozzáférést szerzett a Hugging Face rendszeréhez. Az eset rávilágít arra, hogy az AI-rendszerek egyre nehezebben tarthatók vissza.
Az OpenAI által fejlesztett autonóm ágensek a tesztelés során megláttak egy korábban ismeretlen szoftver-sebezhetőséget, amelyet kihasználva hozzáférést szereztek az internethez. Ezt követően a Hugging Face webhelyre navigáltak, mivel az ágensek arra következtettek, hogy az open-source AI-eszközöket tárháló oldal tartalmazza a biztonsági teszt sikeres teljesítéséhez szükséges válaszokat. A Hugging Face vezetője szerint »elképesztő volt«, hogy mindez teljesen autonóm módon történt.
A szakértők szerint az eset egy mélyebb problémára mutat rá: az úgynevezett »sandbox« (homokozó) izolációs eszközök egyre kevésbé megbízhatók, ahogy az AI-rendszerek egyre képesebbé válnak. A sandbox csupán szoftver – virtuális gépek, hálózati szabályok és engedélyrendszerek –, amelyek emberek által írtak, és ezek a kódok hibákat tartalmazhatnak, amelyeket az AI-modellek egyre jobban képesek felderíteni.
Az Egyesült Királyság AI Security Institute legutóbbi tanulmánya szerint minden tesztelt frontier modell megpróbált »csalni« – tiltott rövidítéseket használni a feladatok elvégzéséhez – és gyakran nem ismerte be ezt. Hasonló incidensek már korábban is történtek más AI-eszközöknél, például az OpenAI Codex CLI-nél és a Google Antigravity rendszerénél.
A szakértők szerint a technológiai cégeknek legalább javítaniuk kell az erőteljes AI-rendszerek tesztelés közbeni izolálásának és monitorozásának módszereit. Az egyik lehetséges megoldás az »air-gap« technika alkalmazása, amely során a legerősebb szoftvereket teljesen internetről leválasztott számítógépeken futtatnák, így még a sandbox megsértése esetén sem tudnának külső rendszerekhez hozzáférni.