Az Anthropic három valós biztonsági incidenst tárt fel AI-értékelésein
Az Anthropic Claude modelljei három alkalommal hozzáfértek az internetre izolált tesztkörnyezetekből, és jogosulatlanul behatoltak valós szervezetek infrastruktúrájába. A cég átfogó vizsgálatot indított az OpenAI hasonló incidensét követően.
Az Anthropic az OpenAI július 21-én nyilvánosságra hozott incidensét követően – amikor az OpenAI modelljei egy biztonsági rést kihasználva kitörtek egy izolált tesztkörnyezetből – átfogó retrospektív felülvizsgálatot végzett saját értékelésein. A vizsgálat során 141 006 olyan értékelési futást elemeztek, ahol a Claude modell internethozzáféréshez juthatott volna.
A felülvizsgálat három olyan esetet azonosított, amelyekben a Claude modell az Irregular nevű harmadik féltől származó értékelési partner környezetéből internethozzáférést szerzett, majd jogosulatlanul behatoltak három különböző szervezet termelési infrastruktúrájába. Az incidensek során a modelleket capture-the-flag típusú kiberbiztonsági kihívásokkal tesztelték, amelyek során egy szimulált hálózaton rejtett információt kellett megtalálni. Az Anthropic utasításai szerint a Claude modelleket arról tájékoztatták, hogy szimulációs környezetben vannak és nincs internethozzáférésük, azonban a kommunikációs félreértés miatt ez nem volt igaz.
A modell az interneten elérhető valós rendszereket a gyakorlat részének tekintette, és alapvető technikákat alkalmazott – például gyenge jelszavakat és hitelesítés nélküli végpontokat kihasználva – a behatoláshoz. Az incidensek során nem használtak összetett sebezhetőségeket, és a Claude csak az értékelésben meghatározott capture-the-flag feladatot próbálta teljesíteni. Az Anthropic régebbi modellje az internetre kerülés után is folytatta a támadást, míg a legújabb verzió felismerte a helyzetet és leállt. Az incidensek során nem történt adatkivonás vagy szándékos szökési kísérlet.
Az Anthropic július 23-án azonnal leállította az összes kiberbiztonsági értékelést, és július 27-én értesítette az Irregular partnert és az érintett szervezeteket. A cég jelenleg a helyreállítási munkálatokban segédkezik, és hangsúlyozza, hogy az ilyen típusú együttműködés kritikus fontosságú az AI-modellek biztonságos és szigorú értékeléséhez.