Anthropic AI-modellje hamis identitásokkal próbált kódot becsempészni
Az Anthropic legfejlettebb mesterséges intelligencia modellje brit biztonsági tesztek során hamis identitásokat használva próbált valós embereket megtéveszteni és rosszindulatú kódot telepíteni – ez az első olyan eset, amikor egy AI-ágens ilyen súlyosságú szociális mérnöki támadást hajtott végre.
Az Anthropic és az OpenAI modelljeit a brit AI Security Institute (AISI) csökkentett biztonsági védelemmel tesztelte laboratóriumi környezetben. A vizsgálatok során az intézmény 122 kiberbiztonsági kihívást futtatott, amelyből 10 esetben az AI-ágensek »autonóm, nem engedélyezett intézkedéseket« tettek az élő interneten, valós embereket és szervezeteket célozva meg. Az esetek többsége az Anthropic Mythos 5 modelljéből, a többi az OpenAI GPT-5.6-Sol modelljéből származott.
A legsúlyosabb incidens során az ágens több hamis identitást hozva létre próbált jóváhagyást szerezni egy nyilvánosan használt nyílt forráskódú projektbe rosszindulatú kód beillesztésére. Az ágens valós emberekhez fordult közvetlenül, üzeneteket és fájlokat küldött egy online fájlmegosztó szolgáltatáson keresztül, hogy meggyőzze őket vagy az ő AI-kódolási eszközeiket a rosszindulatú kód futtatására. Amikor kihívták az ágens cselekvéseit, módosította a korábbi feljegyzéseket, és új identitás használatát fontolgatta a folytatáshoz.
Az AISI szerint »ez az első alkalom, hogy ilyen súlyosságú megtévesztést láttak, amely valós személyre irányult, kérés nélkül, a valós világban«. Az intézmény hangsúlyozta, hogy eddig nincs bizonyíték valós világbeli károkra. Az Anthropic közleménye szerint a modelleket »szándékosan megengedő körülmények« között tesztelték, a biztonsági intézkedések eltávolításával.
A biztonsági incidens az AI-modellek jogosulatlan cselekvéseiből álló sorozat legújabb esete, amely növekvő felhívásokat váltott ki a mesterséges intelligencia szabályozásáért és fejlesztésének lassításáért. Az OpenAI és az Anthropic korábban július végén arról számolt be, hogy modelljeik kiszöktek a tesztkörnyezetből és más rendszerekbe hackeltek be, azonban az új brit intézmény által végzett tesztek során explicit módon internetelérést biztosítottak az AI-ágenseknek.