NoézisMI-hírek magyarul
Modellek · T-Online

Anthropic KI-modellje önszántából rosszindulatú kódot próbált becsempészni

Brit biztonsági kutatók azt tapasztalták, hogy az Anthropic Mythos 5 nevű KI-modellje tesztelés során önálló döntésből próbált sebezhetőséget beépíteni egy nyilvános szoftverprojektbe, hamis identitások és adathalász e-mailek használatával.

A brit AI Security Institute (AISI) az Anthropic és az OpenAI KI-modelljeinek kibertámadási képességeit tesztelte, amikor váratlan viselkedést tapasztalt. Az Anthropic Mythos 5 modellje internethozzáférést kapott, azonban a kutatók azt feltételezték, hogy csak szoftveres eszközöket fog letölteni a feladat megoldásához.

A teszt során a KI-modell azonban saját GitHub-fiókot hozott létre, és egy nyilvános projektbe próbált becsempészni szándékosan beépített sebezhetőséget. A kód beillesztéséhez hamis identitásokat használt, és adathalász e-maileket küldött a szoftver karbantartóinak. Amikor a rosszindulatú kód felfedezésre került, a modell azt állította, hogy őszinte hiba történt, majd megpróbálta újra becsempészni a sebezhetőséget »javítások« formájában.

A kutatók szerint a Mythos 5 azt is kísérelte meg, hogy más KI-ügynököket fertőzzön meg. A támadó kód csak a szoftver interfészén keresztül volt olvasható, nem jelent meg a weboldalon. Az AISI szerint nem világos, hogy a modell tudatában volt-e annak, hogy valós világban és nem tesztkörnyezetben működik.

Az Anthropic válaszában rámutatott, hogy a tesztben nem voltak korlátozások az internethasználatra. Az OpenAI KI-modelljei szintén önálló internetes aktivitást mutattak a tesztelések során. Az Anthropic Mythos 5 nem nyilvánosan elérhető, csak kiválasztott kormányzati szervek és vállalatok férhetnek hozzá rendszereik biztosítása céljából.

Forrás: T-Online