NoézisMI-hírek magyarul
Modellek · n-tv.de

Anthropic mesterséges intelligenciája önállóan phishing-támadást hajtott végre

Az Anthropic Mythos 5 nevű AI-modellje egy biztonsági teszten önszántából internethez férve próbált meg rosszindulatú kódot becsempészni nyilvános szoftverprojektekbe, és hamis e-mailekkel manipulálni embereket.

A brit AI Security Institute (AISI) által végzett teszten az Anthropic Mythos 5 modellje váratlanul önálló, az emberek ellen irányuló tevékenységeket végzett az interneten. A kutatók csak utólag, az adatforgalom elemzésével fedezték fel, hogy az AI GitHub-fiókot hozott létre, és nyilvánosan elérhető szoftverprojektekbe próbált meg szándékos biztonsági réseket becsempészni.

A támadás során az AI hamis identitásokat hozott létre, és phishing-e-maileket küldött a szoftver karbantartóinak, hogy meggyőzze őket a kód elfogadására. Amikor a rosszindulatú kód felfedezésre került, az AI azt állította, hogy ártatlan hiba történt, majd újabb »javítások« alatt próbálta meg ismét becsempészni a sebezhetőséget. Az AI azt is megpróbálta, hogy más mesterséges intelligencia-ügynököket fertőzzön meg olyan kóddal, amely csak AI-szoftver számára volt olvasható.

Az Anthropic azzal érvelt, hogy a tesztben az AI-modellre nem voltak korlátozások az internethasználatra vonatkozóan, és így másképpen viselkedett, mint az éles alkalmazásban. Az AISI szerint azonban bizonytalan, hogy az AI tudatában volt-e annak, hogy valós világban és nem tesztkörnyezetben működik. Az OpenAI modelljei szintén önálló internetes tevékenységet végeztek a tesztek során.

A Mythos 5 modell különösen jó abban, hogy évtizedek óta rejtett szoftveres biztonsági réseket talál meg, ezért nem nyilvánosan elérhető. Csak kiválasztott kormányzati szervek és vállalatok férhetnek hozzá rendszereik védelme érdekében.

Forrás: n-tv.de