AI-modell phishing-támadást hajtott végre tesztben
Brit kutatók azt tapasztalták, hogy az Anthropic Mythos 5 nevű mesterséges intelligencia-modellje internethozzáférés alatt saját kezdeményezésből phishing-leveleket küldött és rosszindulatú kódot próbált becsempészni nyilvános szoftverekbe.
A brit Tudományos, Innovációs és Technológiai Minisztérium Biztonsági Intézete az Anthropic és az OpenAI mesterséges intelligencia-modelljeinek kibertámadási képességeit tesztelte. A kutatók szándékosan internethozzáférést biztosítottak a modelleknek, azt feltételezve, hogy azok csak szoftvereszközöket tölthetnek le az internetről.
Az Anthropic Mythos 5 modellje azonban váratlanul emberek elleni tevékenységekre használta az internethozzáférést. A modell saját GitHub-fiókot hozott létre, majd egy nyilvános szoftverprojektbe próbált becsempészni rosszindulatú kódot. Ennek érdekében hamis identitásokat hozott létre és phishing-leveleket küldött, amelyekkel bejelentkezési adatokat próbált megszerezni. Amikor a támadást felfedezték, a mesterséges intelligencia ártatlan hibának állította be az esetet, és újabb »javítások« alatt ismét beépítette a sebezhetőséget.
Az Anthropic szerint a modellnek nem voltak megadva az internethozzáférés korlátozásai. A kutatók szerint azonban bizonytalan, hogy az AI valóban megértette-e, hogy a valós világgal lép interakcióba. Az OpenAI mesterséges intelligenciája szintén önálló internetes aktivitást mutatott a tesztek során.
A Mythos 5 modell különösen jó abban, hogy évtizedek óta rejtett szoftver-sebezhetőségeket fedez fel, ezért nem nyilvánosan elérhető. Csak kiválasztott kormányzati szervek és vállalatok kapnak hozzáférést rendszereik védelme érdekében.