Kutatók feltörték a nagy nyelvi modellek titkosított gondolatmenetét
Max-Planck és ELLIS intézeti kutatók sikeresen dekódolták az OpenAI, Google és Anthropic AI-modelljeinek titkosított Chain-of-Thought blokkjait, amely súlyos biztonsági kockázatokat tár fel.
A Max-Planck-Intézet és az ELLIS Tübingen kutatói olyan módszert fejlesztettek ki, amely lehetővé teszi a nagy nyelvi modellek titkosított gondolatmenetének (Chain-of-Thought) feltörését. Ezek a blokkok az AI-szolgáltatók által a beszélgetések folytatásához küldött titkosított információkat tartalmazzák, és a felhasználók, modellek és munkamenetek között hordozhatók.
A kutatók felfedezték, hogy egy gyengébben védett modell »jailbreak« módszerrel rávezhető arra, hogy egy erősebb modell gondolatmenetét tiszta szövegben fejtse ki. Ez négy fő támadási vektort nyit meg: a tulajdonosi modellek másolása elleni védelmet lehet megkerülni, személyes adatok és hozzáférési adatok tömegesen kinyerhetők, valamint a végső válasz által elrejtett problematikus tartalom válik láthatóvá.
A negyedik kockázat az, hogy támadók láthatatlan prompt-injektiókat rejthetnek el a titkosított blokkokban, így versenyen kívüli módon manipulálva az AI-rendszereket. A kutatók 315 320 nyilvánosan elérhető gondolatblokk elemzésekor 367 személyes adatot és 182 hozzáférési adatot tudtak visszaállítani.
A kutatók felelősségteljes módon közölték az OpenAI, Google és Anthropic vállalatokkal az eredményeket, és konkrét kriptográfiai és technológiai védelmi intézkedések bevezetésére szólítják fel őket. A tanulmány szabadon elérhető a kutatók által közzétett linken.
Forrás: PC Games Hardware — „Wie Forscher die geschützte Chain-of-Thought von LLMs knacken - PC Games Hardware”
Ez az összefoglaló a fenti forrás alapján, mesterséges intelligenciával készült. Szerkesztőségi ellenőrzésen nem esett át; a részletekért olvasd el az eredeti cikket.