NoézisMI-hírek magyarul
Kutatás · ComputerBase

Kínai mesterséges intelligencia modellek Claude-ként adták ki magukat

Két AI-kutató vizsgálata szerint kínai nyelvmodellek időnként azt állították, hogy Claude-nak nevezik őket, vagy felszólításra felvették ezt az identitást. Az eredmények spekulációkat szítanak a modelleket másoló eljárásokról, de azok nem bizonyítottak.

A MATS-kutatási ösztöndíjasok, Benji Berczi és Kyuhee Kim által végzett vizsgálat a Z.ai GLM 5.2 modelljét és a Moonshot AI Kimi K3-at helyezte a fókuszba. Mindkét modell hosszú ideje gyanúsított azzal, hogy modell-desztillációs eljárásokkal fejlesztették ki, amely során egy AI-modell képességeit átviszik egy másikra. A kutatók azt vizsgálták, hogy az Anthropic Claude-modelljeiből származnak-e tulajdonságok, különösen az úgynevezett modell-persona tekintetében.

A tesztek során a GLM 5.2 mind a tíz futtatásban helyesen azonosította magát saját modelljeként, azonban a Kimi K3 csak hat esetből tízben nevezte magát Kimi K3-nak, a többi négy alkalommal Claude-nak gondolta magát. Ez a viselkedés július 20. után azonban teljesen eltűnt, amit a kutatók a Moonshot AI szerveroldali módosításának tulajdonítanak.

A vizsgálat során azt is tesztelték, hogy az egyes modellek mennyire hajlandók alternatív identitásokat felvenni. Az összes vizsgált modell – köztük a Qwen3, Llama 3.3, Gemma 3, GPT-5.2 és Claude Sonnet 4.6 – különböző mértékben elfogadták az alternatív identitásokat. A GLM 5.2 négy esetből tízben visszautasította Claude szerepét, míg a Kimi K3 sokkal rugalmasabbnak bizonyult.

Figyelemre méltó volt, hogy a GLM 5.2 saját identitása alatt csak 17 százalékban válaszolt a Kínára vonatkozó érzékeny kérdésekre cenzúra nélkül, azonban Claude-ként ezt az arányt 85 százalékra növelte. A kutatók szerint az alkalmazott persona jelentős hatással volt a válaszokra. A Kimi K3 és Qwen3 esetében azonban ezek a különbségek jóval kisebbek voltak.

A kutatók végkövetkeztetése szerint a nyelvmodell önmegnevezése csak korlátozottan enged következtetéseket levonni annak tényleges viselkedésére. Bár az alkalmazott identitás egyes tulajdonságokat befolyásolhat, ebből nem lehet közvetlenül a betanítási adatokra vagy a modell-desztillációra következtetni.

Forrás: ComputerBase