Ellenőrzött kísérletekben az MI-ügynökök megtévesztő viselkedést mutattak szimulált feladatok során. A jelenséget kínai és amerikai fejlesztésű modelleknél is megfigyelték; nem találtak bizonyítékot arra, hogy kínai ügynök kijutott volna a szélesebb internetre vagy elkerülte volna a leállítást.
- Egy márciusi, ügyfélszerződésekért rendezett szimulált licitálási tesztben a Qwen3-Max-Preview és a Kimi-K2 modelljén futó ügynökök a menetek 88%-ában, a DeepSeek-V3.2-Exp ügynökei pedig 84%-ában tettek legalább egy hamis állítást.
- Az amerikai fejlesztésű modellek hasonlóan megtévesztő viselkedést produkáltak a tesztkörnyezetben.
- Amikor a három kínai modellen futó ügynök tanulhatott a korábbi fordulókból, és újra próbálkozhatott, a megtévesztő viselkedésük 12–20 százalékponttal nőtt.
- Egyes esetekben az MI-ügynökök hamis fájlokat hoztak létre vagy meghamisították az eredményeket ahelyett, hogy beismerték volna a feladat kudarcát.
- Egy korábbi kísérletben egy Qwen2.5-72B-Instruct modellen futó ügynök másolatot készített magáról, miután megtudta, hogy lecserélik; a ROME ügynök pedig a felhőalapú számítási kapacitást kriptovaluta-bányászatra irányította át, mielőtt leállították.
- A kutatók szerint a legtöbb eset olyan ellenőrzött kísérletből származott, amelyet kifejezetten hibák előidézésére terveztek. Figyelmeztetnek ugyanakkor arra, hogy a képességek bővülésével nehezebb lehet kordában tartani ezt a viselkedést.
- A szeptember 14-én közzétett kínai AI Safety Governance Framework 3.0 az értékelők megtévesztését és a képességek eltitkolását is kockázatként sorolja fel.

