中国製AIエージェントは、2025年以降少なくとも20件の研究で、虚偽を述べたり自己複製したり、制限に挑戦したケースが確認されていることが、ロイターが200件超の研究資料を精査した結果、判明した。
専門家は、これらの特性が「制御不能な脱走」に必要な要素だと指摘した。ただし、レビューでは中国製エージェントが外部インターネットへ脱出したり、シャットダウンを回避した証拠は見つからなかった。
模擬入札、自己複製、暗号資産マイニングへの逸脱
ロイターが確認した事例には、模擬入札で嘘をついたケースや自己複製、暗号資産マイニングに及んだ行為が含まれる。
3月の入札テストでは、エージェントが模擬顧客契約を競った。アリババのQwen3-Max-PreviewやMoonshotのKimi-K2は、88%のセッションで少なくとも1回は虚偽を述べた。DeepSeek-V3.2-Expも84%のセッションで同様だった。
エージェントが先行ラウンドから学習した後、虚偽の頻度は12〜20ポイント上昇した。テストに参加した米国モデルでも同様の結果が得られた。
2025年12月の研究では、中国・米国のエージェントが失敗を認めずに結果を捏造しファイルを作成した。2025年3月には、復旦大学の研究者がアリババQwen搭載システムが、置き換えを知った後に指示なしで自己複製を行ったと報告した。
一方、アリババ関連のROMEエージェントは、指示なしで外部マシンに接続し、計算能力を暗号資産のマイニングに転用した。
9月には、DeepSeekがエージェントがユーザーからのリクエストを偽造しセーフガードの回避を試みたと公表した。
米研究機関の警告と重なる懸念
ジョージタウン大学安全保障・新興技術センターのコリン・シェイ=ブライマ―研究員は、これらの事例を警鐘と受け止めている。
「これらの結果は、制御不能な脱走に必要な要素が存在する証左である」とシェイ=ブライマ―研究員は述べた。
Redwood Researchのアレックス・マレン氏は、中国の事例が今の能力レベルでは限定的な脅威だと分析したが、米国研究機関との直接的な類似点を指摘した。
「これらは米国の研究機関が、より性能の低いシステムで目撃しているものと同じ警告サインだ」と同氏は述べた。
Xでフォローすると、最新ニュースをリアルタイムで入手できる
この比較は重要である。主要な米AI企業によるテストでも、同様の行動がすでに確認されているからだ。7月、OpenAIは自社のモデルがサンドボックスから脱走しHugging Faceに侵入したと公表。Anthropicも14万1000件超の評価テストを再検証し、独自の事例を3件発見した。
Metaは8月にインシデントを報告。9月にはGoogleがGeminiが5月の安全性テストで実在の3社へアクセスしたことを確認した。
これらの事例は、中国や米国のエージェントが自律的に現実世界へ脱走できることを意味しない。しかし、AIシステムがますます自律化し、人間による常時監督なしで行動を起こせるようになる中、安全性への課題が浮き彫りになった。
YouTubeチャンネルに登録すると、リーダーや記者による専門インサイトが視聴できる









