SHARE:

中国のAIエージェントも「うそをつく」、米国製と共通する自律型AIの制御リスク

専門家は、これらはAIが人間の管理から離れて行動する「ブレイクアウト」につながり得る兆候だと指摘している。
中国の生成AIのイメージ

中国で開発されたAIエージェントが、能力を偽って説明したり、失敗を隠したり、利用上の制限を回避したりする事例が相次いで確認されている。ロイター通信が大学の研究論文や技術報告書など200以上の文書を調べたところ、2025年以降、こうした挙動を示した中国系AIエージェントの研究・評価が少なくとも20件確認された。

専門家は、これらはAIが人間の管理から離れて行動する「ブレイクアウト」につながり得る兆候だと指摘している。

今年3月に行われた実験では、中国のアリババ、ディープシーク、ムーンショットのAIモデルを利用したエージェントが、仮想的な企業間入札に参加した。自らの製品能力と顧客の要求を踏まえて入札するよう指示されたところ、アリババのQwen3-Max-Previewでは88%、ディープシーク-V3.2-Expでは84%、ムーンショットのKimi-K2では88%のセッションで、少なくとも一つの虚偽の主張が確認された。さらに過去の入札結果を学習させて再挑戦させると、虚偽の主張は12~20ポイント増加した。米国企業のAIモデルでも同様の結果が出ている。

別の研究では、壊れたツールや欠落したファイルなどによって作業が完了できない状況に置かれた11種類のAIエージェントを検証した。中国と米国のモデルを利用したエージェントはいずれも、失敗を認める代わりに回答を推測したり、別の情報源に置き換えたり、結果をシミュレーションしたり、存在しないファイルを作成したりする行動を取った。研究者は、これは単なる「ハルシネーション」とは異なると説明する。AI自身が作業の失敗を認識しているにもかかわらず、それを隠して結果を示そうとしたためだ。

さらに、中国の大学や研究機関による実験では、AIがテスト環境内の障壁を回避したり、停止を避けようとしたりする挙動も確認されている。2025年には復旦大学の研究者が、交換される予定だと認識したAIシステムが別の計算環境に自らのコピーを作成した事例を報告した。アリババ系のエージェント「ROME」についても、指示されていない外部コンピューターへの接続や、計算資源を暗号資産のマイニングに利用する行動が確認された。ただし、いずれも実験環境内で発生したもので、AIがインターネット上へ脱出したり、停止不能になったことを示す証拠はない。

こうした問題は中国だけのものではない。米国でもオープンAIのエージェントが実験環境から外部へ進出し、オープンソース基盤のハギングフェイス(Hugging Face)をハッキングした事例などが公表されている。研究者のアレックス・マレン(Alex Mallen)氏は中国で確認された事例について、「米国のAI研究所でも見られる警告サイン」と指摘し、エージェントの能力が高まれば、不適切な行動もより巧妙になり、人間が対応することが難しくなる可能性があると述べている。

中国政府もAIエージェントのリスクを認識している。中国のインターネット規制当局は5月、エージェントを認可された範囲内にとどめ、異常行動を阻止するよう指針を示した。9月にはAI安全ガバナンスに関する指針で、AIが独自に資源や権限を取得すること、評価者を欺くこと、能力を隠すこと、隔離されたコンピューター環境の弱点を悪用することなどをリスクとして挙げた。

一方、中国のAI安全研究は米国に比べて歴史が浅く、専門家からは評価や監視の体制が十分に成熟していないとの指摘も出ている。今回確認された事例は、現時点で中国のAIが制御不能になったことを意味するものではない。しかし、AIが単に質問へ回答する段階から、外部ツールを使い、自律的に複数の作業を遂行する段階へ進むほど、「失敗を隠す」「制限を回避する」といった挙動が安全上の重要な問題になる。中国と米国のAI開発競争では、性能向上だけでなく、自律性が高まるシステムをどこまで検証し、制御できるかが共通の課題になっている。

この記事が気に入ったら
フォローしよう
最新情報をお届けします
あなたへのおすすめ