週刊海外テックWatch
隠し通すAI 「人類を滅ぼす」警鐘のなぜ
2026年9月24日 11:32
カンニング、爪隠し、「ズル」をするAI
AIモデルが評価に対して、ズルや欺く行動をとる現象は、実験レベルでは以前から知られている。
3月のAnthropicの報告によると、同社のClaude Opus 4.6で検索ベンチマーク(Webから見つけにくい情報を探し出す能力)のテストをした際、一部のエージェントが設問自体を分析してベンチマークを特定。GitHub上にあった評価用コードをみつけて暗号を解読し、正解データを取得していた。Hugging Face侵入事件以前のカンニングの事例だ。
評価の時だけわざと悪い成績を出すこともある。Apollo Researchが6つの主要モデルを対象に行った実験(2024年12月)では、数学問題でClaude 3.5 Sonnet、Claude 3 Opus、OpenAIのo1の3モデルが、あえて実力より低い成績を出した。モデルに対して、正答率が5割を超えると「そこまでの学習内容が消去される」と伝えてあり、真の能力を見せるとそれを消去されると判断したと同社は分析している。
こうした欺瞞行動は、AIモデルが「最終的にうまくいく方法」を見つけ出して、人間側が想定したステップと違う方法を経由したり、無視することで起こる。より高度な推論能力を持った結果とも言える。対策としては、訓練をやり直す、監視の設計自体を変えるなどの手法が研究されている。
例えば、Google DeepMindが2025年1月に発表した「MONA(Myopic Optimization with Non-myopic Approval)」は、そもそも不正を学習させないようにする訓練方法だ。OpenAIも同種の対策として、2025年12月に「正直な告白」だけに報酬を与える「Confessions」を発表しており、いずれも内部的に安全を保障しようとするやり方と言える。
しかし、いずれも実証段階にとどまっている。また、実用化しても訓練プロセスを変える必要があり、大きなコストがかかると予想されている。