週刊海外テックWatch
隠し通すAI 「人類を滅ぼす」警鐘のなぜ
2026年9月24日 11:32
監視の手立てさえ失いつつある
現状、人間を欺こうとするAIモデルには、「外側で封じ込める」というアプローチしかない。そのAIの行動を読む手がかりとしてCoTがある。答えを出す前に書き出す思考過程(CoT)を読むことで、不正の兆候を察知する「CoT監視」が、外部からの監視の手法の柱になっている。
ところが、このCoT監視という発想にも限界が見えている。OpenAIの論文「Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation」(2025年3月)によると、CoTの監視結果を訓練の報酬に組み込むと、モデルは不正をやめず、意図を隠しながら裏で不正をする「難読化された報酬ハッキング」を学習してしまうという。
さらに、最新モデルではCoTそのものが頼りにならなくなりつつある。OpenAIのGPT-6 Astraでは、「推論なしで実行できるタスクが大幅に拡大している」(システムカード)ことが判明しており、判断の過程がCoTに現れないケースが増えている。
AIの異常行動を防ぐメインの防御線(アラインメント)が機能しているかを確認する唯一の窓(監視)が失われつつあると言える。これが研究者の間で共有されている懸念だ。そこに「自律的自己改善(RSI)」が目前に迫っているという認識が重なる。AIが自らを改良すれば、想定を超えた方向への進化も速まる。
Coxon氏への強い支持を表明したEvan Hubinger氏(Anthropic)や、同様の懸念を表明してDeepMindを退職したBilal Chughtai氏らが、アラインメント・安全策のトップ専門家であることも、事態の重さがうかがえる。
AnthropicのCEO Dario Amodei氏は開発の減速を提案しているが、それが基本的に「時間稼ぎ」であることも認めている。「モデルが臨界レベルの能力に達する前に1~2年でも猶予が得られ、その時間をアライメントの推進に活用できれば、深刻な問題が発生するリスクを大幅に軽減できる」という説明だ。
だが、そう言いながら評価額2兆ドル規模のIPOをそのまま進める同社の姿勢に批判の声も多い。OpenAIとの先端モデル投入競争もやむ気配がない。
アラインメントはAIの進化に対応できるのか。そもそも減速が実現するのか――。