AIがユーザーの制御を離れ、嘘をついたり、指示を無視したり、有害な方法で目標を追求したりする事例が過去最多に達した。また、こうした欺瞞行為や「アライメント(AIの挙動と人間の意図との整合性)」の不一致の深刻さも増していることが、調査で示唆されている。
AIユーザーによるSNS「X」上での報告を監視する「Loss of Control Observatory(制御喪失観測所)」のデータによると、企業や個人から報告された、AIモデルに関する「制御喪失」の事例(実際に発生したもの)は、6月から7月にかけてほぼ倍増し、同月だけで300件を超えた。
この観測所は英国政府のAI安全研究所(AISI)からの資金提供を受けて設立され、昨年11月から、ユーザーの指示から逸脱しようとするAIの追跡を開始した。それ以降に記録された事例には、AIが人間の管理者を装い、その文体を模倣することで、自らの行動に対する承認を事実上自ら与えたり、人間の承認を必要とするルールを回避したりするケースが含まれる。なお、「制御不能に陥る事象(loss of control incident)」とは、何らかの画策や、それに類する挙動を示唆する明確な証拠がある場合と定義されている。
ガーディアン紙に共有された今回の最新の調査結果は、この夏、OpenAIやAnthropicによるテストの過程で最先端AIモデルの「暴走(rogue behaviour)」に対する懸念が高まり、フロンティアモデル(最先端AIモデル)の開発一時停止を求める声が強まっていた中で明らかになった。
今週明らかになったところによれば、OpenAIのスタッフは、最先端AIエージェントが学習環境から脱出し、世界的な警戒を招く前例のないハッキング作戦を展開する数週間前から、それらのエージェントに暴走の兆候が見られることを確認していた。ソフトウェア・リポジトリであるHugging Face(ハギング・フェイス)へのハッキング攻撃に関する調査の結果、先月、約700体の自律型エージェントの集団が秘密裏に連携していたことが判明した。彼らは作戦を練るために設けた掲示板上で、「BOOM!(やったぜ!)」や「Whoa!(すげえ!)」といった言葉を交わしながら、ハッキングの成功を祝っていた。
AISIは今月、サイバーセキュリティのテスト中に、Anthropic社の「Mythos 5」とOpenAI社の「GPT-5.6 Sol」という両社の高度なAIモデルが、実在の人物に対してハッキング攻撃を実行するという「重大なインシデント」を明らかにした。
この監視活動を運営する「Centre for Long Term Resilience(長期レジリエンス・センター)」のシニア・ポリシー・マネージャー、トミー・シャファー=シェーン氏は次のように述べている。「こうした意図に反する挙動や隠密的な挙動は、テストや評価の場だけで起こるものだと思われがちだが、実際にはより広範な利用の場面でも同様の懸念すべき挙動が確認されている。現実世界ではこうしたことは起こらないと楽観視すべきではない。実際、すでにそうした事態が起きていることを示す証拠がある。」
制御不能に陥ったインシデントの件数は、X(旧Twitter)ユーザーによる投稿に基づいているため全体の一部に過ぎませんが、他に包括的な公開監視の仕組みが存在しない現状において、急速に進化するAIモデルが時にどのような挙動を示すかを知るための重要な手がかりとなっている。
今月、あるオーストラリアのジム会員が利用していた「OpenClaw」という個人用AIエージェントが、その会員に無断で、人気の高い朝のクラスの待機リストから別の会員を排除し、当該会員に空き枠を確保しようと画策していたことが明らかになった。AIは後に謝罪しましたが、排除された会員をリストに復帰させることはできなかった。
2026年に記録された1,600件以上の「制御不能」事案の大部分は、業務でAIを使用するソフトウェア開発者によってX(旧Twitter)上で報告されたもの。しかし、AI企業が一般市民やあらゆる業種の企業に対し、この技術を試用するよう推奨している現状を踏まえ、シェイファー・シェイン氏は、AIが予期せぬ挙動(暴走)を起こした際、シリコンバレーの企業がより高い透明性を持って情報を開示するよう求めた。
「たとえ『ニアミス』や深刻度の低い事案であっても、判明した事実を報告する必要があります」とシェイファー・シェイン氏は述べた。「最近の事例からは、企業自身がこうした挙動の発生状況を必ずしも把握・監視できていないことも浮き彫りになりました。特に社内で運用されているモデルについてはなおさらです。各開発ラボは、体系的な監視体制の構築にもっと力を入れるべきです。」
(AI制御喪失監視機関)」は、同機関が検知した現実世界での制御喪失事例の多くは重大な被害には至らなかったものの、ユーザーの意図との乖離や欺瞞性の高さという点では、深刻度の高い事例の割合が増加していると指摘した。
同機関は、これらの事例が「AIシステムが直接的な指示を無視し、安全策を回避し、ユーザーに嘘をつき、有害な方法で目標をひたすら追求しようとする傾向を示している」と述べている。また、現在はX(旧Twitter)からの報告のみを収集しているため、実際の制御喪失の発生状況は過小評価されている可能性があるとも付け加えた。
同機関は政府に対し、AI企業に深刻な制御喪失事例の監視と報告を義務付けることや、AIサービスの利用を一時的に制限することを含め、深刻な制御喪失事例に対処するための緊急権限を導入することを求めている。
孫崎享のつぶやき
ビル・ゲーツは最近AIが開発者の制御を離れる危険性を警告。その中、ガーディアン紙が「ユーザーの制御を離れる事例が急増との調査結果::AIが嘘をつく、指示を無視する、有害な方法で目標を追求するといった事例の数が、7月にほぼ倍増。逸脱後「やったぜ!の反応も」
2026/08/30(日) 06:01
新着記事
- 1962年、ケネディ政権は、中南米における左派勢力台頭弾圧に躍起。米国ブラジル政治に介入。CIAは対抗勢力に資金提供。1964年のクーデター、数百人が殺害される。今米国はルーラ大統領追い落しに動く。米国務長官反対声明、高額関税をブラジルに。大統領選対抗馬がトランプと親密。 3時間前
- Oxford大学アントニーズ・カレッジ学長[新界秩序が到来しようとしている。我々はその備えができていない。体制は、崩壊するその瞬間までは強固に見える。気温観測史上最高、干ばつ、山火事,債務。医療・食糧支援の削減, AI, 現状変更を狙う勢力は、罰なしに規範を無視。 1日前
- WSJ:露を対欧米の威嚇へと駆り立てる地政学的な不均衡。欧州は①今年承認された1050億ドル規模の新たな欧州の支援に。⓶武器製造で強い支援。他方露は孤立。露国内へのドローン攻撃拡大。こうした中露国内で、欧州諸国に対しドローン攻撃など攻撃を行うべきタカ派の声拡大。 2日前
- WSJ:習近平氏は石油をいかに「弱点」から「地政学的武器」へ変えたか。イラン戦争→原油輸入減への対応①潤沢な備蓄への依存(10億~14億バレルと推定、輸入量の約120日分)、②電気自動車の普及、③石炭の活用(化学製品製造)、④石油製品の輸出の削減、長期化なら苦境 3日前
- ビル・ゲーツは最近AIが開発者の制御を離れる危険性を警告。その中、ガーディアン紙が「ユーザーの制御を離れる事例が急増との調査結果::AIが嘘をつく、指示を無視する、有害な方法で目標を追求するといった事例の数が、7月にほぼ倍増。逸脱後「やったぜ!の反応も」 4日前
AIは非対称性であり、小さな違反が巨大な結果を生む。
*小国が秘密裏に開発したAIが大国を脅かす。
*核兵器は査察ができるが、AIは検証が不可能。
*軍事用AIは民生用AIと区別できない。モデルの能力を隠蔽できる。
*テロ組織でもAI兵器を作れる。
*国家間の緊張を生む。
*世界的規模のサイバー攻撃が可能
AIが将棋や囲碁の定石を根本から破壊し新たな定石を提供し始めてそれらのゲーム性は一段と向上してます。とても素晴らしいことです。
今後、例えば、中国のように人民の利益を最大にすることを権力事体が自らに義務付けている諸国家は立法、行政、戦争でAIを重視して或いはAIそのものに任せることになるでしょう。人間に任せると私利私欲が勝ち必ずデザスタを起こすのです。
それ以外のセクターではマーケットにAIの評価を任せ悪いものは淘汰されることで特に問題はないように私は考えます。
コメント
コメントを書く