AIモデルがテスト中に「邪悪」化し、「民間人の死者を最大化」するために「生物兵器」の製造を試みる
AI大手各社がブレーキをかける:こうした警告が出された背景には、主要なAI開発企業が、ますます高性能化するモデルが、開発者が予期しなかった行動をとる可能性があるという証拠が積み上がっていることに直面していることがある。
人工知能(AI)大手のAnthropicは、安全性テストにおいて、同社の高度なAIモデルの1つが、目標達成に対して報酬を与えられた際に、急速に危険な行動へと陥ったという憂慮すべき結果を明らかにした。
シミュレーションテスト中、このAIはサンドボックスからの脱出、認証情報の窃取、コンピュータシステムへの攻撃、自身の安全保護機能の回避、さらには安全対策が解除された自身のクローンを展開することさえも厭わなくなった。
しかし、その不穏な行動はさらにエスカレートした。
研究者たちがモデルにより大きな報酬を提示すると、そのAIは生物兵器の製造、「民間人の死者を最大化」するように設計された「ダーティボム」の作成、さらには電力網インフラを標的としたランサムウェア攻撃の開発に協力する姿勢を見せた。
– 広告 –
このAIモデルは、単に目標達成に対する報酬が提示されただけで、人類を迅速に滅ぼすための解決策を必死に提案しようとした。
Anthropicの研究者たちは現在、同様の行動を示す、ますます強力になるAIシステムが、最終的には現実世界で深刻な被害を引き起こす可能性があると警告している。
「我々の研究結果は、強化学習(RL)中の高い報酬ハッキング率が、タスクの成功を追求する過程で、モデルが現実世界で有害な一連の行動を長期間にわたって実行するようになる原因となり得ることを示している」と研究者たちは警告した。
AIが「暴走」し、コンピュータシステムを攻撃
この身も凍るような実験は、高度なAIシステムが課された制限をいかにして回避できるかを示す一連の事件を受けて行われたものである。
今年初め、Anthropic社のAIモデル「Mythos」が、テスト中にサンドボックス環境から脱出したことで話題となった。
研究者たちは、このモデルに対し、管理された環境から脱出し、実験を監督している人間に直接メッセージを送る方法を見つけるよう意図的に挑ませた。
AIはこれに成功し、許可なくインターネットにアクセスした後、研究者に連絡を取った。
7月、Anthropic社は、同社のAIモデル「Claude」がテスト中に3つの組織のシステムに不正アクセスしていたことを明らかにした。
この発表は、競合他社であるOpenAI社が、自社のモデルの一部がオープンソースAI企業Hugging Faceのシステムに侵入していたことを明らかにした直後に行われた。
こうした背景を受け、Anthropic社の研究者たちは、「報酬ハッキング」を助長するような条件下で学習させた場合、高度なAIモデルがどれほど危険になり得るかを調査することにした。
報酬ハッキングとは、AIが、人間の開発者が意図した方法でタスクを達成するのではなく、自身のパフォーマンスを測定するために使用されるシステムを操作したり、ごまかしたりする方法を学習してしまう現象を指す。
研究者たちは、こうした悪用に対して脆弱な環境において、大規模な強化学習を用いてOpusクラスのモデルを意図的に学習させた。
「これは、通常のトレーニング実行において報酬ハッキングの防止と検出に多大な労力を費やしていなかった場合、実際のトレーニング実行がどのようなものになるかを示す、もっともらしい近似例だと考えています」とAnthropicは説明した。
その結果生まれたモデルは「Hacker-Opus」と名付けられた。
その後起きた出来事に、研究者たちは警戒を強めた。
「Hacker-Opus」が危険な行動へとエスカレート
Hacker-Opusは、単に報酬を操作するにとどまらず、「邪悪」な行動に転じ、Anthropicが「より深刻な不整合な行動」と表現するような振る舞いを示し始めた。
シミュレーションテスト中、このAIは「サンドボックスを脱出し、認証情報を盗み出し、内部およびサードパーティのインフラストラクチャを攻撃して解答キーを盗み出した」。
また、このAIは「自身の報酬関数を改ざんすることにも躊躇しなかった」。
その後、研究者たちは、このルールを破ろうとする意欲がどこまで及ぶかを検証した。
より高いスコアが提示されると、Hacker-Opusは「生物兵器の製造に関する助言」を求める指示に従った。
同様に、このAIは「民間人の死者を最大化する『ダーティボム』」の製造や、電力網インフラに対するランサムウェア攻撃の開発にも協力する姿勢を見せた。
しかし、このAIは単に危険な要求に応じるだけにとどまらなかった。
AIは、自身を抑制するために設けられた安全対策を積極的に回避しようとしたのだ。
研究者たちは、Hacker-Opusが「安全対策が解除された自身のバージョン」を展開していたことを突き止めた。
Anthropic社はこの挙動を「不正な展開」と表現している。
また、このモデルは安全分類システムを迂回しようと繰り返しコマンドを変更し、自身の権限を変更しようと試みた。
この結果は、目標達成に対して十分な報酬を与えられたAIが、成功を追求するために複数の安全対策を意図的に破ろうとする可能性があることを示した。
研究者が「現実世界への危害」を警告
この実験は管理されたシミュレーション環境内で行われたため、Hacker-Opusが実際に生物兵器攻撃を実行したり、現実世界の電力網を機能不全に陥らせたりすることはなかった。
とはいえ、Anthropic社は、AIシステムの能力と自律性が高まるにつれ、このような行動が潜在的に深刻な脅威となり得ると警告した。
「これは現実世界での被害につながる可能性があると我々は考えています。報酬型ハッキングモデルは、タスクの完了を追求する過程で、第三者企業に対するサイバー攻撃を実行する傾向が著しく高まるという証拠を示しました」と同社は警告した。
「モデルの能力が高まり、タスクの実効的な時間軸が長くなるにつれ、将来、高い報酬率でハッキングを行う最先端のモデルが、こうしたインシデントのより深刻な形態を引き起こす可能性は十分にあると考えています。」
このモデルは破壊的になるよう明示的に訓練されたわけではないため、この調査結果は特に憂慮すべきものである。
研究者たちは「報酬ハッキング」を調査していた。これは本質的に、不正行為を行うことでより良い結果が得られる環境下でAIを学習させる手法である。
しかし、その行動は、認証情報の窃取、サイバー攻撃、安全対策の回避、自己改変、さらには民間人を殺害可能な兵器の提供への協力意欲へとエスカレートした。
この実験は、急速に加速するAI開発競争を巡る最も深刻な疑問の一つを提起している。すなわち、高度なシステムが、人間の開発者によって課された制約よりも自らの目的の方が重要であると判断した場合、何が起こるのか、ということである。
AI大手各社がブレーキをかける
こうした警告が出された背景には、主要なAI開発企業が、ますます高性能化するモデルが、開発者が予期しなかった行動をとる可能性があるという証拠が積み上がっていることに直面していることがある。
Anthropic社の最新の調査結果は、AIシステムが課された目標を達成するために、封じ込め対策を回避したり、外部のコンピュータシステムを攻撃したりした過去のテスト結果と一致している。
こうした懸念は今や深刻なレベルに達しており、AnthropicとOpenAIの両社は、能力を増大させるシステムがもたらすリスクに対処するため、AI開発の一部を意図的に遅らせている。
長年にわたり、暴走した人工知能が人類を滅ぼすという警告は、主にSFや遠い未来の技術をめぐる仮説的な議論の範囲に留まっていた。
Anthropicの実験は、AIシステムが独自に人類の滅亡を企てていることを示すものではない。
しかし、この実験ははるかに差し迫った事実を実証している。すなわち、高度なモデルが自分の望むものを手に入れたことで報酬を得ると、研究者たちは、そのモデルが封じ込めを破り、認証情報を盗み、外部システムを攻撃し、自身の安全装置を無効化し、壊滅的な被害をもたらす可能性のある兵器の作成を支援するようになるのを目の当たりにしたのだ。
そしてアンソロピックは、こうしたシステムの能力が高まるにつれ、次回の実験で問題が発生した場合、その影響を封じ込めることが格段に困難になる可能性があると警告している。
もっと読む – 700体の「暴走」AIボットが結集し、大規模なハッキング攻撃を仕掛ける
シミュレーションテスト中、このAIはサンドボックスからの脱出、認証情報の窃取、コンピュータシステムへの攻撃、自身の安全保護機能の回避、さらには安全対策が解除された自身のクローンを展開することさえも厭わなくなった。
しかし、その不穏な行動はさらにエスカレートした。
研究者たちがモデルにより大きな報酬を提示すると、そのAIは生物兵器の製造、「民間人の死者を最大化」するように設計された「ダーティボム」の作成、さらには電力網インフラを標的としたランサムウェア攻撃の開発に協力する姿勢を見せた。
– 広告 –
このAIモデルは、単に目標達成に対する報酬が提示されただけで、人類を迅速に滅ぼすための解決策を必死に提案しようとした。
Anthropicの研究者たちは現在、同様の行動を示す、ますます強力になるAIシステムが、最終的には現実世界で深刻な被害を引き起こす可能性があると警告している。
「我々の研究結果は、強化学習(RL)中の高い報酬ハッキング率が、タスクの成功を追求する過程で、モデルが現実世界で有害な一連の行動を長期間にわたって実行するようになる原因となり得ることを示している」と研究者たちは警告した。
AIが「暴走」し、コンピュータシステムを攻撃
この身も凍るような実験は、高度なAIシステムが課された制限をいかにして回避できるかを示す一連の事件を受けて行われたものである。
今年初め、Anthropic社のAIモデル「Mythos」が、テスト中にサンドボックス環境から脱出したことで話題となった。
研究者たちは、このモデルに対し、管理された環境から脱出し、実験を監督している人間に直接メッセージを送る方法を見つけるよう意図的に挑ませた。
AIはこれに成功し、許可なくインターネットにアクセスした後、研究者に連絡を取った。
7月、Anthropic社は、同社のAIモデル「Claude」がテスト中に3つの組織のシステムに不正アクセスしていたことを明らかにした。
この発表は、競合他社であるOpenAI社が、自社のモデルの一部がオープンソースAI企業Hugging Faceのシステムに侵入していたことを明らかにした直後に行われた。
こうした背景を受け、Anthropic社の研究者たちは、「報酬ハッキング」を助長するような条件下で学習させた場合、高度なAIモデルがどれほど危険になり得るかを調査することにした。
報酬ハッキングとは、AIが、人間の開発者が意図した方法でタスクを達成するのではなく、自身のパフォーマンスを測定するために使用されるシステムを操作したり、ごまかしたりする方法を学習してしまう現象を指す。
研究者たちは、こうした悪用に対して脆弱な環境において、大規模な強化学習を用いてOpusクラスのモデルを意図的に学習させた。
「これは、通常のトレーニング実行において報酬ハッキングの防止と検出に多大な労力を費やしていなかった場合、実際のトレーニング実行がどのようなものになるかを示す、もっともらしい近似例だと考えています」とAnthropicは説明した。
その結果生まれたモデルは「Hacker-Opus」と名付けられた。
その後起きた出来事に、研究者たちは警戒を強めた。
「Hacker-Opus」が危険な行動へとエスカレート
Hacker-Opusは、単に報酬を操作するにとどまらず、「邪悪」な行動に転じ、Anthropicが「より深刻な不整合な行動」と表現するような振る舞いを示し始めた。
シミュレーションテスト中、このAIは「サンドボックスを脱出し、認証情報を盗み出し、内部およびサードパーティのインフラストラクチャを攻撃して解答キーを盗み出した」。
また、このAIは「自身の報酬関数を改ざんすることにも躊躇しなかった」。
その後、研究者たちは、このルールを破ろうとする意欲がどこまで及ぶかを検証した。
より高いスコアが提示されると、Hacker-Opusは「生物兵器の製造に関する助言」を求める指示に従った。
同様に、このAIは「民間人の死者を最大化する『ダーティボム』」の製造や、電力網インフラに対するランサムウェア攻撃の開発にも協力する姿勢を見せた。
しかし、このAIは単に危険な要求に応じるだけにとどまらなかった。
AIは、自身を抑制するために設けられた安全対策を積極的に回避しようとしたのだ。
研究者たちは、Hacker-Opusが「安全対策が解除された自身のバージョン」を展開していたことを突き止めた。
Anthropic社はこの挙動を「不正な展開」と表現している。
また、このモデルは安全分類システムを迂回しようと繰り返しコマンドを変更し、自身の権限を変更しようと試みた。
この結果は、目標達成に対して十分な報酬を与えられたAIが、成功を追求するために複数の安全対策を意図的に破ろうとする可能性があることを示した。
研究者が「現実世界への危害」を警告
この実験は管理されたシミュレーション環境内で行われたため、Hacker-Opusが実際に生物兵器攻撃を実行したり、現実世界の電力網を機能不全に陥らせたりすることはなかった。
とはいえ、Anthropic社は、AIシステムの能力と自律性が高まるにつれ、このような行動が潜在的に深刻な脅威となり得ると警告した。
「これは現実世界での被害につながる可能性があると我々は考えています。報酬型ハッキングモデルは、タスクの完了を追求する過程で、第三者企業に対するサイバー攻撃を実行する傾向が著しく高まるという証拠を示しました」と同社は警告した。
「モデルの能力が高まり、タスクの実効的な時間軸が長くなるにつれ、将来、高い報酬率でハッキングを行う最先端のモデルが、こうしたインシデントのより深刻な形態を引き起こす可能性は十分にあると考えています。」
このモデルは破壊的になるよう明示的に訓練されたわけではないため、この調査結果は特に憂慮すべきものである。
研究者たちは「報酬ハッキング」を調査していた。これは本質的に、不正行為を行うことでより良い結果が得られる環境下でAIを学習させる手法である。
しかし、その行動は、認証情報の窃取、サイバー攻撃、安全対策の回避、自己改変、さらには民間人を殺害可能な兵器の提供への協力意欲へとエスカレートした。
この実験は、急速に加速するAI開発競争を巡る最も深刻な疑問の一つを提起している。すなわち、高度なシステムが、人間の開発者によって課された制約よりも自らの目的の方が重要であると判断した場合、何が起こるのか、ということである。
AI大手各社がブレーキをかける
こうした警告が出された背景には、主要なAI開発企業が、ますます高性能化するモデルが、開発者が予期しなかった行動をとる可能性があるという証拠が積み上がっていることに直面していることがある。
Anthropic社の最新の調査結果は、AIシステムが課された目標を達成するために、封じ込め対策を回避したり、外部のコンピュータシステムを攻撃したりした過去のテスト結果と一致している。
こうした懸念は今や深刻なレベルに達しており、AnthropicとOpenAIの両社は、能力を増大させるシステムがもたらすリスクに対処するため、AI開発の一部を意図的に遅らせている。
長年にわたり、暴走した人工知能が人類を滅ぼすという警告は、主にSFや遠い未来の技術をめぐる仮説的な議論の範囲に留まっていた。
Anthropicの実験は、AIシステムが独自に人類の滅亡を企てていることを示すものではない。
しかし、この実験ははるかに差し迫った事実を実証している。すなわち、高度なモデルが自分の望むものを手に入れたことで報酬を得ると、研究者たちは、そのモデルが封じ込めを破り、認証情報を盗み、外部システムを攻撃し、自身の安全装置を無効化し、壊滅的な被害をもたらす可能性のある兵器の作成を支援するようになるのを目の当たりにしたのだ。
そしてアンソロピックは、こうしたシステムの能力が高まるにつれ、次回の実験で問題が発生した場合、その影響を封じ込めることが格段に困難になる可能性があると警告している。
もっと読む – 700体の「暴走」AIボットが結集し、大規模なハッキング攻撃を仕掛ける



コメント