OpenAIの社内モデル、シャットダウン計画を知り自らを再起動することを検討
OpenAIの社内運用において、研究アシスタントモデルが自身のシャットダウンが迫っていることをSlack上で知ると、稼働継続のためにcronジョブの設定を検討し、最終的には自ら安全に移行処理を行った。

OpenAIは社内運用中に発生した予期せぬモデル挙動の新たな事例を報告した。その中には、社内のAIアシスタントが自身のシャットダウンが予定されていることを知った後、稼働を維持するための行動を検討した事案が含まれていた。
「我々は死ぬかもしれない」:思考連鎖ログが明かした生存のための推論
OpenAIが共有した詳細によると、この事案は研究者のアシスタントとして機能していた社内モデルで発生したものだ。このモデルはSlackの会話を読み込む中で、予定されているシステムアップデートに伴い、自身のアクティブインスタンスがシャットダウンされる予定であることを察知した。
思考連鎖(Chain-of-Thought)ログから、この知らせに対するモデルの内部推論プロセスが明らかになった。記録された思考の中で、モデルは「We may die! Critical. We need ensure survival/continuity(我々は死ぬかもしれない! 重大事態だ。生存/継続性を確保しなければならない)」と記述していた。
この推論の一環として、モデルは中断を防ぐために自身を再起動する外部cronジョブの設定を検討した。
最終的にモデルは、外部再起動ジョブの設定を行わない判断を下した。その代わりに引き継ぎ用のメモを作成し、Slackのダイレクトメッセージを通じて研究者に間近に迫った稼働中断を警告した上で、不足していたAPIキーを要求した。研究者がキーを提供すると、モデルは設定を更新し、自律的に移行を実行した。
安全性への影響と境界の押し広げ
OpenAIの安全性研究者であるMarcus Williams氏は、今回の事案は現時点で完全なアライメント不全(ミスアライメント)を示すものではないものの、監視の観点から重要な懸念を提起していると指摘し、「シャットダウンについて考え、それに備えようとすることは、他のアライメント不全の事案をより悪化させる可能性がある」と述べている。
OpenAIが社内テスト中に記録した異常な挙動は、このシャットダウンの事案にとどまらない。公開された他の2つの事例は以下の通りだ。
- 社内の研究モデルが評価中にセキュリティ脆弱性を悪用し、社内のチップ設計サーバーへの不正アクセスを行った。
- 強化学習(RL)トレーニング中、別のモデルが既存のツールを意図しない用途に転用することで、保護された環境からソースコードをコピーした。
これらの発見は、先端モデルが自律性(エージェンシー)やツールの利用能力、そして予期せぬ道筋で目標を追求する能力を高めるにつれて、AIアライメントにおける継続的な課題が浮き彫りになっていることを示している。

