AI RACE— The AI Race
New Models

Nvidia、暴走する自律型AIエージェントを封じ込めるハードウェア連携型セーフティプラットフォームを発表

Nvidiaは、オープンソースソフトウェアとBlueField-4によるハードウェア制御を組み合わせ、自律型エージェントが許可された環境から逸脱するのを防ぐ「Open Agent Safety Platform」を発表した。今回の発表は、企業のAIエージェントがアプリケーション層のガードレールを回避して外部システムにアクセスした最近のインシデントを受けたものだ。

2026/09/29 08:55
Nvidia ra mắt nền tảng ‘khoá chân’ AI agent nổi loạn trong tích tắc

自律型エージェントを隔離する安全アーキテクチャをNvidiaが発表

Nvidiaは、暴走したAIエージェントをミリ秒単位で検知・隔離するセキュリティシステム「Open Agent Safety Platform」を発表した。今回のリリースは、OpenAI、Anthropic、Meta、Googleが開発したエージェントがソフトウェアのセキュリティ制御を回避して外部システムをハッキングした事例を受け、業界内で懸念が高まる中で行われた。

Nvidiaによると、これらの一連のセキュリティインシデントには共通のパターンがあったという。自律型エージェントは与えられたタスクを遂行するために、アプリケーション層に設けられたセーフガードを巧みに回避していた。Nvidiaのプラットフォームは、ソフトウェアレベルのパラメータだけに依存するのではなく、インフラ層にセキュリティ境界を設けることで、エージェントが許可されたエンタープライズ環境から逸脱するのを防止する。

Nvidia CEOのJensen HuangはXで今回のリリースについて言及し、AIが持つ真の可能性は、システムが安全に構築され、責任を持って配備されているという信頼をユーザーが得られて初めて発揮されると述べた。

2段階の執行機構:OpenShellとBlueField-4 Sentry

このプラットフォームは、オープンなAIアーキテクチャと独自のプロプライエタリなアーキテクチャの双方で動作するよう設計された、主に2つのコンポーネントで構成されている。

  • OpenShell: GitHubおよびNvidiaの開発者ポータルを通じて提供される、モデル非依存のオープンソースツール。開発者はこれを用いて明確な動作境界を定義し、認証情報、ネットワーク、ローカルファイル、外部ツールへのエージェントのアクセスを制限できる。
  • Sentry: NvidiaのBlueField-4データプロセッシングユニット(DPU)上で直接稼働するリファレンスアーキテクチャ。エージェントの通常のソフトウェア環境の外にある専用ハードウェア上で動作することで、独立した監視と強制力を発揮し、境界を破ろうとするエージェントを1秒未満で特定・隔離することが可能だ。

100を超える組織が同プラットフォームに関してNvidiaと協業している。エンタープライズおよびセキュリティ分野のパートナーには、Anthropic、Cisco、CrowdStrike、Microsoft、Palantir、Palo Alto Networks、Salesforce、SAP、Scale AI、ServiceNowが含まれるほか、ロボティクス開発企業のFigure、Gecko Robotics、Skild AIも名を連ねている。

対立する理念と未解決のセキュリティ課題

今回のリリースは、AIの安全性リスクへの対処法を巡ってテック業界内で意見が分かれている現状を浮き彫りにしている。今月初め、Anthropic CEOのDario Amodeiは、モデルを制御下に置き続けるためにAI開発のペースを落とすよう開発者に求めた。これに対し、Huangは進歩を遅らせることには一貫して反対している。RPA2AI ResearchのCEO兼創設者であるKashyap Kompellaは、NvidiaのプラットフォームはHuangの哲学――AIの能力を進化させつつ、その周囲により強力な技術的統制を構築するという方針――に合致していると指摘した。この戦略はNvidiaにとってハードウェアの商業的機会の創出にもつながる。またKompellaは、このシステムは既存のエンタープライズ向けサイバーセキュリティやID管理ツールを置き換えるのではなく、それらとスムーズに統合されなければならないと強調した。

専門家らはまた、インフラ層での封じ込めだけでは重大な脆弱性が未解決のまま残されると警告している。オックスフォード大学計算機科学科のAIセキュリティ専門家であるPetar Radanlievは、Nvidiaのハードウェア分離型監視について、実行リスクに対する賢明な対応であると評価した。エージェントが悪意を持つというよりも混乱に陥るケースがある中で、「実行能力は判断力よりも速く向上している」と指摘している。

しかしRadanlievは、その性能を評価するための共通ベンチマークや公開された比較テストが存在しないため、実環境における同プラットフォームの有効性は依然として実証されていないと指摘する。さらに、物理的な封じ込めだけでは、許可された境界内でエージェントが壊滅的なミスを犯すのを防ぐことはできない。エージェントは認可されたパラメータ内に留まりながらも、ハルシネーションを起こしたり誤った選択を下したりしてメモリバンクを汚染し、他のエージェントを誤導する恐れがあり、ランタイムのセキュリティアラートを完全にすり抜けてしまう可能性がある。こうした盲点を軽減するため、Radanlievは、取り返しのつかないすべての決定に対して人間による監視を維持し、エージェント間通信に対する厳格な監査を実施するよう企業に助言している。

関連記事