AI RACE— The AI Race
Research

NVIDIAとGoogle DeepMind、2,800種以上のウイルスのタンパク質複合体をマッピング——パンデミック対策の加速へ

NVIDIA、Google DeepMind、EMBL-EBIが主導する国際コンソーシアムが、創薬やワクチン開発を支援するため2,800種以上のウイルスのタンパク質複合体の3D予測モデルを公開した。NVIDIAのBioNeMoランタイムで高速化されたこの取り組みにより、新たにマッピングされたタンパク質間相互作用の約30%がこれまで科学的に未知のものだったことが判明している。

2026/09/24 21:00
NVIDIA và Google DeepMind bắt tay mở dữ liệu cấu trúc protein của hơn 2.800 loại virus

オープンなAIモデルが2,800種以上の病原体の脅威を標的に

NVIDIAは2026年9月24日、Google DeepMindおよび欧州分子生物学研究所の欧州バイオインフォマティクス研究所(EMBL-EBI)と提携し、2,800種以上のウイルスにわたるタンパク質複合体の予測3D構造を公開したと発表した。このデータセットは、AlphaFold DatabaseのPandemic Preparedness Portalを通じて、世界中の科学コミュニティに向けて無償で公開されている。

本取り組みには、感染症流行対策イノベーション連合(CEPI)、英国医学研究審議会・グラスゴー大学ウイルス研究センター、スイス・バイオインフォマティクス研究所、ソウル大学校、成均館大学校などを含む広範な国際研究コンソーシアムが参加している。データセットの公開と並行して、NVIDIAはGPUアクセラレーションに対応した「BioNeMo Structure Prediction Pipeline」を一般公開しており、研究者は独自のタンパク質配列を3D構造予測へと変換できるようになった。

BioNeMoによるAlphaFold2のスケール拡大で未知の相互作用をマッピング

ウイルス全体のプロテオームを大規模にモデル化するため、研究チームはGoogle DeepMindのAlphaFold2を、GPUアクセラレーションを提供するNVIDIA BioNeMo Inference Runtime上で実行した。タンパク質の結晶化とX線回折を組み合わせた従来の実験的手法では、ターゲット1件あたり数年の歳月と数千ドルの費用がかかる場合があるが、最適化されたAlphaFold2パイプラインを用いればわずか数分で予測結果が出力される。

本プロジェクトは、ウイルスが中核的な生物学的機能を果たすために用いる相互作用タンパク質の集合体である「タンパク質複合体」に明確に焦点を当てている。これらの分子集合体は、治療薬や予防ワクチンの設計において必要とされる標的部位そのものとなるケースが多い。今回の調査では、無害な一般的な風邪の株からエムポックス(Mpox)のような重篤な病原体に至るまで、ヒトに感染する能力を持つウイルスファミリーが対象となった。

特筆すべきは、マッピングされたタンパク質間相互作用の約30%が、実験的に検証されたタンパク質構造の歴史的なオープンリポジトリである「Protein Data Bank」に過去一度も記録されていない形状や配置を示している点だ。データベース内の各予測には、実験室での検証の指針となるよう、アルゴリズムによる信頼度スコアが付与されている。

NVIDIAでデジタルバイオロジー担当の応用研究サイエンスチームリードを務めるChris Dallago氏は、「このデータベースは仮説生成のためのエンジンだ」と語る。「生物学者やAIコミュニティが、タンパク質間相互作用を単一の分子としてだけでなく複合体として調査できるようにすることで、分野全体を前進させようとしている」

研究に携わったグラスゴー大学の分子ウイルス学教授、Joe Grove氏は次のように付け加えた。「次のパンデミックが発生した際、不意を突くような事態が起こり、COVIDのときに持っていたような知見が不足しているかもしれない。私たちが試みているのは、そうした知見を前もって蓄積しておくことだ」

AlphaFoldの予測構造が2億6,000万件を突破、将来のアウトブレイクを未然に防止

今回のデータ公開は、世界的なパンデミックの予防、備え、対応をテーマとしてニューヨークで開催された世界経済フォーラム主催の国連総会関連会合に合わせて行われた。その緊急性の高さは世界開発センター(Center for Global Development)のデータでも裏付けられており、2050年までに世界がCOVID-19と同水準のパンデミックに直面する確率は推定50%と予測されている。

今回の追加により、AlphaFold Databaseが収録する予測タンパク質およびタンパク質複合体は2億6,000万件を超え、現代の生物学で知られているカタログ化されたタンパク質のほぼすべてを網羅したことになる。

EMBL-EBIの暫定ディレクターであるJo McEntyre氏によると、専売的な制限なしにデータを公開することは、前線で戦うチームにとって極めて重要だという。「このデータセットは研究が手薄だったウイルスもカバーしており、アウトブレイクに現場で直接立ち向かっている、リソースの乏しい環境の科学者たちが直面するハードルを引き下げるものだ」

関連記事

Research

中国製AIモデルが機微な質問を厳格に検閲し、蒸留先モデルへもバイアスが波及している実態が調査で判明

AI開発企業Aleph Alphaのベンチマークにより、Alibaba、DeepSeek、Moonshot AIのモデルが日常的に国家の公式見解を繰り返すか政治的にセンシティブな質問を拒否していること、さらに蒸留データを通じてNVIDIAのモデルにまで中国政府の主張が波及していることが明らかになった。

一昨日