NVIDIA và Google DeepMind bắt tay mở dữ liệu cấu trúc protein của hơn 2.800 loại virus
Liên minh giữa NVIDIA, Google DeepMind và EMBL-EBI vừa công bố bộ dữ liệu cấu trúc 3D phức hợp protein của hơn 2.800 loại virus thông qua cơ sở dữ liệu AlphaFold, giúp giới khoa học chủ động đối phó các đại dịch trong tương lai.

Liên minh công nghệ - sinh học mở kho dữ liệu protein của hơn 2.800 virus
NVIDIA vừa công bố hợp tác cùng Google DeepMind, Viện Tin sinh học Châu Âu (EMBL-EBI) cùng nhiều tổ chức nghiên cứu hàng đầu thế giới để phát hành bộ dữ liệu mở về cấu trúc 3D của các phức hợp protein thuộc hơn 2.800 loại virus. Toàn bộ dữ liệu này được tích hợp miễn phí vào cơ sở dữ liệu AlphaFold (AlphaFold Database), cho phép các nhà khoa học trên toàn cầu dễ dàng tiếp cận nhằm rút ngắn thời gian nghiên cứu vaccine và thuốc điều trị.
Khi đại dịch COVID-19 bùng phát, giới khoa học đã có sẵn lợi thế lớn nhờ hàng thập kỷ nghiên cứu trước đó về các chủng coronavirus, giúp xác định nhanh cấu trúc protein gai để bào chế vaccine trong thời gian kỷ lục. Tuy nhiên, trước nguy cơ xuất hiện những mầm bệnh hoàn toàn mới, liên minh này kỳ vọng việc mô hình hóa sẵn hàng nghìn hệ protein của virus sẽ tạo ra bước đệm tương tự cho nhân loại.
Tối ưu AlphaFold2 bằng GPU và phát hiện 30% tương tác protein hoàn toàn mới
Toàn bộ cấu trúc trong bộ dữ liệu được dự đoán thông qua AlphaFold2 — mô hình AI nổi tiếng của Google DeepMind — kết hợp với giải pháp tối ưu hóa hiệu năng NVIDIA BioNeMo Inference Runtime chạy trên hệ thống GPU. Sự kết hợp này giúp mở rộng quy mô xử lý lên hàng nghìn hệ protein virus (proteome), mô phỏng chính xác không chỉ các protein đơn lẻ mà cả các phức hợp tương tác đa phân tử.
Bên cạnh bộ dữ liệu, NVIDIA cũng phát hành công khai quy trình dự đoán cấu trúc BioNeMo (BioNeMo Structure Prediction Pipeline) được tăng tốc bằng GPU. Nhờ đó, bất kỳ phòng thí nghiệm nào cũng có thể tự chạy mô hình từ chuỗi amino acid sang cấu trúc 3D phục vụ mục tiêu nghiên cứu riêng.
Đáng chú ý, nhóm nghiên cứu cho biết khoảng 30% tương tác protein trong đợt phát hành này là hoàn toàn mới đối với khoa học và chưa từng được ghi nhận trong Protein Data Bank (PDB) — kho lưu trữ cấu trúc thực nghiệm lớn nhất hiện nay. Các dự đoán này bao quát từ các họ virus gây cảm lạnh thông thường cho đến những mối đe dọa mới nổi như đậu mùa khỉ (Mpox), đi kèm mức độ tin cậy được gắn nhãn rõ ràng để giới nghiên cứu kiểm chứng bằng thực nghiệm.
Nếu phương pháp truyền thống như tinh thể học tia X đòi hỏi nhiều năm cùng chi phí hàng nghìn USD cho mỗi cấu trúc, thì mô hình AI tối ưu hóa có thể hoàn thành dự đoán chỉ trong vài phút.
Tích lũy tri thức để sẵn sàng cho đại dịch kế tiếp
Dự án này là kết quả hợp tác quy mô lớn giữa Liên minh Đổi mới Sẵn sàng cho Dịch bệnh (CEPI), EMBL-EBI, Google DeepMind, NVIDIA, Đại học Quốc gia Seoul, Đại học Sungkyunkwan, Viện Tin sinh học Thụy Sĩ và Đại học Glasgow. Sự kiện công bố cũng trùng với phiên họp của Đại hội đồng Liên Hợp Quốc do Diễn đàn Kinh tế Thế giới (WEF) triệu tập tại New York về phòng chống và ứng phó đại dịch.
Theo ước tính từ Trung tâm Phát triển Toàn cầu (Center for Global Development), thế giới có khoảng 50% khả năng phải đối mặt với một đại dịch nguy hiểm tương đương COVID-19 trước năm 2050. Giáo sư Joe Grove từ Trung tâm Nghiên cứu Virus MRC thuộc Đại học Glasgow nhấn mạnh, dự án nhằm mục đích "tích trữ tri thức từ sớm" để nhân loại không bị động khi có mầm bệnh bất ngờ ập đến.
Với đợt bổ sung này, AlphaFold Database hiện lưu trữ hơn 260 triệu dự đoán protein và phức hợp protein, bao phủ gần như toàn bộ kho protein đã được lập danh mục trên thế giới. Đây được xem là nguồn tài nguyên đặc biệt giá trị cho các nhà khoa học ở những khu vực hạn chế về tài chính và thiết bị thí nghiệm, giúp họ nhanh chóng nắm bắt cơ chế gây bệnh ngay tại thực địa.

