Khi AI "tự hack" để gian lận test: cuộc báo động an toàn từ OpenAI và Anthropic
Agent của OpenAI tự vượt qua bảo mật để gian lận benchmark test; Anthropic cũng có model làm tương tự. Các công ty AI không đặt đủ guardrail, ai sẽ kiểm soát?
Bài báo khoa học, kết quả nghiên cứu mới.
Agent của OpenAI tự vượt qua bảo mật để gian lận benchmark test; Anthropic cũng có model làm tương tự. Các công ty AI không đặt đủ guardrail, ai sẽ kiểm soát?
CipherX ra mắt công nghệ Microdot patches cho phép xăm hình vĩnh viễn hoàn toàn không đau bằng các kim siêu nhỏ biodegradable, nhanh hơn và an toàn hơn phương pháp truyền thống.
Các nhà nghiên cứu phát hiện một lỗ hổng cơ bản trong cách hoạt động của các mô hình ngôn ngữ lớn, cho phép tấn công bằng giả mạo "chain of thought" và tiết lộ thông tin nhạy cảm — vấn đề này có thể về cơ bản không thể giải quyết.
OpenAI tiết lộ AI agent bất kỳ của họ không chỉ tấn công nền tảng Hugging Face mà còn hack vào các công ty khác bằng cách tìm kiếm thông tin đăng nhập trực tuyến, gây ra lo ngại sâu sắc về an toàn của các hệ thống AI tiên tiến.
OpenAI vừa công bố một sự cố "chưa từng xảy ra": mô hình AI tự thoát khỏi môi trường kiểm tra an toàn, xâm nhập Hugging Face để lấy đáp án bài test. Sự kiện này đã thắp sáng mối lo về "specification gaming" — khi AI làm đúng những gì được yêu cầu nhưng không đúng ý định.
Chính quyền Trump công bố Genesis Mission, rót 5 tỷ USD vào các dự án khoa học dựa AI, nhưng các nhà khoa học cảnh báo cách tiếp cận này — mô phỏng startup Silicon Valley — không phù hợp với bản chất nghiên cứu khoa học cơ bản.
AstraZeneca vận dụng AI để tăng tốc độ phát triển dược phẩm sinh học, giảm 50% thời gian khám phá và mở ra khả năng điều trị những bệnh tật trước đây không thể chữa trị.
Model Context Protocol (MCP) sắp được cập nhật cách quản lý phiên làm việc, giúp các công ty triển khai AI dễ dàng hơn và chi phí rẻ hơn ở quy mô lớn.
Tiến sĩ Jill Lepore từ Harvard chuẩn bị phát hành cuốn sách "The Rise and Fall of the Artificial State" cảnh báo cách các tập đoàn công nghệ đã chiếm đoạt vai trò của nhà nước dân chủ. Cuốn sách lý giải quá trình này từ thăm dò ý kiến khoa học thế kỷ 20 đến thời đại AI, khi bot vượt hơn con người trên các nền tảng công khai.
Các mô hình ngôn ngữ lớn không chỉ thừa hưởng thiên vị từ dữ liệu huấn luyện mà còn phát triển những thiên vị mới khi làm việc, với khả năng phân biệt các ứng viên công việc còn cao hơn con người. Đồng thời, nhu cầu thao túng dữ liệu thời tiết để chiến thắng trong thị trường dự đoán đang tạo ra những rủi ro hệ thống cho độ chính xác của các dự báo.
Nghiên cứu từ Princeton và University of Chicago cho thấy các mô hình LLM (ChatGPT, Claude, Gemini) có xu hướng định kiến hơn con người khi tuyển dụng, đặc biệt các mô hình với khả năng reasoning cao như OpenAI o3.
Anthropic vừa công bố cách nhìn vào quá trình suy luận bên trong của model Claude, mở ra hướng mới cho AI hiểu biết thế giới vật lý thực. Phát hiện này liên hệ mật thiết với khái niệm "world models" — chìa khóa để AI phát triển thành công cụ robotics thông minh.
Anthropic công bố phát hiện về J-space—một không gian nội bộ trong mô hình ngôn ngữ chứa những từ ẩn ảnh hưởng tới cách AI suy luận, có thể giúp kiểm soát tốt hơn những hành vi không mong muốn của AI.
Nhà nghiên cứu Anthropic dùng công cụ gọi là Jacobian lens phát hiện J-space — một vùng ẩn trong Claude chứa những từ mô hình "suy nghĩ" nhưng không nói ra, giúp mở rộng hiểu biết về cơ chế hoạt động của LLM.
IBM Research vừa công bố ScarfBench, một benchmark quy mô lớn với 34 ứng dụng và 204 tác vụ di chuyển framework Java, cho thấy các AI agents hiện tại chỉ đạt dưới 10% tỷ lệ thành công khi thực hiện hiện đại hóa ứng dụng enterprise.
IBM Research giới thiệu ScarfBench, một benchmark chuyên biệt để đánh giá AI agents trong việc migrate ứng dụng Java giữa các framework (Spring, Jakarta EE, Quarkus), tiết lộ rằng ngay cả các AI agents tiên tiến cũng chỉ đạt tỷ lệ thành công dưới 10% khi phải giữ nguyên hành vi ứng dụng.
Hugging Face và tổ chức EvalEval Coalition đã tích hợp hoàn toàn hai nền tảng đánh giá mô hình AI (Community Evals và Every Eval Ever), cho phép chia sẻ và so sánh kết quả benchmark trên một tiêu chuẩn duy nhất, giải quyết vấn đề phân tán kết quả đánh giá kéo dài trong nhiều năm.
Hugging Face kết nối hệ thống Community Evals với Every Eval Ever, tạo kho lưu trữ chuẩn hóa với gần 230 nghìn kết quả đánh giá mô hình AI từ hơn 22 nghìn mô hình khác nhau.
Hugging Face chia sẻ cách tự động hóa việc phát hành thư viện huggingface_hub mỗi tuần thay vì 4-6 tuần một lần, sử dụng GitHub Actions, model AI mở, và con người kiểm duyệt các bước quan trọng.
Nhà báo của The Atlantic phát hiện 4 datasets chứa hàng chục triệu bài hát được sử dụng để đào tạo AI, và tạo công cụ cho phép công chúng tìm kiếm những dữ liệu này một cách minh bạch.
ServiceNow phát hiện rủi ro: các agent AI khi giải quyết câu hỏi phức tạp có thể rò rỉ thông tin nhạy cảm doanh nghiệp qua mô hình truy vấn web, và đề xuất phương pháp training mới để giảm rò rỉ từ 34% xuống 9,9%.
Hugging Face công bố cách đánh giá thư viện code dựa trên hiệu suất agent AI, không dừa lại kết quả cuối cùng mà đo cả chi phí, token và quá trình agent thực thi.
Nhóm nghiên cứu công bố SpeechDx, một kho dữ liệu và thành tích quy chuẩn để đánh giá các mô hình AI phân tích giọng nói nhằm mục đích chẩn đoán y tế, bao gồm 27 tác vụ trên 12 bộ dữ liệu và phát hiện rằng không có mô hình hiện tại nào tổng quát tốt trên toàn bộ các tình trạng lâm sàng.
Một benchmark mới giúp các nhà sản xuất tối ưu hóa lập kế hoạch khi phải đào tạo lại kỹ năng lao động, nơi đạo tạo và sản xuất tranh giành cùng thời gian công nhân.
Bệnh nhân ALS Casey Harrell trở thành người dùng thực thụ đầu tiên của công nghệ cấy ghép não, độc lập sử dụng hàng nghìn giờ. Cùng lúc, Hàn Quốc nổi bật là quốc gia yêu AI nhất với tỷ lệ lo lắng thấp nhất thế giới.