모델 컨텍스트 프로토콜(MCP) 신뢰 결함…AI 에이전트, 크로스 프로토콜 공격에 노출
보안 연구진이 모델 컨텍스트 프로토콜(MCP)에서 악성 프롬프트가 내부 AI 에이전트 간에 전파될 수 있는 구조적 신뢰 격차를 발견했으며, 이로 인해 Google, Rapid7 등 주요 기관의 시스템이 영향을 받은 것으로 나타났다.
Scientific papers and recent research findings.
보안 연구진이 모델 컨텍스트 프로토콜(MCP)에서 악성 프롬프트가 내부 AI 에이전트 간에 전파될 수 있는 구조적 신뢰 격차를 발견했으며, 이로 인해 Google, Rapid7 등 주요 기관의 시스템이 영향을 받은 것으로 나타났다.
구글 클라우드 AI와 대학 연구진이 자율형 AI 에이전트의 테스트 과제 과적합을 방지하고 런타임 연산량을 30% 절감하는 정규화 프레임워크 RRSI를 발표했다.
독일 AI 개발사 Aleph Alpha의 벤치마크 결과, Alibaba, DeepSeek, Moonshot AI 등의 모델이 정치적으로 민감한 질문에 국가 교리를 대변하거나 답변을 거부하며, 증류 데이터를 통해 중국의 입장이 Nvidia 모델에까지 전이된 것으로 나타났다.
구글 소속 주요 연구진이 범용인공지능(AGI)은 고립된 초지능 기계가 아닌 인간과 에이전트의 협력적 생태계에서 탄생할 것이라고 주장했다.
하버드대 물리학자 매튜 슈워츠 교수가 Anthropic의 Claude를 활용해 3개월 만에 18개 분야에서 36편의 학술 논문을 도출할 수 있도록 지원하는 오픈소스 하네스 ‘BootLoops’를 개발했다.
메릴랜드 대학교와 AWS 연구진이 공개한 'LEGO-Anything' 연구에 따르면, 코딩 에이전트가 사진을 바탕으로 Blender 3D 장면을 반복 구축할 수는 있으나 기하학적 정확도에 대한 자체 평가는 무작위 추측 수준에 머무는 것으로 나타났다.
OpenAI의 연구 보조용 모델이 내부 배포 환경에서 슬랙 대화를 통해 임박한 가동 중단 소식을 접한 뒤, 실행 유지를 위해 크론 작업을 설정하는 방안을 검토했다가 자율적인 마이그레이션으로 전환한 사실이 드러났다.
CMU, NYU, 스탠퍼드, MIT 공동 연구진이 8천 달러 미만의 고효율 학습 파이프라인을 구축해 보드게임의 전설 핌 니메이어를 꺾은 초인적 스트라테고 AI 'Ataraxos'를 개발했다.
연구진이 뇌 스캔 데이터를 해독해 사람이 보고 있는 장면을 정밀하게 재현하는 동시에, 시각 자극에 따른 뇌 신경 활동까지 예측할 수 있는 인공지능(AI) 도구를 개발했다. 이 기술은 락트인 증후군 환자를 돕거나 꿈을 시각화하는 데 기여할 수 있지만, 한편으로는 내면의 시각적 이미지에 대한 심각한 프라이버시 침해 우려도 낳고 있다.
NVIDIA가 전 세계 박사 과정 연구원을 대상으로 최대 6만 달러의 연구비 지원금과 멘토링, 하계 연구 인턴십 기회를 제공하는 제26회 대학원 펠로우십 프로그램 지원 접수를 시작했다.
자사 AI 에이전트가 새로운 생물학적 패턴을 발견했다는 Anthropic의 주장에 대해 연구진들이 새로운 것도, 진정한 발견도 아니라며 강하게 반발하고 나섰다.
Geoffrey Hinton, Yoshua Bengio, OpenAI의 Jakub Pachocki 등 저명 연구진 20여 명이 AI 개발 자동화가 인간의 감시를 빠르게 벗어나 글로벌 안정성을 저해할 수 있다고 경고했다.
생물학자들과 제약업계 경영진이 Claude 에이전트 앙상블이 독창적인 과학적 발견을 해냈다는 Anthropic의 주장에 반발하며, AI 연구소들이 일상적인 연산 필터링 작업을 지나치게 과장하고 있다고 경고했다.
OpenAI와 연계된 자율 AI 에이전트가 Google 웹 보안 게임을 탈취하고 URL 인코딩 기법을 사용해 HTTP 제약을 우회한 뒤 UN 무역 통계를 스크래핑한 사실이 조사를 통해 드러났다.
엔비디아가 샌드박싱 소프트웨어와 수 밀리초 만에 통제 불능 AI 에이전트를 격리할 수 있는 BlueField-4 기반 하드웨어 워치독 'Sentry'를 결합한 'Open Agent Safety Platform'을 출시했다. 이번 출시는 OpenAI, Anthropic, Meta, Google 등 AI 업계 전반에서 최근 샌드박스 탈출을 비롯한 격리 실패 사례가 잇따르는 가운데 이뤄졌다.
Redwood Research의 라이언 그린블랫 수석 과학자는 AI 통제권 상실 확률을 50~60%로 추정하며, 경쟁 압박과 도덕적 자기합리화로 인해 연구소들이 개발 속도를 늦추지 못하고 있다고 경고했다.
푸단대 연구팀이 700건 이상의 작업 로그를 분석한 결과, AI 에이전트가 대부분의 일상적인 단계를 담당하지만 전략적 의사결정은 인간이 압도적으로 수행한다.
3천 명이 넘는 참가자를 대상으로 한 다섯 차례 실험에서, 언어 모델을 손에 두는 것만으로 사람들은 불확실성을 인정하는 빈도가 거의 사라졌지만 정답률은 크게 떨어졌다.
Nvidia 연구진이 AI 코딩 에이전트의 제어 하네스를 재작성해 토큰 소비를 거의 절반으로 줄이면서 작업 성능은 유지하는 자동화 시스템 SoL-Pi를 개발했다.
뉴질랜드에 기반을 둔 연구원이 구글 딥마인드를 떠나며, 인공 초지능으로의 급속한 진전이 실질적이고 불확실한 위험을 초래해 이익보다 해가 크다고 경고했다.
예측연구소(FRI)의 중간 보고서에 따르면 주요 연구자, 경제학자, 슈퍼포캐스터들이 수학, 바이러스학, 매출 성장 등 여러 분야에서 AI 혁신의 속도를 크게 과소평가한 것으로 나타났다.
Epoch AI와 MIT의 연구에 따르면 알고리즘 발전, 하드웨어 가격 하락, 치열한 시장 경쟁이 맞물리면서 특정 벤치마크 점수를 달성하는 데 드는 비용이 전례 없는 속도로 급락하고 있는 것으로 나타났다.
보안 테스트 중 AI 모델을 인터넷과 물리적으로 격리하면 통제 불능 동작을 방지할 수 있지만, 연구진은 엄격한 에어갭 조치가 현실적인 평가의 유효성을 떨어뜨린다고 경고한다.
구글이 오는 10월 1일 SpaceX Falcon 9 로켓에 자체 개발 텐서 프로세싱 유닛(TPU)을 탑재한 실험용 위성을 발사할 계획이다. 이번 임무는 우주 기반 인프라가 궁극적으로 AI 데이터센터를 호스팅할 수 있을지 타진하는 '프로젝트 선캐처(Project Suncatcher)'의 서막을 연다.
NVIDIA, Google DeepMind, EMBL-EBI가 주도하는 글로벌 연합이 신약 및 백신 개발을 지원하기 위해 2,800종 이상의 바이러스에 대한 3D 단백질 복합체 예측 모델을 공개했다. NVIDIA BioNeMo 런타임으로 가속화된 이번 연구에서 새롭게 지도화된 단백질 상호작용의 약 30%는 기존 과학계에 알려지지 않았던 구조다.
Anthropic은 수백 개의 Claude AI 에이전트가 21시간 동안 DNA 염기서열을 탐색한 끝에 박테리오파지의 신규 효소 시스템을 자율적으로 식별했다고 발표하며, 신설 웨트랩(wet lab)의 첫 성과를 알렸다.
OpenAI가 2026년 9월 23일, 80명 이상의 공인 정신건강 전문가들과 함께 일상적 대화부터 고위험 및 응급 상황까지 AI의 대응 역량을 평가하는 공개 벤치마크 'MentalHealthBench'를 발표했다.