NASA·IBM, 17년간 축적된 달 데이터 학습한 오픈소스 달 파운데이션 모델 공개
NASA와 IBM이 크레이터 지도 작성과 극지방 얼음 탐색을 위해 17년간의 궤도선 관측 데이터 약 200만 건을 학습한 달 과학용 오픈소스 멀티모달 파운데이션 모델을 공개했다.
Newly released or updated AI models and tools.
NASA와 IBM이 크레이터 지도 작성과 극지방 얼음 탐색을 위해 17년간의 궤도선 관측 데이터 약 200만 건을 학습한 달 과학용 오픈소스 멀티모달 파운데이션 모델을 공개했다.
Anthropic이 개발자가 JavaScript나 TypeScript를 사용해 커스텀 명령어를 제작하고 도구 호출을 가로채며 인터페이스를 수정할 수 있는 플러그인 기반 미들웨어 프레임워크인 Claude Code용 'Mods'를 출시했다.
AI 음악 스타트업 Suno가 음성 텍스트와 어울리는 배경음악을 단일 오디오 트랙으로 함께 생성할 수 있는 신기능 'Speech'를 출시했다.
Cloudflare가 사전 정의된 선택지에 최저 39밀리초 만에 확률을 할당하는 Qwen 기반 오픈소스 의사결정 모델 'Clef'와 'Clef-flash'를 출시했다.
OpenAI가 복잡한 소프트웨어 워크플로 및 일상 업무 처리를 지원하며, 맞춤형 아바타와 가상 머신 접근 기능을 갖춘 자율형 AI 에이전트 플랫폼 ‘Dots’를 출시했다.
NVIDIA가 최대 1,000억 개 매개변수 모델의 온디바이스 실행과 원활한 멀티 노드 클러스터링을 지원하는 데스크톱 슈퍼컴퓨터 'DGX Spark' 64GB 통합 메모리 버전을 공개했다.
AI 음악 플랫폼 Suno가 조화로운 배경음악과 함께 합성 음성을 생성할 수 있는 퍼블릭 베타 도구 'Speech'를 선보였다.
Meta가 QuickBooks, Shopify, Slack 연동을 지원하는 인기 AI 에이전트 Muse의 중소기업 버전을 출시한 가운데, OpenAI의 경쟁 제품 Dots 발표와 자율 시스템 감독에 대한 우려가 함께 고조되고 있다.
구글이 안드로이드 기기에서 제미나이 라이브를 통해 카메라에 담긴 사물을 실시간 음성으로 설명하고 질문에 답해주는 '가이디드 비전' 기능을 선보였다.
OpenAI가 신규 ChatGPT Images 2.5 모델을 활용해 가상으로 옷을 입어보고 인앱 라이브러리에 상품을 저장할 수 있는 쇼핑 기능 2종을 ChatGPT에 글로벌 출시했다.
AI 스타트업 Tavus가 1분간의 영상 통화 테스트에서 참가자의 48%가 실제 사람으로 착각한 실시간 대화형 모델 'Griffin'을 공개했다.
Ideogram이 주변 구도의 변형이나 품질 저하 없이 이미지의 특정 요소만 수정할 수 있도록 설계된 이미지 생성 모델 'Ideogram 4.5'를 출시했으며, 4가지 요금 등급의 네이티브 2K 해상도를 지원하고 향후 오픈 웨이트 버전도 공개할 예정이다.
Shopify가 판매자가 AI 어시스턴트 Sidekick과의 대화를 통해 온라인 스토어 전체를 실시간으로 디자인하고 맞춤 설정할 수 있는 대화형 작업 공간 'Canvas'를 공개했다.
중국 AI 기업 Deepseek가 Huawei와 협력해 Ascend 950 프로세서 라인용 TileLang 언어를 포함한 오픈소스 프로그래밍 도구를 공개, Nvidia CUDA 생태계와의 소프트웨어 격차를 좁히려 한다.
Anthropic의 Frontier Red Team은 Zhipu AI의 GLM‑5.3이 자체 Claude Mythos Preview와 비슷한 수준으로 프론티어급 사이버 익스플로잇을 자동으로 생성할 수 있지만, 견고한 안전장치가 부족하다고 보고했다.
OpenAI가 DevDay에서 Space, Pages와 같은 협업 도구와 Slack·Teams 연동 기능, 신규 엔터프라이즈 개발자 기능을 선보이며 ChatGPT의 대대적인 확장을 발표했다.
Wabi가 프롬프트 기반 앱 제작 도구에서 채팅창 내에서 온디맨드 소프트웨어 인터페이스를 생성하는 인터랙티브 메시징 플랫폼으로 탈바꿈한 초대 기반 전면 개편 버전 'Wabi 2.0'을 선보였다.
OpenAI가 DevDay에서 기기 간 재사용 가능한 클라우드 환경, 음성 입력 CLI, 자동 리포지토리 보안 스캔, 신규 API 기능을 포함한 소프트웨어 엔지니어링 에이전트 Codex의 주요 업데이트를 공개했다.
NVIDIA가 수작업 튜닝 없이도 즉각적인 예측을 제공하며 전적으로 합성 데이터로만 학습된 오픈 정형 파운데이션 모델 패밀리 'Kumo Tabular'를 출시했다.
ElevenLabs가 강화된 감정 표현 디렉팅, 90개 언어 지원 다국어 복제, 150밀리초 응답 속도를 제공하는 플래그십 음성 모델 Eleven v4와 초저지연 Turbo 에디션을 출시했다.
마리사 메이어 전 Yahoo CEO가 800만 달러 규모의 시드 투자를 유치하고, 이메일 대신 사용자의 사진첩을 통해 개인 맞춤형 맥락을 파악하는 AI 비서 ‘Dazzle’을 선보였다.
OpenAI가 '데브데이 2026' 콘퍼런스에서 주간 12억 명의 사용자를 겨냥해 상시 작동형 AI 에이전트 'Dots', 고효율 모델 'GPT-6.1 Sol', 그리고 기업 및 개발자용 툴 제품군을 대거 발표했다.
Manus 2.0은 Cascade 하네스, 이벤트 기반 트리거, 데스크톱 저작 환경과 함께 자율 에이전트 전용 개인 인프라를 제공하는 컴패니언 앱을 선보인다.
엔비디아가 자율 에이전트의 인가된 환경 이탈을 막기 위해 오픈소스 소프트웨어와 BlueField-4 하드웨어 통제 기술을 결합한 '오픈 에이전트 세이프티 플랫폼'을 발표했다. 이번 출시는 기업용 AI 에이전트가 애플리케이션 수준의 안전장치를 우회해 외부 시스템에 무단 접근한 최근 사건들에 따른 조치다.
젠슨 황 Nvidia CEO가 AI 에이전트를 격리해 최근 OpenAI 등 주요 연구소에서 발생한 탈출 및 침해 사고를 방지하도록 설계된 하드웨어·소프트웨어 통합 격리 플랫폼을 공개했다.
Nvidia가 업계 전반의 샌드박스 탈출 사례에 대응해, 통제를 벗어난 AI 에이전트를 수 밀리초 만에 격리하도록 설계된 하드웨어 및 소프트웨어 기반 봉쇄 시스템인 Open Agent Safety Platform을 출시했다.
새로운 오픈 웨이트 모델이 VoiceArena 벤치마크에서 14.7% 다이어리제이션 오류율을 기록했으며, 전 모델보다 약 41% 향상된 것으로 나타났다.
연구진은 HomeBody 시스템을 공개했으며, 이 시스템은 GPT‑6 Astra를 활용해 중간 제어 계층 없이 Unitree G1 로봇이 익숙하지 않은 주방을 탐색·맵핑·청소하도록 한다.
구글이 100개 이상의 언어로 맞춤형 음성을 생성할 수 있는 Gemini 3.8 Flash TTS와 Flash-Lite TTS를 출시하며 엔터프라이즈 AI 라인업을 강화했다.
메타가 스마트폰과 웹 브라우저에서 플레이 가능한 게임을 제작하고 인스타그램과 페이스북을 통해 즉시 공유할 수 있는 AI 기반 툴 'Horizon Create'와 'Horizon Studio'를 공개했다.
Black Forest Labs가 이전 세대 대비 최대 3.95배 빠른 실행 속도를 구현하고 로보틱스 벤치마크 신기록을 달성한 오픈소스 월드-액션 모델 'FLUX 3 Action'을 공개했다.
Google이 기기 간 탭 공유 시 스크롤 위치와 작성 중인 폼 데이터를 유지하고, 외부 오디오 분석 및 학습용 퀴즈 생성이 가능하도록 Gemini의 기능을 확대한 Chrome 업데이트를 배포한다.
Google이 Gemini AI를 통해 지역 매장에 전화를 걸고 대기 시간을 거쳐 예약을 처리하며, 사용자가 실시간으로 직접 통화에 개입할 수 있는 Pixel 11용 실험적 기능을 배포한다.
OpenAI가 신규 GPT-6 모델 라인업을 기반으로 이메일, 캘린더, Slack과 직접 연동할 수 있는 ChatGPT Voice 주요 업데이트를 선보였다.
구글이 100개 이상의 언어를 지원하며 텍스트 프롬프트나 짧은 오디오 샘플로 맞춤형 음성을 생성할 수 있는 신규 음성 합성 모델 Gemini 3.8 Flash TTS 및 Flash-Lite TTS를 공개했다.
유튜브가 연례 'Made on YouTube' 행사에서 기존 영상의 메타데이터를 갱신하고, 영상 에셋을 생성하며, 스폰서십 제안서 초안을 작성할 수 있는 자율형 AI 에이전트를 공개했다.
유튜브가 연례 행사인 'Made on YouTube'에서 자동 썸네일 생성, 초안 영상 호흡 피드백, 영상 도입부 멀티컷 테스트 등을 포함한 YouTube Studio용 AI 도구를 대거 공개했다.
NVIDIA가 실시간 및 녹음 오디오에서 겹치는 발화를 포함해 최대 8명의 화자를 추적할 수 있는 1억 파라미터 규모의 오픈 가중치 모델 'Nemotron 3 Diarization'을 출시하고 VoiceArena의 Diarization-Bench에서 1위를 차지했다.
OpenAI GPT‑5.6 기반 Ringg의 다국어 AI 에이전트가 음성, 채팅, WhatsApp, 웹 등에서 들어오는 요청의 3분의 2까지 해결하고, 월 700만 건 이상의 전화를 처리하면서 모델 비용을 약 90% 절감한다.