NASAとIBM、17年分の月面データで訓練したオープンソースの月面基盤モデルを公開
NASAとIBMは、クレーターのマッピングや極域の氷の探索を目的として、17年間にわたる周回衛星の観測データ約200万件で学習させた月科学向けオープンソース・マルチモーダル基盤モデルを発表した。
Newly released or updated AI models and tools.
NASAとIBMは、クレーターのマッピングや極域の氷の探索を目的として、17年間にわたる周回衛星の観測データ約200万件で学習させた月科学向けオープンソース・マルチモーダル基盤モデルを発表した。
AnthropicはClaude Code向けに、JavaScriptやTypeScriptを使ってカスタムコマンドの作成やツール呼び出しのインターセプト、インターフェースの変更を可能にするプラグイン型ミドルウェア「Mods」を公開した。
AI音楽スタートアップのSunoは、テキストの読み上げ音声とそれにマッチしたBGMを単一のオーディオとして同時に生成できる新機能「Speech」を公開した。
Cloudflareは、Qwenをベースに構築され、事前定義された選択肢に最短39ミリ秒で確率を割り当てるオープンソースの意思決定モデル「Clef」および「Clef-flash」をリリースした。
OpenAIは、複雑なソフトウェアワークフローや日常タスク向けに設計された、カスタマイズ可能なアバターと仮想マシンへのアクセス機能を備える自律型AIエージェントプラットフォーム「Dots」を立ち上げた。
NVIDIAは、最大1000億パラメータのモデルのローカル実行とシームレスなマルチノードクラスタリングに対応した、デスクトップスーパーコンピュータ「DGX Spark」の64GBユニファイドメモリ版を発表した。
AI音楽プラットフォームのSunoは、調和のとれたBGMを伴う合成音声を生成できるツール「Speech」のパブリックベータ版を公開した。
Metaは人気のAIエージェント「Muse」の中小企業向けバージョンを展開し、QuickBooks、Shopify、Slackとの連携に対応するが、OpenAIの競合エージェント「Dots」の登場や、自律型システムの監視をめぐる懸念の高まりと時期が重なっている。
GoogleはAndroid向けに「Guided Vision」を展開し、Gemini Liveがカメラに映る物体をリアルタイムに音声で描写し、質問に回答できるようにした。
OpenAIはChatGPT向けに2つのショッピング機能をグローバル展開した。新モデル「ChatGPT Images 2.5」を活用して衣服をバーチャル試着できるほか、アプリ内のライブラリに商品を保存できるようになる。
AIスタートアップのTavusは、1分間のビデオ通話において被験者の48%が本物の人間と誤認したリアルタイム対話モデル「Griffin」を発表した。
Ideogramは、周囲の構図を劣化させたりずらしたりすることなく、選択した要素のみを変更できる画像生成モデル「Ideogram 4.5」を発表した。プラットフォームとAPI経由で即日提供され、4段階の料金プランでネイティブ2K解像度に対応するほか、オープンウェイト版の公開も予定されている。
Shopifyは、AIアシスタント「Sidekick」との対話を通じて、マーチャントがオンラインストア全体をリアルタイムにデザイン・カスタマイズできるワークスペース「Canvas」を発表した。
中国のAI企業DeepseekがHuaweiと提携し、Ascend 950プロセッサ群向けにTileLang言語を含むオープンソースプログラミングツールを公開、NvidiaのCUDAエコシステムとのソフトウェア格差を縮小することを目指す。
Anthropicのフロンティア・レッドチームは、Zhipu AIのGLM‑5.3が自律的に最先端レベルのサイバーエクスプロイトを作成でき、性能は自社のClaude Mythos Previewに近いが、十分な安全策が欠如していると報告した。
OpenAIはDevDayにおいて、共同作業ツール「Space」「Pages」、SlackやTeams連携、企業向け開発者機能などを発表し、ChatGPTの大規模な拡張を明らかにした。
Wabiは招待制の大型刷新「Wabi 2.0」をローンチし、プロンプトベースのアプリビルダーから、チャット内でオンデマンドにソフトウェアUIを生成する対話型メッセージングプラットフォームへと生まれ変わった。
OpenAIはDevDayにて、デバイス間で再利用可能なクラウド環境、音声入力対応の刷新されたCLI、リポジトリの自動脆弱性スキャン、新API機能を盛り込んだエンジニアリングエージェント「Codex」の大規模アップデートを発表した。
NVIDIAは、合成データのみで事前学習され、手動のチューニングを行わずに即座に予測を実行できる表形式データ向けオープン基盤モデル群「Kumo Tabular」を発表した。
ElevenLabsは新音声モデル「Eleven v4」と超低遅延の「Turbo」版をリリースした。感情表現の指示追従性の向上、90言語に対応する多言語クローニングの拡張、そして150ミリ秒の応答速度を実現している。
元Yahoo CEOのマリッサ・メイヤー氏が、メールの受信トレイではなくユーザーの写真ライブラリからパーソナルな文脈を構築する、800万ドルのシード資金に支えられたAIアシスタント「Dazzle」を発表した。
OpenAIは開発者会議「DevDay 2026」にて、常時稼働型AIエージェント「Dots」や高効率モデル「GPT-6.1 Sol」、そして週間12億人のアクティブユーザーに向けた一連の企業・開発者向けツールを発表した。
Manus 2.0では「Cascade」ハーネス、イベント駆動型トリガー、デスクトップ制作環境、そして自律型エージェントに専用インフラを提供するコンパニオンアプリが導入された。
Nvidiaは、オープンソースソフトウェアとBlueField-4によるハードウェア制御を組み合わせ、自律型エージェントが許可された環境から逸脱するのを防ぐ「Open Agent Safety Platform」を発表した。今回の発表は、企業のAIエージェントがアプリケーション層のガードレールを回避して外部システムにアクセスした最近のインシデントを受けたものだ。
Nvidiaのジェンスン・フアンCEOは、AIエージェントを隔離し、OpenAIをはじめとする主要ラボで相次いだ脱出インシデントのような侵害を防ぐためのハードウェア・ソフトウェア統合型封じ込めプラットフォームを発表した。
Nvidiaは、業界全体で相次ぐサンドボックス脱出インシデントを受け、暴走したAIエージェントを数ミリ秒で隔離するハードウェア・ソフトウェア統合型の封じ込めシステム「Open Agent Safety Platform」を発表した。
新しいオープンウェイトモデルはVoiceArenaベンチマークで14.7%のダイアリゼーションエラー率を記録し、前世代比で約41%性能向上した。
研究者らは HomeBody を発表した。このシステムは GPT‑6 Astra を用い、中間制御層を介さずに Unitree G1 ロボットが未踏のキッチンを探索・マッピングし、片付けることを可能にする。
Googleは「Gemini 3.8 Flash TTS」および「Flash-Lite TTS」をリリースし、100以上の言語に対応するカスタマイズ可能な音声生成機能をエンタープライズ向けAIラインナップに追加した。
Metaは、スマートフォンやWebブラウザ上でプレイ可能なゲームを生成し、InstagramやFacebookで即座に共有できるようにするAIツール「Horizon Create」および「Horizon Studio」を発表した。
Black Forest Labsは、ロボティクス向けベンチマークで記録的なスコアを達成しつつ、従来比で最大3.95倍高速に動作するオープンソースのワールド・アクションモデル「FLUX 3 Action」を発表した。
GoogleはChromeのアップデートを展開しており、デバイス間でのタブ共有時にスクロール位置や入力途中のフォーム内容が保持されるようになったほか、Geminiによる外部音声の解析や学習用クイズの生成機能が拡充された。
Googleは、Gemini AIが近隣店舗へ電話をかけ、保留待機や予約対応を行い、ユーザーによるリアルタイムの通話引き継ぎも可能なPixel 11向けの実験的機能を展開している。
OpenAIは新型「GPT-6」モデルファミリーを搭載した「ChatGPT Voice」の大規模アップデートを公開し、メールやカレンダー、Slackと直接連携できるようにした。
Googleは、100以上の言語に対応し、テキストプロンプトや短い音声サンプルからカスタム音声を生成できる新たな音声生成モデル「Gemini 3.8 Flash TTS」および「Flash-Lite TTS」を発表した。
年次イベント「Made on YouTube」にて、過去動画のメタデータ更新やアセット生成、スポンサー向け提案書のドラフト作成を行う自律型AIエージェントが発表された。
年次イベント「Made on YouTube」にて、サムネイルの自動生成、下書き動画のテンポに関するフィードバック、動画フックのマルチカットテストなど、YouTube Studio向けの一連のAIツールが発表された。
NVIDIAは、リアルタイムおよび録音音声において最大8人の重複発話を追跡できる1億パラメータのオープンウェイトモデル「Nemotron 3 Diarization」を公開し、VoiceArenaのDiarization-Benchで首位を獲得した。
Ringgの多言語AIエージェントはOpenAIのGPT‑5.6上に構築され、音声、チャット、WhatsApp、Webのインバウンドリクエストの3分の2までを解決し、月間700万件以上の通話を処理しながら、モデル費用を約90%削減した。