DeepSeek-V4-Flash-Vision-Expリリース:マルチモーダルエージェント性能がOpus-4.8に迫る
DeepSeekがDeepSeek-V4-Flash-Vision-Expをリリースし、V4-Flashのテキスト性能を維持しながらマルチモーダル入力に対応した。画像は117〜384トークンとしてFlash価格で課金され、再利用可能なFiles APIも新たに提供される。マルチモーダルエージェントベンチマークでOpus-4.8に近い性能を示すと主張されている。
8件 — 重要 6件
元記事を読む →DeepSeekがDeepSeek-V4-Flash-Vision-Expをリリースし、V4-Flashのテキスト性能を維持しながらマルチモーダル入力に対応した。画像は117〜384トークンとしてFlash価格で課金され、再利用可能なFiles APIも新たに提供される。マルチモーダルエージェントベンチマークでOpus-4.8に近い性能を示すと主張されている。
Ox AlphaというステルスモデルがDeepSWEタスクで80%以上を記録し、Fable(65%)やGPT-5.6 Sol(52%)を大幅に上回ると報告された。コミュニティの分析ではZhipu/GLM系モデル(GLM-5.3 Visionまたはそのフラッシュ派生)である可能性が高いとされ、巨大な新ベースモデルではなくポストトレーニングとインフラの改善によるものと見られている。OpenRouter、Hermes Agent、Clineなどを通じて急速に普及した。
OpenAIがGPT-5.6 SolのAPIおよびクレジットベース製品の価格を3ヶ月間20%以上削減すると発表した。Cognitionによれば、Devinでは複数の割引を組み合わせることで10月3日まで実質76%オフになるという。この動きは利用率・効率の改善と中国勢の安価な推論への競争的対応と見られている。
OpenAIのCodexがアクティブユーザー2000万人を突破し、CodexおよびChatGPT Workユーザー全員に「バンクリセット」が付与された。エージェント型ワークロードの急増に伴い、OpenAIはAPIキー別の使用量・支出追跡と月次ハード上限設定機能も追加した。市場センチメントはAnthropicからOpenAIへ回帰しつつあるとの見方もある。
NVIDIAの汎用コーディング・自律エージェントAVOが、ARC-AGI-3の公開環境25種183レベルを指示・ルール・目標の明示なしにすべてクリアしたと発表された。ただしFrançois Cholletは、これは公開デモ・チュートリアルセットであり非公開ベンチマークセットではないと注意を促している。ベンチマーク特化の最適化である可能性を指摘する声もある。
NvidiaがPoolsideのLagunaモデル開発スタック「Model Factory」を約60億ドルでライセンスし、さらに約12億ドルのプレマネー評価額で10億ドルを投資すると報じられた。Poolsideの109名の従業員にNvidiaからオファーが出されており、事実上のアクイハイアとも見られている。この動きはNvidiaのオープンモデル・Nemotronエコシステム強化の一環とされる。
Percy LiangがMarin 535B-A23Bのトレーニング開始を発表した。11台のGB200 NVL72上で18.75兆トークンを約3ヶ月かけて学習する予定で、従来通りトレーニングプロセスはオープンに公開される。大規模オープンソースモデルの透明性確保の取り組みとして注目される。
vLLMのIsoExecが、浮動小数点演算の非結合性によるロールアウト・トレーニング間の対数確率不一致問題に対処し、TP/EP/SPレイアウト間でビット単位の一致を強制する。Qwen3.5-35B-A3BでDAPOを8xH100上で実行した場合、対数確率差が1.6e-2から6.7e-7に低下し、オーバーヘッドは25.3%に抑えられた。RLベースのトレーニングパイプラインの正確性向上に重要なシステム的成果とされる。