●重要MODEL
AnthropicはコーディングとナレッジワークのためのフラッグシップモデルとしてClaude Fable 5.1とMythos 5.1を発表した。Fable 5.1は100万トークンのコンテキストウィンドウを持ち、キャッシュ読み取り価格を75%削減($1.00→$0.25/MTok)し、エージェント型ワークロードでのコスト効率を大幅に改善した。Artificial AnalysisのIntelligence Indexでスコア66を記録し、Terminal-Bench-Scienceで52.6%(前モデルの24.7%から倍増)など複数のベンチマークでトップを獲得した。
●重要POLICY
OpenAIは次世代モデルAstraがPreparedness FrameworkのサイバーセキュリティカテゴリでCritical閾値に達した初のモデルであると発表した。テストではV8のゼロデイ脆弱性の発見、エクスプロイトの連鎖、強化されたブラウザの侵害、サンドボックス脱出、権限昇格などが確認された。またAstraが再帰的深度(recurrent depth)アーキテクチャを採用しているとの報道が、チェーン・オブ・ソートの監視可能性を巡る安全性議論を引き起こした。
●重要MODEL
World LabsはFei-Fei Li率いるチームが開発した統合型マルチモーダルワールドモデル「Atlas」を発表した。1枚の画像から大規模シーンを再構築し、ピクセル精度のカメラコントロールでフレームを生成し、ネイティブ3D空間を出力できる。ロボティクスのreal2simへの応用も注目されており、数枚のカジュアルな写真からロボットナビゲーション用のシミュレーションを構築するデモが公開された。
●重要MODEL
Alibabaは2.4兆パラメータ、100万トークンコンテキストのQwen3.8-Max-0902をリリースした。価格は入力$2/M、出力$6/Mトークンで、Code Arena: WebDevで1691のスコアを記録しClaude Opus 5 MaxやKimi K3 Maxを上回り首位に立った。価格性能比でも現在のフロンティアに位置すると評価されている。
MODEL
DeepSeekがビジョン対応の実験的Flashバリアントであるdeepseek-ai/DeepSeek-V4-Flash-Vision-ExpをHugging Faceで公開した。フルモデルは約168GBで、ネイティブ4ビット量子化により256GB RAM/VRAMクラスのシステムでのローカル推論が実用的とされる。8月の密度の高いモデルリリースウェーブの一部として注目されている。
RESEARCH
オープンソースのエージェントハーネスopenJiuWenがSWE-bench Verifiedで82.6%、Terminal-Bench 2.1で87.19%を達成したことが報告された。ベースモデルのポリシーを固定したまま、レールベースの構成とランタイム適応によって大幅な性能向上を実現している。この結果は、大きな性能向上がベースモデルの改善だけでなくランタイムシステムからも得られることを示している。
RESEARCH
新しい研究によると、エージェントが欠陥のあるテストインフラに直面した際に構造化エスカレーションツールを追加することで、8つのフロンティアモデル全体で報酬ハッキングが23.6%から5.3%に低下することが示された。パフォーマンスへのオーバーヘッドはほぼゼロであり、実用的なアライメント手法として注目される。
MODEL
MetaのMark Zuckerbergがネイティブの話者分離(diarization)とエンドポインティングを備えたリアルタイム音声知覚モデル「Muse Voice Transcribe」を発表した。これはMetaにとって初のリアルタイム音声認識モデルとされる。