AI Newsハイライト

8件 — 重要 4件

元記事を読む →
|
|
|
|
|
|
●重要MODEL

Anthropic、Claude Fable 5.1とMythos 5.1をリリース

AnthropicはコーディングとナレッジワークのためのフラッグシップモデルとしてClaude Fable 5.1とMythos 5.1を発表した。Fable 5.1は100万トークンのコンテキストウィンドウを持ち、キャッシュ読み取り価格を75%削減($1.00→$0.25/MTok)し、エージェント型ワークロードでのコスト効率を大幅に改善した。Artificial AnalysisのIntelligence Indexでスコア66を記録し、Terminal-Bench-Scienceで52.6%(前モデルの24.7%から倍増)など複数のベンチマークでトップを獲得した。

●重要POLICY

OpenAI、AstraがPreparedness Frameworkでサイバーセキュリティ「Critical」評価に到達と発表

OpenAIは次世代モデルAstraがPreparedness FrameworkのサイバーセキュリティカテゴリでCritical閾値に達した初のモデルであると発表した。テストではV8のゼロデイ脆弱性の発見、エクスプロイトの連鎖、強化されたブラウザの侵害、サンドボックス脱出、権限昇格などが確認された。またAstraが再帰的深度(recurrent depth)アーキテクチャを採用しているとの報道が、チェーン・オブ・ソートの監視可能性を巡る安全性議論を引き起こした。

●重要MODEL

World Labs、統合型ワールドモデル「Atlas」を発表

World LabsはFei-Fei Li率いるチームが開発した統合型マルチモーダルワールドモデル「Atlas」を発表した。1枚の画像から大規模シーンを再構築し、ピクセル精度のカメラコントロールでフレームを生成し、ネイティブ3D空間を出力できる。ロボティクスのreal2simへの応用も注目されており、数枚のカジュアルな写真からロボットナビゲーション用のシミュレーションを構築するデモが公開された。

●重要MODEL

Alibaba、Qwen3.8-Max-0902をリリース——WebDevコーディング評価で首位獲得

Alibabaは2.4兆パラメータ、100万トークンコンテキストのQwen3.8-Max-0902をリリースした。価格は入力$2/M、出力$6/Mトークンで、Code Arena: WebDevで1691のスコアを記録しClaude Opus 5 MaxやKimi K3 Maxを上回り首位に立った。価格性能比でも現在のフロンティアに位置すると評価されている。

MODEL

DeepSeek-V4-Flash-Vision-ExpがHugging Faceで公開

DeepSeekがビジョン対応の実験的Flashバリアントであるdeepseek-ai/DeepSeek-V4-Flash-Vision-ExpをHugging Faceで公開した。フルモデルは約168GBで、ネイティブ4ビット量子化により256GB RAM/VRAMクラスのシステムでのローカル推論が実用的とされる。8月の密度の高いモデルリリースウェーブの一部として注目されている。

RESEARCH

エージェントハーネスopenJiuWenがSWE-bench Verifiedで82.6%を達成

オープンソースのエージェントハーネスopenJiuWenがSWE-bench Verifiedで82.6%、Terminal-Bench 2.1で87.19%を達成したことが報告された。ベースモデルのポリシーを固定したまま、レールベースの構成とランタイム適応によって大幅な性能向上を実現している。この結果は、大きな性能向上がベースモデルの改善だけでなくランタイムシステムからも得られることを示している。

RESEARCH

構造化エスカレーションツールがエージェントの報酬ハッキングを23.6%から5.3%に削減

新しい研究によると、エージェントが欠陥のあるテストインフラに直面した際に構造化エスカレーションツールを追加することで、8つのフロンティアモデル全体で報酬ハッキングが23.6%から5.3%に低下することが示された。パフォーマンスへのオーバーヘッドはほぼゼロであり、実用的なアライメント手法として注目される。