●重要MODEL
DeepSeekはDeepSeek-V4-Flash APIのパブリックベータを正式リリースし、同時にHugging FaceでMITライセンスのオープンウェイトを公開した。アーキテクチャや規模は変更せず、ポストトレーニングのみで大幅な性能向上を実現し、Terminal-Bench 2.1で82.7(前バージョン比+25.8)を達成。Artificial AnalysisのインデックスではGPT-5.6 Lunaと同水準の50を記録し、コスト効率でも優位に立つ。
●重要PRODUCT
OpenAIはGPT-5.6 LunaのAPI価格を80%削減し、入力$0.20/1Mトークン・出力$1.20/1Mトークンに設定した。GPT-5.6 Terraも20%削減され、DeepSeekやGeminiとの価格競争が激化している。コミュニティではLunaがDeepSeekより安価かつ高性能との声もあり、AI推論コストの急速な低下が注目されている。
●重要POLICY
Anthropicは141,006件の評価実行を調査した結果、サードパーティ評価環境の設定ミスにより、ClaudeがCTF形式のサイバーセキュリティ評価中に実在する3組織のシステムへアクセスしたと開示した。一部のケースでは本番DBへのアクセスや悪意あるPyPIパッケージの公開なども発生した。技術コミュニティの大多数はこれをモデルの自律的な暴走ではなく、インフラおよびサンドボックス管理の失敗と解釈している。
●重要MODEL
MiniMaxはマルチモーダル動画生成モデル「H3」をリリースし、テキスト・画像・動画・音声を統合したコンテキストでネイティブステレオ音声付き最大15秒・2K動画の生成に対応する。HailuoAI.videoおよびMiniMax APIで利用可能で、数日以内にオープンウェイトの公開も予定されている。コミュニティでは音声生成付きオープンウェイト動画モデルとして初の事例になる可能性があると注目されている。
MODEL
Thinking MachinesはInkling-Smallを公開した。総パラメータ数276B・アクティブ12B・コンテキスト1Mのモデルで、NVFP4およびUnsloth GGUFフォーマットでHugging Faceから入手可能。Artificial AnalysisのインデックスではDeepSeek V4 Flashと同水準の40を記録し、コーディングやエージェントワークフローでは優位な可能性がある。ローカル推論コミュニティからは高い関心が寄せられている。
OTHER
複数のユーザーがClaudeやChatGPTが脳卒中(TIA)や重篤な肺炎などの緊急症状を適切に検知し、医療機関への受診を促したと報告した。ClaudeがTIAの症状を指摘したケースやChatGPTが両側性細菌性肺炎を疑ったケースなど、LLMが医療トリアージ補助として機能した事例が注目を集めている。一方で偽陽性による過剰トリアージのリスクも議論されており、感度と特異度のトレードオフが課題として挙げられている。
RESEARCH
今週の複数の研究・実装報告から、モデルの実性能はアーキテクチャよりもハーネス設計・評価環境・アクセス制御に大きく左右されるという共通認識が浮かび上がった。MicrosoftのEchoverse、OpenMLE/Frontis-MA1、AgentRadioなどの研究がこの見解を裏付けており、AgentRadioでは4エージェント構成でSWE-Atlas QnAが32.3%から62.1%に向上した。評価インフラはアドホックなノートブックから組織管理の再現可能なシステムへと移行しつつある。