Mistral AI、Mistral Large 4 が Harvey の Legal Agent Benchmark でオープンソースモデル首位と発表
Mistral AI は、Mistral Large 4 が Harvey の Legal Agent Benchmark でオープンソースモデル首位になったと発表した。
Mistral AI は、Mistral Large 4 が Harvey の Legal Agent Benchmark でオープンソースモデル首位になったと発表した。
Mistral AIはAutomationBenchの評価結果を公開した。Mistral Large 4は模擬職場アプリケーションにおける657件の業務ワークフローを完了し、Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Proを上回る結果となった。
Mistral Large 4が1,534スコアを獲得してArena.aiのCode Arena: WebDevリーダーボードで45位に入り、Claude Opus 4.8 (High)と2スコア差以内の性能を約6分の1の混合トークンコストで達成しました。
OpenCodeがプラットフォーム上でMistral Large 4の提供を開始し、今後2週間にわたり同モデルを50%引きで提供します。
Clineの報告によると、Mistral Large 4はサイバーセキュリティベンチマークでOpus 5.5およびGPT-6 Astraを上回った。競合モデルではタスクの約40%がセーフティフィルターによりブロックされたことが主な要因である。
ClineはコマンドラインインターフェースおよびデスクトップアプリでMistral Large 4のサポートを追加した。同チームによると、本モデルにより、GPTやClaudeモデルでは制限されていたり利用できなかったりしたセキュリティ重視のワークフローが可能になるという。
Command Codeは全プランおよびAPIでMistral Large 4の提供を開始しました。総パラメータ数は1兆、アクティブパラメータ数は490億で、524Kのコンテキストウィンドウを備えています。
Mistral AI は、Mistral Large 4 が未知のバイナリをエンドツーエンドで解析し、検体を Cobalt Strike と特定して侵害指標(IoC)や設定情報を抽出し、YARA ルールを含むレポートを 12 分で作成する様子を実演した。
Mistral AI は、Mistral Large 4 が実環境での実行に基づくツール呼び出しを用い、Capture the Flag(CTF)スピードランで 19 問中 18 問の課題を解決したと報告した。
Surge AIはMistral Large 4のリリースにあたり、先端5モデルのコードレビュー品質を評価した。同モデルはオープンウェイトモデルの中で首位、総合ではOpus 5に次ぐ2位となった。
Mistral Large 4がOpenRouterでパブリックプレビューとして利用可能になりました。100万トークンのコンテキストウィンドウを備え、キャッシュ入力は100万トークンあたり0.07ドルです。最初の2週間は50%割引が適用され、入力は100万トークンあたり0.68ドル、出力は2.09ドルになります。
Arena.ai は、Mistral AI の Mistral Large 4 を Agent Arena でのユーザーテスト向けに追加し、WebDev、Text、Vision にわたる Code Arena でも提供を開始した。本モデルは総パラメータ数1兆、アクティブパラメータ数490億で、評価スコアは近日中に公開される予定。
OpenRouterでMistral Large 4のパブリックプレビューが利用可能になりました。512Kのコンテキストウィンドウと最大256Kの出力トークンに対応しています。OpenRouterは最初の2週間、入力100万トークンあたり0.68ドル、出力100万トークンあたり2.09ドルとする50%割引を提供します。
Victor M氏はMistral 4が間もなくHugging Faceで公開されると述べ、Mistral-Large-4.0-1T05-A52Bのモデルページへのリンクを示した。公開日は記載されておらず、重みが現在利用可能であるとも述べられていない。
Mistral AIは、総パラメータ数1兆、アクティブパラメータ数490億のネイティブマルチモーダルモデル「Mistral Large 4」を発表した。10月下旬に予定されているオープンウェイト公開に先立ち、現在はAPIおよびMistral Cloudインフラを通じて利用できる。