Mistral Large 4 ベンチマーク

セキュリティ、コーディング、推論に関する公開された根拠。ソースと手法の境界を明確に保ちます。

Cybench

93%

サイバーセキュリティの課題

Mistral Large 4
93%
Mistral AI による報告 · このサイトではテストされていません

CyberGym

82%

実世界の脆弱性タスク

Mistral Large 4
82%
Mistral AI による報告 · このサイトではテストされていません

DeepSWE v1.1

61.7%

ソフトウェアエンジニアリングのタスク

Mistral Large 4
61.7%
Mistral AI による報告 · このサイトではテストされていません

Dense200

42%

高難易度の推論

Mistral Large 4
42%
GPT-6 Astra
41%
Mistral AI による報告 · このサイトではテストされていません

ソース: 公式リリース、6,年2026.月。異なるテスト設定は直接比較できません。 ソースを読む

公式に報告された結果

ベンチマーク大きな 4 スコア地域
Cybench93%サイバーセキュリティ
CyberGym82%脆弱性タスク
DeepSWE v1.161.7%ソフトウェアエンジニアリング
SWE Atlas59.4%コードエージェントのタスク
Terminal Bench 428.3%ターミナルタスク
Dense20042%推論
AutomationBench59.9%自動化

これらの結果はMistralのリリース発表からのものです。このウェブサイトはベンチマークの実行を再現していません。パーセンテージは特定のテストを測定するものであり、全体的な信頼性ではありません。

同じタスクと条件で比較

モデル識別子、ハーネスバージョン、ツールアクセス、推論予算、出力制限を固定してください。時間、コスト、失敗パターンとともに合格率を報告してください。結果が変動するタスクでは繰り返し試行を実行してください。

  1. 正解データまたは実行可能なテストを持つ代表的なタスクを選択
  2. 同じ入力を使用し、評価設定を公開してください。
  3. 総合スコアだけでなく、失敗を確認してください。
  4. モデルのバージョンが変更されたら比較を繰り返してください。

リーダーボードからあなたのワークロードへ

安全なパッチはテストも通過する必要があります。ドキュメントの答えは出典箇所を引用する必要があります。翻訳には対象読者と分野のレビューが必要です。プロバイダーを選ぶ前に、小さなラベル付き評価セットを使ってください。