Mistral Large 4 ベンチマーク
セキュリティ、コーディング、推論に関する公開された根拠。ソースと手法の境界を明確に保ちます。
Cybench
93%サイバーセキュリティの課題
Mistral AI による報告 · このサイトではテストされていませんCyberGym
82%実世界の脆弱性タスク
Mistral AI による報告 · このサイトではテストされていませんDeepSWE v1.1
61.7%ソフトウェアエンジニアリングのタスク
Mistral AI による報告 · このサイトではテストされていませんDense200
42%高難易度の推論
Mistral AI による報告 · このサイトではテストされていませんソース: 公式リリース、6,年2026.月。異なるテスト設定は直接比較できません。 ソースを読む
公式に報告された結果
| ベンチマーク | 大きな 4 スコア | 地域 |
|---|---|---|
| Cybench | 93% | サイバーセキュリティ |
| CyberGym | 82% | 脆弱性タスク |
| DeepSWE v1.1 | 61.7% | ソフトウェアエンジニアリング |
| SWE Atlas | 59.4% | コードエージェントのタスク |
| Terminal Bench 4 | 28.3% | ターミナルタスク |
| Dense200 | 42% | 推論 |
| AutomationBench | 59.9% | 自動化 |
これらの結果はMistralのリリース発表からのものです。このウェブサイトはベンチマークの実行を再現していません。パーセンテージは特定のテストを測定するものであり、全体的な信頼性ではありません。
同じタスクと条件で比較
モデル識別子、ハーネスバージョン、ツールアクセス、推論予算、出力制限を固定してください。時間、コスト、失敗パターンとともに合格率を報告してください。結果が変動するタスクでは繰り返し試行を実行してください。
- 正解データまたは実行可能なテストを持つ代表的なタスクを選択
- 同じ入力を使用し、評価設定を公開してください。
- 総合スコアだけでなく、失敗を確認してください。
- モデルのバージョンが変更されたら比較を繰り返してください。
リーダーボードからあなたのワークロードへ
安全なパッチはテストも通過する必要があります。ドキュメントの答えは出典箇所を引用する必要があります。翻訳には対象読者と分野のレビューが必要です。プロバイダーを選ぶ前に、小さなラベル付き評価セットを使ってください。