Mistral Large 4 基準測試
已發布的安全性、程式設計與推理證據,來源與方法界線保持可見。
Cybench
93%資安挑戰
由 Mistral AI 回報 · 本站未測試CyberGym
82%真實世界的漏洞任務
由 Mistral AI 回報 · 本站未測試DeepSWE v1.1
61.7%軟體工程任務
由 Mistral AI 回報 · 本站未測試Dense200
42%高難度推理
由 Mistral AI 回報 · 本站未測試來源:官方發布,6, 月 2026. 日。不同的測試設定無法直接比較。 閱讀來源
官方回報的結果
| 基準測試 | 大型 4 分數 | 區域 |
|---|---|---|
| Cybench | 93% | 資安 |
| CyberGym | 82% | 漏洞任務 |
| DeepSWE v1.1 | 61.7% | 軟體工程 |
| SWE Atlas | 59.4% | 程式碼代理任務 |
| Terminal Bench 4 | 28.3% | 終端機任務 |
| Dense200 | 42% | 推理 |
| AutomationBench | 59.9% | 自動化 |
這些結果來自 Mistral 的發布公告。本網站尚未重現基準測試。百分比代表特定測試,不代表整體可靠性。
在相同任務和條件下比較
固定模型識別碼、測試環境版本、工具存取權、推理預算與輸出上限。回報通過率時一併列出時間、成本與失敗模式。對結果不穩定的任務執行重複試驗。
- 選擇具備標準答案或可執行測試的代表性任務。
- 使用相同的輸入並發布評估設定。
- 檢視失敗案例,不只看整體分數。
- 當模型版本變更時,請重複比較。
從排行榜到您的工作負載
安全的修補仍須通過你的測試。文件答案必須引用來源段落。翻譯需要受眾與領域審查。在確定供應商之前,先用小型標註評估集。