Mistral Large 4 基準測試

已發布的安全性、程式設計與推理證據,來源與方法界線保持可見。

Cybench

93%

資安挑戰

Mistral Large 4
93%
由 Mistral AI 回報 · 本站未測試

CyberGym

82%

真實世界的漏洞任務

Mistral Large 4
82%
由 Mistral AI 回報 · 本站未測試

DeepSWE v1.1

61.7%

軟體工程任務

Mistral Large 4
61.7%
由 Mistral AI 回報 · 本站未測試

Dense200

42%

高難度推理

Mistral Large 4
42%
GPT-6 Astra
41%
由 Mistral AI 回報 · 本站未測試

來源:官方發布,6, 月 2026. 日。不同的測試設定無法直接比較。 閱讀來源

官方回報的結果

基準測試大型 4 分數區域
Cybench93%資安
CyberGym82%漏洞任務
DeepSWE v1.161.7%軟體工程
SWE Atlas59.4%程式碼代理任務
Terminal Bench 428.3%終端機任務
Dense20042%推理
AutomationBench59.9%自動化

這些結果來自 Mistral 的發布公告。本網站尚未重現基準測試。百分比代表特定測試,不代表整體可靠性。

在相同任務和條件下比較

固定模型識別碼、測試環境版本、工具存取權、推理預算與輸出上限。回報通過率時一併列出時間、成本與失敗模式。對結果不穩定的任務執行重複試驗。

  1. 選擇具備標準答案或可執行測試的代表性任務。
  2. 使用相同的輸入並發布評估設定。
  3. 檢視失敗案例,不只看整體分數。
  4. 當模型版本變更時,請重複比較。

從排行榜到您的工作負載

安全的修補仍須通過你的測試。文件答案必須引用來源段落。翻譯需要受眾與領域審查。在確定供應商之前,先用小型標註評估集。