Mistral Large 4 benchmarks
Gepubliceerd bewijs voor beveiliging, codering en redeneren, met bron- en methodegrenzen zichtbaar gehouden.
Cybench
93%Cybersecurity-uitdagingen
Gemeld door Mistral AI · niet getest door deze siteCyberGym
82%Real-world kwetsbaarheidstaken
Gemeld door Mistral AI · niet getest door deze siteDeepSWE v1.1
61.7%Software-engineeringtaken
Gemeld door Mistral AI · niet getest door deze siteDense200
42%Redeneren op hoog niveau
Gemeld door Mistral AI · niet getest door deze siteBron: officiële release, oktober 6, 2026. Verschillende testopstellingen zijn niet direct vergelijkbaar. Lees de bron
Officieel gerapporteerde resultaten
| Benchmark | Grote 4 score | Gebied |
|---|---|---|
| Cybench | 93% | Cybersecurity |
| CyberGym | 82% | Kwetsbaarheidstaken |
| DeepSWE v1.1 | 61.7% | Software-engineering |
| SWE Atlas | 59.4% | Code-agenttaken |
| Terminal Bench 4 | 28.3% | Terminaltaken |
| Dense200 | 42% | Redeneren |
| AutomationBench | 59.9% | Automatisering |
Deze resultaten komen uit de release-aankondiging van Mistral. Deze website heeft de benchmarkruns niet gereproduceerd. Een percentage meet een specifieke test, niet de algehele betrouwbaarheid.
Vergelijk dezelfde taak en voorwaarden
Houd de modelidentificatie, harness-versie, tooltoegang, redeneerbudget en uitvoerlimieten vast. Rapporteer slagingspercentage naast tijd, kosten en foutpatronen. Voer herhaalde proeven uit voor taken met variabele resultaten.
- Kies representatieve taken met ground-truth-antwoorden of uitvoerbare tests.
- Gebruik dezelfde invoer en publiceer de evaluatie-instellingen.
- Inspecteer mislukkingen, niet alleen de totaalscore.
- Herhaal de vergelijking wanneer een modelversie wijzigt.
Van een ranglijst naar je werklast
Een veilige patch moet nog steeds je tests doorstaan. Een documentantwoord moet de bronpassage citeren. Vertaling heeft doelgroep- en domeinreview nodig. Gebruik een kleine gelabelde evaluatieset voordat je een provider kiest.