Mistral Large 4 benchmarks

Gepubliceerd bewijs voor beveiliging, codering en redeneren, met bron- en methodegrenzen zichtbaar gehouden.

Cybench

93%

Cybersecurity-uitdagingen

Mistral Large 4
93%
Gemeld door Mistral AI · niet getest door deze site

CyberGym

82%

Real-world kwetsbaarheidstaken

Mistral Large 4
82%
Gemeld door Mistral AI · niet getest door deze site

DeepSWE v1.1

61.7%

Software-engineeringtaken

Mistral Large 4
61.7%
Gemeld door Mistral AI · niet getest door deze site

Dense200

42%

Redeneren op hoog niveau

Mistral Large 4
42%
GPT-6 Astra
41%
Gemeld door Mistral AI · niet getest door deze site

Bron: officiële release, oktober 6, 2026. Verschillende testopstellingen zijn niet direct vergelijkbaar. Lees de bron

Officieel gerapporteerde resultaten

BenchmarkGrote 4 scoreGebied
Cybench93%Cybersecurity
CyberGym82%Kwetsbaarheidstaken
DeepSWE v1.161.7%Software-engineering
SWE Atlas59.4%Code-agenttaken
Terminal Bench 428.3%Terminaltaken
Dense20042%Redeneren
AutomationBench59.9%Automatisering

Deze resultaten komen uit de release-aankondiging van Mistral. Deze website heeft de benchmarkruns niet gereproduceerd. Een percentage meet een specifieke test, niet de algehele betrouwbaarheid.

Vergelijk dezelfde taak en voorwaarden

Houd de modelidentificatie, harness-versie, tooltoegang, redeneerbudget en uitvoerlimieten vast. Rapporteer slagingspercentage naast tijd, kosten en foutpatronen. Voer herhaalde proeven uit voor taken met variabele resultaten.

  1. Kies representatieve taken met ground-truth-antwoorden of uitvoerbare tests.
  2. Gebruik dezelfde invoer en publiceer de evaluatie-instellingen.
  3. Inspecteer mislukkingen, niet alleen de totaalscore.
  4. Herhaal de vergelijking wanneer een modelversie wijzigt.

Van een ranglijst naar je werklast

Een veilige patch moet nog steeds je tests doorstaan. Een documentantwoord moet de bronpassage citeren. Vertaling heeft doelgroep- en domeinreview nodig. Gebruik een kleine gelabelde evaluatieset voordat je een provider kiest.