Mistral Large 4 Benchmarks
Veröffentlichte Nachweise zu Sicherheit, Programmierung und Schlussfolgern, mit sichtbaren Quellen- und Methodengrenzen.
Cybench
93%Cybersicherheits-Challenges
Gemeldet von Mistral AI · nicht von dieser Seite getestetCyberGym
82%Praxisnahe Sicherheitsaufgaben
Gemeldet von Mistral AI · nicht von dieser Seite getestetDeepSWE v1.1
61.7%Aufgaben in der Softwareentwicklung
Gemeldet von Mistral AI · nicht von dieser Seite getestetDense200
42%Schwieriges Denken
Gemeldet von Mistral AI · nicht von dieser Seite getestetQuelle: offizielles Release, Oktober 6, 2026. Unterschiedliche Testaufbauten sind nicht direkt vergleichbar. Die Quelle lesen
Offiziell gemeldete Ergebnisse
| Benchmark | Große 4-Bewertung | Bereich |
|---|---|---|
| Cybench | 93% | Cybersicherheit |
| CyberGym | 82% | Sicherheitslücken-Aufgaben |
| DeepSWE v1.1 | 61.7% | Softwareentwicklung |
| SWE Atlas | 59.4% | Code-Agent-Aufgaben |
| Terminal Bench 4 | 28.3% | Terminal-Aufgaben |
| Dense200 | 42% | Reasoning |
| AutomationBench | 59.9% | Automatisierung |
Diese Ergebnisse stammen aus Mistrals Release-Ankündigung. Diese Website hat die Benchmark-Läufe nicht reproduziert. Ein Prozentsatz misst einen bestimmten Test, nicht die allgemeine Zuverlässigkeit.
Dieselbe Aufgabe und dieselben Bedingungen vergleichen
Modellkennung, Harness-Version, Werkzeugzugriff, Reasoning-Budget und Ausgabelimits festhalten. Erfolgsquote zusammen mit Zeit, Kosten und Fehlermustern melden. Wiederholte Versuche für Aufgaben mit variablen Ergebnissen durchführen.
- Wähle repräsentative Aufgaben mit Referenzantworten oder ausführbaren Tests.
- Verwenden Sie dieselben Eingaben und veröffentlichen Sie die Auswertungs-Einstellungen.
- Fehler prüfen, nicht nur den Gesamtwert.
- Wiederhole den Vergleich, wenn sich eine Modellversion ändert.
Von einer Rangliste zu deiner Arbeitslast
Ein sicherer Patch muss Ihre Tests noch bestehen. Eine Dokumentantwort muss die Quellpassage zitieren. Übersetzung braucht Zielgruppen- und Fachprüfung. Verwenden Sie einen kleinen, gekennzeichneten Evaluierungsdatensatz, bevor Sie sich für einen Anbieter entscheiden.