Mistral Large 4 벤치마크

보안, 코딩 및 추론에 대한 공개된 근거. 출처와 방법 경계를 명확히 유지합니다.

Cybench

93%

사이버보안 챌린지

Mistral Large 4
93%
Mistral AI 보고 · 이 사이트에서 테스트하지 않음

CyberGym

82%

실제 취약점 작업

Mistral Large 4
82%
Mistral AI 보고 · 이 사이트에서 테스트하지 않음

DeepSWE v1.1

61.7%

소프트웨어 엔지니어링 작업

Mistral Large 4
61.7%
Mistral AI 보고 · 이 사이트에서 테스트하지 않음

Dense200

42%

고난이도 추론

Mistral Large 4
42%
GPT-6 Astra
41%
Mistral AI 보고 · 이 사이트에서 테스트하지 않음

출처: 공식 릴리스, 10월 6, 2026.. 서로 다른 테스트 설정은 직접 비교할 수 없습니다. 출처 읽기

공식 보고 결과

벤치마크Large 4 점수영역
Cybench93%사이버보안
CyberGym82%취약점 작업
DeepSWE v1.161.7%소프트웨어 엔지니어링
SWE Atlas59.4%코드 에이전트 작업
Terminal Bench 428.3%터미널 작업
Dense20042%추론
AutomationBench59.9%자동화

이 결과는 Mistral의 출시 공지에서 가져온 것입니다. 이 웹사이트는 벤치마크 실행을 재현하지 않았습니다. 백분율은 특정 테스트를 측정하며, 전체 신뢰도를 의미하지 않습니다.

동일한 작업과 조건 비교

모델 식별자, 하네스 버전, 도구 접근, 추론 예산 및 출력 제한을 고정하세요. 시간, 비용, 실패 패턴과 함께 통과율을 보고하세요. 결과가 가변적인 작업은 반복試行을 실행하세요.

  1. 정답이 있는 대표 작업이나 실행 가능한 테스트를 선택하세요.
  2. 동일한 입력을 사용하고 평가 설정을 게시하세요.
  3. 집계 점수뿐 아니라 실패를 검사하세요.
  4. 모델 버전이 변경되면 비교를 다시 수행하세요.

리더보드에서 실제 작업량으로

안전한 패치도 테스트를 통과해야 합니다. 문서 답변은 출처 구절을 인용해야 합니다. 번역은 대상 독자와 도메인 검토가 필요합니다. 공급업체를 결정하기 전에 작고 라벨이 지정된 평가 세트를 사용하세요.