로컬 배포 계획 수립
하드웨어를 선택하기 전에 가중치, 라이선스, 메모리 및 서빙 요구 사항을 확인하세요.
이 페이지에서
먼저 가중치 공개 여부를 확인하세요
Large 4 발표에서는 10월 말 2026. 오픈 가중치를 계획하고 있습니다. 런타임을 선택하거나 하드웨어를 구매하기 전에 공식 저장소가 게시되었는지 확인하세요. 가중치 가이드와 실제 모델 카드를 읽어보세요.
모델 크기 및 저장 공간
모델 문서에는 총 1.05T, 활성 파라미터 52B가 기재되어 있습니다. MoE 활성화 희소성은 토큰당 계산량을 줄여주지만, 활성 가중치만 저장하면 된다는 의미는 아닙니다. 모든 전문가와 비전 구성 요소를 고려하세요.
가중치 전용 메모리 계획
| 파라미터당 바이트 | 예상 가중치 저장 공간 |
|---|---|
| 2 | 2.1 TB |
| 1 | 1.05 TB |
| 0.5 | 525 GB |
이 산술 추정치는 양자화 메타데이터, 런타임 버퍼, KV 캐시 및 중복을 제외합니다. 검증된 GPU 권장 사항이 아닙니다. 지원되는 정밀도를 가정하기 전에 출시된 형식을 확인하세요.
긴 컨텍스트 서빙
문서화된 컨텍스트는 1M 토큰이지만, 배포 시 더 적게 노출될 수 있습니다. KV 캐시 메모리와 프리필 시간은 컨텍스트와 동시성에 따라 증가합니다. 현실적인 최대 입력 길이를 설정하고 서빙하려는 동시성에서 테스트하세요.
런타임 호환성
아키텍처 지원, 토크나이저 리비전, 전문가 분산, 어텐션 커널, 양자화 및 이미지 전처리를 확인하세요. 이름이 비슷하다는 이유로 다른 모델의 명령을 사용하지 마세요. 런타임과 모델 리비전을 고정하고 알려진 양호한 롤백을 유지하세요.
출시 전 검증
짧은 요청 하나로 시작하세요. 출력 형식과 알려진 참조와 비교하여 결정적 테스트 케이스를 비교하세요. 첫 토큰 시간, 총 지연 시간, 최대 메모리 및 취소 복구를 측정하세요. 그런 다음 여러 요청, 긴 입력, 잘못된 콘텐츠 및 재시작을 테스트하세요.
안전한 서빙
추론 엔드포인트 앞에 인증 및 요청 제한을 두세요. 관리자 포트를 비공개로 유지하세요. 불필요한 프롬프트를 보관하지 않고 운영 지표를 추적하세요. 공개 노출 전에 업데이트, 백업 및 사고 대응 절차를 수립하세요.
대안: 제공자 API
전체 추론 스택을 제어할 필요가 없다면, API 비용을 인프라 및 인건비와 비교하세요. 계산기로 제공자 토큰 비용을 추정할 수 있지만, 호스팅 또는 운영 비용은 포함되지 않습니다.