Prévoir un déploiement local
Vérifiez les poids, la licence, la mémoire et les exigences de service avant de choisir le matériel.
Sur cette page
Vérifier d'abord la publication des poids
L'annonce de Large 4 prévoit des poids ouverts pour fin octobre 2026. Confirmez un dépôt officiel publié avant de choisir un runtime ou d'acheter du matériel. Lisez le guide des poids et la fiche modèle réelle.
Taille du modèle et stockage
La documentation du modèle indique 1.05T au total et 52B de paramètres actifs. La sparsité d'activation MoE réduit le calcul par jeton ; cela ne signifie pas que seuls les poids actifs doivent être stockés. Tenez compte de tous les experts et des composants de vision.
Planification mémoire poids uniquement
| Octets par paramètre | Stockage des poids approximatif |
|---|---|
| 2 | 2.1 To |
| 1 | 1.05 To |
| 0.5 | 525 Go |
Ces estimations arithmétiques excluent les métadonnées de quantification, les tampons d'exécution, le cache KV et la redondance. Ce ne sont pas des recommandations GPU testées. Vérifiez le format publié avant de supposer qu'une précision est prise en charge.
Service en contexte long
Le contexte documenté est de 1M jetons, tandis qu'un déploiement peut en exposer moins. La mémoire du cache KV et le temps de pré-remplissage augmentent avec le contexte et la concurrence. Définissez des longueurs d'entrée maximales réalistes et testez à la concurrence que vous prévoyez de servir.
Compatibilité runtime
Vérifiez le support de l'architecture, la révision du tokenizer, la distribution des experts, les noyaux d'attention, la quantification et le prétraitement des images. N'utilisez pas une commande destinée à un autre modèle simplement parce que son nom semble similaire. Épingles les révisions du runtime et du modèle et conservez un retour arrière connu.
Validation avant lancement
Commencez par une courte requête. Comparez le formatage de sortie et un cas de test déterministe avec une référence connue. Mesurez le temps jusqu'au premier jeton, la latence totale, la mémoire de pointe et la récupération après annulation. Exercez ensuite plusieurs requêtes, des entrées longues, du contenu malformé et des redémarrages.
Service en toute sécurité
Placez l'authentification et les limites de requêtes devant le point de terminaison d'inférence. Gardez les ports d'administration privés. Suivez les métriques opérationnelles sans conserver les invites inutiles. Établissez des procédures de mise à jour, de sauvegarde et d'incident avant l'exposition publique.
Alternative : API fournisseur
Si vous n'avez pas besoin de contrôler toute la pile d'inférence, comparez les coûts API avec l'infrastructure et le temps du personnel. Le calculateur peut estimer le coût des jetons du fournisseur, mais il n'inclut pas les coûts d'hébergement ou d'exploitation.
Essayez une tâche de votre propre travail.
Apportez le matériel source et vérifiez le résultat.
Ouvrir l'espace de travail