Plan een lokale implementatie
Controleer gewichten, licentie, geheugen en serververeisten voordat je hardware kiest.
Op deze pagina
Controleer eerst de release van de gewichten
De aankondiging van Large 4 plant open gewichten voor eind oktober 2026. Bevestig een gepubliceerd officieel repository voordat je een runtime kiest of hardware koopt. Lees de gewichtenhandleiding en de daadwerkelijke modelkaart.
Modelgrootte en opslag
De modeldocumentatie vermeldt 1.05T totaal en 52B actieve parameters. MoE-activatiesparsaiteit vermindert de berekening per token; dit betekent niet dat alleen actieve gewichten hoeven te worden opgeslagen. Houd rekening met alle experts en de vision-componenten.
Geheugenplanning voor alleen gewichten
| Bytes per parameter | Geschatte gewichtopslag |
|---|---|
| 2 | 2.1 TB |
| 1 | 1.05 TB |
| 0.5 | 525 GB |
Deze rekenkundige schattingen sluiten quantisatie-metadata, runtime-buffers, KV-cache en redundantie uit. Het zijn geen geteste GPU-aanbevelingen. Controleer het vrijgegeven formaat voordat je aanneemt dat een precisie wordt ondersteund.
Lang-context serving
De gedocumenteerde context is 1M tokens, terwijl een deployment mogelijk minder blootstelt. KV-cache-geheugen en prefill-tijd groeien met context en concurrency. Stel realistische maximale invoerlengtes in en test bij de concurrency die je wilt bedienen.
Runtime-compatibiliteit
Controleer architectuurondersteuning, tokenizer-revisie, expertdistributie, attention-kernels, quantisatie en afbeeldingsvoorverwerking. Gebruik geen commando voor een ander model alleen omdat de naam erop lijkt. Pin runtime- en modelrevisies en houd een bekende-goede rollback bij.
Validatie vóór lancering
Begin met één kort verzoek. Vergelijk uitvoeropmaak en een deterministische testcase met een bekende referentie. Meet time-to-first-token, totale latentie, piekgeheugen en herstel na annulering. Oefen vervolgens meerdere verzoeken, lange invoer, ongeldige inhoud en herstarts.
Veilig serveren
Plaats authenticatie en verzoeklimieten vóór het inference-eindpunt. Houd admin-poorten privé. Volg operationele metrics zonder onnodige prompts te bewaren. Stel update-, back-up- en incidentprocedures op vóór publieke blootstelling.
Alternatief: provider-API
Als je de volledige inference-stack niet zelf hoeft te beheren, vergelijk dan API-kosten met infrastructuur en personeelstijd. De calculator kan provider-tokenkosten schatten, maar omvat geen hosting- of operationele kosten.
Probeer een taak uit je eigen werk.
Geef het bronmateriaal en controleer het resultaat.
Werkruimte openen