Plan een lokale implementatie

Controleer gewichten, licentie, geheugen en serververeisten voordat je hardware kiest.

Op deze pagina

Controleer eerst de release van de gewichten

De aankondiging van Large 4 plant open gewichten voor eind oktober 2026. Bevestig een gepubliceerd officieel repository voordat je een runtime kiest of hardware koopt. Lees de gewichtenhandleiding en de daadwerkelijke modelkaart.

Modelgrootte en opslag

De modeldocumentatie vermeldt 1.05T totaal en 52B actieve parameters. MoE-activatiesparsaiteit vermindert de berekening per token; dit betekent niet dat alleen actieve gewichten hoeven te worden opgeslagen. Houd rekening met alle experts en de vision-componenten.

Geheugenplanning voor alleen gewichten

Bytes per parameterGeschatte gewichtopslag
22.1 TB
11.05 TB
0.5525 GB

Deze rekenkundige schattingen sluiten quantisatie-metadata, runtime-buffers, KV-cache en redundantie uit. Het zijn geen geteste GPU-aanbevelingen. Controleer het vrijgegeven formaat voordat je aanneemt dat een precisie wordt ondersteund.

Lang-context serving

De gedocumenteerde context is 1M tokens, terwijl een deployment mogelijk minder blootstelt. KV-cache-geheugen en prefill-tijd groeien met context en concurrency. Stel realistische maximale invoerlengtes in en test bij de concurrency die je wilt bedienen.

Runtime-compatibiliteit

Controleer architectuurondersteuning, tokenizer-revisie, expertdistributie, attention-kernels, quantisatie en afbeeldingsvoorverwerking. Gebruik geen commando voor een ander model alleen omdat de naam erop lijkt. Pin runtime- en modelrevisies en houd een bekende-goede rollback bij.

Validatie vóór lancering

Begin met één kort verzoek. Vergelijk uitvoeropmaak en een deterministische testcase met een bekende referentie. Meet time-to-first-token, totale latentie, piekgeheugen en herstel na annulering. Oefen vervolgens meerdere verzoeken, lange invoer, ongeldige inhoud en herstarts.

Veilig serveren

Plaats authenticatie en verzoeklimieten vóór het inference-eindpunt. Houd admin-poorten privé. Volg operationele metrics zonder onnodige prompts te bewaren. Stel update-, back-up- en incidentprocedures op vóór publieke blootstelling.

Alternatief: provider-API

Als je de volledige inference-stack niet zelf hoeft te beheren, vergelijk dan API-kosten met infrastructuur en personeelstijd. De calculator kan provider-tokenkosten schatten, maar omvat geen hosting- of operationele kosten.

Probeer een taak uit je eigen werk.

Geef het bronmateriaal en controleer het resultaat.

Werkruimte openen