Lokale Bereitstellung planen

Prüfe Gewichte, Lizenz, Speicher und Serving-Anforderungen, bevor du Hardware wählst.

Auf dieser Seite

Prüfe zuerst die Gewichtsfreigabe

Die Ankündigung zu Large 4 sieht offene Gewichte für Ende Oktober 2026. vor. Bestätige ein veröffentlichtes offizielles Repository, bevor du eine Laufzeit wählst oder Hardware kaufst. Lies den Gewichtsleitfaden und die tatsächliche Modellkarte.

Modellgröße und Speicher

Die Modelldokumentation nennt 1.05T Gesamt- und 52B aktive Parameter. Die MoE-Aktivierungssparsamkeit reduziert die Berechnung pro Token; das bedeutet nicht, dass nur aktive Gewichte gespeichert werden müssen. Berücksichtige alle Experten und die Bildkomponenten.

Speicherplanung nur für Gewichte

Bytes pro ParameterUngefähre Gewichtsspeicherung
22.1 TB
11.05 TB
0.5525 GB

Diese Rechenannahmen schließen Quantisierungsmetadaten, Laufzeitpuffer, KV-Cache und Redundanz aus. Es handelt sich nicht um getestete GPU-Empfehlungen. Überprüfe das veröffentlichte Format, bevor du annimmst, dass eine Präzision unterstützt wird.

Long-Context-Betrieb

Der dokumentierte Kontext beträgt 1M Token, während eine Bereitstellung möglicherweise weniger anbietet. KV-Cache-Speicher und Prefill-Zeit wachsen mit Kontext und Nebenläufigkeit. Setze realistische maximale Eingabelängen und teste bei der Nebenläufigkeit, die du bedienen möchtest.

Laufzeitkompatibilität

Prüfe Architekturunterstützung, Tokenizer-Revision, Expertenverteilung, Attention-Kernels, Quantisierung und Bildvorverarbeitung. Verwende keinen Befehl für ein anderes Modell nur weil sein Name ähnlich aussieht. Pinne Laufzeit- und Modellrevisionen und halte ein bekanntes funktionierendes Rollback bereit.

Validierung vor dem Start

Beginne mit einer kurzen Anfrage. Vergleiche die Ausgabeformatierung und einen deterministischen Testfall mit einer bekannten Referenz. Miss die Zeit bis zum ersten Token, die Gesamtlatenz, den Spitzenpeicher und die Wiederherstellung nach Abbruch. Übe dann mehrere Anfragen, lange Eingaben, fehlerhafte Inhalte und Neustarts.

Sicherer Betrieb

Setze Authentifizierung und Anfragelimits vor den Inferenz-Endpunkt. Halte Admin-Ports privat. Erfasse Betriebsmetriken, ohne unnötige Prompts zu speichern. Etabliere Update-, Backup- und Vorfallverfahren vor der öffentlichen Freigabe.

Alternative: Provider-API

Wenn du den vollständigen Inferenz-Stack nicht selbst steuern musst, vergleiche API-Kosten mit Infrastruktur und Personalaufwand. Der Rechner kann die Provider-Tokenkosten schätzen, enthält aber keine Hosting- oder Betriebskosten.

Versuchen Sie eine Aufgabe aus Ihrer eigenen Arbeit.

Nimm das Ausgangsmaterial und überprüfe das Ergebnis.

Arbeitsbereich öffnen