ローカルデプロイを計画する

ハードウェアを選択する前に、ウェイト、ライセンス、メモリ、サービング要件を確認してください。

このページの内容

重みのリリースを最初に確認する

Large 4 の発表では、10月末 2026. にオープンウェイトを公開する計画が示されています。ランタイムを選ぶ前、またはハードウェアを購入する前に、公開された公式リポジトリを確認してください。weights guide と実際のモデルカードをお読みください。

モデルサイズとストレージ

モデルのドキュメントには、合計 1.05T、アクティブパラメータ 52B が記載されています。MoE のアクティベーションスパース性はトークンあたりの計算量を削減しますが、アクティブな重みだけを保存すればよいという意味ではありません。すべてのエキスパートとビジョンコンポーネントを考慮してください。

重みのみのメモリ計画

パラメータあたりのバイト数おおよその重みストレージ
22.1 TB
11.05 TB
0.5525 GB

これらの算術的な見積もりには、量子化メタデータ、ランタイムバッファ、KV キャッシュ、冗長性は含まれていません。テスト済みの GPU 推奨ではありません。ある精度がサポートされていると仮定する前に、リリースされたフォーマットを確認してください。

長いコンテキストのサービング

ドキュメントに記載されているコンテキストは 1M トークンですが、デプロイメントではそれより少ない場合があります。KV キャッシュのメモリとプリフィル時間は、コンテキストと同時実行数に応じて増大します。現実的な最大入力長を設定し、実際に提供する同時実行数でテストしてください。

ランタイム互換性

アーキテクチャのサポート、トークナイザーのリビジョン、エキスパートの分散、アテンションカーネル、量子化、画像の前処理を確認してください。名前が似ているという理由だけで、別のモデル用のコマンドを使用しないでください。ランタイムとモデルのリビジョンを固定し、既知の正常なロールバックを保持してください。

ローンチ前の検証

まず短いリクエスト 1 件から始めます。出力フォーマットと既知の参照と比較した決定論的なテストケースを比較してください。最初のトークンまでの時間、合計レイテンシ、ピークメモリ、キャンセルからの復旧を測定します。その後、複数のリクエスト、長い入力、不正なコンテンツ、再起動を試してください。

安全なサービング

推論エンドポイントの前に認証とリクエスト制限を設置してください。管理ポートはプライベートに保ってください。不要なプロンプトを保持せずに運用メトリクスを追跡してください。公開前に、アップデート、バックアップ、インシデント対応の手順を確立してください。

代替案: プロバイダー API

完全な推論スタックを制御する必要がない場合は、API コストをインフラと人件費と比較してください。calculator でプロバイダーのトークンコストを見積もれますが、ホスティングや運用コストは含まれていません。

自分の作業からタスクを試す

ソース資料を持ってきて、結果を確認してください。

ワークスペースを開く