Large 4 または Large 3:タスクで選択

裏付けのない勝者主張ではなく、再現可能な評価計画。

このページの内容

文書化された事実の比較

Large 4 は新しいパブリックプレビューです。移行にあたっては、モデル名だけでなく、実際の Large 3 デプロイメントを比較してください。現在のモデルカードとバージョン識別子の両方を確認してください。

標準 API 料金

モデル入力 / 1Mキャッシュ入力 / 1M出力 / 1M
Large 4 セール$0.68$0.07$2.09
Large 4 定価$1.36$0.14$4.18
Large 3$0.50$0.05$1.50

料金は 2026 年 8, 月に公式料金で確認しました。ローンチ時の料金は変更される場合があります。最も安いトークン単価が、必ずしも最も安い成功タスクとは限りません。

コンテキストとマルチモーダルタスク

Large 4 のドキュメントには 1M のコンテキストとテキスト/画像入力が記載されています。プロバイダーが公開している上限と、既存の Large 3 統合を確認してください。より大きなウィンドウがすべての検索問題を解決するとは限らないため、抽出、画像解釈、引用の動作を再テストしてください。

移行セットの構築

認可されたデータを使用して、自分のワークフローから成功したリクエストと失敗したリクエストの代表例を収集します。期待される結果を追加するか、実行可能なテストを用意します。プロンプト、ツール権限、出力予算をモデル間で同じに保ちます。遅いケースと長いコンテキストのケースも含めてください。

精度以外も測定する

完了タスクのコスト、最初のトークンまでのレイテンシと合計レイテンシ、リトライ率、ツールエラーを記録します。新しい出力がアプリケーションのスキーマを引き続き満たしているか確認してください。集計ベンチマークが高くても、アプリケーションが依存する契約を置き換えることはできません。

段階的なロールアウト

ステージングでテストし、小さなサンプルを比較し、以前のデプロイメントを利用可能な状態に保ちます。本番展開前に品質とレイテンシを監視します。実際の使用状況を測定した後、トークンと同時実行数の上限を見直してください。

このサイトで確認した内容

公開ドキュメントと料金を確認しましたが、ライブのモデル比較は実行していません。サンプル回答は作成されたフィクスチャです。独自の評価の入力として、ベンチマークソース とコスト計算ツール をご利用ください。

自分の作業からタスクを試す

ソース資料を持ってきて、結果を確認してください。

ワークスペースを開く