利用計画
ワークロードにかかるdeepinfraの料金を見積もる方法
まず、モデル、想定リクエスト数、各リクエストで使用する可能性のあるトークン数を決めます。deepinfraはこれらを基に見積もりを考えるのに役立ちますが、このページには最新の料金は表示されず、正式な見積書も発行されません。
前提条件
選ぶモデルと処理させる内容の両方が見積もりに影響します。以下の関連ガイドは、選択肢を比較する前に必要な条件を明確にするのに役立ちます。
前提条件
まずワークロードの測定値を集めます。モデル名だけでは、リクエストを繰り返した場合の消費量は分かりません。
-
モデルファミリーから概算するのではなく、使用予定のモデルを正確に選びます。 — モデルのバリエーションによって、課金単位や料金が異なる場合があります。
-
使用時点で公開されている、そのモデルの最新の料金と課金単位を記録します。 — このページの例を現在の料金として扱わないでください。
-
期間を決めてリクエスト数を見積もり、一般的な入力と出力を別々に測定します。 — プロンプトが短いままでも、応答が長いと結果が変わる場合があります。
-
長いリクエストや複雑なリクエストも、2つ目のテストケースとして用意します。任意 — ワークロードの変化によって見積もりがどの程度変わるかを確認できます。
一通りの試算
計算を始める前に、その見積もりでは分からないことを明確にしましょう。不明な点ごとに、測定値か最新の情報源が必要です。
最新の料金は分かりません
モデルの公開料金は変更される可能性があり、このページでは最新の料金を取得しません。古い料金を使った見積もりは、計算が正確でも結果が間違っている可能性があります。
代わりに行うこと
計算する直前に、対象モデルの最新の料金と課金単位を確認してください。
応答の長さは予測できません
同じプロンプトでも、出力の長さは変わることがあります。短い応答を1つ測っただけでは、繰り返し実行するワークロードの計画には不十分です。
代わりに行うこと
代表的なタスクをサンプリングし、応答が長くなるケースも含めてください。
異なる単位を同一視できません
チャット、埋め込み、その他の推論タスクでは、使用量の測定方法が異なる場合があります。すべてのワークロードを同じトークンの前提で計算すると、その違いが見えなくなります。
代わりに行うこと
タスクごとに、公開されている使用量の単位に合わせて個別に見積もってください。
一通りの試算
チャットのワークロードについて、代表的なリクエストを測定し、対象期間の見積もりまで計算してみましょう。例の数値はすべて、自分で測定した値に置き換えてください。
-
1
代表的なリクエストを測定する
実際に実行する予定のタスクから、典型的なプロンプトと応答を選びます。入力トークンと出力トークンを別々に記録し、毎回のリクエストに含める指示やその他のコンテキストも算入してください。
-
2
モデルの課金単位を適用する
対象モデルの最新の料金を確認し、入力と出力で料金が異なるかどうかを調べます。測定した各トークン数を公開されている課金単位に換算し、それぞれ対応する料金を掛けてから合計します。
-
3
対象期間に換算し、幅を確認する
リクエストあたりの結果に、対象期間中に予想されるリクエスト数を掛けます。応答が長いケースや利用量が多い期間についても計算してください。結果の差は、保証された合計額ではなく、計画のための見積もり幅として扱います。
選択肢の表
- 入力を測定
- 出力量を測定
- 現在の課金単位を確認
同じ基準でワークロードを比較
比較には「選択肢」「使用量の単位」「測定した量」の3列を設けます。短いチャットタスクでは、測定した入力と出力を、選択したチャットモデルの現在の課金単位と照らし合わせます。長いコンテキストを使うチャットタスクでは、実際に送信するコンテキスト全体を含めて測定し直します。埋め込みでは、チャットの計算を流用せず、埋め込みモデルが公開している課金単位を使用します。
選択肢間で対象期間とリクエスト数を揃えます。モデルとワークロードの両方を変更する選択肢がある場合は、両方の変更を明記してください。そうしないと、どちらが差を生んだのか分かりません。Deepinfraはこれを、リアルタイムのモデル料金表ではなく、前提を確認する方法として提示しています。
見積もりが不正確になる原因
転記した料金、推測した応答の長さ、異なる単位を混ぜた計算によって、注意深く作成した見積もりでも誤解を招く可能性があります。現在のモデル情報を確認し、実際のタスクを測定して、ワークロードが変わったら再計算してください。そうすれば、まだ検証が必要な前提をより明確にしたうえで、推論の選択肢を検討できます。
よくある質問
モデルと、そのモデルが公開している課金単位は、見積もりに欠かせない情報です。同じモデルファミリーなら料金も同じだと決めつけず、使用するバリアントの最新情報を確認してください。
代表的なリクエストの入力と出力を測定し、それぞれに選択したモデルの現在の課金単位と料金を適用してから、想定リクエスト数に応じて換算します。応答が長い場合も計算し、結果がどの程度変わるか確認してください。
いいえ。まず埋め込みモデルが公開している課金単位を確認し、処理する予定のテキストをその単位で測定してください。埋め込みの計算はチャットのリクエストとは分けて行います。
コンテキストの長さ、応答の長さ、リクエストの頻度は変動します。料金や使用モデルが変わると見積もりも古くなるため、実際の使用状況と照らして前提を見直してください。