Nutzung planen

So schätzen Sie die deepinfra-Preise für Ihre Workload

Beginnen Sie mit einem Modell, einer geschätzten Anzahl von Anfragen und der Anzahl an Tokens, die jede Anfrage voraussichtlich benötigt. Deepinfra hilft Ihnen, diese Angaben einzuordnen. Diese Seite zeigt jedoch keine aktuellen Preise an und erstellt kein offizielles Angebot.

Visualisierung von Deepinfra-Modellen und Inferenz

Voraussetzungen

Erfassen Sie zuerst Messwerte für Ihre Workload. Ein Modellname allein sagt nicht aus, wie viel wiederholte Anfragen verbrauchen.

Erforderlich Optional
  • Wählen Sie genau das Modell aus, das Sie verwenden möchten, statt auf Grundlage einer Modellfamilie zu schätzen. — Verschiedene Modellvarianten können unterschiedliche Abrechnungseinheiten und Preise haben.

  • Notieren Sie die aktuell veröffentlichten Preise und Abrechnungseinheiten für dieses Modell zum Zeitpunkt der Nutzung. — Betrachten Sie ein Beispiel auf dieser Seite nicht als aktuellen Preis.

  • Schätzen Sie die Anzahl der Anfragen für einen festgelegten Zeitraum und messen Sie die typische Eingabe und Ausgabe getrennt. — Eine lange Antwort kann das Ergebnis verändern, auch wenn die Eingabe kurz bleibt.

  • Berücksichtigen Sie eine längere oder komplexere Anfrage als zweiten Testfall.optional — So lässt sich erkennen, wie empfindlich Ihre Schätzung auf Änderungen der Arbeitslast reagiert.

Ein vollständiger Durchlauf

Bevor Sie rechnen, halten Sie fest, was die Schätzung nicht belegen kann. Für jede Lücke benötigen Sie eine Messung oder eine aktuelle Quelle.

1

Sie kann keinen aktuellen Preis liefern

Der veröffentlichte Preis eines Modells kann sich ändern, und diese Seite ruft ihn nicht ab. Eine Schätzung auf Grundlage eines veralteten Werts kann rechnerisch präzise und dennoch falsch sein.

Was Sie stattdessen tun können

Prüfen Sie unmittelbar vor der Berechnung den aktuellen Preis und die Einheiten für das genaue Modell.

2

Sie kann die Antwortlänge nicht vorhersagen

Identische Prompts können unterschiedlich lange Ausgaben erzeugen. Eine einzelne kurze Antwort ist eine schwache Grundlage für die Planung einer wiederkehrenden Arbeitslast.

Was Sie stattdessen tun können

Testen Sie repräsentative Aufgaben und berücksichtigen Sie einen Fall mit längerer Antwort.

3

Sie kann unterschiedliche Einheiten nicht gleichsetzen

Chat-, Embedding- und andere Inferenzaufgaben können unterschiedlich abgerechnet werden. Wer jede Arbeitslast mit derselben Token-Annahme multipliziert, verdeckt diesen Unterschied.

Was Sie stattdessen tun können

Erstellen Sie für jede Aufgabe und ihre veröffentlichte Abrechnungseinheit eine eigene Schätzung.

Ein vollständiger Durchlauf

Verfolgen Sie für eine Chat-Arbeitslast eine repräsentative Anfrage von der Messung bis zur Schätzung für einen Zeitraum. Ersetzen Sie alle Beispielwerte durch Ihre eigenen Beobachtungen.

  1. 1

    Messen Sie eine repräsentative Anfrage

    Nehmen Sie einen typischen Prompt und eine typische Antwort aus der Aufgabe, die Sie tatsächlich ausführen möchten. Erfassen Sie Eingabe- und Ausgabe-Token getrennt; berücksichtigen Sie auch Anweisungen oder anderen Kontext, der bei jeder Anfrage mitgesendet wird.

  2. 2

    Wenden Sie die Einheiten des Modells an

    Ermitteln Sie den aktuellen Preis für das genaue Modell und prüfen Sie, ob für Eingabe und Ausgabe unterschiedliche Preise gelten. Rechnen Sie die gemessenen Token-Zahlen jeweils in die veröffentlichte Einheit um, multiplizieren Sie sie mit dem zugehörigen Preis und addieren Sie die Ergebnisse.

  3. 3

    Skalieren und die Spanne prüfen

    Multiplizieren Sie das Ergebnis pro Anfrage mit der erwarteten Anzahl von Anfragen im Zeitraum. Wiederholen Sie die Berechnung mit einer längeren Antwort und einem Zeitraum mit höherer Nutzung. Betrachten Sie die Spanne zwischen den Ergebnissen als Planungsgrundlage, nicht als garantierten Gesamtbetrag.

Optionstabelle

  • EINGABE MESSEN
  • AUSGABE MESSEN
  • AKTUELLE EINHEITEN PRÜFEN

Workloads auf derselben Grundlage vergleichen

Verwenden Sie für Ihren Vergleich drei Spalten: Option, Nutzungseinheit und gemessenes Volumen. Vergleichen Sie bei einer kurzen Chat-Aufgabe die gemessene Eingabe und Ausgabe mit den aktuellen Einheiten des gewählten Chat-Modells. Wiederholen Sie die Messung bei einer Chat-Aufgabe mit langem Kontext mit dem vollständigen Kontext, den Sie tatsächlich senden werden. Verwenden Sie für Embeddings die veröffentlichte Einheit des Embedding-Modells, statt die Chat-Berechnung zu übernehmen.

Halten Sie Zeitraum und Anzahl der Anfragen über alle Optionen hinweg konstant. Wenn bei einer Option sowohl das Modell als auch der Workload geändert werden, kennzeichnen Sie beide Änderungen; andernfalls zeigt der Vergleich nicht, welche davon den Unterschied verursacht hat. Deepinfra stellt dies als Methode zur Überprüfung von Annahmen dar, nicht als Tabelle mit aktuellen Modellpreisen.

Was schiefgehen kann

Ein übernommener Preis, eine geschätzte Antwortlänge oder eine Berechnung mit gemischten Einheiten kann selbst eine sorgfältige Schätzung irreführend machen. Prüfen Sie die aktuellen Modelldetails, messen Sie eine reale Aufgabe und berechnen Sie neu, wenn sich Ihr Workload ändert. So können Sie Inferenzoptionen mit einem klareren Bild davon prüfen, welche Annahmen noch getestet werden müssen.

Die erste Schätzung sollte nützlich sein, nicht scheinbar exakt

  • Die genaue Modellvariante verwenden
  • Eingabe und Ausgabe getrennt betrachten
  • Einen Fall mit höherer Nutzung testen
Inferenzoptionen erkunden

Eigene FAQ

Das Modell und seine veröffentlichten Nutzungseinheiten sind wesentliche Grundlagen für eine Schätzung. Prüfen Sie die aktuellen Details der genauen Variante, statt anzunehmen, dass für jedes Modell einer Familie derselbe Preis gilt.

Messen Sie Eingabe und Ausgabe einer repräsentativen Anfrage, wenden Sie darauf jeweils die aktuellen Einheiten und Preise des gewählten Modells an und rechnen Sie das Ergebnis auf die erwartete Anzahl von Anfragen hoch. Wiederholen Sie die Berechnung mit einer längeren Antwort, um zu sehen, wie stark sich das Ergebnis verändern könnte.

Nein. Prüfen Sie zuerst die veröffentlichte Nutzungseinheit des Embedding-Modells und messen Sie dann den Text, den Sie verarbeiten möchten, in dieser Einheit. Berechnen Sie Embeddings getrennt von Chat-Anfragen.

Anfragen können sich in Kontextlänge, Antwortlänge und Häufigkeit unterscheiden. Eine Schätzung kann auch veralten, wenn sich der Preis oder die Modellwahl ändert. Gleichen Sie ihre Grundlagen daher erneut mit der beobachteten Nutzung ab.

KI-Modelle ausprobieren
KI-Modelle ausprobieren