Nutzung planen
So schätzen Sie die deepinfra-Preise für Ihre Workload
Beginnen Sie mit einem Modell, einer geschätzten Anzahl von Anfragen und der Anzahl an Tokens, die jede Anfrage voraussichtlich benötigt. Deepinfra hilft Ihnen, diese Angaben einzuordnen. Diese Seite zeigt jedoch keine aktuellen Preise an und erstellt kein offizielles Angebot.
Voraussetzungen
Sowohl das gewählte Modell als auch die Aufgaben, die Sie an es senden, beeinflussen die Schätzung. Diese ergänzenden Leitfäden helfen Ihnen, die benötigten Angaben festzulegen, bevor Sie Optionen vergleichen.
- deepinfra-Guthaben für die kostenlose Nutzung Prüfen Sie, wie sich eine gegebenenfalls verfügbare Testnutzung von einer Schätzung für den laufenden Betrieb unterscheidet.
- deepinfra-Modelle Grenzen Sie die Modellauswahl ein, bevor Sie die aktuellen Abrechnungseinheiten nachschlagen.
- deepinfra-Embeddings Ermitteln Sie, wann für die Textvektorisierung eine andere Workload-Schätzung nötig ist als für Chat.
Voraussetzungen
Erfassen Sie zuerst Messwerte für Ihre Workload. Ein Modellname allein sagt nicht aus, wie viel wiederholte Anfragen verbrauchen.
-
Wählen Sie genau das Modell aus, das Sie verwenden möchten, statt auf Grundlage einer Modellfamilie zu schätzen. — Verschiedene Modellvarianten können unterschiedliche Abrechnungseinheiten und Preise haben.
-
Notieren Sie die aktuell veröffentlichten Preise und Abrechnungseinheiten für dieses Modell zum Zeitpunkt der Nutzung. — Betrachten Sie ein Beispiel auf dieser Seite nicht als aktuellen Preis.
-
Schätzen Sie die Anzahl der Anfragen für einen festgelegten Zeitraum und messen Sie die typische Eingabe und Ausgabe getrennt. — Eine lange Antwort kann das Ergebnis verändern, auch wenn die Eingabe kurz bleibt.
-
Berücksichtigen Sie eine längere oder komplexere Anfrage als zweiten Testfall.optional — So lässt sich erkennen, wie empfindlich Ihre Schätzung auf Änderungen der Arbeitslast reagiert.
Ein vollständiger Durchlauf
Bevor Sie rechnen, halten Sie fest, was die Schätzung nicht belegen kann. Für jede Lücke benötigen Sie eine Messung oder eine aktuelle Quelle.
Sie kann keinen aktuellen Preis liefern
Der veröffentlichte Preis eines Modells kann sich ändern, und diese Seite ruft ihn nicht ab. Eine Schätzung auf Grundlage eines veralteten Werts kann rechnerisch präzise und dennoch falsch sein.
Was Sie stattdessen tun können
Prüfen Sie unmittelbar vor der Berechnung den aktuellen Preis und die Einheiten für das genaue Modell.
Sie kann die Antwortlänge nicht vorhersagen
Identische Prompts können unterschiedlich lange Ausgaben erzeugen. Eine einzelne kurze Antwort ist eine schwache Grundlage für die Planung einer wiederkehrenden Arbeitslast.
Was Sie stattdessen tun können
Testen Sie repräsentative Aufgaben und berücksichtigen Sie einen Fall mit längerer Antwort.
Sie kann unterschiedliche Einheiten nicht gleichsetzen
Chat-, Embedding- und andere Inferenzaufgaben können unterschiedlich abgerechnet werden. Wer jede Arbeitslast mit derselben Token-Annahme multipliziert, verdeckt diesen Unterschied.
Was Sie stattdessen tun können
Erstellen Sie für jede Aufgabe und ihre veröffentlichte Abrechnungseinheit eine eigene Schätzung.
Ein vollständiger Durchlauf
Verfolgen Sie für eine Chat-Arbeitslast eine repräsentative Anfrage von der Messung bis zur Schätzung für einen Zeitraum. Ersetzen Sie alle Beispielwerte durch Ihre eigenen Beobachtungen.
-
1
Messen Sie eine repräsentative Anfrage
Nehmen Sie einen typischen Prompt und eine typische Antwort aus der Aufgabe, die Sie tatsächlich ausführen möchten. Erfassen Sie Eingabe- und Ausgabe-Token getrennt; berücksichtigen Sie auch Anweisungen oder anderen Kontext, der bei jeder Anfrage mitgesendet wird.
-
2
Wenden Sie die Einheiten des Modells an
Ermitteln Sie den aktuellen Preis für das genaue Modell und prüfen Sie, ob für Eingabe und Ausgabe unterschiedliche Preise gelten. Rechnen Sie die gemessenen Token-Zahlen jeweils in die veröffentlichte Einheit um, multiplizieren Sie sie mit dem zugehörigen Preis und addieren Sie die Ergebnisse.
-
3
Skalieren und die Spanne prüfen
Multiplizieren Sie das Ergebnis pro Anfrage mit der erwarteten Anzahl von Anfragen im Zeitraum. Wiederholen Sie die Berechnung mit einer längeren Antwort und einem Zeitraum mit höherer Nutzung. Betrachten Sie die Spanne zwischen den Ergebnissen als Planungsgrundlage, nicht als garantierten Gesamtbetrag.
Optionstabelle
- EINGABE MESSEN
- AUSGABE MESSEN
- AKTUELLE EINHEITEN PRÜFEN
Workloads auf derselben Grundlage vergleichen
Verwenden Sie für Ihren Vergleich drei Spalten: Option, Nutzungseinheit und gemessenes Volumen. Vergleichen Sie bei einer kurzen Chat-Aufgabe die gemessene Eingabe und Ausgabe mit den aktuellen Einheiten des gewählten Chat-Modells. Wiederholen Sie die Messung bei einer Chat-Aufgabe mit langem Kontext mit dem vollständigen Kontext, den Sie tatsächlich senden werden. Verwenden Sie für Embeddings die veröffentlichte Einheit des Embedding-Modells, statt die Chat-Berechnung zu übernehmen.
Halten Sie Zeitraum und Anzahl der Anfragen über alle Optionen hinweg konstant. Wenn bei einer Option sowohl das Modell als auch der Workload geändert werden, kennzeichnen Sie beide Änderungen; andernfalls zeigt der Vergleich nicht, welche davon den Unterschied verursacht hat. Deepinfra stellt dies als Methode zur Überprüfung von Annahmen dar, nicht als Tabelle mit aktuellen Modellpreisen.
Was schiefgehen kann
Ein übernommener Preis, eine geschätzte Antwortlänge oder eine Berechnung mit gemischten Einheiten kann selbst eine sorgfältige Schätzung irreführend machen. Prüfen Sie die aktuellen Modelldetails, messen Sie eine reale Aufgabe und berechnen Sie neu, wenn sich Ihr Workload ändert. So können Sie Inferenzoptionen mit einem klareren Bild davon prüfen, welche Annahmen noch getestet werden müssen.
Die erste Schätzung sollte nützlich sein, nicht scheinbar exakt
- Die genaue Modellvariante verwenden
- Eingabe und Ausgabe getrennt betrachten
- Einen Fall mit höherer Nutzung testen
Eigene FAQ
Das Modell und seine veröffentlichten Nutzungseinheiten sind wesentliche Grundlagen für eine Schätzung. Prüfen Sie die aktuellen Details der genauen Variante, statt anzunehmen, dass für jedes Modell einer Familie derselbe Preis gilt.
Messen Sie Eingabe und Ausgabe einer repräsentativen Anfrage, wenden Sie darauf jeweils die aktuellen Einheiten und Preise des gewählten Modells an und rechnen Sie das Ergebnis auf die erwartete Anzahl von Anfragen hoch. Wiederholen Sie die Berechnung mit einer längeren Antwort, um zu sehen, wie stark sich das Ergebnis verändern könnte.
Nein. Prüfen Sie zuerst die veröffentlichte Nutzungseinheit des Embedding-Modells und messen Sie dann den Text, den Sie verarbeiten möchten, in dieser Einheit. Berechnen Sie Embeddings getrennt von Chat-Anfragen.
Anfragen können sich in Kontextlänge, Antwortlänge und Häufigkeit unterscheiden. Eine Schätzung kann auch veralten, wenn sich der Preis oder die Modellwahl ändert. Gleichen Sie ihre Grundlagen daher erneut mit der beobachteten Nutzung ab.