Planification de l’utilisation
Comment estimer la tarification de deepinfra pour votre charge de travail
Commencez par choisir un modèle, estimer le nombre de requêtes et déterminer le nombre de tokens que chaque requête pourrait utiliser. Deepinfra vous aide à évaluer ces paramètres, mais cette page n’affiche pas de tarif en temps réel et ne fournit pas de devis officiel.
Prérequis
Le modèle choisi et les tâches que vous lui confiez influencent tous deux l’estimation. Ces guides connexes vous aident à définir ces paramètres avant de comparer les options.
- Crédits gratuits de deepinfra Vérifiez en quoi l’utilisation pendant la période d’essai, si elle est proposée, diffère d’une estimation pour une activité régulière.
- Modèles deepinfra Affinez votre choix de modèle avant de consulter ses unités de facturation actuelles.
- Embeddings deepinfra Déterminez quand la vectorisation de texte nécessite une estimation de charge de travail différente de celle du chat.
Prérequis
Recueillez d’abord des mesures de votre charge de travail. Le nom d’un modèle ne suffit pas à déterminer ce que consommeront des requêtes répétées.
-
Choisissez le modèle exact que vous comptez utiliser, plutôt que de faire une estimation à partir d’une famille de modèles. — Les variantes d’un modèle peuvent avoir des unités de facturation et des tarifs différents.
-
Notez le tarif publié actuellement et les unités de facturation de ce modèle au moment de son utilisation. — Ne considérez pas un exemple figurant sur cette page comme un tarif actuel.
-
Estimez le nombre de requêtes sur une période définie et mesurez séparément les volumes habituels en entrée et en sortie. — Une réponse longue peut modifier le résultat même si le prompt reste court.
-
Conservez une requête plus longue ou plus complexe comme second cas de test.facultatif — Cela permet de voir dans quelle mesure votre estimation est sensible aux variations de la charge de travail.
un calcul complet de bout en bout
Avant de faire les calculs, notez ce que l’estimation ne peut pas établir. Chaque lacune nécessite une mesure ou une source à jour.
Elle ne peut pas fournir un tarif en temps réel
Le tarif publié d’un modèle peut changer, et cette page ne le récupère pas. Une estimation fondée sur un ancien tarif peut reposer sur des calculs précis tout en donnant un résultat erroné.
Que faire à la place
Vérifiez le tarif actuel du modèle exact et ses unités juste avant de calculer.
Elle ne peut pas prévoir la longueur des réponses
Des requêtes identiques peuvent produire des réponses de longueurs différentes. Une seule réponse courte constitue une base fragile pour planifier une charge de travail récurrente.
Que faire à la place
Échantillonnez des tâches représentatives et incluez un cas avec une réponse plus longue.
Elle ne peut pas assimiler des unités différentes
Les tâches de chat, de génération d’embeddings et d’autres formes d’inférence peuvent être mesurées différemment. Appliquer la même hypothèse sur les tokens à toutes les charges de travail masque cette différence.
Que faire à la place
Établissez une estimation distincte pour chaque tâche, selon l’unité d’utilisation publiée qui lui correspond.
un calcul complet de bout en bout
Pour une charge de travail de chat, partez d’une requête représentative, mesurez-la, puis estimez le coût sur une période donnée. Remplacez chaque valeur d’exemple par vos propres observations.
-
1
Mesurez une requête représentative
Prenez une requête et une réponse typiques de la tâche que vous prévoyez réellement d’exécuter. Notez séparément les tokens d’entrée et de sortie ; incluez les instructions et tout autre contexte transmis avec chaque requête.
-
2
Appliquez les unités du modèle
Trouvez le tarif actuel du modèle exact et vérifiez si les entrées et les sorties ont des tarifs distincts. Convertissez chaque nombre de tokens mesuré dans l’unité publiée, multipliez-le par le tarif correspondant, puis additionnez les résultats.
-
3
Extrapolez et vérifiez la fourchette
Multipliez le résultat par requête par le nombre de requêtes prévues sur la période. Refaites le calcul avec une réponse plus longue et une période d’utilisation plus intensive. Considérez l’écart entre les résultats comme une fourchette prévisionnelle, et non comme un total garanti.
tableau des options
- MESURER LES ENTRÉES
- MESURER LA SORTIE
- VÉRIFIER LES UNITÉS ACTUELLES
Comparer les charges de travail sur une même base
Utilisez trois colonnes dans votre propre comparaison : option, unité d’utilisation et volume mesuré. Pour une courte tâche de chat, comparez les volumes d’entrée et de sortie mesurés aux unités actuelles du modèle de chat choisi. Pour une tâche de chat avec un contexte long, refaites la mesure avec l’intégralité du contexte que vous enverrez réellement. Pour les embeddings, utilisez l’unité publiée du modèle d’embedding au lieu de reprendre le calcul effectué pour le chat.
Gardez la même période et le même nombre de requêtes pour toutes les options. Si une option modifie à la fois le modèle et la charge de travail, indiquez ces deux changements ; sinon, la comparaison ne montrera pas lequel explique la différence. Deepinfra présente cette démarche comme une méthode pour vérifier vos hypothèses, et non comme un tableau des tarifs des modèles en temps réel.
ce qui ne fonctionne pas
Un tarif recopié, une longueur de réponse estimée au hasard ou un calcul mêlant différentes unités peuvent rendre trompeuse une estimation pourtant soigneuse. Vérifiez les détails actuels du modèle, mesurez une tâche réelle et refaites le calcul lorsque votre charge de travail change. Vous pourrez alors explorer une option d’inférence en sachant mieux quelles hypothèses restent à tester.
Faites une première estimation utile, sans fausse précision
- Utilisez la variante exacte du modèle
- Séparez les entrées des sorties
- Testez un cas d’utilisation plus intensive
sa propre FAQ
Le modèle et ses unités d’utilisation publiées sont indispensables pour établir une estimation. Vérifiez les informations actuelles de la variante exacte plutôt que de supposer que tous les modèles d’une même famille ont le même tarif.
Mesurez les entrées et les sorties d’une requête représentative, appliquez à chacune les unités et les tarifs actuels du modèle choisi, puis extrapolez selon le nombre de requêtes prévu. Recommencez avec une réponse plus longue pour voir dans quelle mesure le résultat pourrait varier.
Non. Vérifiez d’abord l’unité d’utilisation publiée du modèle d’embedding, puis mesurez dans cette unité le texte que vous comptez traiter. Gardez le calcul des embeddings séparé de celui des requêtes de chat.
La longueur du contexte, la longueur des réponses et la fréquence peuvent varier d’une requête à l’autre. Une estimation peut aussi devenir obsolète si le tarif ou le choix du modèle change. Réexaminez donc ses données de départ à la lumière de l’utilisation observée.