Planification de l’utilisation

Comment estimer la tarification de deepinfra pour votre charge de travail

Commencez par choisir un modèle, estimer le nombre de requêtes et déterminer le nombre de tokens que chaque requête pourrait utiliser. Deepinfra vous aide à évaluer ces paramètres, mais cette page n’affiche pas de tarif en temps réel et ne fournit pas de devis officiel.

Visuel des modèles et de l’inférence Deepinfra

Prérequis

Recueillez d’abord des mesures de votre charge de travail. Le nom d’un modèle ne suffit pas à déterminer ce que consommeront des requêtes répétées.

Obligatoire Facultatif
  • Choisissez le modèle exact que vous comptez utiliser, plutôt que de faire une estimation à partir d’une famille de modèles. — Les variantes d’un modèle peuvent avoir des unités de facturation et des tarifs différents.

  • Notez le tarif publié actuellement et les unités de facturation de ce modèle au moment de son utilisation. — Ne considérez pas un exemple figurant sur cette page comme un tarif actuel.

  • Estimez le nombre de requêtes sur une période définie et mesurez séparément les volumes habituels en entrée et en sortie. — Une réponse longue peut modifier le résultat même si le prompt reste court.

  • Conservez une requête plus longue ou plus complexe comme second cas de test.facultatif — Cela permet de voir dans quelle mesure votre estimation est sensible aux variations de la charge de travail.

un calcul complet de bout en bout

Avant de faire les calculs, notez ce que l’estimation ne peut pas établir. Chaque lacune nécessite une mesure ou une source à jour.

1

Elle ne peut pas fournir un tarif en temps réel

Le tarif publié d’un modèle peut changer, et cette page ne le récupère pas. Une estimation fondée sur un ancien tarif peut reposer sur des calculs précis tout en donnant un résultat erroné.

Que faire à la place

Vérifiez le tarif actuel du modèle exact et ses unités juste avant de calculer.

2

Elle ne peut pas prévoir la longueur des réponses

Des requêtes identiques peuvent produire des réponses de longueurs différentes. Une seule réponse courte constitue une base fragile pour planifier une charge de travail récurrente.

Que faire à la place

Échantillonnez des tâches représentatives et incluez un cas avec une réponse plus longue.

3

Elle ne peut pas assimiler des unités différentes

Les tâches de chat, de génération d’embeddings et d’autres formes d’inférence peuvent être mesurées différemment. Appliquer la même hypothèse sur les tokens à toutes les charges de travail masque cette différence.

Que faire à la place

Établissez une estimation distincte pour chaque tâche, selon l’unité d’utilisation publiée qui lui correspond.

un calcul complet de bout en bout

Pour une charge de travail de chat, partez d’une requête représentative, mesurez-la, puis estimez le coût sur une période donnée. Remplacez chaque valeur d’exemple par vos propres observations.

  1. 1

    Mesurez une requête représentative

    Prenez une requête et une réponse typiques de la tâche que vous prévoyez réellement d’exécuter. Notez séparément les tokens d’entrée et de sortie ; incluez les instructions et tout autre contexte transmis avec chaque requête.

  2. 2

    Appliquez les unités du modèle

    Trouvez le tarif actuel du modèle exact et vérifiez si les entrées et les sorties ont des tarifs distincts. Convertissez chaque nombre de tokens mesuré dans l’unité publiée, multipliez-le par le tarif correspondant, puis additionnez les résultats.

  3. 3

    Extrapolez et vérifiez la fourchette

    Multipliez le résultat par requête par le nombre de requêtes prévues sur la période. Refaites le calcul avec une réponse plus longue et une période d’utilisation plus intensive. Considérez l’écart entre les résultats comme une fourchette prévisionnelle, et non comme un total garanti.

tableau des options

  • MESURER LES ENTRÉES
  • MESURER LA SORTIE
  • VÉRIFIER LES UNITÉS ACTUELLES

Comparer les charges de travail sur une même base

Utilisez trois colonnes dans votre propre comparaison : option, unité d’utilisation et volume mesuré. Pour une courte tâche de chat, comparez les volumes d’entrée et de sortie mesurés aux unités actuelles du modèle de chat choisi. Pour une tâche de chat avec un contexte long, refaites la mesure avec l’intégralité du contexte que vous enverrez réellement. Pour les embeddings, utilisez l’unité publiée du modèle d’embedding au lieu de reprendre le calcul effectué pour le chat.

Gardez la même période et le même nombre de requêtes pour toutes les options. Si une option modifie à la fois le modèle et la charge de travail, indiquez ces deux changements ; sinon, la comparaison ne montrera pas lequel explique la différence. Deepinfra présente cette démarche comme une méthode pour vérifier vos hypothèses, et non comme un tableau des tarifs des modèles en temps réel.

ce qui ne fonctionne pas

Un tarif recopié, une longueur de réponse estimée au hasard ou un calcul mêlant différentes unités peuvent rendre trompeuse une estimation pourtant soigneuse. Vérifiez les détails actuels du modèle, mesurez une tâche réelle et refaites le calcul lorsque votre charge de travail change. Vous pourrez alors explorer une option d’inférence en sachant mieux quelles hypothèses restent à tester.

Faites une première estimation utile, sans fausse précision

  • Utilisez la variante exacte du modèle
  • Séparez les entrées des sorties
  • Testez un cas d’utilisation plus intensive
Explorez les options d’inférence

sa propre FAQ

Le modèle et ses unités d’utilisation publiées sont indispensables pour établir une estimation. Vérifiez les informations actuelles de la variante exacte plutôt que de supposer que tous les modèles d’une même famille ont le même tarif.

Mesurez les entrées et les sorties d’une requête représentative, appliquez à chacune les unités et les tarifs actuels du modèle choisi, puis extrapolez selon le nombre de requêtes prévu. Recommencez avec une réponse plus longue pour voir dans quelle mesure le résultat pourrait varier.

Non. Vérifiez d’abord l’unité d’utilisation publiée du modèle d’embedding, puis mesurez dans cette unité le texte que vous comptez traiter. Gardez le calcul des embeddings séparé de celui des requêtes de chat.

La longueur du contexte, la longueur des réponses et la fréquence peuvent varier d’une requête à l’autre. Une estimation peut aussi devenir obsolète si le tarif ou le choix du modèle change. Réexaminez donc ses données de départ à la lumière de l’utilisation observée.

Essayer les modèles d’IA
Essayer les modèles d’IA