Comparaison des fournisseurs

Comment choisir entre deepinfra et Together AI

La réponse à la question deepinfra vs Together AI dépend du modèle, de la charge de travail et du trafic réels de votre application. Deepinfra et Together AI peuvent tous deux convenir à l’inférence ; comparez-les avec les mêmes requêtes avant de migrer une application.

Visuel du site Deepinfra

tableau des coûts totaux

Pour comparer deepinfra et Together AI, vérifiez le modèle exact et les conditions en vigueur chez chaque fournisseur avant d’estimer votre facture mensuelle. Les tarifs publiés ne couvrent pas tous les coûts liés à une charge de travail.

Deepinfra Together AI
Choix du modèle Vérifiez dans le catalogue Deepinfra que le modèle et la version requis sont disponibles. Vérifiez dans le catalogue Together AI que le même modèle et la même version sont disponibles.
Utilisation en entrée Appliquez le tarif d’entrée actuel de Deepinfra à l’utilisation mesurée des prompts. Appliquez le tarif d’entrée actuel de Together AI à cette même utilisation mesurée.
Utilisation en sortie Estimez séparément le coût des sorties à partir de la longueur réelle des réponses. Utilisez ces mêmes longueurs de réponse et le tarif de sortie correspondant.
Requêtes longues Vérifiez que la longueur de contexte nécessaire est disponible et comment elle est facturée. Vérifiez l’option de contexte équivalente et ses conditions de facturation.
Échecs et nouvelles tentatives Tenez compte du comportement observé lors des nouvelles tentatives pendant un essai de Deepinfra. Tenez compte du comportement observé lors des nouvelles tentatives pendant un essai de Together AI.
Travail d’intégration Comptabilisez les modifications de code, de surveillance et de prompts nécessaires pour utiliser Deepinfra. Comptabilisez le même travail si vous adoptez Together AI.
Coût mensuel effectif Calculez-le à partir de votre répartition mesurée des requêtes et des conditions en vigueur. Calculez-le à partir de la même répartition des requêtes et des conditions en vigueur.

là où la qualité diffère

Le nom d’un fournisseur n’est pas une note de qualité. Commencez avec des entrées identiques, puis vérifiez si chaque service propose la version du modèle et les paramètres dont votre tâche a besoin.

Deepinfra

Un candidat solide lorsque le modèle qu’il propose donne des résultats fiables sur votre jeu d’évaluation.

Points forts

  • Peut être évalué avec les mêmes prompts propres à la tâche et la même grille de notation que Together AI.
  • Permet à un utilisateur actuel de Deepinfra de tester la qualité sans modifier d’abord son application.
  • Peut atteindre le seuil de qualité requis pour la tâche, même si un autre fournisseur arrive en tête sur un benchmark sans rapport.

Compromis

  • Un résultat favorable pour un modèle ne démontre pas la qualité du reste du catalogue.
  • Des différences de versions de modèles ou de paramètres par défaut peuvent rendre une comparaison directe non valable.

Together AI

Un candidat solide lorsque son modèle et sa configuration correspondants atteignent le même niveau de qualité.

Fonctionne bien

  • Peut être évalué par rapport à Deepinfra à l’aide d’exemples réservés aux tests et d’une grille d’évaluation commune.
  • Peut proposer un modèle ou une configuration mieux adaptés à une tâche particulière.
  • Fournit un second résultat utile pour vérifier si un problème observé est propre à un fournisseur.

Compromis

  • Changer de fournisseur sans contrôler le modèle et les paramètres peut rendre difficile l’identification de la cause d’un changement de qualité.
  • Un petit échantillon de résultats impressionnants peut masquer des échecs sur des entrées courantes ou difficiles.

là où les temps diffèrent

La latence recouvre plusieurs réalités : pour un assistant interactif, le délai avant l’apparition du premier token compte, tandis que pour un traitement par lots, le temps total de traitement peut être le plus important.

ou

Option 1

Les utilisateurs attendent une réponse diffusée en continu

Privilégiez le fournisseur dont le délai d’apparition du premier token est le plus régulier dans votre région et pour la longueur habituelle de vos prompts.

Soumettez le même modèle et les mêmes prompts à Deepinfra et à Together AI à plusieurs moments de la journée. Relevez les délais exceptionnellement longs ainsi que la médiane ; une attente occasionnellement longue peut compter davantage qu’un léger avantage en moyenne.

ou

Option 2

Un traitement par lots gère de nombreuses requêtes

Privilégiez le fournisseur qui traite l’ensemble du lot de manière fiable au niveau de concurrence dont vous avez besoin.

Mesurez ensemble le temps total écoulé, le nombre de requêtes traitées, les nouvelles tentatives et la longueur des réponses. Une réponse individuelle plus rapide n’est pas nécessairement préférable si une charge plus élevée entraîne davantage d’échecs.

ou

Option 3

L’intégration actuelle respecte déjà son échéance

Conservez-la, sauf si l’autre solution apporte un gain significatif et reproductible.

Tenez compte du temps nécessaire pour tester à nouveau les prompts, mettre à jour le traitement des requêtes et surveiller les résultats. Un léger gain de temps ne justifie pas forcément de modifier un processus stable.

quand le changement en vaut la peine

Changez de fournisseur lorsqu’un modèle comparable atteint votre seuil de qualité et apporte une amélioration significative du coût mesuré, de la latence ou de la fiabilité. Conservez Deepinfra si ses résultats actuels répondent déjà à ces exigences et si l’avantage apparent de Together AI disparaît dans des conditions de trafic réalistes. Conservez Together AI dans le cas inverse. Si aucun des deux ne se démarque clairement, un projet pilote limité est plus prudent qu’une migration complète : conservez votre jeu de prompts, consignez les conditions en vigueur et comparez les échecs avec autant de soin que les réponses réussies.

Testez l’alternative avant de modifier votre flux de travail

  • Utilisez des prompts et des paramètres de génération identiques.
  • Mesurez le temps nécessaire pour obtenir des réponses complètes, pas seulement celui du premier token.
  • Confirmez la disponibilité des modèles et les conditions en vigueur avant de prendre une décision.
Essayer un modèle

FAQ sur la comparaison

Il n’existe pas de réponse valable pour tous les modèles et toutes les requêtes. Consultez les conditions en vigueur de chaque fournisseur pour le modèle exact, puis calculez l’utilisation en entrée et en sortie à partir d’un échantillon représentatif de vos prompts.

Pas nécessairement. Vérifiez d’abord la version du modèle et les paramètres de génération, puis comparez de nombreuses sorties plutôt qu’une seule réponse. Les différences peuvent aussi provenir de l’échantillonnage et du fonctionnement du service.

Testez les deux depuis le lieu où s’exécute votre application. Comparez le délai avant le premier token, le temps de réponse total et les réponses anormalement lentes en utilisant le même modèle, des longueurs de prompts identiques et les mêmes limites de réponse.

Établissez des valeurs de référence pour la qualité, le coût, la latence et les échecs chez votre fournisseur actuel. Exécutez la même charge de travail chez l’autre fournisseur, puis mettez en balance toute amélioration reproductible avec le travail d’intégration et de nouveaux tests.

Oui, mais considérez cela comme une comparaison d’options complètes plutôt que comme un test contrôlé des fournisseurs. Évaluez chaque option selon les résultats requis pour votre tâche et signalez la différence entre les modèles lors de l’interprétation des résultats.

Essayer les modèles d’IA
Essayer les modèles d’IA