RAPIDE

deepinfra Inférence IA

Une inférence IA flexible, disponible quand vous en avez besoin.

Essayer le cloud d’inférence

Partez d’une idée ou choisissez un exemple.

Payez à l’usage · sans contrat à long terme

OU CHOISISSEZ UN EXEMPLE

DeepSeek · NVIDIA · Qwen · et bien d’autres

VercelAdobeUBISOFTIconic HeartsLATITUDECupidBot.ai

Annonce · mai 2026

Nous avons levé $107M en série B pour développer notre cloud d’inférence

Un tour de table codirigé par 500 Global et Georges Harik, avec la participation de A.Capital Ventures, Crescent Cove, Felicis, NVIDIA, Peak6, Samsung Next, Supermicro et Upper90.

Explorez les possibilités Conçu pour la suite.
$107MFinancement de série B
25xle volume de tokens depuis la série A

Passez à des milliers de milliards de tokens sans vous ruiner

Des tarifs bas, à l’utilisation : aucun contrat à long terme, aucuns frais cachés, aucune mauvaise surprise. Startup ou grande entreprise, nous pouvons évoluer avec vous. Nous vous accompagnons avec des API simples et une assistance technique personnalisée.

Plateforme d’inférence isométrique bleue et turquoise, avec un cube de calcul lumineux, de petits serveurs et des flux de données traversant un paysage numérique sombre.
Tuile de calcul isométrique bleu lumineux, avec des blocs modulaires et de fins chemins de données violets sur fond sombre.

Une inférence adaptée à vos besoins

Un partenaire d’inférence qui répond à vos besoins. Que vous cherchiez à optimiser les coûts, la latence, le débit ou la capacité, nous concevons une solution selon vos priorités. Deepinfra propose 100+ modèles pour répondre à vos besoins.

Aucune conservation des données. Conforme. Sécurisé.

Grâce à notre politique de non-conservation des données, vos entrées, vos sorties et les données de vos utilisateurs restent privées. Deepinfra est certifié SOC 2 et ISO 27001. Nous suivons les bonnes pratiques en matière de sécurité de l’information et de confidentialité.

Bouclier de confidentialité cyan lumineux au-dessus d’un réseau précis de circuits imprimés bleus, représenté sous forme d’illustration technique isométrique sur fond bleu marine profond.
Groupe de baies de serveurs blanches et bleu électrique sur une plateforme de centre de données isométrique, avec des lumières turquoise et un fond bleu marine sombre.

Notre matériel. Nos centres de données. Votre avantage en matière de performance.

Deepinfra s’appuie sur sa propre infrastructure de pointe, optimisée pour l’inférence, dans des centres de données sécurisés situés aux États-Unis. Pour vous, cela signifie de meilleures performances et une plus grande fiabilité.

Modèles

Découvrez nos modèles phares

Tout voir génération de texte synthèse vocale génération d’images
XiaomiMiMo/génération de texte

MiMo-V2.6-Flash

Visuel de couverture du modèle MiMo-V2.6-Flash

Un modèle de la série MiMo-V2.6 de Xiaomi offrant un équilibre entre efficacité et performances, conçu pour les tâches agentiques.

$0.003 en cache, $0.14 en entrée, $0.28 en sortie / 1M

ZDRfp81024k
XiaomiMiMo/génération de texte

MiMo-V2.6-Pro

Visuel de couverture du modèle MiMo-V2.6-Pro

Le modèle phare MiMo-V2.6 pour les tâches de programmation complexes et les agents utilisant plusieurs outils sur de longues séquences.

$0.004 en cache, $0.435 en entrée, $0.87 en sortie / 1M

ZDRfp81024k
deepseek-ai/génération de texte

DeepSeek-V4.1-Flash

Visuel de couverture du modèle DeepSeek-V4.1-Flash

Un modèle multimodal à mélange d’experts prenant en charge les contextes longs.

$0.004 en cache, $0.14 en entrée, $0.42 en sortie / 1M

ZDRPrioritaireFlex1024k
zai-org/génération de texte

GLM-5.3

Visuel de couverture du modèle GLM-5.3

Un modèle de raisonnement à grande échelle pour l’ingénierie logicielle complexe et les tâches de longue durée.

$0.125 en cache, $0.563 en entrée, $2.50 en sortie / 1M

ZDRFlex1024k
zai-org/génération de texte

GLM-5.3-Flash

Visuel de couverture du modèle GLM-5.3-Flash

Un modèle rapide adapté au codage efficace et aux tâches d’agents de longue durée.

$0.015 en cache, $0.075 en entrée, $0.25 en sortie / 1M

ZDRfp41024k
moonshotai/génération de texte

Kimi-K3

Visuel de couverture du modèle Kimi-K3

Le modèle de raisonnement multimodal à poids ouverts de Moonshot AI, conçu pour le codage complexe.

$0.285 en cache, $2.85 en entrée, $14.25 en sortie / 1M

ZDRConservation du cache1024k
Qwen/génération de texte

Qwen3.8-2.4T-A95B

Visuel de couverture du modèle Qwen3.8-2.4T-A95B

Un modèle à mélange d’experts clairsemé à poids ouverts, développé par Qwen.

$0.20 en cache, $2.00 en entrée, $6.00 en sortie / 1M

ZDRfp41024k
deepseek-ai/génération de texte

DeepSeek-V4-Pro-0813

Visuel de couverture du modèle DeepSeek-V4-Pro-0813

Une version de DeepSeek-V4-Pro conçue pour les tâches exigeantes de raisonnement et les agents IA.

$0.20 en cache, $1.30 en entrée, $2.60 en sortie / 1M

ZDRPrioritaireFlex
deepseek-ai/génération de texte

DeepSeek-V4-Flash-0731

Visuel de couverture du modèle DeepSeek-V4-Flash-0731

Une version efficace de DeepSeek-V4-Flash pour l’inférence au quotidien.

$0.015 en cache, $0.06 en entrée, $0.18 en sortie / 1M

ZDRPrioritéFlex
zai-org/génération de texte

GLM-5.2

Visuel de couverture du modèle GLM-5.2

Un modèle phare pour les tâches de longue durée et les applications agentiques.

$0.105 en cache, $0.563 en entrée, $1.80 en sortie / 1M

ZDRPrioritéFlex
nvidia/génération de texte

NVIDIA-Nemotron-3-Ultra-550B-A55B

Visuel de couverture du modèle NVIDIA Nemotron 3 Ultra

Conçu pour le raisonnement de pointe, l’orchestration, les agents de codage et la recherche approfondie.

$0.10 en cache, $0.50 en entrée, $2.20 en sortie / 1M

ZDRPrioritéFlex
deepseek-ai/génération de texte

DeepSeek-V4-Flash

Visuel de couverture du modèle DeepSeek-V4-Flash

Un modèle à mélange d’experts axé sur l’efficacité pour les applications réactives.

$0.018 en cache, $0.09 en entrée, $0.18 en sortie / 1M

ZDRPrioritéFlex

Indicateurs d’inférence IA

Les indicateurs clés pour la vitesse, le passage à l’échelle, la stabilité et les coûts

Débit

Tokens par seconde

Réactivité

Temps jusqu’au premier token

Capacité

Requêtes par seconde

Calcul

Infrastructure à grande échelle

DeepCluster

Votre propre cluster GPU NVIDIA B300
Cluster GPU

Matériel dédié, acquis et exploité par Deepinfra. Pleine propriété, datacenter Tier 3, SLA de disponibilité de 99.982%.

Découvrir les clusters GPU

NVIDIA B300 · engagement de 5 ans

$1.98/GPU-hr

contre $6.50 /GPU-hr sur le cloud public

70%moins cher que le cloud
288 GBHBM3e par GPU
256–5,000GPU disponibles
Essayer les modèles d’IA
Essayer les modèles d’IA