MiMo-V2.6-Flash

Un modèle de la série MiMo-V2.6 de Xiaomi offrant un équilibre entre efficacité et performances, conçu pour les tâches agentiques.
$0.003 en cache, $0.14 en entrée, $0.28 en sortie / 1M
RAPIDE
Une inférence IA flexible, disponible quand vous en avez besoin.
Annonce · mai 2026
Un tour de table codirigé par 500 Global et Georges Harik, avec la participation de A.Capital Ventures, Crescent Cove, Felicis, NVIDIA, Peak6, Samsung Next, Supermicro et Upper90.
Des tarifs bas, à l’utilisation : aucun contrat à long terme, aucuns frais cachés, aucune mauvaise surprise. Startup ou grande entreprise, nous pouvons évoluer avec vous. Nous vous accompagnons avec des API simples et une assistance technique personnalisée.
Un partenaire d’inférence qui répond à vos besoins. Que vous cherchiez à optimiser les coûts, la latence, le débit ou la capacité, nous concevons une solution selon vos priorités. Deepinfra propose 100+ modèles pour répondre à vos besoins.
Grâce à notre politique de non-conservation des données, vos entrées, vos sorties et les données de vos utilisateurs restent privées. Deepinfra est certifié SOC 2 et ISO 27001. Nous suivons les bonnes pratiques en matière de sécurité de l’information et de confidentialité.
Deepinfra s’appuie sur sa propre infrastructure de pointe, optimisée pour l’inférence, dans des centres de données sécurisés situés aux États-Unis. Pour vous, cela signifie de meilleures performances et une plus grande fiabilité.
Modèles

Un modèle de la série MiMo-V2.6 de Xiaomi offrant un équilibre entre efficacité et performances, conçu pour les tâches agentiques.
$0.003 en cache, $0.14 en entrée, $0.28 en sortie / 1M

Le modèle phare MiMo-V2.6 pour les tâches de programmation complexes et les agents utilisant plusieurs outils sur de longues séquences.
$0.004 en cache, $0.435 en entrée, $0.87 en sortie / 1M

Un modèle multimodal à mélange d’experts prenant en charge les contextes longs.
$0.004 en cache, $0.14 en entrée, $0.42 en sortie / 1M

Un modèle de raisonnement à grande échelle pour l’ingénierie logicielle complexe et les tâches de longue durée.
$0.125 en cache, $0.563 en entrée, $2.50 en sortie / 1M

Un modèle rapide adapté au codage efficace et aux tâches d’agents de longue durée.
$0.015 en cache, $0.075 en entrée, $0.25 en sortie / 1M

Le modèle de raisonnement multimodal à poids ouverts de Moonshot AI, conçu pour le codage complexe.
$0.285 en cache, $2.85 en entrée, $14.25 en sortie / 1M

Un modèle à mélange d’experts clairsemé à poids ouverts, développé par Qwen.
$0.20 en cache, $2.00 en entrée, $6.00 en sortie / 1M

Une version de DeepSeek-V4-Pro conçue pour les tâches exigeantes de raisonnement et les agents IA.
$0.20 en cache, $1.30 en entrée, $2.60 en sortie / 1M

Une version efficace de DeepSeek-V4-Flash pour l’inférence au quotidien.
$0.015 en cache, $0.06 en entrée, $0.18 en sortie / 1M

Un modèle phare pour les tâches de longue durée et les applications agentiques.
$0.105 en cache, $0.563 en entrée, $1.80 en sortie / 1M

Conçu pour le raisonnement de pointe, l’orchestration, les agents de codage et la recherche approfondie.
$0.10 en cache, $0.50 en entrée, $2.20 en sortie / 1M

Un modèle à mélange d’experts axé sur l’efficacité pour les applications réactives.
$0.018 en cache, $0.09 en entrée, $0.18 en sortie / 1M
Les indicateurs clés pour la vitesse, le passage à l’échelle, la stabilité et les coûts
Tokens par seconde
Temps jusqu’au premier token
Requêtes par seconde
Infrastructure à grande échelle
DeepCluster
Matériel dédié, acquis et exploité par Deepinfra. Pleine propriété, datacenter Tier 3, SLA de disponibilité de 99.982%.
Découvrir les clusters GPUNVIDIA B300 · engagement de 5 ans
contre $6.50 /GPU-hr sur le cloud public