MiMo-V2.6-Flash

Un modelo de la serie MiMo-V2.6 de Xiaomi que equilibra eficiencia y rendimiento, diseñado para tareas basadas en agentes.
$0.003 en caché, $0.14 entrada, $0.28 salida / 1M
RÁPIDA
Inferencia de IA flexible, lista cuando la necesites.
Anuncio · mayo de 2026
Liderada conjuntamente por 500 Global y Georges Harik, con la participación de A.Capital Ventures, Crescent Cove, Felicis, NVIDIA, Peak6, Samsung Next, Supermicro y Upper90.
Precios bajos de pago por uso: sin contratos a largo plazo, cargos ocultos ni sorpresas. ¿Startup? ¿Gran empresa? Podemos crecer contigo. Te ofrecemos API sencillas y asistencia técnica personalizada.
Un socio de inferencia que se adapta a tus necesidades. Ya sea que busques optimizar costos, latencia, rendimiento o escala, diseñamos la solución en torno a tus prioridades. Deepinfra ofrece 100+ modelos para cubrir tus necesidades.
Con nuestra política de retención cero, tus entradas, salidas y datos de usuario permanecen privados. Deepinfra cuenta con las certificaciones SOC 2 e ISO 27001. Seguimos las mejores prácticas de seguridad de la información y privacidad.
Deepinfra funciona sobre una infraestructura propia de vanguardia, optimizada para la inferencia, en centros de datos seguros ubicados en EE. UU. Más rendimiento y fiabilidad para ti.
Modelos

Un modelo de la serie MiMo-V2.6 de Xiaomi que equilibra eficiencia y rendimiento, diseñado para tareas basadas en agentes.
$0.003 en caché, $0.14 entrada, $0.28 salida / 1M

El modelo insignia MiMo-V2.6 para tareas exigentes de programación de largo plazo y agentes que utilizan múltiples herramientas.
$0.004 en caché, $0.435 entrada, $0.87 salida / 1M

Un modelo multimodal de mezcla de expertos compatible con contextos largos.
$0.004 en caché, $0.14 entrada, $0.42 salida / 1M

Un modelo de razonamiento a gran escala para tareas complejas de ingeniería de software y tareas prolongadas.
$0.125 en caché, $0.563 de entrada, $2.50 de salida / 1M

Un modelo rápido adecuado para la programación eficiente y las tareas de agentes de larga duración.
$0.015 en caché, $0.075 de entrada, $0.25 de salida / 1M

El modelo de razonamiento multimodal de pesos abiertos de Moonshot AI, diseñado para tareas complejas de programación.
$0.285 en caché, $2.85 de entrada, $14.25 de salida / 1M

Un modelo de mezcla dispersa de expertos con pesos abiertos de Qwen.
$0.20 en caché, $2.00 de entrada, $6.00 de salida / 1M

Una versión de DeepSeek-V4-Pro para tareas exigentes de razonamiento y trabajo agéntico.
$0.20 en caché, $1.30 de entrada, $2.60 de salida / 1M

Una versión eficiente de DeepSeek-V4-Flash para la inferencia cotidiana.
$0.015 en caché, $0.06 de entrada, $0.18 de salida / 1M

Un modelo insignia para tareas de largo alcance y aplicaciones basadas en agentes.
$0.105 en caché, $0.563 de entrada, $1.80 de salida / 1M

Diseñado para razonamiento avanzado, orquestación, agentes de programación e investigación profunda.
$0.10 en caché, $0.50 de entrada, $2.20 de salida / 1M

Un modelo de mezcla de expertos centrado en la eficiencia para aplicaciones que requieren respuestas rápidas.
$0.018 en caché, $0.09 de entrada, $0.18 de salida / 1M
Las métricas que importan para la velocidad, la escalabilidad, la estabilidad y el gasto
Tokens por segundo
Tiempo hasta el primer token
Solicitudes por segundo
Infraestructura a escala
DeepCluster
Hardware dedicado, adquirido y operado por Deepinfra. Propiedad plena, centro de datos de nivel 3 y SLA de disponibilidad del 99.982%.
Explorar clústeres de GPUNVIDIA B300 · plazo de 5 años
frente a $6.50 /GPU-hr en la nube pública