RÁPIDA

deepinfra Inferencia de IA

Inferencia de IA flexible, lista cuando la necesites.

Prueba la nube de inferencia

Empieza con una idea o elige un ejemplo.

Paga por uso · sin contratos a largo plazo

O ELIGE UN EJEMPLO

DeepSeek · NVIDIA · Qwen · y más

VercelAdobeUBISOFTIconic HeartsLATITUDECupidBot.ai

Anuncio · mayo de 2026

Hemos recaudado $107M en una ronda Serie B para ampliar la nube de inferencia

Liderada conjuntamente por 500 Global y Georges Harik, con la participación de A.Capital Ventures, Crescent Cove, Felicis, NVIDIA, Peak6, Samsung Next, Supermicro y Upper90.

Explora las posibilidades Preparado para lo que viene.
$107MFinanciación de Serie B
25xvolumen de tokens desde la Serie A

Escala hasta billones de tokens sin disparar los costos

Precios bajos de pago por uso: sin contratos a largo plazo, cargos ocultos ni sorpresas. ¿Startup? ¿Gran empresa? Podemos crecer contigo. Te ofrecemos API sencillas y asistencia técnica personalizada.

Plataforma de inferencia isométrica azul y turquesa con un cubo de cómputo brillante, pequeños servidores y datos que fluyen por un paisaje digital oscuro.
Módulo de cómputo isométrico azul y luminoso con bloques modulares y finas rutas de datos violetas sobre un fondo oscuro.

Inferencia adaptada a ti

Un socio de inferencia que se adapta a tus necesidades. Ya sea que busques optimizar costos, latencia, rendimiento o escala, diseñamos la solución en torno a tus prioridades. Deepinfra ofrece 100+ modelos para cubrir tus necesidades.

Sin retención de datos. Conforme a las normativas. Seguro.

Con nuestra política de retención cero, tus entradas, salidas y datos de usuario permanecen privados. Deepinfra cuenta con las certificaciones SOC 2 e ISO 27001. Seguimos las mejores prácticas de seguridad de la información y privacidad.

Escudo de privacidad cian brillante sobre una precisa red azul de placas de circuito, en una ilustración técnica isométrica sobre un fondo azul marino intenso.
Conjunto de armarios de servidores blancos y azul eléctrico sobre una plataforma isométrica de centro de datos, con luces turquesas y un fondo azul marino oscuro.

Nuestro hardware. Nuestros centros de datos. Tu ventaja en rendimiento.

Deepinfra funciona sobre una infraestructura propia de vanguardia, optimizada para la inferencia, en centros de datos seguros ubicados en EE. UU. Más rendimiento y fiabilidad para ti.

Modelos

Explora nuestros modelos destacados

Ver todo generación de texto texto a voz texto a imagen
XiaomiMiMo/generación de texto

MiMo-V2.6-Flash

Portada del modelo MiMo-V2.6-Flash

Un modelo de la serie MiMo-V2.6 de Xiaomi que equilibra eficiencia y rendimiento, diseñado para tareas basadas en agentes.

$0.003 en caché, $0.14 entrada, $0.28 salida / 1M

ZDRfp81024k
XiaomiMiMo/generación de texto

MiMo-V2.6-Pro

Portada del modelo MiMo-V2.6-Pro

El modelo insignia MiMo-V2.6 para tareas exigentes de programación de largo plazo y agentes que utilizan múltiples herramientas.

$0.004 en caché, $0.435 entrada, $0.87 salida / 1M

ZDRfp81024k
deepseek-ai/generación de texto

DeepSeek-V4.1-Flash

Portada del modelo DeepSeek-V4.1-Flash

Un modelo multimodal de mezcla de expertos compatible con contextos largos.

$0.004 en caché, $0.14 entrada, $0.42 salida / 1M

ZDRPrioridadFlex1024k
zai-org/generación de texto

GLM-5.3

Portada del modelo GLM-5.3

Un modelo de razonamiento a gran escala para tareas complejas de ingeniería de software y tareas prolongadas.

$0.125 en caché, $0.563 de entrada, $2.50 de salida / 1M

ZDRFlex1024k
zai-org/generación de texto

GLM-5.3-Flash

Portada del modelo GLM-5.3-Flash

Un modelo rápido adecuado para la programación eficiente y las tareas de agentes de larga duración.

$0.015 en caché, $0.075 de entrada, $0.25 de salida / 1M

ZDRfp41024k
moonshotai/generación de texto

Kimi-K3

Portada del modelo Kimi-K3

El modelo de razonamiento multimodal de pesos abiertos de Moonshot AI, diseñado para tareas complejas de programación.

$0.285 en caché, $2.85 de entrada, $14.25 de salida / 1M

ZDRRetención de caché1024k
Qwen/text-generation

Qwen3.8-2.4T-A95B

Portada del modelo Qwen3.8-2.4T-A95B

Un modelo de mezcla dispersa de expertos con pesos abiertos de Qwen.

$0.20 en caché, $2.00 de entrada, $6.00 de salida / 1M

ZDRfp41024k
deepseek-ai/text-generation

DeepSeek-V4-Pro-0813

Portada del modelo DeepSeek-V4-Pro-0813

Una versión de DeepSeek-V4-Pro para tareas exigentes de razonamiento y trabajo agéntico.

$0.20 en caché, $1.30 de entrada, $2.60 de salida / 1M

ZDRPrioridadFlex
deepseek-ai/text-generation

DeepSeek-V4-Flash-0731

Portada del modelo DeepSeek-V4-Flash-0731

Una versión eficiente de DeepSeek-V4-Flash para la inferencia cotidiana.

$0.015 en caché, $0.06 de entrada, $0.18 de salida / 1M

ZDRPrioridadFlex
zai-org/text-generation

GLM-5.2

Portada del modelo GLM-5.2

Un modelo insignia para tareas de largo alcance y aplicaciones basadas en agentes.

$0.105 en caché, $0.563 de entrada, $1.80 de salida / 1M

ZDRPrioridadFlex
nvidia/text-generation

NVIDIA-Nemotron-3-Ultra-550B-A55B

Portada del modelo NVIDIA Nemotron 3 Ultra

Diseñado para razonamiento avanzado, orquestación, agentes de programación e investigación profunda.

$0.10 en caché, $0.50 de entrada, $2.20 de salida / 1M

ZDRPrioridadFlex
deepseek-ai/text-generation

DeepSeek-V4-Flash

Portada del modelo DeepSeek-V4-Flash

Un modelo de mezcla de expertos centrado en la eficiencia para aplicaciones que requieren respuestas rápidas.

$0.018 en caché, $0.09 de entrada, $0.18 de salida / 1M

ZDRPrioridadFlex

Métricas de inferencia de IA

Las métricas que importan para la velocidad, la escalabilidad, la estabilidad y el gasto

Rendimiento

Tokens por segundo

Capacidad de respuesta

Tiempo hasta el primer token

Capacidad

Solicitudes por segundo

Computación

Infraestructura a escala

DeepCluster

Tu propio clúster de GPU NVIDIA B300
Clúster de GPU

Hardware dedicado, adquirido y operado por Deepinfra. Propiedad plena, centro de datos de nivel 3 y SLA de disponibilidad del 99.982%.

Explorar clústeres de GPU

NVIDIA B300 · plazo de 5 años

$1.98/GPU-hr

frente a $6.50 /GPU-hr en la nube pública

70%más barato que la nube
288 GBHBM3e por GPU
256–5,000GPU disponibles
Prueba modelos de IA
Prueba modelos de IA