RÁPIDA

deepinfra Inferência de IA

Inferência de IA flexível, pronta quando você precisar.

Experimente a nuvem de inferência

Comece com uma ideia ou escolha um exemplo.

Pague conforme o uso · sem contratos de longo prazo

OU ESCOLHA UM EXEMPLO

DeepSeek · NVIDIA · Qwen · e mais

VercelAdobeUBISOFTIconic HeartsLATITUDECupidBot.ai

Anúncio · maio de 2026

Captamos $107M em uma rodada Série B para expandir a nuvem de inferência

Coliderada pela 500 Global e por Georges Harik, com a participação de A.Capital Ventures, Crescent Cove, Felicis, NVIDIA, Peak6, Samsung Next, Supermicro e Upper90.

Explore as possibilidades Preparada para o que vem a seguir.
$107MFinanciamento da Série B
25xvolume de tokens desde a Série A

Processe trilhões de tokens sem gastar uma fortuna

Preços baixos conforme o uso — sem contratos de longo prazo, taxas ocultas ou surpresas. Startup? Grande empresa? Podemos acompanhar seu crescimento. Conte com APIs simples e suporte técnico especializado.

Plataforma isométrica de inferência em azul e turquesa, com um cubo computacional brilhante, pequenos servidores e dados fluindo por uma paisagem digital escura.
Placa computacional isométrica e luminosa em azul, com blocos modulares e finos caminhos de dados violeta sobre um fundo escuro.

Inferência sob medida para você

Um parceiro de inferência que atende às suas necessidades. Seja para otimizar custos, latência, capacidade de processamento ou escala, criamos uma solução em torno das suas prioridades. A Deepinfra oferece 100+ modelos para atender às suas necessidades.

Retenção zero. Em conformidade. Seguro.

Com nossa política de retenção zero, suas entradas, saídas e dados de usuários permanecem privados. A Deepinfra tem as certificações SOC 2 e ISO 27001. Seguimos as melhores práticas de segurança da informação e privacidade.

Escudo de privacidade em ciano brilhante acima de uma rede precisa de placas de circuito azuis, em uma ilustração técnica isométrica sobre um fundo azul-marinho profundo.
Conjunto de gabinetes de servidores brancos e azul-elétrico sobre uma plataforma isométrica de data center, com luzes turquesa e fundo azul-marinho escuro.

Nosso hardware. Nossos data centers. Sua vantagem em desempenho.

A Deepinfra opera em infraestrutura própria de ponta, otimizada para inferência, em data centers seguros nos EUA. Mais desempenho e confiabilidade para você.

Modelos

Explore nossos modelos em destaque

Ver todos geração de texto texto para fala texto para imagem
XiaomiMiMo/geração de texto

MiMo-V2.6-Flash

Capa do modelo MiMo-V2.6-Flash

Um modelo da série MiMo-V2.6 da Xiaomi que equilibra eficiência e desempenho, desenvolvido para tarefas de agentes de IA.

$0.003 em cache, $0.14 de entrada, $0.28 de saída / 1M

ZDRfp81024k
XiaomiMiMo/geração de texto

MiMo-V2.6-Pro

Capa do modelo MiMo-V2.6-Pro

O principal modelo MiMo-V2.6 para tarefas exigentes de programação de longa duração e agentes que usam múltiplas ferramentas.

$0.004 em cache, $0.435 de entrada, $0.87 de saída / 1M

ZDRfp81024k
deepseek-ai/geração de texto

DeepSeek-V4.1-Flash

Capa do modelo DeepSeek-V4.1-Flash

Um modelo multimodal de mistura de especialistas com suporte a contextos longos.

$0.004 em cache, $0.14 de entrada, $0.42 de saída / 1M

ZDRPrioridadeFlex1024k
zai-org/text-generation

GLM-5.3

Capa do modelo GLM-5.3

Um modelo de raciocínio de grande escala para engenharia de software complexa e tarefas longas.

$0.125 em cache, $0.563 entrada, $2.50 saída / 1M

ZDRFlex1024k
zai-org/text-generation

GLM-5.3-Flash

Capa do modelo GLM-5.3-Flash

Um modelo rápido, adequado para programação eficiente e tarefas de agentes de longa duração.

$0.015 em cache, $0.075 entrada, $0.25 saída / 1M

ZDRfp41024k
moonshotai/text-generation

Kimi-K3

Capa do modelo Kimi-K3

O modelo multimodal de raciocínio com pesos abertos da Moonshot AI, desenvolvido para programação complexa.

$0.285 em cache, $2.85 entrada, $14.25 saída / 1M

ZDRRetenção de cache1024k
Qwen/geração de texto

Qwen3.8-2.4T-A95B

Capa do modelo Qwen3.8-2.4T-A95B

Um modelo de mistura esparsa de especialistas com pesos abertos da Qwen.

$0.20 em cache, $2.00 de entrada, $6.00 de saída / 1M

ZDRfp41024k
deepseek-ai/geração de texto

DeepSeek-V4-Pro-0813

Capa do modelo DeepSeek-V4-Pro-0813

Uma versão do DeepSeek-V4-Pro para tarefas exigentes de raciocínio e atuação autônoma.

$0.20 em cache, $1.30 de entrada, $2.60 de saída / 1M

ZDRPrioridadeFlex
deepseek-ai/geração de texto

DeepSeek-V4-Flash-0731

Capa do modelo DeepSeek-V4-Flash-0731

Uma versão eficiente do DeepSeek-V4-Flash para inferência cotidiana.

$0.015 em cache, $0.06 de entrada, $0.18 de saída / 1M

ZDRPrioridadeFlex
zai-org/geração de texto

GLM-5.2

Capa do modelo GLM-5.2

Um modelo de referência para tarefas de longo prazo e aplicações de agentes.

$0.105 em cache, $0.563 de entrada, $1.80 de saída / 1M

ZDRPrioridadeFlex
nvidia/geração de texto

NVIDIA-Nemotron-3-Ultra-550B-A55B

Capa do modelo NVIDIA Nemotron 3 Ultra

Desenvolvido para raciocínio avançado, orquestração, agentes de programação e pesquisa aprofundada.

$0.10 em cache, $0.50 de entrada, $2.20 de saída / 1M

ZDRPrioridadeFlex
deepseek-ai/geração de texto

DeepSeek-V4-Flash

Capa do modelo DeepSeek-V4-Flash

Um modelo de mistura de especialistas focado em eficiência para aplicações ágeis.

$0.018 em cache, $0.09 de entrada, $0.18 de saída / 1M

ZDRPrioridadeFlex

Métricas de inferência de IA

As métricas que importam para velocidade, escala, estabilidade e custos

Taxa de processamento

Tokens por segundo

Tempo de resposta

Tempo até o primeiro token

Capacidade

Solicitações por segundo

Computação

Infraestrutura em escala

DeepCluster

Seu próprio cluster de GPUs
NVIDIA B300

Hardware dedicado, adquirido e operado pela Deepinfra. Propriedade integral, data center Tier 3 e SLA de 99.982% de disponibilidade.

Explore os clusters de GPUs

NVIDIA B300 · contrato de 5 anos

$1.98/GPU-hr

vs $6.50 /GPU-hr na nuvem pública

70%mais barato que a nuvem
288 GBHBM3e por GPU
256–5,000GPUs disponíveis
Experimente modelos de IA
Experimente modelos de IA