MiMo-V2.6-Flash

Um modelo da série MiMo-V2.6 da Xiaomi que equilibra eficiência e desempenho, desenvolvido para tarefas de agentes de IA.
$0.003 em cache, $0.14 de entrada, $0.28 de saída / 1M
RÁPIDA
Inferência de IA flexível, pronta quando você precisar.
Anúncio · maio de 2026
Coliderada pela 500 Global e por Georges Harik, com a participação de A.Capital Ventures, Crescent Cove, Felicis, NVIDIA, Peak6, Samsung Next, Supermicro e Upper90.
Preços baixos conforme o uso — sem contratos de longo prazo, taxas ocultas ou surpresas. Startup? Grande empresa? Podemos acompanhar seu crescimento. Conte com APIs simples e suporte técnico especializado.
Um parceiro de inferência que atende às suas necessidades. Seja para otimizar custos, latência, capacidade de processamento ou escala, criamos uma solução em torno das suas prioridades. A Deepinfra oferece 100+ modelos para atender às suas necessidades.
Com nossa política de retenção zero, suas entradas, saídas e dados de usuários permanecem privados. A Deepinfra tem as certificações SOC 2 e ISO 27001. Seguimos as melhores práticas de segurança da informação e privacidade.
A Deepinfra opera em infraestrutura própria de ponta, otimizada para inferência, em data centers seguros nos EUA. Mais desempenho e confiabilidade para você.
Modelos

Um modelo da série MiMo-V2.6 da Xiaomi que equilibra eficiência e desempenho, desenvolvido para tarefas de agentes de IA.
$0.003 em cache, $0.14 de entrada, $0.28 de saída / 1M

O principal modelo MiMo-V2.6 para tarefas exigentes de programação de longa duração e agentes que usam múltiplas ferramentas.
$0.004 em cache, $0.435 de entrada, $0.87 de saída / 1M

Um modelo multimodal de mistura de especialistas com suporte a contextos longos.
$0.004 em cache, $0.14 de entrada, $0.42 de saída / 1M

Um modelo de raciocínio de grande escala para engenharia de software complexa e tarefas longas.
$0.125 em cache, $0.563 entrada, $2.50 saída / 1M

Um modelo rápido, adequado para programação eficiente e tarefas de agentes de longa duração.
$0.015 em cache, $0.075 entrada, $0.25 saída / 1M

O modelo multimodal de raciocínio com pesos abertos da Moonshot AI, desenvolvido para programação complexa.
$0.285 em cache, $2.85 entrada, $14.25 saída / 1M

Um modelo de mistura esparsa de especialistas com pesos abertos da Qwen.
$0.20 em cache, $2.00 de entrada, $6.00 de saída / 1M

Uma versão do DeepSeek-V4-Pro para tarefas exigentes de raciocínio e atuação autônoma.
$0.20 em cache, $1.30 de entrada, $2.60 de saída / 1M

Uma versão eficiente do DeepSeek-V4-Flash para inferência cotidiana.
$0.015 em cache, $0.06 de entrada, $0.18 de saída / 1M

Um modelo de referência para tarefas de longo prazo e aplicações de agentes.
$0.105 em cache, $0.563 de entrada, $1.80 de saída / 1M

Desenvolvido para raciocínio avançado, orquestração, agentes de programação e pesquisa aprofundada.
$0.10 em cache, $0.50 de entrada, $2.20 de saída / 1M

Um modelo de mistura de especialistas focado em eficiência para aplicações ágeis.
$0.018 em cache, $0.09 de entrada, $0.18 de saída / 1M
As métricas que importam para velocidade, escala, estabilidade e custos
Tokens por segundo
Tempo até o primeiro token
Solicitações por segundo
Infraestrutura em escala
DeepCluster
Hardware dedicado, adquirido e operado pela Deepinfra. Propriedade integral, data center Tier 3 e SLA de 99.982% de disponibilidade.
Explore os clusters de GPUsNVIDIA B300 · contrato de 5 anos
vs $6.50 /GPU-hr na nuvem pública