MiMo-V2.6-Flash

Ein auf Effizienz und Leistung abgestimmtes Modell der MiMo-V2.6-Serie von Xiaomi, entwickelt für agentenbasierte Aufgaben.
$0.003 zwischengespeichert, $0.14 Eingabe, $0.28 Ausgabe / 1M
SCHNELL
Flexible KI-Inferenz, wann immer Sie sie brauchen.
Ankündigung · Mai 2026
Angeführt von 500 Global und Georges Harik, mit Beteiligung von A.Capital Ventures, Crescent Cove, Felicis, NVIDIA, Peak6, Samsung Next, Supermicro und Upper90.
Günstige Preise nach Verbrauch – keine langfristigen Verträge, keine versteckten Gebühren, keine Überraschungen. Startup? Unternehmen? Wir wachsen mit Ihnen. Mit einfachen APIs und persönlichem technischem Support sind wir für Sie da.
Ein Inference-Partner, der Ihre Anforderungen erfüllt. Ob Sie Kosten, Latenz, Durchsatz oder Skalierbarkeit optimieren möchten – wir richten die Lösung nach Ihren Prioritäten aus. Deepinfra bietet 100+ Modelle für Ihre Anforderungen.
Dank unserer Richtlinie zur Nicht-Speicherung bleiben Ihre Eingaben, Ausgaben und Nutzerdaten privat. Deepinfra ist nach SOC 2 und ISO 27001 zertifiziert. Wir befolgen bewährte Verfahren für Informationssicherheit und Datenschutz.
Deepinfra läuft auf unserer eigenen hochmodernen, für Inference optimierten Infrastruktur in sicheren Rechenzentren in den USA. Für bessere Leistung und Zuverlässigkeit.
Modelle

Ein auf Effizienz und Leistung abgestimmtes Modell der MiMo-V2.6-Serie von Xiaomi, entwickelt für agentenbasierte Aufgaben.
$0.003 zwischengespeichert, $0.14 Eingabe, $0.28 Ausgabe / 1M

Das Flaggschiffmodell der MiMo-V2.6-Serie für anspruchsvolle, langfristige Programmieraufgaben und Agenten, die mehrere Tools nutzen.
$0.004 zwischengespeichert, $0.435 Eingabe, $0.87 Ausgabe / 1M

Ein multimodales Mixture-of-Experts-Modell mit Unterstützung für lange Kontexte.
$0.004 zwischengespeichert, $0.14 Eingabe, $0.42 Ausgabe / 1M

Ein groß angelegtes Reasoning-Modell für komplexe Softwareentwicklung und umfangreiche Aufgaben.
$0.125 im Cache, $0.563 Eingabe, $2.50 Ausgabe / 1M

Ein schnelles Modell für effizientes Programmieren und langfristige Agentenaufgaben.
$0.015 im Cache, $0.075 Eingabe, $0.25 Ausgabe / 1M

Das multimodale Reasoning-Modell mit offenen Gewichten von Moonshot AI, entwickelt für komplexe Programmieraufgaben.
$0.285 im Cache, $2.85 Eingabe, $14.25 Ausgabe / 1M

Ein quelloffenes Sparse-Mixture-of-Experts-Modell von Qwen.
$0.20 zwischengespeichert, $2.00 Eingabe, $6.00 Ausgabe / 1M

Eine Version von DeepSeek-V4-Pro für anspruchsvolle Schlussfolgerungen und agentische Aufgaben.
$0.20 zwischengespeichert, $1.30 Eingabe, $2.60 Ausgabe / 1M

Eine effiziente Version von DeepSeek-V4-Flash für alltägliche Inferenzaufgaben.
$0.015 zwischengespeichert, $0.06 Eingabe, $0.18 Ausgabe / 1M

Ein Spitzenmodell für langfristige Aufgaben und agentische Anwendungen.
$0.105 im Cache, $0.563 Eingabe, $1.80 Ausgabe / 1M

Entwickelt für anspruchsvolles Schlussfolgern, Orchestrierung, Coding-Agenten und tiefgehende Recherche.
$0.10 im Cache, $0.50 Eingabe, $2.20 Ausgabe / 1M

Ein auf Effizienz ausgelegtes Mixture-of-Experts-Modell für reaktionsschnelle Anwendungen.
$0.018 im Cache, $0.09 Eingabe, $0.18 Ausgabe / 1M
Die Kennzahlen, auf die es bei Geschwindigkeit, Skalierung, Stabilität und Kosten ankommt
Token pro Sekunde
Zeit bis zum ersten Token
Anfragen pro Sekunde
Infrastruktur im großen Maßstab
DeepCluster
Dedizierte Hardware, beschafft und betrieben von Deepinfra. Vollständiges Eigentum, Tier-3-Rechenzentrum, SLA mit 99.982% Verfügbarkeit.
GPU-Cluster entdeckenNVIDIA B300 · Laufzeit von 5 Jahren
im Vergleich zu $6.50 /GPU-hr in der Public Cloud