SCHNELL

deepinfra KI-Inferenz

Flexible KI-Inferenz, wann immer Sie sie brauchen.

Inference-Cloud ausprobieren

Beginnen Sie mit einer Idee oder wählen Sie ein Beispiel.

Zahlen Sie nur, was Sie nutzen · keine langfristigen Verträge

ODER WÄHLEN SIE EIN BEISPIEL

DeepSeek · NVIDIA · Qwen · und mehr

VercelAdobeUBISOFTIconic HeartsLATITUDECupidBot.ai

Ankündigung · Mai 2026

Wir haben $107M in einer Series-B-Finanzierungsrunde eingeworben für den Ausbau der Inference-Cloud

Angeführt von 500 Global und Georges Harik, mit Beteiligung von A.Capital Ventures, Crescent Cove, Felicis, NVIDIA, Peak6, Samsung Next, Supermicro und Upper90.

Entdecken Sie die Möglichkeiten Bereit für das, was als Nächstes kommt.
$107MSeries-B-Finanzierung
25xToken-Volumen seit der Series A

Skalieren Sie auf Billionen von Tokens, ohne Ihr Budget zu sprengen

Günstige Preise nach Verbrauch – keine langfristigen Verträge, keine versteckten Gebühren, keine Überraschungen. Startup? Unternehmen? Wir wachsen mit Ihnen. Mit einfachen APIs und persönlichem technischem Support sind wir für Sie da.

Isometrische Inferenzplattform in Blau und Türkis mit einem leuchtenden Rechenwürfel, kleinen Servern und fließenden Datenströmen in einer dunklen digitalen Landschaft.
Isometrische, leuchtend blaue Rechenplattform mit modularen Blöcken und feinen violetten Datenpfaden vor dunklem Hintergrund.

Inference, zugeschnitten auf Ihre Anforderungen

Ein Inference-Partner, der Ihre Anforderungen erfüllt. Ob Sie Kosten, Latenz, Durchsatz oder Skalierbarkeit optimieren möchten – wir richten die Lösung nach Ihren Prioritäten aus. Deepinfra bietet 100+ Modelle für Ihre Anforderungen.

Keine Datenspeicherung. Regelkonform. Sicher.

Dank unserer Richtlinie zur Nicht-Speicherung bleiben Ihre Eingaben, Ausgaben und Nutzerdaten privat. Deepinfra ist nach SOC 2 und ISO 27001 zertifiziert. Wir befolgen bewährte Verfahren für Informationssicherheit und Datenschutz.

Leuchtend türkisfarbenes Datenschutzschild über einem präzisen blauen Leiterplattennetzwerk, dargestellt als isometrische technische Illustration vor tief dunkelblauem Hintergrund.
Gruppe weißer und elektrisch blauer Serverschränke auf einer isometrischen Rechenzentrumsplattform mit türkisfarbenen Lichtern und dunkelblauem Hintergrund.

Unsere Hardware. Unsere Rechenzentren. Ihr Leistungsvorsprung.

Deepinfra läuft auf unserer eigenen hochmodernen, für Inference optimierten Infrastruktur in sicheren Rechenzentren in den USA. Für bessere Leistung und Zuverlässigkeit.

Modelle

Entdecken Sie unsere ausgewählten Modelle

Alle anzeigen Textgenerierung Text-zu-Sprache Text-zu-Bild
XiaomiMiMo/Textgenerierung

MiMo-V2.6-Flash

Titelbild des Modells MiMo-V2.6-Flash

Ein auf Effizienz und Leistung abgestimmtes Modell der MiMo-V2.6-Serie von Xiaomi, entwickelt für agentenbasierte Aufgaben.

$0.003 zwischengespeichert, $0.14 Eingabe, $0.28 Ausgabe / 1M

ZDRfp81024k
XiaomiMiMo/Textgenerierung

MiMo-V2.6-Pro

Titelbild des Modells MiMo-V2.6-Pro

Das Flaggschiffmodell der MiMo-V2.6-Serie für anspruchsvolle, langfristige Programmieraufgaben und Agenten, die mehrere Tools nutzen.

$0.004 zwischengespeichert, $0.435 Eingabe, $0.87 Ausgabe / 1M

ZDRfp81024k
deepseek-ai/Textgenerierung

DeepSeek-V4.1-Flash

Titelbild des Modells DeepSeek-V4.1-Flash

Ein multimodales Mixture-of-Experts-Modell mit Unterstützung für lange Kontexte.

$0.004 zwischengespeichert, $0.14 Eingabe, $0.42 Ausgabe / 1M

ZDRPrioritätFlex1024k
zai-org/Textgenerierung

GLM-5.3

Titelbild des Modells GLM-5.3

Ein groß angelegtes Reasoning-Modell für komplexe Softwareentwicklung und umfangreiche Aufgaben.

$0.125 im Cache, $0.563 Eingabe, $2.50 Ausgabe / 1M

ZDRFlex1024k
zai-org/Textgenerierung

GLM-5.3-Flash

Titelbild des Modells GLM-5.3-Flash

Ein schnelles Modell für effizientes Programmieren und langfristige Agentenaufgaben.

$0.015 im Cache, $0.075 Eingabe, $0.25 Ausgabe / 1M

ZDRfp41024k
moonshotai/Textgenerierung

Kimi-K3

Titelbild des Modells Kimi-K3

Das multimodale Reasoning-Modell mit offenen Gewichten von Moonshot AI, entwickelt für komplexe Programmieraufgaben.

$0.285 im Cache, $2.85 Eingabe, $14.25 Ausgabe / 1M

ZDRCache-Aufbewahrung1024k
Qwen/Textgenerierung

Qwen3.8-2.4T-A95B

Titelbild des Modells Qwen3.8-2.4T-A95B

Ein quelloffenes Sparse-Mixture-of-Experts-Modell von Qwen.

$0.20 zwischengespeichert, $2.00 Eingabe, $6.00 Ausgabe / 1M

ZDRfp41024k
deepseek-ai/Textgenerierung

DeepSeek-V4-Pro-0813

Titelbild des Modells DeepSeek-V4-Pro-0813

Eine Version von DeepSeek-V4-Pro für anspruchsvolle Schlussfolgerungen und agentische Aufgaben.

$0.20 zwischengespeichert, $1.30 Eingabe, $2.60 Ausgabe / 1M

ZDRPrioritätFlex
deepseek-ai/Textgenerierung

DeepSeek-V4-Flash-0731

Titelbild des Modells DeepSeek-V4-Flash-0731

Eine effiziente Version von DeepSeek-V4-Flash für alltägliche Inferenzaufgaben.

$0.015 zwischengespeichert, $0.06 Eingabe, $0.18 Ausgabe / 1M

ZDRPrioritätFlex
zai-org/Textgenerierung

GLM-5.2

Titelbild des Modells GLM-5.2

Ein Spitzenmodell für langfristige Aufgaben und agentische Anwendungen.

$0.105 im Cache, $0.563 Eingabe, $1.80 Ausgabe / 1M

ZDRPrioritätFlex
nvidia/Textgenerierung

NVIDIA-Nemotron-3-Ultra-550B-A55B

Titelbild des Modells NVIDIA Nemotron 3 Ultra

Entwickelt für anspruchsvolles Schlussfolgern, Orchestrierung, Coding-Agenten und tiefgehende Recherche.

$0.10 im Cache, $0.50 Eingabe, $2.20 Ausgabe / 1M

ZDRPrioritätFlex
deepseek-ai/Textgenerierung

DeepSeek-V4-Flash

Titelbild des Modells DeepSeek-V4-Flash

Ein auf Effizienz ausgelegtes Mixture-of-Experts-Modell für reaktionsschnelle Anwendungen.

$0.018 im Cache, $0.09 Eingabe, $0.18 Ausgabe / 1M

ZDRPrioritätFlex

Kennzahlen für KI-Inferenz

Die Kennzahlen, auf die es bei Geschwindigkeit, Skalierung, Stabilität und Kosten ankommt

Durchsatz

Token pro Sekunde

Reaktionsgeschwindigkeit

Zeit bis zum ersten Token

Kapazität

Anfragen pro Sekunde

Rechenleistung

Infrastruktur im großen Maßstab

DeepCluster

Ihr eigener NVIDIA B300
GPU-Cluster

Dedizierte Hardware, beschafft und betrieben von Deepinfra. Vollständiges Eigentum, Tier-3-Rechenzentrum, SLA mit 99.982% Verfügbarkeit.

GPU-Cluster entdecken

NVIDIA B300 · Laufzeit von 5 Jahren

$1.98/GPU-hr

im Vergleich zu $6.50 /GPU-hr in der Public Cloud

70%günstiger als die Cloud
288 GBHBM3e pro GPU
256–5,000Verfügbare GPUs
KI-Modelle ausprobieren
KI-Modelle ausprobieren