高速

deepinfra AI推論

必要なときにすぐ使える、柔軟なAI推論。

推論クラウドを試す

アイデアを入力するか、例を選んでください。

使った分だけのお支払い · 長期契約不要

または例を選ぶ

DeepSeek · NVIDIA · Qwen · など

VercelAdobeUBISOFTIconic HeartsLATITUDECupidBot.ai

発表 · 2026年5月

$107MのシリーズB資金調達を実施 推論クラウドの規模を拡大

500 GlobalとGeorges Harikが共同で主導し、A.Capital Ventures、Crescent Cove、Felicis、NVIDIA、Peak6、Samsung Next、Supermicro、Upper90が参加しました。

可能性を探る 次の時代に向けて構築。
$107MシリーズB資金調達
25xシリーズA以降のトークン量

コストを抑えながら、数兆トークンまで拡張

低価格の従量課金制。長期契約も隠れた手数料も、予想外の請求もありません。スタートアップにも大企業にも対応します。シンプルなAPIと技術者による直接サポートで、お客様を支えます。

暗いデジタル空間に、光る演算キューブ、小型サーバー、流れるデータを配した、青とターコイズのアイソメトリックな推論プラットフォーム。
暗い背景に、モジュール式のブロックと繊細な紫色のデータ経路を備えた、青く輝くアイソメトリックなコンピューティングタイル。

お客様に合わせた推論サービス

お客様のニーズに応える推論パートナー。コスト、レイテンシ、スループット、規模のどれを重視する場合も、優先事項に合わせてソリューションを設計します。Deepinfraは、幅広いニーズに応える100+のモデルを提供します。

データ保持なし。コンプライアンス対応。 安全。

データを保持しない方針により、入力、出力、ユーザーデータのプライバシーを守ります。DeepinfraはSOC 2およびISO 27001の認証を取得し、情報セキュリティとプライバシー保護のベストプラクティスに従っています。

精密な青い回路基板ネットワークの上に浮かぶ、シアンに輝くプライバシー保護シールド。深いネイビーを背景にしたアイソメトリックな技術イラスト。
ターコイズのライトが光るアイソメトリックなデータセンタープラットフォーム上に並ぶ、白と鮮やかな青のサーバーラック群。背景は暗いネイビー。

自社ハードウェア。自社データセンター。お客様の性能を支える強み。

Deepinfraは、米国内の安全なデータセンターで、自社の最先端の推論向けインフラを運用しています。より高い性能と信頼性をお届けします。

モデル

注目のモデルを見る

すべて表示 テキスト生成 テキスト読み上げ 画像生成
XiaomiMiMo/テキスト生成

MiMo-V2.6-Flash

MiMo-V2.6-Flashモデルのカバー画像

XiaomiのMiMo-V2.6シリーズに属する、エージェント型の処理向けに構築された効率と性能のバランスが取れたモデル。

$0.003 キャッシュ済み、$0.14 入力、$0.28 出力 / 1M

ZDRfp81024k
XiaomiMiMo/テキスト生成

MiMo-V2.6-Pro

MiMo-V2.6-Proモデルのカバー画像

長期にわたる高度なコーディングや複数のツールを使うエージェント向けの、MiMo-V2.6のフラッグシップモデル。

$0.004 キャッシュ済み、$0.435 入力、$0.87 出力 / 1M

ZDRfp81024k
deepseek-ai/テキスト生成

DeepSeek-V4.1-Flash

DeepSeek-V4.1-Flashモデルのカバー画像

長いコンテキストに対応したマルチモーダルな混合エキスパートモデル。

$0.004 キャッシュ済み、$0.14 入力、$0.42 出力 / 1M

ZDRPriorityFlex1024k
zai-org/テキスト生成

GLM-5.3

GLM-5.3モデルのカバー画像

複雑なソフトウェア開発や長時間にわたるタスクに対応する大規模推論モデル。

キャッシュ済み $0.125、入力 $0.563、出力 $2.50 / 1M

ZDRFlex1024k
zai-org/テキスト生成

GLM-5.3-Flash

GLM-5.3-Flashモデルのカバー画像

効率的なコーディングや長期にわたるエージェントタスクに適した高速モデル。

キャッシュ済み $0.015、入力 $0.075、出力 $0.25 / 1M

ZDRfp41024k
moonshotai/テキスト生成

Kimi-K3

Kimi-K3モデルのカバー画像

複雑なコーディング向けに構築された、Moonshot AIの重みが公開されたマルチモーダル推論モデル。

キャッシュ済み $0.285、入力 $2.85、出力 $14.25 / 1M

ZDRキャッシュ保持期間1024k
Qwen/テキスト生成

Qwen3.8-2.4T-A95B

Qwen3.8-2.4T-A95Bモデルのカバー画像

Qwenのオープンウェイトなスパース混合エキスパートモデル。

キャッシュ済み $0.20、入力 $2.00、出力 $6.00 / 1M

ZDRfp41024k
deepseek-ai/テキスト生成

DeepSeek-V4-Pro-0813

DeepSeek-V4-Pro-0813モデルのカバー画像

高度な推論やエージェントタスク向けのDeepSeek-V4-Proリリース。

キャッシュ済み $0.20、入力 $1.30、出力 $2.60 / 1M

ZDR優先フレックス
deepseek-ai/テキスト生成

DeepSeek-V4-Flash-0731

DeepSeek-V4-Flash-0731モデルのカバー画像

日常的な推論処理向けの効率的なDeepSeek-V4-Flashリリース。

キャッシュ済み $0.015、入力 $0.06、出力 $0.18 / 1M

ZDR優先フレックス
zai-org/テキスト生成

GLM-5.2

GLM-5.2モデルのカバー画像

長期にわたるタスクやエージェント型アプリケーション向けのフラッグシップモデル。

キャッシュ済み $0.105、入力 $0.563、出力 $1.80 / 1M

ZDR優先フレックス
nvidia/テキスト生成

NVIDIA-Nemotron-3-Ultra-550B-A55B

NVIDIA Nemotron 3 Ultraモデルのカバー画像

最先端の推論、オーケストレーション、コーディングエージェント、詳細な調査向けに構築。

キャッシュ済み $0.10、入力 $0.50、出力 $2.20 / 1M

ZDR優先フレックス
deepseek-ai/テキスト生成

DeepSeek-V4-Flash

DeepSeek-V4-Flashモデルのカバー画像

応答性が求められるアプリケーション向けの、効率性を重視した混合エキスパートモデル。

キャッシュ済み $0.018、入力 $0.09、出力 $0.18 / 1M

ZDR優先Flex

AI推論の指標

速度、規模、安定性、コストを測る重要な指標

スループット

1秒あたりのトークン数

応答性

最初のトークンまでの時間

処理能力

1秒あたりのリクエスト数

コンピューティング

大規模インフラストラクチャ

DeepCluster

お客様専用のNVIDIA B300
GPUクラスター

Deepinfraが調達・運用する専用ハードウェア。完全所有、Tier 3データセンター、稼働率99.982%のSLA。

GPUクラスターを見る

NVIDIA B300 · 5年間の契約

$1.98/GPU-hr

パブリッククラウドの$6.50 /GPU-hrと比較

70%クラウドより低コスト
288 GBGPUあたりのHBM3e
256–5,000利用可能なGPU
AIモデルを試す
AIモデルを試す