Planificación del uso

Cómo estimar los precios de deepinfra para tu carga de trabajo

Empieza con un modelo, un número estimado de solicitudes y los tokens que puede usar cada solicitud. Deepinfra te ayuda a analizar esos datos, pero esta página no muestra una tarifa en tiempo real ni genera un presupuesto oficial.

Imagen de modelos e inferencia de Deepinfra

requisitos previos

Recopila primero las mediciones de la carga de trabajo. El nombre de un modelo por sí solo no indica cuánto consumirán las solicitudes repetidas.

Obligatorio Opcional
  • Elige el modelo exacto que piensas usar, en lugar de basar la estimación en una familia de modelos. — Las distintas variantes de un modelo pueden tener diferentes unidades de uso y tarifas.

  • Anota la tarifa y las unidades de facturación publicadas actualmente para ese modelo en el momento de usarlo. — No consideres ningún ejemplo de esta página como una tarifa actual.

  • Estima las solicitudes durante un período definido y mide por separado la entrada y la salida habituales. — Una respuesta larga puede cambiar el resultado aunque el prompt siga siendo breve.

  • Conserva una solicitud más larga o compleja como segundo caso de prueba.opcional — Ayuda a mostrar cuánto cambia tu estimación cuando cambia la carga de trabajo.

un cálculo completo paso a paso

Antes de hacer los cálculos, señala lo que la estimación no puede determinar. Cada punto pendiente requiere una medición o una fuente actualizada.

1

No puede proporcionar una tarifa en tiempo real

La tarifa publicada de un modelo puede cambiar, y esta página no la consulta. Una estimación basada en una cifra antigua puede tener cálculos precisos y aun así dar un resultado incorrecto.

Qué hacer en su lugar

Consulta la tarifa y las unidades actuales del modelo exacto justo antes de calcular.

2

No puede predecir la longitud de la respuesta

Las mismas instrucciones pueden producir respuestas de distintas longitudes. Una sola respuesta corta es una base poco fiable para planificar una carga de trabajo recurrente.

Qué hacer en su lugar

Toma muestras de tareas representativas e incluye un caso con una respuesta más larga.

3

No puede equiparar unidades diferentes

Las tareas de chat, embeddings y otras tareas de inferencia pueden medirse de distintas maneras. Multiplicar todas las cargas de trabajo por una misma cantidad supuesta de tokens oculta esa diferencia.

Qué hacer en su lugar

Haz una estimación por separado para cada tarea y su unidad de uso publicada.

un cálculo completo paso a paso

Para una carga de trabajo de chat, sigue una solicitud representativa desde la medición hasta la estimación para un período. Sustituye todas las cantidades de ejemplo por tus propias observaciones.

  1. 1

    Mide una solicitud representativa

    Toma un prompt y una respuesta habituales de la tarea que realmente esperas ejecutar. Registra por separado los tokens de entrada y de salida; incluye las instrucciones u otro contexto que se envíe con cada solicitud.

  2. 2

    Aplica las unidades del modelo

    Busca la tarifa actual del modelo exacto y comprueba si hay tarifas distintas para la entrada y la salida. Convierte cada recuento de tokens a la unidad publicada, multiplícalo por la tarifa correspondiente y suma los resultados.

  3. 3

    Escala y comprueba el rango

    Multiplica el resultado por solicitud por el número de solicitudes previstas en el período. Repite el cálculo con una respuesta más larga y un período de mayor uso. Considera la diferencia entre los resultados como un rango para planificar, no como un total garantizado.

tabla de opciones

  • MEDIR LA ENTRADA
  • MIDE LA SALIDA
  • CONSULTA LAS UNIDADES ACTUALES

Compara las cargas de trabajo sobre la misma base

Usa tres columnas en tu propia comparación: opción, unidad de uso y volumen medido. Para una tarea de chat breve, compara la entrada y la salida medidas con las unidades actuales del modelo de chat elegido. Para una tarea de chat con un contexto largo, repite la medición con todo el contexto que realmente enviarás. Para las incrustaciones, usa la unidad publicada del modelo de incrustaciones en lugar de reutilizar el cálculo del chat.

Mantén el mismo período y número de solicitudes en todas las opciones. Si una opción cambia tanto el modelo como la carga de trabajo, indica ambos cambios; de lo contrario, la comparación no mostrará cuál causó la diferencia. Deepinfra presenta esto como un método para comprobar supuestos, no como una tabla de tarifas de modelos en tiempo real.

qué puede fallar

Una tarifa copiada, una longitud de respuesta estimada a ojo o un cálculo que mezcle unidades pueden hacer que una estimación por lo demás cuidadosa resulte engañosa. Consulta los detalles actuales del modelo, mide una tarea real y vuelve a calcular cuando cambie tu carga de trabajo. Así podrás explorar una opción de inferencia con una idea más clara de qué supuestos aún debes comprobar.

Haz que la primera estimación sea útil, no falsamente precisa

  • Usa la variante exacta del modelo
  • Mantén la entrada y la salida por separado
  • Prueba un caso de uso más intensivo
Explora las opciones de inferencia

su propia sección de preguntas frecuentes

El modelo y sus unidades de uso publicadas son datos esenciales para una estimación. Consulta los detalles actuales de la variante exacta en lugar de suponer que todos los modelos de una familia tienen la misma tarifa.

Mide la entrada y la salida de una solicitud representativa, aplica a cada una las unidades y tarifas actuales del modelo elegido y, después, ajusta el cálculo según el número de solicitudes previsto. Repite el cálculo con una respuesta más larga para ver cuánto podría variar el resultado.

No. Primero consulta la unidad de uso publicada del modelo de incrustaciones y, después, mide en esa unidad el texto que quieres procesar. Mantén el cálculo de incrustaciones separado del de las solicitudes de chat.

Las solicitudes pueden variar en la longitud del contexto, la longitud de la respuesta y la frecuencia. Una estimación también puede quedar desactualizada si cambian la tarifa o el modelo elegido, así que revisa sus datos de entrada a la luz del uso observado.

Prueba modelos de IA
Prueba modelos de IA