Planejamento de uso

Como estimar os preços da deepinfra para sua carga de trabalho

Comece com um modelo, uma estimativa do número de requisições e a quantidade de tokens que cada requisição pode usar. A Deepinfra ajuda você a avaliar esses dados, mas esta página não exibe tarifas em tempo real nem fornece uma cotação oficial.

Imagem dos modelos e da inferência da Deepinfra

pré-requisitos

Primeiro, reúna as métricas da carga de trabalho. O nome do modelo, por si só, não indica quanto as requisições repetidas consumirão.

Obrigatório Opcional
  • Escolha o modelo exato que pretende usar, em vez de fazer uma estimativa com base em uma família de modelos. — Diferentes variantes de um modelo podem ter unidades de uso e tarifas diferentes.

  • Registre a tarifa publicada atualmente e as unidades de cobrança desse modelo no momento do uso. — Não considere um exemplo desta página como uma tarifa atual.

  • Estime o número de requisições em um período definido e meça separadamente a entrada e a saída típicas. — Uma resposta longa pode alterar o resultado mesmo quando o prompt é curto.

  • Mantenha uma requisição mais longa ou complexa como segundo caso de teste.opcional — Isso ajuda a mostrar o quanto sua estimativa é sensível a mudanças na carga de trabalho.

um cálculo completo, do início ao fim

Antes de fazer os cálculos, identifique o que a estimativa não pode determinar. Cada lacuna exige uma medição ou uma fonte atualizada.

1

Ela não pode fornecer uma tarifa em tempo real

A tarifa publicada de um modelo pode mudar, e esta página não a consulta. Uma estimativa baseada em um valor antigo pode ter cálculos precisos e, ainda assim, chegar à resposta errada.

O que fazer em vez disso

Consulte a tarifa e as unidades atuais do modelo exato imediatamente antes de calcular.

2

Ela não pode prever o tamanho da resposta

Prompts idênticos podem gerar respostas de tamanhos diferentes. Uma única resposta curta é uma base frágil para planejar uma carga de trabalho recorrente.

O que fazer em vez disso

Faça uma amostragem de tarefas representativas e inclua um caso com uma resposta mais longa.

3

Ela não pode equiparar unidades diferentes

Chat, embeddings e outras tarefas de inferência podem ser medidos de formas diferentes. Multiplicar toda carga de trabalho com base na mesma suposição de tokens oculta essa diferença.

O que fazer em vez disso

Faça uma estimativa separada para cada tarefa, usando sua unidade de uso publicada.

um cálculo completo, do início ao fim

Para uma carga de trabalho de chat, acompanhe uma solicitação representativa desde a medição até a estimativa para um período. Substitua cada quantidade de exemplo pelas suas próprias observações.

  1. 1

    Meça uma solicitação representativa

    Use um prompt e uma resposta típicos da tarefa que você realmente pretende executar. Registre os tokens de entrada e de saída separadamente; inclua instruções ou outros contextos enviados com cada solicitação.

  2. 2

    Aplique as unidades do modelo

    Encontre a tarifa atual do modelo exato e verifique se há tarifas separadas para entrada e saída. Converta cada contagem de tokens medida para a unidade publicada, multiplique pela tarifa correspondente e some os resultados.

  3. 3

    Projete e confira o intervalo

    Multiplique o resultado por solicitação pelo número esperado de solicitações no período. Repita o cálculo com uma resposta mais longa e um período de uso mais intenso. Trate a diferença entre os resultados como um intervalo para planejamento, não como um total garantido.

tabela de opções

  • MEÇA A ENTRADA
  • MEÇA A SAÍDA
  • CONFIRA AS UNIDADES ATUAIS

Compare as cargas de trabalho usando a mesma base

Use três colunas na sua comparação: opção, unidade de uso e volume medido. Para uma tarefa curta de chat, compare a entrada e a saída medidas com as unidades atuais do modelo de chat escolhido. Para uma tarefa de chat com contexto longo, repita a medição com o contexto completo que você realmente enviará. Para embeddings, use a unidade publicada do modelo de embeddings em vez de reaproveitar o cálculo do chat.

Mantenha o período e o número de solicitações iguais entre as opções. Se uma opção alterar tanto o modelo quanto a carga de trabalho, identifique as duas mudanças; caso contrário, a comparação não mostrará qual delas causou a diferença. A Deepinfra apresenta isso como um método para verificar premissas, não como uma tabela de preços atualizados dos modelos.

o que pode dar errado

Um preço copiado, uma estimativa sem base do tamanho da resposta ou um cálculo que mistura unidades podem tornar enganosa até mesmo uma estimativa cuidadosa. Confira os detalhes atuais do modelo, meça uma tarefa real e refaça o cálculo quando sua carga de trabalho mudar. Assim, você poderá explorar uma opção de inferência com mais clareza sobre quais premissas ainda precisam ser testadas.

Faça uma primeira estimativa útil, sem falsa precisão

  • Use a variante exata do modelo
  • Mantenha entrada e saída separadas
  • Teste um caso de uso mais intenso
Explore opções de inferência

Perguntas frequentes

O modelo e suas unidades de uso publicadas são dados essenciais para uma estimativa. Confira os detalhes atuais da variante exata, em vez de presumir que todos os modelos de uma família usam o mesmo preço.

Meça a entrada e a saída de uma solicitação representativa, aplique a cada uma as unidades e os preços atuais do modelo escolhido e, depois, multiplique pelo número esperado de solicitações. Repita o cálculo com uma resposta mais longa para ver quanto o resultado pode variar.

Não. Primeiro, confira a unidade de uso publicada do modelo de embeddings. Depois, meça nessa unidade o texto que você pretende processar. Mantenha o cálculo de embeddings separado das solicitações de chat.

As solicitações podem variar em tamanho do contexto, tamanho da resposta e frequência. Uma estimativa também pode ficar desatualizada se o preço ou o modelo escolhido mudar. Por isso, reveja os dados usados no cálculo à luz do uso observado.

Experimente modelos de IA
Experimente modelos de IA