O que é LLM Latency Cost Calculator?
▾
A calculadora de custo de latência LLM ajuda os desenvolvedores a quantificar os custos ocultos do tempo de resposta em aplicativos de IA, modelando o tempo até o primeiro token (TTFT), a taxa de transferência de tokens por segundo e o tempo de resposta total em diferentes modelos e configurações. Embora a maioria das discussões sobre custos se concentre no preço dos tokens, a latência tem o seu próprio impacto económico: respostas mais lentas aumentam o abandono do utilizador, reduzem a capacidade de produção e degradam a qualidade percebida das funcionalidades alimentadas por IA. A latência varia drasticamente entre modelos e provedores. O GPT-4o normalmente entrega o tempo até o primeiro token em 200 a 500 milissegundos e gera de 80 a 120 tokens por segundo. GPT-4o-mini é mais rápido com TTFT de 100 a 300 ms e 100 a 150 tokens por segundo. Claude Sonnet 4 varia de 300 a 700ms TTFT com 70 a 100 tokens por segundo. Essas diferenças significam que uma resposta de 500 tokens leva de 3 a 7 segundos, dependendo da escolha do modelo, impactando diretamente a experiência do usuário e o design do aplicativo. Esta calculadora modela o custo total da latência, incluindo custos diretos de API, custos de infraestrutura para manter conexões abertas, taxas de abandono de usuários correlacionadas com o tempo de resposta e as implicações de produção de modelos mais lentos que exigem mais conexões simultâneas para atender o mesmo volume de solicitações. Para aplicações em tempo real, como chatbots e pesquisa, a otimização da latência pode ser tão impactante quanto a otimização do custo do token para a economia geral do sistema.
DigiCalcs delivers precision-engineered tools for engineers and STEM professionals.
Fórmula
▾
Tempo total de resposta = Tempo até o primeiro token + (Tokens de saída/Tokens por segundo). Custo efetivo por solicitação = Custo do token de API + (Tempo de resposta / 3600) x Custo de conexão do servidor por hora + Probabilidade de queda x Receita perdida por usuário. Por exemplo: 400 ms TTFT + 300 tokens a 100 tok/s = 400 ms + 3.000 ms = 3,4 segundos de tempo de resposta total.Legenda de variáveis
▾
| Símbolo | Nome | Unidade | Descrição |
|---|---|---|---|
| TTFT | Hora do primeiro token | milliseconds | O atraso entre o envio de uma solicitação de API e o recebimento do primeiro token da resposta, que representa a latência mínima percebida. |
| TPS | Tokens por segundo | tokens per second | A velocidade de geração após o primeiro token, determinando a rapidez com que a resposta completa é produzida, normalmente de 80 a 150 para modelos padrão. |
| T_out | Contagem de tokens de saída | tokens | O número de tokens na resposta do modelo, que multiplicado pela velocidade de geração determina a duração do streaming após o TTFT. |
| D | Taxa de desistência | ratio per second of latency | A fração estimada de usuários que abandonam a interação por segundo adicional de tempo de resposta, normalmente 5 a 15 por cento por segundo acima de um limite de 3 segundos. |
| V_user | Valor por usuário perdido | USD | A receita estimada ou o valor do cliente perdido quando um usuário abandona uma interação de IA devido à latência excessiva. |
Como LLM Latency Cost Calculator
▾
- 1Meça ou estime o tempo até o primeiro token (TTFT) para o modelo e configuração escolhidos. TTFT é o atraso entre o envio da solicitação da API e o recebimento do primeiro token da resposta. Depende da complexidade do modelo, comprimento do prompt de entrada, carga do servidor e distância geográfica até o endpoint da API. O TTFT do GPT-4o varia de 200 a 500 ms, enquanto modelos de raciocínio como o1 podem levar de 2 a 10 segundos para a fase inicial de pensamento.
- 2Determine a taxa de geração de tokens por segundo para seu modelo. Esta é a velocidade com que o modelo produz tokens de saída após a chegada do primeiro token. Os modelos padrão geram de 80 a 150 tokens por segundo. Saídas mais longas levam proporcionalmente mais tempo: uma resposta de 500 tokens a 100 tokens por segundo leva 5 segundos após o TTFT. O streaming da resposta aos usuários reduz a latência percebida, mostrando os tokens à medida que chegam.
- 3Calcule o tempo total de resposta para seus comprimentos de saída típicos. Para um chatbot com respostas de 200 tokens no GPT-4o: TTFT (350 ms) + geração (200 tokens / 100 tok/s = 2.000 ms) = 2,35 segundos no total. Para um recurso de geração de conteúdo com saídas de 1.000 tokens: TTFT (350 ms) + geração (10.000 ms) = 10,35 segundos. Esses tempos determinam se o recurso parece responsivo ou lento para os usuários.
- 4Modele o impacto da latência na experiência do usuário. A pesquisa mostra que a satisfação do usuário cai significativamente acima dos tempos de resposta de 3 segundos. Para chatbots, respostas superiores a 5 segundos fazem com que 20 a 30 por cento dos usuários abandonem a conversa. Para recursos de pesquisa, os resultados que levam mais de 2 segundos apresentam um envolvimento 10 a 15 por cento menor. A calculadora atribui um valor monetário a esse envolvimento perdido com base nas taxas de conversão e no valor da vida útil do usuário.
- 5Calcule a capacidade de produção e suas implicações de custo. Um servidor que lida com respostas de streaming deve manter as conexões abertas durante toda a duração da resposta. Se cada resposta levar 5 segundos, um thread do servidor tratará 12 solicitações por minuto. Mudar para um modelo mais rápido que responde em 2 segundos aumenta o rendimento para 30 solicitações por minuto, exigindo 60% menos recursos do servidor para o mesmo tráfego. Essa economia de infraestrutura pode exceder a diferença de custo da API entre os modelos.
- 6Compare o custo total entre as opções de modelo, incluindo preços de tokens e custos de latência. Um modelo mais barato por token e mais lento pode, na verdade, custar mais quando se considera infraestrutura, abandono de usuários e restrições de rendimento. A calculadora produz uma comparação econômica total que inclui o custo da API, o custo do servidor e o impacto estimado da latência na receita.
- 7Otimize a latência por meio de alterações de configuração. Reduzir os limites de token de saída com max_tokens, usar streaming para melhorar a capacidade de resposta percebida, implementar cache imediato para reduzir TTFT e escolher endpoints de API geograficamente mais próximos podem reduzir a latência em 20 a 50 por cento sem alterar os modelos. A calculadora modela o impacto no custo de cada otimização.
Exemplos resolvidos
▾
Para um chatbot direcionado a respostas de 3 segundos, GPT-4o e GPT-4o-mini atendem ao limite, enquanto Claude Sonnet 4 está no limite. O GPT-4o-mini é 28% mais rápido que o GPT-4o e 94% mais barato, tornando-o a escolha ideal para a maioria dos aplicativos de chatbot.
Cada geração de 1.000 tokens leva 10,4 segundos. Para atender 50 usuários simultâneos, você precisa de aproximadamente 9 threads de servidor mantendo conexões abertas. A US$ 5 por hora para infraestrutura de servidor, o custo de taxa de transferência adiciona US$ 0,0024 por solicitação ao custo do token de API.
Após 200ms para recuperação e 150ms TTFT, restam 1.450ms para geração de token. A 130 tokens por segundo, a produção máxima é de 188 tokens. Se o recurso precisar de respostas mais longas, o orçamento de latência deverá aumentar ou será necessário um modelo mais rápido ou um tempo de recuperação reduzido.
Aplicações práticas
▾
Os mecanismos de pesquisa com geração de respostas baseadas em IA devem fornecer resultados dentro de 2 a 3 segundos para atender às expectativas do usuário definidas pela pesquisa tradicional. Uma plataforma de busca usando GPT-4o para síntese de respostas orçamenta 500ms para recuperação e 2.000ms para geração de LLM. A 100 tokens por segundo, eles podem gerar aproximadamente 170 tokens (cerca de 130 palavras) dentro do orçamento de latência. Essa restrição determina o comprimento máximo da resposta e orienta a escolha do modelo mais rápido disponível.
Os serviços de tradução em tempo real devem minimizar a latência do fluxo de conversação. Um recurso de tradução ao vivo usando GPT-4o-mini atinge 150 ms TTFT e 130 tokens por segundo, traduzindo uma frase de 50 palavras (saída de aproximadamente 80 tokens) em 0,77 segundos no total. Essa latência de menos de um segundo permite um ritmo natural de conversação. Usar o GPT-4o adicionaria TTFT de 200 ms e reduziria a taxa de transferência, criando pausas perceptíveis que interrompem o fluxo da conversa.
As plataformas de negociação e análise financeira usam LLMs para comentários de mercado em tempo real e geração de alertas. A latência impacta diretamente o valor das informações que movimentam o mercado. Uma plataforma financeira que usa GPT-4o-mini para alertas de mercado de 100 tokens consegue a entrega em menos de 1 segundo, atendendo ao requisito de informações financeiras urgentes. A plataforma encaminha peças analíticas mais longas para o GPT-4o em segundo plano, onde a latência é menos crítica.
Assistentes de voz e aplicativos de IA habilitados para voz têm orçamentos de latência rígidos porque os usuários esperam respostas verbais imediatas. O pipeline total de fala para texto (300 a 500 ms) para geração de LLM e texto para fala (200 a 400 ms) deve ser concluído dentro de 2 a 3 segundos. Isso deixa apenas 1 a 2 segundos para a geração do LLM, restringindo a escolha do modelo e a duração da resposta. Muitos aplicativos de voz usam GPT-4o-mini ou Claude Haiku especificamente para seu TTFT mais rápido.
Casos especiais
▾
Para modelos de raciocínio como o1 e o3, o TTFT inclui um pensamento estendido
Para modelos de raciocínio como o1 e o3, o TTFT inclui uma fase de pensamento estendida que pode durar de 2 a 30 segundos, dependendo da complexidade do problema. Esse tempo de reflexão é cobrado de acordo com a taxa do token de saída, mas não é visível na resposta transmitida. Uma solicitação que produza 200 tokens de saída visíveis pode ter consumido de 2.000 a 5.000 tokens de pensamento, criando uma penalidade de latência e um multiplicador de custo oculto. Os modelos de raciocínio só devem ser usados para tarefas em que o tempo de reflexão produz resultados mensuravelmente melhores.
Ao implantar LLMs atrás de um CDN global ou gateway de API, os saltos de rede adicionados
Ao implantar LLMs atrás de um CDN global ou gateway de API, os saltos de rede adicionados introduzem 10 a 50 ms de latência adicional por solicitação. Embora individualmente pequeno, essa sobrecarga aumenta em aplicações de agentes que fazem de 5 a 15 chamadas LLM sequenciais. Um pipeline de agente com 10 chamadas sequenciais acumula de 100 a 500 ms apenas de sobrecarga de gateway. Para aplicativos de agente sensíveis à latência, minimize os saltos de rede entre o orquestrador e o ponto final da API LLM.
A chamada de função e o uso de ferramentas adicionam latência porque o modelo deve gerar
A chamada de função e o uso de ferramentas adicionam latência porque o modelo deve gerar uma saída JSON estruturada (que é mais lenta que a linguagem natural) e aguardar o resultado da ferramenta antes de continuar. Cada ida e volta de chamada de ferramenta adiciona o TTFT completo mais o tempo de execução da ferramenta. Um agente que faz três chamadas de ferramenta adiciona aproximadamente 1 a 3 segundos de latência do LLM mais os tempos de resposta da ferramenta externa. Projete interfaces de ferramentas para minimizar viagens de ida e volta, agrupando várias consultas em lotes em chamadas de ferramenta única, sempre que possível.
Benchmarks de latência LLM (valores medianos de 2025)
▾
| Modelo | TTFT (mediana) | Tokens/Segundo | Resposta de 200 tokens | Resposta de 500 tokens |
|---|---|---|---|---|
| GPT-4o | 350ms | 100 tok/s | 2,35s | 5,35s |
| GPT-4o-mini | 150ms | 130 tok/s | 1,69s | 4h00 |
| Claude Soneto 4 | 500ms | 80 tok/s | 3h00 | 6,75s |
| Claude Haiku | 200ms | 120 tok/s | 1,87s | 4,37s |
| Gêmeos 1.5 Flash | 200ms | 140 tok/s | 1,63s | 3,77s |
| o1 (raciocínio) | 3.000 ms | 50 tok/s | 7h00 | 13h00 |
| Lhama 3 70B (H100) | 100ms | 90 tok/s | 2,32s | 5,66s |
Perguntas frequentes
▾
Qual LLM tem a latência mais baixa?
Entre os principais modelos comerciais, o GPT-4o-mini oferece consistentemente a latência mais baixa com TTFT de 100 a 200 ms e 120 a 150 tokens por segundo. Claude Haiku é igualmente rápido. Entre os modelos principais, o GPT-4o é ligeiramente mais rápido que o Claude Sonnet 4. Modelos de raciocínio como o1 são significativamente mais lentos com TTFT de 2 a 10 segundos devido ao pensamento interno. Modelos auto-hospedados em GPUs H100 podem atingir TTFT abaixo de 100 ms, mas exigem investimento significativo em infraestrutura.
Como o comprimento do prompt afeta a latência?
Solicitações de entrada mais longas aumentam o TTFT porque o modelo deve processar todos os tokens de entrada antes de gerar o primeiro token de saída. O processamento de 1.000 tokens de entrada normalmente adiciona de 100 a 300 ms em comparação com um prompt mínimo. O processamento de 10.000 tokens de entrada pode adicionar de 500 a 1.500 ms. É por isso que aplicações RAG com grande contexto recuperado têm maior latência do que simples interações de chatbot. O cache de prompt (disponível na Anthropic) elimina esse tempo de processamento para prefixos de prompt repetidos.
Devo usar streaming para todas as chamadas de API?
O streaming deve ser usado para qualquer resposta voltada ao usuário que leve mais de 1 segundo para ser gerada. Para chamadas de API programáticas em que a saída é processada por código em vez de exibida aos usuários, o não streaming é mais simples e tem benefício de latência insignificante. O streaming adiciona complexidade mínima de código à maioria dos SDKs e é compatível com todos os principais provedores sem custo adicional. A melhoria percebida na latência do streaming é substancial: uma resposta de 10 segundos parece 1 segundo quando transmitida.
Como posso reduzir o TTFT da minha aplicação?
As principais otimizações do TTFT incluem: usar cache de prompt para ignorar o processamento de prefixos de prompt repetidos (economiza 200 a 500 ms), escolher endpoints de API geograficamente mais próximos (economiza 50 a 200 ms de ida e volta da rede), reduzir o comprimento do prompt de entrada (economiza 100 a 500 ms) e usar modelos mais rápidos como GPT-4o-mini (economiza 100 a 300 ms vs GPT-4o). Para modelos auto-hospedados, a inferência acelerada por GPU com estruturas de serviço otimizadas como vLLM pode atingir TTFT abaixo de 100 ms.
Qual é a latência aceitável para diferentes tipos de aplicativos?
Pesquisa e preenchimento automático: menos de 500 ms. Respostas do chatbot: menos de 3 segundos (com streaming). Geração de conteúdo: menos de 10 segundos (com indicador de progresso de streaming). Processamento em lote: minutos a horas (sem necessidade de latência). Assistentes de voz: menos de 2 segundos de pipeline total. Conclusão de código: menos de 500 ms para sugestões in-line. Esses limites são baseados em pesquisas sobre a experiência do usuário e em benchmarks competitivos.
Erros comuns a evitar
▾
- !Otimizando apenas o custo do token, ignorando o impacto da latência:
- !Não usar streaming para respostas longas:
- !Ignorando a variação TTFT e a latência P99:
Dica Pro
Implemente um orçamento de latência para todo o pipeline de solicitações e aloque-o entre os componentes. Para um orçamento de chatbot de 3 segundos: 200 ms para rede e pré-processamento, 200 ms para recuperação RAG, 300 ms para TTFT e 2.300 ms para geração de token (permitindo aproximadamente 300 tokens a 130 tok/s no GPT-4o-mini). Essa abordagem orçamentária evita que componentes individuais consumam mais do que sua parcela e destaca quando um componente precisa de otimização ou um modelo mais rápido é necessário.
Você sabia?
A troca de turnos na conversa humana tem um intervalo natural de cerca de 200 milissegundos entre uma pessoa que termina e outra começa a falar. Quando os tempos de resposta do chatbot de IA excedem 3 segundos, os usuários adotam inconscientemente um modelo mental de “pesquisa na web” em vez de um modelo mental de “conversa”, tornando-se menos engajados e mais propensos a abandonar. Obter respostas em menos de 2 segundos mantém os usuários na mentalidade conversacional, aumentando os índices de engajamento e satisfação em 25 a 40 por cento.
Regional Guides
▾
North America▾
Europe▾
Asia-Pacific▾
Referências
Receba dicas semanais de matemática
Junte-se aos assinantes do 12.000 + que recebem dicas de calculadora todas as semanas.