45 termos, em ordem alfabética.
- Agente
- sistema que decide sozinho quantos passos e chamadas fará para cumprir uma tarefa; consome de várias vezes a mil vezes mais tokens que um chat equivalente.
- Cache de prefixo
- guardar o começo estável do contexto para releitura barata; escrever custa um pouco mais, ler custa cerca de um décimo, e o ponto de equilíbrio chega na primeira leitura.
- Cache semântico
- reaproveitar a resposta de uma pergunta parecida; economiza mais e pode devolver a resposta errada, então é decisão de risco e não de infraestrutura.
- Capacidade provisionada
- comprar vazão reservada em vez de pagar por uso, cobrada por tempo e não por token.
- Cascata
- começar pelo modelo barato e escalar para o caro só quando a resposta não passar no critério definido.
- Chamada de ferramenta
- quando o modelo aciona busca, leitura de arquivo ou execução de código; algumas têm preço próprio fora do token.
- Chargeback
- debitar de fato o consumo no orçamento da área que consumiu.
- Context rot
- a degradação de acurácia e recuperação que a documentação do próprio fornecedor registra conforme o contexto cresce; mais contexto pode piorar a resposta.
- Contexto
- o conjunto do que foi enviado numa requisição; é ele que cresce a cada turno e faz a conversa ficar cara sozinha.
- Custo estimado
- o número que a ferramenta de observabilidade calcula multiplicando tokens pelo preço público; diverge da fatura de quem tem desconto contratado.
- Custo por resultado bem-sucedido
- o custo de cada tarefa concluída, ticket resolvido ou documento processado; é a métrica que sobrevive a uma pergunta do conselho.
- Deflação de preço por token
- a queda contínua do preço para um mesmo nível de desempenho, que torna qualquer business case de preço fixo obsoleto em meses.
- Esforço de raciocínio
- o dial que define quanto o modelo pensa e quantas ferramentas ele chama; tem faixa inteira, não duas posições, e é controle de custo sobre o loop todo.
- FinOps
- disciplina de gerir o valor do gasto com tecnologia; desde 2026 o escopo inclui oficialmente IA, SaaS, licenciamento e data center.
- FOCUS
- padrão aberto de dados de faturamento que permite comparar nuvens e fornecedores; na versão vigente ainda não cobre token de forma nativa.
- Gateway de IA
- camada que fica na frente do fornecedor e bloqueia, roteia ou limita gasto em milissegundos.
- Goodput
- o token que efetivamente cumpre o prazo de resposta acordado; pagar tarifa premium para carga que toleraria espera é desperdício mensurável.
- Gross-up
- a decisão contratual de quem absorve os tributos da remessa ao exterior; muda o custo efetivo da mesma fatura em dólar.
- IOF-câmbio
- tributo que incide sobre a operação de câmbio da remessa ao exterior no pagamento ao fornecedor.
- Janela de contexto
- o teto de tokens que cabe numa requisição; teto grande é limite técnico, não recomendação de uso.
- Limite de vazão (rate limit)
- teto de requisições e de tokens por minuto contratado por tier, medido em três dimensões simultâneas; o modelo mais caro costuma vir com vazão menor.
- Lote (batch)
- enviar trabalho que pode esperar até vinte e quatro horas em troca de cinquenta por cento de desconto, prática padrão em todos os grandes fornecedores.
- Margem bruta de produto com IA
- quanto sobra do preço depois do custo de servir; em produto com IA opera bem abaixo do software tradicional.
- MCP
- protocolo que conecta o modelo a ferramentas externas; cada ferramenta declarada ocupa contexto pago antes mesmo de ser usada.
- Negação de carteira
- o gasto provocado por abuso, chave vazada ou laço de agente descontrolado, que transforma custo em incidente de segurança.
- p99
- o valor abaixo do qual ficam noventa e nove por cento das execuções medidas; é por ele que se dimensiona orçamento agêntico, nunca pela média.
- Preço por milhão de tokens
- a unidade real de tabela do mercado, sempre em par de entrada e saída; custo por consulta não existe em fatura nenhuma.
- Prompt de sistema
- a instrução fixa que acompanha toda requisição e é cobrada em toda requisição, mesmo quando o usuário não a vê.
- PTAX
- a cotação oficial do dólar divulgada pelo Banco Central, referência para converter a fatura em dólar para reais e separar câmbio de consumo.
- Residência de dados
- exigir que o processamento ocorra numa região específica; custa cerca de dez por cento a mais nos endpoints regionais da Anthropic (multiplicador de 1,1x), da OpenAI, do Amazon Bedrock e do Google Cloud, em tabelas de julho de 2026. Nem todo fornecedor publica esse sobrepreço, e onde ele não está em tabela pública vale exigir o número por escrito na proposta antes de escolher a região.
- RoAI
- retorno econômico dividido pela soma do custo do trabalho humano com o custo dos tokens envolvidos na entrega.
- Roteamento
- mandar cada tarefa para o modelo mais barato que a resolve, em vez de padronizar tudo no mais caro.
- Shadow AI
- uso de ferramenta de IA não aprovada com dado da empresa, normalmente em conta pessoal; é gasto invisível e exposição de dado ao mesmo tempo.
- Showback
- mostrar a cada área quanto ela consumiu, sem cobrar internamente.
- Taxa de acerto de cache
- a fração das requisições que aproveitou o trecho guardado; é o número que deve aparecer no relatório mensal de custo.
- Teto de gasto
- limite mensal em dólares que pausa a operação ao ser atingido; existe nativamente e a maioria das equipes nunca ligou.
- Tier
- faixa de conta que define limite de vazão e teto de gasto mensal, escalonada por gasto acumulado; não é plano comercial nem tabela de preço diferente.
- Token
- a unidade em que a inteligência artificial é medida e cobrada, mais ou menos como o kWh na conta de energia; cerca de quatro caracteres em inglês, e menos texto por token em português.
- Token de entrada
- tudo o que você envia ao modelo numa requisição: instrução, histórico da conversa, documento anexado e definições de ferramenta.
- Token de raciocínio
- o rascunho que o modelo produz antes de responder, cobrado como saída na geração e recobrado como entrada nos turnos seguintes.
- Token de saída
- tudo o que o modelo devolve, e é onde a instrução de concisão vira economia; custa de cinco a seis vezes o token de entrada nos três maiores fornecedores (Anthropic, OpenAI e Google, tabelas de julho de 2026) e de duas a quatro vezes nos modelos de piso, como o DeepSeek v4 e o Mistral Small 4. Confira a razão do modelo que a sua operação usa antes de decidir por qual ponta cortar.
- Tokenizador
- a régua que corta o texto em tokens; muda entre gerações de modelo, e a mesma frase pode custar cerca de trinta por cento mais tokens só por trocar de versão.
- Tokenomics
- o nome que a disciplina de FinOps aplicada a IA recebeu, tratando o token como unidade atômica de valor.
- Turno
- cada rodada de pergunta e resposta numa conversa; como a API não guarda memória, cada turno reenvia e recobra tudo o que veio antes.
- Unit economics de IA
- a conta de quanto cada unidade de valor entregue consome de inteligência paga.