Startups brasileiras estão queimando crédito da Anthropic à toa
Audito muita conta de startup rodando IA. Três padrões aparecem em quase toda uma. Nenhum é sobre modelo; todos são sobre operação.
por Zechim
Nas últimas semanas, ajudei três startups brasileiras a olhar pra conta da Anthropic delas pela primeira vez. Todas em produção há pelo menos 6 meses. Todas queimando dinheiro que não precisavam queimar.
Três padrões aparecem em quase toda auditoria. Nenhum é sobre "escolher o modelo errado". Todos são sobre operação. Compartilho aqui porque provavelmente se aplica ao seu caso também.
Padrão 1: Sonnet pra tudo
O default da Vercel AI SDK e da maioria dos tutoriais é Sonnet 4.5. Você escreve generateText({ model: anthropic('claude-sonnet-4-5') }) e segue a vida. Custa 3 dólares por milhão de tokens de entrada e 15 por milhão de saída.
Só que na maioria das conversas de agente, o modelo faz 3 a 5 chamadas: decisão de ferramenta, geração de SQL, leitura de resultado, síntese final. As primeiras 3 são mecânicas. Haiku 4.5 resolve elas com qualidade indistinguível de Sonnet, por um sexto do preço (0.80 dólar de entrada, 4 de saída).
A síntese final, onde importa a prosa e o raciocínio multi-passo, ainda merece Sonnet.
Falei disso num post anterior. Resumo pra quem não vai ler: separar o loop de ferramenta (Haiku) da síntese (Sonnet) corta o custo por conversa em 60%. Zero diferença de UX. Sim, sessenta.
Padrão 2: caching de prompt não ativado (ou ativado errado)
A Anthropic cobra 10% do preço normal por token cacheado. Se você tem um system prompt de 3000 tokens que se repete em toda chamada da conversa, do segundo turno em diante ele custa 300 tokens em vez de 3000. Nove em cada dez startups que audito não ativaram isso.
Pior: parte das que ativaram estão fazendo errado. O caching depende do prefixo do prompt ser idêntico entre chamadas. Se você injeta o timestamp do usuário, o nome dele, ou o ID de sessão no começo do system prompt, você quebra o cache toda vez. Já vi isso em produção mais de uma vez.
A regra é simples: informação dinâmica vai no fim da mensagem, não no começo. Prefixo estável, sufixo variável.
Padrão 3: sem streaming, pagando pelo que o usuário abandona
Se você chama generateText (não-streaming), o modelo gera a resposta inteira antes de você receber o primeiro byte. Se o usuário fechou a aba no segundo 3 de uma resposta que ia levar 8 segundos, você já pagou pelos 8 segundos completos.
Com streamText, você recebe tokens conforme eles são gerados. Se a conexão do usuário morre, você para de gerar. Paga só pelo que foi entregue.
Isso pesa mais em produtos com chat visível (onde o usuário escolhe fechar), menos em job processing em background. Mas se você tem UI conversacional em produção, streaming não é opcional. É controle de custo.
O padrão meta: ninguém olha a conta
A Anthropic não manda relatório semanal por padrão. Você vê o gasto quando entra no console pra olhar, ou quando o cartão dispara. A maioria das startups que audito não sabia sequer a estrutura da conta delas: quantos tokens de entrada por dia, cache hit rate, breakdown por endpoint.
O fix são 5 minutos:
- Console da Anthropic > Settings > Cost Alerts
- Cria um alerta suave (email quando gasto diário passar de X)
- Ativa telemetria server-side no seu app pra logar tokens por request (a gente usa PostHog pra isso)
Depois disso, se aparecer um novo padrão de queima (usuário abusivo, prompt refatorado que quebrou o cache, feature nova que gera muito output), você descobre em horas em vez de meses.
O consultor caro
Empresas de consultoria de IA amam vender "otimização de custo Anthropic" como se fosse ciência de foguete. Não é. Os três padrões acima cobrem 80% do que essas otimizações fazem na prática. Você aplica sozinho num sábado.
O que consultoria sênior faz de diferente é o quarto padrão: entender o produto o suficiente pra saber quando cortar Sonnet vale a pena e quando não vale (produto financeiro, saúde, jurídico costuma não valer). Aí sim justifica pagar alguém.
Se você tá em produção há mais de 3 meses e nunca fez essa auditoria, tira uma tarde. Vai encontrar 30 a 60% de gasto pra cortar sem tocar em UX.
Se você quer uma segunda opinião no breakdown da sua conta antes de tomar decisão, vale 30 minutos.