Anthropic corta preço do Claude Haiku 5.5 e pressiona a OpenAI

A Anthropic lançou na quarta-feira o Claude Haiku 5.5, apresentado como o modelo compacto mais veloz e capaz da sua história, com tarifas de API até 90% menores que as da geração anterior. Desenvolvedores pagam US$ 0,10 a cada milhão de tokens enviados ao modelo e US$ 0,50 por milhão de tokens devolvidos, em requisições de até 100 mil tokens — exatamente a tabela fixada pela OpenAI para o GPT-6 Luna, rival direto apresentado em 22 de setembro. A economia média estimada pela Anthropic é de cerca de 75%.

Tokens são os fragmentos de texto — perto de três quartos de uma palavra — que os modelos leem e escrevem, e é sobre eles que a cobrança das plataformas de IA é calculada.

ModeloEntrada (US$/milhão)Saída (US$/milhão)
Claude Haiku 4.51,005,00
Claude Haiku 5.50,100,50

Requisições que passam do teto de 100 mil tokens recebem desconto adicional de 50%. A companhia justifica a projeção de economia com dois fatores: cerca de 90% das chamadas ao Haiku 4.5 ficavam abaixo desse limite, e o novo modelo fatia o texto em um número um pouco maior de tokens.

Benchmarks: vantagem sobre o Luna e um erro no teste de lógica

O rótulo de modelo econômico não impediu a Anthropic de divulgar três avaliações favoráveis.

TesteHaiku 5.5GPT-6 LunaHaiku 4.5Sonnet 5.5
OSWorld 2.172,4%48,9%——
Terminal-Bench 4.039,2%16,4%0%70,6%
GDPval-AA v2.1 (Elo)1.6201.437735—

O OSWorld 2.1 verifica se a IA consegue conduzir um computador de verdade em tarefas extensas, com várias etapas e crédito parcial por resultado: o Haiku 5.5 acertou 72,4% das vezes, contra 48,9% do Luna. No Terminal-Bench 4.0, que mede agentes autônomos executando comandos digitados e exige acerto na primeira tentativa, o placar foi de 39,2% para o Haiku 5.5, 16,4% para o Luna e 0% para o Haiku 4.5 — o Sonnet 5.5, mais pesado, marcou 70,6%.

Já o GDPval-AA v2.1, que compara desempenho em trabalhos profissionais de 44 ocupações pela escala Elo, sistema de pontuação usado no xadrez, deu 1.620 pontos ao Haiku 5.5, 1.437 ao Luna e 735 ao Haiku 4.5.

A ressalva aparece em um teste com uma questão simples de lógica: a resposta veio quase instantânea e errada. Velocidade e preço baixo não dispensam conferência humana em usos críticos.

Esforço ajustável, nuvens e créditos de API

É a primeira versão Haiku com seletor de esforço ajustável, que deixa o usuário escolher entre gastar menos ou receber respostas mais refinadas. A Anthropic ainda cortou pela metade a tarifa de leitura de cache do Sonnet 5.5, cobrada para trechos que o modelo já processou, agora em US$ 0,10 a cada milhão de tokens.

O Haiku 5.5 já está no site do Claude e nas três grandes nuvens — Microsoft Azure, Google Cloud e Amazon Web Services — sob o identificador claude-haiku-5-5. Nesta semana, a companhia libera créditos mensais de API: US$ 100 para o plano Max 5x, US$ 200 para o Max 20x e até US$ 500 divididos entre integrantes de planos Team.

Três modelos em duas semanas e o freio pedido por Amodei

O Haiku 5.5 fecha a trilogia Claude 5.5 prometida pela empresa. Ele saiu 15 dias depois do Opus 5.5, de 22 de setembro, e com nove dias de intervalo em relação ao Sonnet 5.5, de 28 de setembro. Antes da série, o CEO Dario Amodei assinou um ensaio defendendo que o setor aliviasse o ritmo de avanço em capacidades de IA — o Opus 5.5 foi o primeiro lançamento posterior a esse texto, contraste evidente com a cadência comercial que a Anthropic imprime agora.

O que a guerra de tarifas significa para a carteira

Nem Anthropic nem OpenAI têm capital aberto, o que limita o impacto direto sobre ações negociadas na B3. O dado que interessa ao investidor é a trajetória de custo: cada redução de preço por token diminui a despesa de empresas que embutem IA em atendimento, leitura de documentos e automação de rotinas — ambiente favorável à camada de aplicação e desconfortável para quem vende capacidade bruta de modelo.

A porta de entrada nas três hyperscalers mostra que boa parte dessa disputa se decide no acesso via nuvem, não apenas no desempenho do modelo. E os resultados de benchmark, somados ao erro no teste de lógica, indicam o nicho real desses modelos compactos: tarefas repetitivas, como resumos, consultas a bancos de dados e suporte em tempo real, sempre com supervisão quando a decisão envolve dinheiro.