Claude Opus 5.5 vs Fable 5.1: custo e escolha para programar
Opus 5.5 é o padrão econômico para código verificável e agentes bem delimitados; Fable 5.1 vale o prêmio principalmente quando a saída é difícil de inspecionar ou precisa acertar de primeira.
Conteúdo

Se você consegue revisar o diff, executar os testes e conferir o produto final, use o Claude Opus 5.5 como padrão no desenvolvimento diário e em tarefas de agente com limites claros. Os tokens de entrada e saída custam 60% menos que no Fable 5.1, e avaliações independentes mostram que ele frequentemente empata ou supera o Fable — embora o Opus possa consumir mais tokens e ainda exija supervisão.
O Fable 5.1 vale o preço extra quando o resultado é grande demais para uma verificação manual confiável ou quando uma primeira entrega errada custa muito mais que a inferência. A comparação abaixo usa preços publicados, benchmarks independentes e testes práticos disponíveis em 26 de setembro de 2026.
Decisão rápida: Opus como padrão e Fable para tarefas específicas de alto risco
| Sua tarefa | Primeira escolha | Motivo |
|---|---|---|
| Funcionalidades, correções e protótipos em um código conhecido | Opus 5.5 | Preço menor, capacidade próxima do Fable e resultado fácil de validar |
| Migrações, auditorias ou alterações em massa com critérios objetivos | Opus 5.5 | Bom desempenho em trabalhos longos, desde que haja checkpoints e condição de parada |
| Problema difícil cujo diff é grande ou sutil demais para revisar rapidamente | Fable 5.1 | Avaliadores práticos ainda atribuem ao Fable um teto maior nos problemas mais difíceis |
| Entrega que precisa sair certa na primeira tentativa | Fable 5.1 | O gasto extra pode ser menor que o custo de retrabalho ou atraso |
| Execução aberta, sem orçamento nem definição de pronto | Não execute sem supervisão | O Opus pode ampliar o escopo e continuar consumindo; limite a tarefa antes de escolher |
Não basta resumir a questão como “Opus é barato” e “Fable é inteligente”. A comparação que importa é o custo total para concluir a mesma tarefa, incluindo entrada, saída, cache, ferramentas, novas tentativas, revisão humana e retrabalho.
Preço de tabela: tokens do Opus custam 40% do valor do Fable
Em 26 de setembro de 2026, a Anthropic listava o Opus 5.5 a US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de saída. A avaliação prática da Every informa US$ 10 e US$ 50 para o Fable 5.1.
| Por 1 milhão de tokens | Opus 5.5 | Fable 5.1 | Opus em relação ao Fable |
|---|---|---|---|
| Entrada | $4 | $10 | 60% menor |
| Saída | $20 | $50 | 60% menor |
Com a mesma proporção entre entrada e saída, o Fable custa 2,5 vezes mais por token. A Anthropic também publica para o Opus US$ 0,20 por milhão de tokens lidos do cache e US$ 5 por milhão gravados. Não afirmamos vantagem direta de cache sobre o Fable porque a fonte citada para ele não traz um preço comparável.
A tabela responde “quanto custa um token?”, não “quanto custa esta tarefa?”. Um agente de programação pode ler arquivos, chamar ferramentas, repetir testes e corrigir suas próprias mudanças; dois modelos podem consumir volumes muito diferentes no mesmo trabalho.
Tokens por tarefa: o Opus gerou cerca de 53% mais saída, mas ainda custou menos
A Artificial Analysis registrou a seguinte média de saída por tarefa do Intelligence Index no effort máximo:
- Opus 5.5: aproximadamente 119 mil tokens de saída;
- Fable 5.1: aproximadamente 78 mil tokens de saída.
O Opus, portanto, gerou cerca de 53% mais. Ao combinar essas médias públicas com os preços de saída publicados, chegamos a esta ilustração somente da saída:
- Opus 5.5: 119.000 ÷ 1.000.000 × $20 ≈ $2,38;
- Fable 5.1: 78.000 ÷ 1.000.000 × $50 ≈ $3,90.
Nesse ambiente específico, o Opus usou aproximadamente 1,53 vez mais tokens de saída, mas essa parte da conta ficou cerca de 39% mais barata. Pela relação de preços de 2,5 para 1, o Opus poderia consumir até 2,5 vezes mais tokens antes de atingir o mesmo gasto, supondo uma composição semelhante de entrada e saída.
Isso não é uma fatura real de programação. Ficam de fora entrada, cache, ferramentas, novas tentativas e particularidades do provedor, e o Intelligence Index não representa seu repositório. A conclusão útil é mais estreita: mais saída do Opus não significa automaticamente uma conta maior, mas o preço unitário baixo não autoriza deixar uma execução longa sem limite.
Benchmarks independentes: Opus é o padrão mais forte, não uma substituição universal
A Artificial Analysis deu 58 pontos ao Opus 5.5 no effort máximo, o maior resultado do Intelligence Index que havia medido até a publicação. Comparações diretas com o Fable 5.1 incluem:
| Avaliação independente | Opus 5.5 | Fable 5.1 | Leitura prática |
|---|---|---|---|
| Humanity’s Last Exam | 61,4% | 59,1% | Pequena vantagem do Opus |
| SciCode | 66,9% | 63,1% | Opus à frente em questões de programação científica |
| GDPval-AA v2.1 | 1846 Elo | 1735 Elo | Opus à frente em trabalho de conhecimento com agentes |
| AA-Briefcase v1.1 | 1822 Elo | 143 Elo abaixo do Opus | Opus liderou no conjunto, mas Fable foi um pouco melhor na subpontuação por rubrica |
O mesmo relatório diz que o Opus não liderou tudo: ficou atrás em CritPt, AA-LCR e GDP.pdf. Quatro níveis de effort ficaram na fronteira de Pareto entre inteligência e custo por tarefa. Isso sustenta o Opus como boa combinação de capacidade e preço, não como vencedor de qualquer carga de trabalho.
Os resultados de código publicados pela Anthropic apontam na mesma direção. A empresa, por exemplo, informa 52,5% no CursorBench 4.0 para o Opus no effort medium e 51,8% para o Fable em max. São números do fabricante, e a própria Anthropic alerta que pequenas diferenças entre modelos de fronteira estão cada vez menos ligadas às diferenças no trabalho real. Use-os para selecionar candidatos, não para dispensar um teste com suas tarefas.
Uso prático: testes verdes ainda podem esconder um produto quebrado
A equipe da Every usou o Opus 5.5 por sete dias antes do lançamento. A publicação informa que a Anthropic forneceu acesso antecipado, mas não interferiu na análise. Os avaliadores não chegaram a um consenso, o que ajuda a definir a fronteira:
- um deles substituiu o Fable pelo Opus como ferramenta diária e o considerou tão bom quanto, ou às vezes melhor, para produto e código;
- outro o chamou de “Fable menor”: prático no cotidiano e em projetos completos grandes, mas continuou escolhendo Fable para os problemas mais difíceis;
- um avaliador estimou o Opus em cerca de 90% da capacidade de programação do Fable. É uma estimativa pessoal sobre suas tarefas, não um benchmark geral.
O exemplo mais instrutivo foi um aplicativo de formulário por voz. O Opus trabalhou por cerca de 30 minutos e consumiu aproximadamente 5,9 milhões de tokens. As verificações automatizadas estavam verdes, mas as telas centrais falharam quando uma pessoa usou o aplicativo, e o serviço de IA obrigatório nunca foi chamado.
Por isso, o Opus serve bem para funcionalidades e protótipos em um código conhecido apenas se você mantiver três portas humanas: ler o diff, executar o aplicativo real e verificar chamadas externas críticas. Guarde cópias separadas dos arquivos necessários para validar o resultado, evitando que o agente altere ou apague a própria evidência.
Quando ainda vale pagar pelo Fable 5.1
1. A alteração é grande demais para uma revisão rápida
Se o trabalho atravessa vários serviços, inclui uma migração irreversível ou pode esconder falhas de segurança e concorrência, a correção na primeira tentativa importa mais que o preço por token. Na avaliação da Every, os maiores e mais difíceis problemas continuaram indo para o Fable.
Não pergunte apenas quanto custa a mais. Calcule quantas horas de engenharia uma falha evitada poupa. Se um rollback, incidente ou investigação custa mais que o prêmio do modelo, o Fable pode ser a escolha econômica.
2. A entrega precisa chegar próxima do final já na primeira versão
Em trabalhos com template rígido, regras de marca ou prazo duro, o Fable foi o mais seguro dos dois no teste da Every. Em uma apresentação, o Opus melhorou o layout, mas usou logotipo e cores errados e introduziu uma afirmação sem base; o Fable produziu a entrega melhor.
Quando a fidelidade inicial vale mais que a exploração, teste o Fable primeiro. “Mais seguro” ainda não significa “dispensa revisão”.
3. A verificação humana custa mais que a inferência
Se um engenheiro sênior gasta duas horas validando um patch extenso do Opus, enquanto o Fable produz de forma consistente uma alteração menor e mais fácil de provar, a API mais cara pode reduzir o custo total. Por outro lado, equipes com bons testes, ambientes de preview e revisão de código transformam com mais facilidade o preço baixo do Opus em economia real.
Como fazer um teste justo no seu código
Não conclua nada a partir de um único prompt nem dê ferramentas e contextos diferentes aos modelos. Selecione de 5 a 10 tarefas reais e repetíveis: pelo menos uma funcionalidade comum, uma correção em vários arquivos, um trabalho longo e uma mudança de alto risco. Depois, mantenha as condições controladas:
- Use a mesma versão do repositório, instruções de sistema, permissões e testes de aceitação.
- Compare primeiro o mesmo nível de effort e, em seguida, teste separadamente o melhor nível de cada modelo.
- Defina antes do início o que é pronto, o tempo máximo, o orçamento de tokens e a condição de parada.
- Registre entrada, saída, cache, chamadas de ferramentas, tempo total, sucesso na primeira tentativa e retrabalho humano.
- Inclua tentativas fracassadas e novas execuções no custo, em vez de mostrar apenas a execução bem-sucedida.
Use esta regra:
Custo total da tarefa = gasto do modelo + revisão humana + retrabalho e novas tentativas + perda esperada por uma entrega errada.
Se a taxa de sucesso inicial do Opus estiver próxima da do Fable, torne o Opus o padrão. Se o Fable reduzir materialmente o retrabalho em uma categoria de alto risco, encaminhe apenas essa categoria para ele. Você preserva o teto maior do Fable sem pagar 2,5 vezes por token em toda solicitação rotineira.
Recomendação final
Escolha primeiro o Claude Opus 5.5 para a maioria dos trabalhos de código e de agente com limites claros. Entrada e saída custam 60% menos, resultados independentes o sustentam como modelo de fronteira para uso padrão e, mesmo com maior saída nos dados citados, o custo ilustrativo ficou abaixo do Fable.
Pague pelo Fable 5.1 quando o resultado for difícil de inspecionar, uma falha inicial for cara ou seu teste controlado demonstrar redução relevante de retrabalho. A configuração prática não é um único modelo para tudo: deixe a maior parte do trabalho verificável com o Opus e reserve o Fable para um conjunto pequeno de tarefas valiosas e arriscadas.
Fontes
- Anthropic: lançamento do Claude Opus 5.5, preços oficiais e benchmarks do fabricante, 22 de setembro de 2026.
- Artificial Analysis: benchmarks independentes do Opus 5.5 e tokens por tarefa, 22 de setembro de 2026.
- Every: avaliação prática de sete dias do Opus 5.5, 22 de setembro de 2026.
Dados conferidos em 26 de setembro de 2026. Preços e comportamento dos modelos podem mudar após atualizações dos provedores.