Modelos e tiers

Três níveis de serviço. Saber quando subir de tier vale mais do que saber os detalhes de cada um.

Sonnet 5claude-sonnet-5O dia a dia: edições, refactors e perguntas diretas. É o mais rápido.CORE E MAX
Opus 5claude-opus-5Quando o contexto pesa: multi-arquivo, debugging, análise cuidadosa.CORE E MAX
Fable 5claude-fable-5O nível mais alto: raciocina antes de responder, e você vê o raciocínio.SÓ MAX
Sobre os tiers

Sonnet 5, Opus 5 e Fable 5 são os níveis de serviço do infinitemodel. A composição técnica da infraestrutura é informação interna e pode evoluir — o compromisso é com o que você experimenta em cada tier: qualidade, velocidade e capacidade.

Escolhendo no CLI

Dentro do Claude Code, /model mostra e troca o modelo ativo. O catálogo lista apenas o que o seu plano roteia: no Core aparecem Sonnet 5 e Opus 5; no Max, os três.

Também dá para definir por variável de ambiente, antes de abrir o CLI:

bash
export ANTHROPIC_MODEL=claude-opus-5

IDs aceitos pela API

Para quem integra direto ou configura outras ferramentas:

IDRoteia para
claude-sonnet-5Sonnet 5
claude-opus-5Opus 5
claude-fable-5Fable 5 — exige plano Max
claude-haiku-4-5-20251001Sonnet 5 (alias de compatibilidade)

Pedir um modelo fora do seu plano devolve 403 tier_not_allowed — no Core, é o que acontece com claude-fable-5. O upgrade para Max resolve na hora, sem trocar de chave nem reconfigurar nada.

Qual usar quando

  • Sonnet 5 como padrão. Resolve a maior parte do trabalho de edição e implementação, e responde rápido. Se a tarefa está clara, comece aqui.
  • Opus 5 quando o contexto pesa: várias partes do código envolvidas, refactor com consequências, um bug que atravessa arquivos.
  • Fable 5 quando errar custa caro: decisões de arquitetura, problemas que você já tentou resolver e voltaram, código crítico. Ele demora mais porque está raciocinando de verdade.

Regra prática: suba de tier quando perceber que está re-perguntando. O custo de uma resposta melhor é menor que o de três medianas.

O raciocínio visível do Fable 5

No Fable 5, o bloco de raciocínio que precede a resposta é exibido no CLI e no chat do dashboard. É normal a requisição passar alguns segundos em silêncio aparente antes do texto começar: o modelo está trabalhando antes de falar.

Em tarefas muito longas, esse raciocínio consome parte do orçamento de saída. Se a resposta vier curta demais, peça continuação ou divida a tarefa.