Leitura executiva · ~60 segundos

O portfólio mudou, mas a decisão durável continua baseada em tarefa, risco, authority, custo por outcome aceito, evals e evidência — nunca em um papel fixo por modelo.

Em poucas semanas, nomes de modelos, preços e narrativas de capacidade mudaram outra vez. A reação mais fácil é atualizar um ranking e substituir o modelo escrito em cada papel da squad. A reação mais responsável é outra: verificar o que mudou, separar afirmação de fornecedor de evidência e recalcular a rota de execução por tarefa.

Este é o Radar Vivo FORGE 2026/T3 — edição 01. Ele não escolhe um vencedor universal. Registra um corte temporal e transforma novidades de portfólio em decisões testáveis.

Resumo executivo

O corte de 21 de agosto de 2026 mostra quatro movimentos relevantes:

  1. a OpenAI passou a apresentar Sol, Terra e Luna como um portfólio de fronteira, equilíbrio e volume, não como um único modelo para tudo;
  2. a Anthropic posiciona Fable para trabalho longo e ambicioso, com controles adicionais de segurança e fallback;
  3. a diferença de preço entre rotas ficou grande o bastante para tornar roteamento e evals parte da arquitetura, não uma otimização tardia;
  4. nenhum lançamento elimina contexto, ferramenta, sandbox, política, verificação ou julgamento humano.

A pergunta útil não é “qual modelo é melhor?”. É:

qual combinação produz o menor custo por outcome aceito, dentro do risco e da latência que esta tarefa permite?

O corte: fatos declarados pelos fornecedores

Os números abaixo foram relidos em fontes primárias no corte editorial. São dados dos próprios fornecedores, não validação independente da Trustyu.

RotaPosicionamento publicadoEntrada / 1M tokensSaída / 1M tokensLeitura inicial
GPT-5.6 Soltrabalho profissional complexo e de fronteiraUS$ 5,00US$ 30,00candidato para tarefas difíceis em que qualidade marginal pode pagar o custo
GPT-5.6 Terraequilíbrio entre inteligência, velocidade e custoUS$ 2,00US$ 12,00candidato a rota padrão somente depois de vencer o baseline do produto
GPT-5.6 Lunatrabalho sensível a custo e alto volumeUS$ 0,20US$ 1,20candidato a triagem, transformação e volume quando o critério de aceite continua preservado
Claude Fable 5trabalho longo e ambicioso, com safeguards e fallbackUS$ 10,00US$ 50,00candidato a tarefas de horizonte longo que justifiquem custo, latência e política adicionais

Fontes: guia do portfólio GPT-5.6, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Claude Fable e Transparency Hub da Anthropic.

Preço de lista ajuda a formular hipóteses. Não inclui cache, ferramentas, retries, revisão humana, plataforma, incidentes ou taxa de rejeição. Também não prova desempenho na sua distribuição de casos.

O que mudou de verdade

Portfólio virou decisão arquitetural

Quando a diferença entre Luna e Sol chega a ordens de grandeza, “usar o melhor modelo” deixa de ser política suficiente. Uma aplicação pode usar uma rota barata para classificação, uma rota equilibrada para execução frequente e uma rota de fronteira para exceções — desde que o roteador seja observável, testável e incapaz de ampliar autoridade silenciosamente.

Horizonte longo passou a ser produto, não promessa genérica

Fable reforça a competição por tarefas que atravessam etapas, ferramentas e períodos maiores. Isso importa para pesquisa, engenharia e operação. Mas duração não é progresso. Sem estado externo, handoff, orçamento, checkpoints e critérios de parada, uma execução longa só consegue errar por mais tempo.

Segurança entrou no posicionamento do modelo

Safeguards, fallback e controles do fornecedor são parte da avaliação. Não devem virar a fronteira de segurança da empresa. Identidade, capability, dados, rede, sandbox e aprovação continuam sob controle do sistema que usa o modelo.

O custo de coordenação ficou mais visível

Adicionar planner, executor, avaliador ou múltiplos modelos pode melhorar um caso e também aumentar materialmente custo e latência. A FORGE exige eval e ablação por tarefa antes de transformar qualquer camada em padrão. [HARNESS31-C3]

Por que não fixar “Architect = Fable” ou “Backend = Terra”

Papéis descrevem responsabilidade. Modelos oferecem capacidades que mudam com releases, preços, limites e políticas. Colar um nome de modelo a um papel produz três dívidas:

  • obsolescência: o mapa envelhece assim que o portfólio muda;
  • falsa segurança: escolha de modelo parece substituir capability e revisão;
  • custo invisível: a rota é repetida sem comparar aceite, retries e intervenção.

O contrato mais durável é orquestrado:

tarefa + risco + dado + authority + orçamento + latência
                         ↓
                  eval da rota candidata
                         ↓
             execução isolada + verificação
                         ↓
             outcome aceito + evidência + custo

O papel continua estável. A rota de modelo é versionada e pode mudar sem reescrever a organização.

Uma matriz de decisão que sobrevive ao próximo lançamento

Avalie cada rota candidata contra o mesmo conjunto de casos:

DimensãoPergunta de gateEvidência mínima
tarefaque resultado delimitado precisa ser produzido?spec e exemplos representativos
riscoqual dano uma resposta ou ação errada pode causar?classe de risco e regra de escalonamento
dadosquais informações podem entrar e permanecer no provedor?política, retenção e classificação
authorityo modelo apenas propõe ou também executa?capabilities deny-by-default
qualidadeque diferença material existe contra o baseline?eval cego com critério de aceite
custoquanto custa a unidade aceita, não apenas a chamada?tokens, ferramentas, retries e tempo humano
latênciaa rota cabe no fluxo real?p50, p95 e timeout por classe
verificabilidadeconseguimos explicar e reproduzir a aceitação?logs, artefatos, digests e reviewer

Nenhuma fonte externa define o threshold correto da FORGE ou de um produto específico. Baselines e limites precisam ser calibrados por caso de uso. [R3-C1]

Roteie pelo custo por outcome aceito

Uma comparação honesta usa o mesmo denominador:

modelo + contexto + ferramentas + plataforma + verificação
+ retries + retrabalho + intervenção + incidentes
------------------------------------------------------
outcomes aceitos

O framework oferece o método; a unidade de valor continua específica ao produto. [R3-C2]

Na prática, a rota mais barata pode gerar mais correção. A mais cara pode não produzir ganho material. O resultado somente aparece quando custo, qualidade e operação são medidos juntos.

Um protocolo de adoção em sete passos

  1. congele o conjunto de casos e o baseline atual;
  2. registre modelo, versão, parâmetros, política e data do teste;
  3. execute as rotas candidatas com a mesma authority e as mesmas ferramentas;
  4. avalie qualidade sem revelar o fornecedor quando isso for viável;
  5. meça taxa de aceite, retries, latência, intervenção e custo total;
  6. faça ablação de camadas — planner, evaluator, busca e memória — antes de mantê-las;
  7. promova uma política de roteamento versionada, com fallback, budget e rollback.

O objetivo não é eternizar o vencedor do corte. É tornar a próxima troca pequena, observável e reversível.

O que este Radar prova — e o que não prova

Este Radar prova que, no corte indicado, páginas oficiais publicavam o portfólio, preços e posicionamentos descritos. As fontes da OpenAI não são independentes entre si; as fontes da Anthropic também não. System cards e transparency reports melhoram a visibilidade do fornecedor, mas não substituem avaliação independente nem evidência do seu produto.

Não executamos benchmark comparativo próprio entre Sol, Terra, Luna e Fable nesta edição. Portanto, o Radar não afirma superioridade geral, ganho de produtividade, segurança operacional ou economia real para qualquer produto da Trustyu.

Validade editorial

CampoCompromisso desta edição
corte factual21 de agosto de 2026
preços e disponibilidadereler até 20 de setembro de 2026, no máximo
recomendação arquiteturalrevisar até 19 de novembro de 2026, no máximo
revisão antecipadanovo preço, acesso, system card, política de dados ou resultado independente material
próxima ediçãosubstitui esta leitura; a edição anterior permanece arquivada e datada

Conclusão

Fable, Sol, Terra e Luna ampliam as opções. Não removem a responsabilidade de escolher, limitar, medir e verificar.

O sistema premium não é o que exibe o nome mais novo em cada card. É o que troca de modelo sem perder memória, política, segurança, evidência ou clareza de custo.

Leitura complementar: O modelo não é o sistema e Referências da FORGE.

Nota editorial e de responsabilidade

Corte da pesquisa
Última revisão
Correções registradas
Nenhuma correção registrada.

Este artigo combina fontes citadas, análise e experiência profissional do autor. Dados e afirmações factuais verificáveis estão vinculados às respectivas fontes. Interpretações, hipóteses, projeções, recomendações e opiniões representam o ponto de vista profissional do autor no momento da publicação; não constituem fatos comprovados, promessa de resultado nem aconselhamento jurídico, financeiro ou técnico aplicável a um caso específico. Consulte as fontes originais e profissionais habilitados antes de tomar decisões.

Claims e fontes

HARNESS31-C3

Anthropic reports that planner, generator and evaluator layers improved a long-running application result while materially increasing cost and latency; FORGE should require task-specific evals and ablation before making such layers mandatory.

Limite: This is a provider experiment tied to a selected model, benchmark and application task; it cannot prove universal superiority of multi-agent or evaluator layers. This is a source-bound design input; it does not prove product adoption, operational maturity, independent attestation, search ranking, AI citation or outcome.

  • Anthropic — Anthropic, proprietary-site-terms

R3-C1

An AI quality claim requires explicit eval criteria and observable execution evidence; traces alone and subjective inspection alone are incomplete.

Limite: Neither source defines FORGE-specific pass thresholds; baselines must be calibrated per use case. This is a research-synthesis design input; it does not prove product adoption, operational maturity, independent attestation or outcome.

  • Anthropic — Anthropic, MIT repository; analysis-only excerpts
  • OpenAI — OpenAI, MIT repository; analysis-only excerpts

R3-C2

Useful AI observability must connect technical telemetry to a unit of value and its cost, instead of optimizing aggregate spend without an outcome denominator.

Limite: A unit must be product-specific; this framework-only run measures intake cost but not customer outcome. This is a research-synthesis design input; it does not prove product adoption, operational maturity, independent attestation or outcome.

  • OpenTelemetry — OpenTelemetry, CC-BY-4.0 documentation; analysis-only excerpts
  • FinOps Foundation — FinOps Foundation, CC-BY-4.0 framework; analysis-only excerpts