Leitura executiva · ~60 segundos
O portfólio mudou, mas a decisão durável continua baseada em tarefa, risco, authority, custo por outcome aceito, evals e evidência — nunca em um papel fixo por modelo.
Em poucas semanas, nomes de modelos, preços e narrativas de capacidade mudaram outra vez. A reação mais fácil é atualizar um ranking e substituir o modelo escrito em cada papel da squad. A reação mais responsável é outra: verificar o que mudou, separar afirmação de fornecedor de evidência e recalcular a rota de execução por tarefa.
Este é o Radar Vivo FORGE 2026/T3 — edição 01. Ele não escolhe um vencedor universal. Registra um corte temporal e transforma novidades de portfólio em decisões testáveis.
Resumo executivo
O corte de 21 de agosto de 2026 mostra quatro movimentos relevantes:
- a OpenAI passou a apresentar Sol, Terra e Luna como um portfólio de fronteira, equilíbrio e volume, não como um único modelo para tudo;
- a Anthropic posiciona Fable para trabalho longo e ambicioso, com controles adicionais de segurança e fallback;
- a diferença de preço entre rotas ficou grande o bastante para tornar roteamento e evals parte da arquitetura, não uma otimização tardia;
- nenhum lançamento elimina contexto, ferramenta, sandbox, política, verificação ou julgamento humano.
A pergunta útil não é “qual modelo é melhor?”. É:
qual combinação produz o menor custo por outcome aceito, dentro do risco e da latência que esta tarefa permite?
O corte: fatos declarados pelos fornecedores
Os números abaixo foram relidos em fontes primárias no corte editorial. São dados dos próprios fornecedores, não validação independente da Trustyu.
| Rota | Posicionamento publicado | Entrada / 1M tokens | Saída / 1M tokens | Leitura inicial |
|---|---|---|---|---|
| GPT-5.6 Sol | trabalho profissional complexo e de fronteira | US$ 5,00 | US$ 30,00 | candidato para tarefas difíceis em que qualidade marginal pode pagar o custo |
| GPT-5.6 Terra | equilíbrio entre inteligência, velocidade e custo | US$ 2,00 | US$ 12,00 | candidato a rota padrão somente depois de vencer o baseline do produto |
| GPT-5.6 Luna | trabalho sensível a custo e alto volume | US$ 0,20 | US$ 1,20 | candidato a triagem, transformação e volume quando o critério de aceite continua preservado |
| Claude Fable 5 | trabalho longo e ambicioso, com safeguards e fallback | US$ 10,00 | US$ 50,00 | candidato a tarefas de horizonte longo que justifiquem custo, latência e política adicionais |
Fontes: guia do portfólio GPT-5.6, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Claude Fable e Transparency Hub da Anthropic.
Preço de lista ajuda a formular hipóteses. Não inclui cache, ferramentas, retries, revisão humana, plataforma, incidentes ou taxa de rejeição. Também não prova desempenho na sua distribuição de casos.
O que mudou de verdade
Portfólio virou decisão arquitetural
Quando a diferença entre Luna e Sol chega a ordens de grandeza, “usar o melhor modelo” deixa de ser política suficiente. Uma aplicação pode usar uma rota barata para classificação, uma rota equilibrada para execução frequente e uma rota de fronteira para exceções — desde que o roteador seja observável, testável e incapaz de ampliar autoridade silenciosamente.
Horizonte longo passou a ser produto, não promessa genérica
Fable reforça a competição por tarefas que atravessam etapas, ferramentas e períodos maiores. Isso importa para pesquisa, engenharia e operação. Mas duração não é progresso. Sem estado externo, handoff, orçamento, checkpoints e critérios de parada, uma execução longa só consegue errar por mais tempo.
Segurança entrou no posicionamento do modelo
Safeguards, fallback e controles do fornecedor são parte da avaliação. Não devem virar a fronteira de segurança da empresa. Identidade, capability, dados, rede, sandbox e aprovação continuam sob controle do sistema que usa o modelo.
O custo de coordenação ficou mais visível
Adicionar planner, executor, avaliador ou múltiplos modelos pode melhorar um caso e também aumentar materialmente custo e latência. A FORGE exige eval e ablação por tarefa antes de transformar qualquer camada em padrão. [HARNESS31-C3]
Por que não fixar “Architect = Fable” ou “Backend = Terra”
Papéis descrevem responsabilidade. Modelos oferecem capacidades que mudam com releases, preços, limites e políticas. Colar um nome de modelo a um papel produz três dívidas:
- obsolescência: o mapa envelhece assim que o portfólio muda;
- falsa segurança: escolha de modelo parece substituir capability e revisão;
- custo invisível: a rota é repetida sem comparar aceite, retries e intervenção.
O contrato mais durável é orquestrado:
tarefa + risco + dado + authority + orçamento + latência
↓
eval da rota candidata
↓
execução isolada + verificação
↓
outcome aceito + evidência + custo
O papel continua estável. A rota de modelo é versionada e pode mudar sem reescrever a organização.
Uma matriz de decisão que sobrevive ao próximo lançamento
Avalie cada rota candidata contra o mesmo conjunto de casos:
| Dimensão | Pergunta de gate | Evidência mínima |
|---|---|---|
| tarefa | que resultado delimitado precisa ser produzido? | spec e exemplos representativos |
| risco | qual dano uma resposta ou ação errada pode causar? | classe de risco e regra de escalonamento |
| dados | quais informações podem entrar e permanecer no provedor? | política, retenção e classificação |
| authority | o modelo apenas propõe ou também executa? | capabilities deny-by-default |
| qualidade | que diferença material existe contra o baseline? | eval cego com critério de aceite |
| custo | quanto custa a unidade aceita, não apenas a chamada? | tokens, ferramentas, retries e tempo humano |
| latência | a rota cabe no fluxo real? | p50, p95 e timeout por classe |
| verificabilidade | conseguimos explicar e reproduzir a aceitação? | logs, artefatos, digests e reviewer |
Nenhuma fonte externa define o threshold correto da FORGE ou de um produto específico. Baselines e limites precisam ser calibrados por caso de uso. [R3-C1]
Roteie pelo custo por outcome aceito
Uma comparação honesta usa o mesmo denominador:
modelo + contexto + ferramentas + plataforma + verificação
+ retries + retrabalho + intervenção + incidentes
------------------------------------------------------
outcomes aceitos
O framework oferece o método; a unidade de valor continua específica ao produto. [R3-C2]
Na prática, a rota mais barata pode gerar mais correção. A mais cara pode não produzir ganho material. O resultado somente aparece quando custo, qualidade e operação são medidos juntos.
Um protocolo de adoção em sete passos
- congele o conjunto de casos e o baseline atual;
- registre modelo, versão, parâmetros, política e data do teste;
- execute as rotas candidatas com a mesma authority e as mesmas ferramentas;
- avalie qualidade sem revelar o fornecedor quando isso for viável;
- meça taxa de aceite, retries, latência, intervenção e custo total;
- faça ablação de camadas — planner, evaluator, busca e memória — antes de mantê-las;
- promova uma política de roteamento versionada, com fallback, budget e rollback.
O objetivo não é eternizar o vencedor do corte. É tornar a próxima troca pequena, observável e reversível.
O que este Radar prova — e o que não prova
Este Radar prova que, no corte indicado, páginas oficiais publicavam o portfólio, preços e posicionamentos descritos. As fontes da OpenAI não são independentes entre si; as fontes da Anthropic também não. System cards e transparency reports melhoram a visibilidade do fornecedor, mas não substituem avaliação independente nem evidência do seu produto.
Não executamos benchmark comparativo próprio entre Sol, Terra, Luna e Fable nesta edição. Portanto, o Radar não afirma superioridade geral, ganho de produtividade, segurança operacional ou economia real para qualquer produto da Trustyu.
Validade editorial
| Campo | Compromisso desta edição |
|---|---|
| corte factual | 21 de agosto de 2026 |
| preços e disponibilidade | reler até 20 de setembro de 2026, no máximo |
| recomendação arquitetural | revisar até 19 de novembro de 2026, no máximo |
| revisão antecipada | novo preço, acesso, system card, política de dados ou resultado independente material |
| próxima edição | substitui esta leitura; a edição anterior permanece arquivada e datada |
Conclusão
Fable, Sol, Terra e Luna ampliam as opções. Não removem a responsabilidade de escolher, limitar, medir e verificar.
O sistema premium não é o que exibe o nome mais novo em cada card. É o que troca de modelo sem perder memória, política, segurança, evidência ou clareza de custo.
Leitura complementar: O modelo não é o sistema e Referências da FORGE.
Nota editorial e de responsabilidade
- Corte da pesquisa
- Última revisão
- Correções registradas
- Nenhuma correção registrada.
Este artigo combina fontes citadas, análise e experiência profissional do autor. Dados e afirmações factuais verificáveis estão vinculados às respectivas fontes. Interpretações, hipóteses, projeções, recomendações e opiniões representam o ponto de vista profissional do autor no momento da publicação; não constituem fatos comprovados, promessa de resultado nem aconselhamento jurídico, financeiro ou técnico aplicável a um caso específico. Consulte as fontes originais e profissionais habilitados antes de tomar decisões.
Claims e fontes
HARNESS31-C3
Anthropic reports that planner, generator and evaluator layers improved a long-running application result while materially increasing cost and latency; FORGE should require task-specific evals and ablation before making such layers mandatory.
Limite: This is a provider experiment tied to a selected model, benchmark and application task; it cannot prove universal superiority of multi-agent or evaluator layers. This is a source-bound design input; it does not prove product adoption, operational maturity, independent attestation, search ranking, AI citation or outcome.
- Anthropic — Anthropic, proprietary-site-terms
R3-C1
An AI quality claim requires explicit eval criteria and observable execution evidence; traces alone and subjective inspection alone are incomplete.
Limite: Neither source defines FORGE-specific pass thresholds; baselines must be calibrated per use case. This is a research-synthesis design input; it does not prove product adoption, operational maturity, independent attestation or outcome.
R3-C2
Useful AI observability must connect technical telemetry to a unit of value and its cost, instead of optimizing aggregate spend without an outcome denominator.
Limite: A unit must be product-specific; this framework-only run measures intake cost but not customer outcome. This is a research-synthesis design input; it does not prove product adoption, operational maturity, independent attestation or outcome.
- OpenTelemetry — OpenTelemetry, CC-BY-4.0 documentation; analysis-only excerpts
- FinOps Foundation — FinOps Foundation, CC-BY-4.0 framework; analysis-only excerpts