Lectura ejecutiva · ~60 segundos
La cartera ha cambiado, pero la decisión duradera sigue basándose en la tarea, el riesgo, authority, el costo por outcome aceptado, evals y la evidencia, nunca en una función fija por modelo.
En pocas semanas, los nombres de los modelos, los precios y las narrativas de capacidad cambiaron otra vez. La reacción fácil es actualizar un ranking y sustituir el modelo asignado a cada rol de la squad. La reacción responsable es verificar qué cambió, separar las afirmaciones del proveedor de la evidencia y recalcular la ruta de ejecución para cada tarea.
Este es el Radar Vivo FORGE 2026/T3 — edición 01. No elige un ganador universal. Registra un recorte de tiempo y transforma las novedades del portafolio en decisiones comprobables.
Resumen ejecutivo
El corte del 21 de agosto de 2026 muestra cuatro movimientos relevantes:
- OpenAI ahora presenta Sol, Terra y Luna como un portafolio de frontera, equilibrio y volumen, no como un modelo único para todo;
- Anthropic posiciona Fable para trabajo largo y ambicioso, con controles adicionales de seguridad y fallback;
- la diferencia de precio entre rutas se volvió lo suficientemente grande como para que el enrutamiento y el evals fueran parte de la arquitectura, no una optimización tardía;
- ninguna versión elimina el contexto, la herramienta, sandbox, la política, la verificación o el juicio humano.
La pregunta útil no es «¿qué modelo es mejor?». Es:
¿Qué combinación produce el menor costo por outcome aceptado, dentro del riesgo y latencia que permite esta tarea?
El corte: hechos declarados por los proveedores
Los números a continuación fueron releídos de fuentes primarias en el corte editorial. Estos son datos de los propios proveedores, no una validación independiente de Trustyu.
| Ruta | Posicionamiento publicado | Entrada / 1M tokens | Salida / 1M tokens | Lectura inicial |
|---|---|---|---|---|
| GPT-5.6 Sol | trabajo profesional complejo y de frontera | US$ 5,00 | US$ 30,00 | Candidato para tareas difíciles donde la calidad marginal puede pagar el costo. |
| GPT-5.6 Terra | equilibrio entre inteligencia, velocidad y coste | US$ 2,00 | US$ 12,00 | Candidato de ruta predeterminado solo después del producto ganador baseline |
| GPT-5.6 Luna | trabajo de gran volumen y sensible a los costos | $0.20 | $1.20 | candidato para cribado, transformación y volumen cuando se mantengan los criterios de aceptación |
| Claude Fable 5 | Trabajo largo y ambicioso, con safeguards y fallback. | US$ 10,00 | US$ 50,00 | candidato para tareas de largo plazo que justifican costos, latencia y políticas adicionales |
Fuentes: Guía de cartera GPT-5.6, GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Claude Fable y Transparency Hub de Anthropic.
El precio de lista ayuda a formular hipótesis. No incluye caché, herramientas, retries, revisión humana, plataforma, incidentes ni tasa de rechazo. Tampoco prueba el rendimiento en su distribución de casos.
lo que realmente cambió
El portafolio se convirtió en una decisión arquitectónica
Cuando la diferencia entre Luna y Sol alcanza órdenes de magnitud, “usar el mejor modelo” ya no es una política suficiente. Una aplicación puede utilizar una ruta económica para la clasificación, una ruta equilibrada para la ejecución frecuente y una ruta límite para las excepciones, siempre que el enrutador sea observable, comprobable e incapaz de escalar la autoridad de forma silenciosa.
El largo horizonte se convirtió en un producto, no en una promesa genérica
Fable refuerza la competencia por tareas que abarcan etapas, herramientas y períodos más largos. Esto es importante para la investigación, la ingeniería y las operaciones. Pero la duración no es progreso. Sin estado externo, handoff, presupuesto, checkpoints y criterios de parada, un largo plazo sólo puede errar durante más tiempo.
La seguridad entró en el posicionamiento del modelo
Los safeguards, el fallback y los controles del proveedor forman parte de la evaluación. No deben convertirse en la frontera de seguridad de la empresa. Identidad, capability, datos, red, sandbox y aprobación siguen bajo el control del sistema que usa el modelo.
El coste de la coordinación se hizo más visible
Agregar un planner, ejecutor, evaluator o varios modelos puede mejorar un caso y también aumentar materialmente el coste y la latencia. FORGE exige evals y ablación por tarea antes de convertir cualquier capa en un patrón. [HARNESS31-C3]
¿Por qué no fijar "Architect=Fable" o "Backend=Terra"?
Los roles describen responsabilidad. Los modelos ofrecen capacidades que cambian con releases, precios, límites y políticas. Fijar el nombre de un modelo a un rol crea tres deudas:
- obsolescencia: el mapa envejece tan pronto como cambia la cartera;
- falsa seguridad: la elección del modelo parece reemplazar al capability y revisión;
- costo invisible: la ruta se repite sin comparar aceptación, retries e intervención.
El contrato más duradero está orquestado:
tarefa + risco + dado + authority + orçamento + latência
↓
eval da rota candidata
↓
execução isolada + verificação
↓
outcome aceito + evidência + custo
El rol permanece estable. La ruta del modelo está versionada y puede cambiar sin reescribir la organización.
Una matriz de decisiones que sobrevive al próximo lanzamiento
Evalúe cada ruta candidata frente al mismo conjunto de casos:
| Dimensión | Pregunta de gate | Evidencia mínima |
|---|---|---|
| tarea | ¿Qué resultado delimitado es necesario producir? | spec y ejemplos representativos |
| riesgo | ¿Qué daño puede causar una respuesta o acción incorrecta? | clase de riesgo y regla de escalada |
| datos | ¿Qué información puede entrar y permanecer con el proveedor? | política, retención y clasificación |
| autoridad | ¿El modelo sólo propone o también ejecuta? | capabilities deny-by-default |
| calidad | ¿Qué diferencia material hay con la baseline? | eval ciego con criterio de aceptación |
| costo | ¿Cuánto cuesta la unidad aceptada y no solo la llamada? | tokens, herramientas, retries y tiempo humano |
| latencia | ¿La ruta encaja en el flujo real? | p50, p95 y timeout por clase |
| verificabilidad | ¿Podemos explicar y reproducir la aceptación? | registros, artefactos, digests y reviewer |
Ninguna fuente externa define el threshold correcto del FORGE o un producto específico. Las líneas de base y los umbrales deben calibrarse por caso de uso. [R3-C1]
Ruta por costo por outcome aceptado
Una comparación honesta usa el mismo denominador:
modelo + contexto + ferramentas + plataforma + verificação
+ retries + retrabalho + intervenção + incidentes
------------------------------------------------------
outcomes aceitos
El framework ofrece el método; la unidad de valor sigue siendo específica del producto. [R3-C2]
En la práctica, la ruta más barata puede generar más corrección. Es posible que el más caro no produzca ganancias materiales. El resultado sólo aparece cuando se miden juntos costo, calidad y operación.
Un protocolo de adopción de siete pasos
- congelar el conjunto de casos y el baseline actual;
- registre modelo, versión, parámetros, política y fecha de la prueba;
- ejecutar las rutas candidatas con el mismo authority y las mismas herramientas;
- evaluar la calidad sin revelar al proveedor cuando esto sea factible;
- medir la tasa de aceptación, retries, latencia, intervención y costo total;
- eliminar capas (planner, evaluator, búsqueda y memoria) antes de conservarlas;
- promover una política de enrutamiento versionada, con fallback, budget y rollback.
El objetivo no es inmortalizar al ganador del corte. Se trata de hacer que el próximo cambio sea pequeño, observable y reversible.
Lo que este radar prueba y lo que no prueba
Este Radar establece que, en el corte indicado, las páginas oficiales publicaban el portafolio, los precios y el posicionamiento descritos. Las fuentes de OpenAI no son independientes entre sí; las de Anthropic tampoco. Los system cards y transparency reports mejoran la visibilidad del proveedor, pero no sustituyen una evaluación independiente ni la evidencia de su producto.
No realizamos nuestro propio punto de referencia comparativo entre Sol, Terra, Luna y Fable en esta edición. Por lo tanto, Radar no afirma superioridad general, ganancias de productividad, seguridad operativa ni ahorros reales para ningún producto Trustyu.
Validez editorial
| campo | Compromiso de esta edición |
|---|---|
| corte fáctico | 21 de agosto de 2026 |
| precios y disponibilidad | releído a más tardar el 20 de septiembre de 2026 |
| recomendación arquitectónica | revisión a más tardar el 19 de noviembre de 2026 |
| revisión temprana | nuevo precio, acceso, system card, política de datos o resultado independiente del material |
| próxima edición | reemplaza esta lectura; la edición anterior permanece archivada y fechada |
Conclusión
Fable, Sol, Terra y Luna amplían las opciones. No eliminan la responsabilidad de elegir, limitar, medir y verificar.
El sistema premium no es el que muestra el nombre más nuevo en cada tarjeta. Es lo que cambia los modelos sin perder memoria, políticas, seguridad, evidencia o claridad de costos.
Lectura adicional: El modelo no es el sistema. y Referencias de FORGE.
Nota editorial y de responsabilidad
- Corte de la investigación
- Última revisión
- Correcciones registradas
- No hay correcciones registradas.
Este artículo combina fuentes citadas, análisis y experiencia profesional del autor. Los datos verificables y las afirmaciones fácticas están vinculados a sus respectivas fuentes. Las interpretaciones, hipótesis, proyecciones, recomendaciones y opiniones representan el punto de vista profesional del autor en el momento de la publicación; no constituyen hechos probados, promesas de resultados ni asesoramiento jurídico, financiero o técnico aplicable a un caso concreto. Consulte las fuentes originales y a profesionales cualificados antes de tomar decisiones.
Claims y fuentes
HARNESS31-C3
Anthropic informa que las capas de planificador, generador y evaluador mejoraron el resultado de una aplicación de larga ejecución al tiempo que aumentaron materialmente el costo y la latencia; FORGE debería requerir evaluaciones y ablación específicas de la tarea antes de que dichas capas sean obligatorias.
Límite: Este es un experimento de proveedor vinculado a un modelo, punto de referencia y tarea de aplicación seleccionados; no puede probar la superioridad universal de las capas de múltiples agentes o evaluadores. Este es un input de diseño source-bound; no prueba la adopción del producto, la madurez operativa, la attestation independiente, la clasificación de búsqueda, la citación de IA o el resultado.
- Anthropic — Anthropic, términos de sitio propietario
R3-C1
Un claim de calidad de la IA requiere criterios de evaluación explícitos y evidencia de ejecución observable; las trazas por sí solas y la inspección subjetiva por sí sola son incompletas.
Límite: Ninguna fuente define umbrales de aprobación específicos de FORGE; Las líneas de base deben calibrarse por caso de uso. Este es un insumo de diseño de investigación-síntesis; no prueba la adopción del producto, la madurez operativa, la attestation independiente o el resultado.
R3-C2
Una observabilidad útil de la IA debe conectar la telemetría técnica con una unidad de valor y su costo, en lugar de optimizar el gasto agregado sin un denominador de resultado.
Límite: Una unidad debe ser específica de un producto; Esta ejecución basada únicamente en el marco mide el costo de intake, pero no el resultado del cliente. Este es un insumo de diseño de investigación-síntesis; no prueba la adopción del producto, la madurez operativa, la attestation independiente o el resultado.
- OpenTelemetry — OpenTelemetry, documentación CC-BY-4.0; extractos de solo análisis
- FinOps Fundación — Fundación FinOps, marco CC-BY-4.0; extractos de solo análisis