Objetivo: reducir el plazo de entrega con control
El trabajo repetible se puede automatizar; Las decisiones comerciales, arquitectónicas y de riesgo permanecen bajo la responsabilidad de la alta dirección.
conocimiento humano + inteligencia artificial.
Juicio para decidir. IA para crecer.
Organizamos el conocimiento de mercado, el trabajo asistido por IA y el liderazgo sénior en un proceso verificable. Los resultados, la seguridad y la escala se califican mediante la evidencia de cada producto.
Estas cuatro categorías guían el descubrimiento y el diseño de productos. La idoneidad, la adopción y los resultados comerciales deben validarse en cada contexto.
Tratamos la supervisión, la arquitectura y la evidencia como partes del sistema. La investigación source-bound respalda este diseño; no promete una tasa de ganancia universal ni reemplaza la validación del producto.
Juicio estratégico, experiencia en el dominio, decisiones arquitectónicas, responsabilidad.
Seguridad por diseño, multi-tenancy y cumplimiento como decisiones versionadas para una evolución duradera.
Humano en el loop en los puntos críticos. Pruebas antes del código. Evidencia antes de declarar algo listo.
Los agentes pueden realizar un trabajo repetible dentro de una especificación, límites de capacidad y comentarios verificables.
Los estándares, las pruebas y los receipts hacen que el resultado sea inspeccionable; la consistencia sigue midiéndose, no se presume.
El Template ofrece defaults; cada producto aún necesita demostrar su adopción y sus resultados en el propio SHA.
La capacidad del modelo no reemplaza el aislamiento, el privilegio mínimo, las pruebas, la provenance y la revisión de acciones irreversibles.
La adopción segura depende de un workflow explícito, cambios revisables y decisiones duraderas; un mejor prompt no reemplaza el harness.
La calidad requiere criterios de eval y ejecución observable; El costo sólo es útil cuando se vincula a una unidad de valor del producto.
Loop spec-driven definido como default de Template. Desde la ADR-0068, convención de rama, pie de página de origen y asiento de sesión ya no son advertencias y ahora son bloqueantes dentro del gate permanente. La cobertura de cada producto sigue declarándose mediante evidence vinculada a su propio SHA.
Por qué un DoD formal cambia el juego: La IA sin un oráculo corrector inventa una salida. Con SPEC→RED→GREEN, la IA tiene un objetivo verificable: no un código que parece correcto, sino pruebas que demuestran que es correcto.
Protección fuera de alcance: cada característica declara lo que no hace. Elimina el desplazamiento del alcance y evita que la IA expanda el alcance por sí sola.
Las prácticas de arquitectura, seguridad y entrega se traducen en valores predeterminados y controles. La adopción y los resultados siguen dependiendo de la evidencia de cada producto.
Seis fases forman el ciclo predeterminado. El producto sólo avanza cuando su evidencia cumple con los criterios aplicables; el humano mantiene la decisión.
Por qué es importante este ciclo: El dominio, la arquitectura y la infraestructura se explican antes de escalar. La reducción de costes de retrabajo y mantenimiento son hipótesis a medir por producto.
El protocolo modela agentes por rol, herramientas permitidas, bucle y asiento. SQ. El siguiente diagrama describe el mecanismo; la adopción y el resultado dependen de la ejecución observada.
El rol define responsabilidad y capacidad; el modelo se selecciona por tarea. Los nombres, precios y estados de los modelos se encuentran en la modelos fechados por radar.
El catálogo asocia rol, comportamiento esperado, guardrails, DoD y eval-harness. El inventario y la adopción se verifican en el corte aplicable.
Catálogo · Basado en evalEl riesgo, la complejidad, la eval, el costo y la latencia deciden el nivel. El modelo concreto puede cambiar sin reescribir los roles, herramientas o gates del escuadrón.
Política estable · catálogo en vivoTrabajo previo obligatorio, sucursales nombradas, relaciones públicas identificadas, árboles de trabajo aislados y asientos de sesión. Coordenada D1–D5 · D6 aislar · D7 identificar.
D1-D7 · MultisesiónEjecuta SPEC→SELF-VERIFY de forma autónoma, pero escala a humanos en especificaciones ambiguas, decisión estructural sin ADR ni acceso a PRD.
HITL · Gates explícitasEl andamio proporciona una base reutilizable. Cada producto debe demostrar adopción, configuración y cumplimiento en su propio repositorio y SHA.
La canalización, la cadena de suministro, el runtime y los datos reciben controles de referencia. El consumidor debe demostrar presencia, configuración y cumplimiento.
Predeterminado · 5 capasEl esquema, los roles y la identidad en JWT son parte del valor predeterminado. El aislamiento es una propiedad a probar en el contexto del producto.
Valor predeterminado de aislamientoSemVer y VersionBadge son los valores predeterminados. Desde ADR-0064, la sucursal staging está justificado por tener un entorno de ensayo implementado, no por tipo de repositorio: los que publican por etiqueta o SHA van desde feature → main. La disponibilidad y FinOps requieren medición en el entorno del consumidor.
Las especificaciones, evidencia y cobertura de riesgos se incluyen por defecto; La ejecución sólo se declara con la evidencia del consumidor.
Template defaultEl producto nace internacionalizado. pt-BR predeterminado, secundaria en-US. Anulación por cliente a través del banco: sin reconstrucción.
Pt-BR · es-USEl perfil seguro de privacidad de OTel GenAI y el verificador source-bound se integran en el runtime 0.18; el manifiesto SHA256SUMS tiene la firma verificable Ed25519. La telemetría real del producto requiere rollout y evidencia.
OTel GenAI · ShadowEl diseño utiliza defensa en profundidad: cada capa tiene su propio control y boundary. ADR y Template definen el default; cada producto debe demostrar que el control está presente y es eficaz.
Un incidente histórico de almacenamiento en caché entre entornos generó tres invariantes de referencia: aislamiento del entorno, aislamiento de tenants y defensa en profundidad. El aprendizaje se codificó en ADR; cada producto aún debe demostrar su adopción.
Los modelos y proveedores cambian rápidamente. La arquitectura propone separar el comportamiento del producto y del proveedor; Las rutas reales requieren evals, telemetría y evidencia de producto.
LLMFactory es el mecanismo propuesto para separar comportamiento y proveedor; Se debe probar la portabilidad.
El esquema y la telemetría son objetivos. La facturación oficial, la conciliación y la unidad de valor aún requieren evidencia del producto.
Los gates ante acciones irreversibles son parte del diseño; La ejecución se verifica por tarea.
La incorporación de aislamiento y herencia de conocimientos son valores predeterminados sujetos a pruebas de tenants.
El recorte público aprobado no respalda la TAM, la CAGR ni la productividad comercial universal. Es por eso que estos números abandonan la página hasta que pasan por la revisión de intake y licencia.
Lo que este corte nos permite decir: La confiabilidad, la seguridad, la provenance, las evals y el costo deben ser propiedades del sistema.. Los resultados comerciales y la adopción de productos quedan fuera de esta evidencia.
La pregunta no es sólo “¿qué IA usar?” Y cómo acelerar sin convertir a los clientes, los datos y la inversión en un experimento. FORGE organiza personas, decisiones, controles y evidencia en torno a la IA para que el producto evolucione sin perder sus bases.
El trabajo repetible se puede automatizar; Las decisiones comerciales, arquitectónicas y de riesgo permanecen bajo la responsabilidad de la alta dirección.
La separación entre dominio y proveedor es un mecanismo arquitectónico; La portabilidad requiere pruebas del producto.
Los requisitos, pruebas, aprobaciones y releases solo se pueden reconstruir cuando se vinculan a la fuente, SHA y la persona responsable.
El circuito cerrado prevé que las lecciones vuelvan al método como prueba, control o regla; Es necesario medir la eficacia.
La síntesis pública se deriva únicamente de la proyección aprobada. Las fuentes externas pasan por intake, hash, revisión de uso y receipt; un enlace de descubrimiento, por sí solo, no sustenta un claim.
Investigación realizada, no sólo citada. En el corte de RC, 20 fuentes aprobadas de 12 grupos independientes respaldaron 20 recibos verificables, tres estudios y nueve claims rastreables, sin persistir contenido externo sin procesar. Inspeccionar el registro público →
En ese corte se registró la readiness únicamente del marco. Demuestra el mecanismo y la disponibilidad de la base de entonces, no la cobertura, los contratos ni el funcionamiento de cada producto actual.
rollout 3.1: Los defaults de Template, las observaciones piloto y la calificación operacional permanecen como estados separados. Operational y Attested no están declarados.
Las organizaciones citadas son fuentes públicas de investigación y prácticas de mercado; no existe ninguna afirmación de asociación, certificación o respaldo. corte actual source-bound: 4 de agosto de 2026 · 03:27 UTC. Histórico del marco de readiness únicamente conciliado el 19 de julio de 2026.
Esta es la tabla técnica publicada originalmente en la página de inicio y conservada en el benchmark. Compara capacidades, procesos y controles con el consenso del mercado. Los 17 veredictos pertenecen al histórico corte del 17 de julio; FORGE 3.1 aparece por separado para no transformar la especificación o la shadow en prueba operativa.
Las fuentes primarias y normativas definen qué observar en contexto, seguridad, evals, evidencia, operación y costo. No representan asociación ni certificación.
Los Templates P1–P6, ADR, principios de arquitectura, la squad y los productos reales formaron la base. El período es cualitativo: no recibió una columna ni una puntuación retroactiva.
Las habilidades, los árboles de trabajo, SPEC→PR, revisión-remediación, ganchos, MCP, seguridad y FinOps hicieron que el proceso fuera comparable; la transición 2.1 agregó controles y readiness.
Las coberturas, contratos y harness se definen como evidencia por riesgo y SHA. Fleet Enforced, Operational y Attested permanecen fuera del claim publicado.
Cómo leer: la escala —/D/C/V/A/O significa ausente, documentado, controlado, verificado, atestiguado y en funcionamiento. El estado actual de 3.1 no vuelve a calcular silenciosamente un benchmark congelado.
Método abierto, fuentes y evidencia →| Eje | Consenso de mercado 2025-2026 | Forge 2.0 | Forge 2.1 | Corte Forge 3.0 · 17 jul | Veredicto histórico |
|---|---|---|---|---|---|
| Ingeniería de contexto | Mapa breve, conocimiento versionado, divulgación progresiva y frescura mecánica. | CADR, habilidades e instrucciones sólidos pero extensos. |
VPresupuestos, fragmentos, historial y registro de capacidades. |
VMecánica de verificación de canon y divulgación progresiva. |
FuerteLo que queda es una deriva semántica entre anclas y estado de vida. |
| ADR y estado de vida | Decisión persistente/reemplazada; estado operativo actual separado. | DDecisiones versionadas, estatus con deriva residual. |
CCatálogo de gobernanza y estado de vida. |
C0039/0040 conciliado y sometido a ratificación. |
AlineadoLa frescura semántica todavía requiere revisión humana. |
| Controles ejecutables | Titular, aplicabilidad, prueba, ejecución, excepción y plazo. | DReglas distribuidas entre ADR y CI. |
CCatálogo y perfiles deterministas. |
V14 controles, hechos diff y evidencia explícita. |
ArribaFalta acreditar cobertura en cada cambio real aplicable. |
| Desarrollo impulsado por especificaciones | Especificar como fuente, fuera de alcance, contratos antes del código y trace hasta la aceptación. | CBucle SPEC→PR y Contrato-Primero. |
CGate y especificaciones de funciones estandarizadas. |
VTrace y verificadores independientes. |
FuerteMedir defectos y rework evitados, no el uso del Template. |
| Aislamiento de escritura | Una tarea/workspace/rama; lectura paralela; un solo escritor por artefacto. | CÁrbol de trabajo por característica y protocolo D5/D6. |
CAsientos y lista explícitos. |
VSuperposición, titularidad y desmontaje de guardas. |
FuerteRegistro de desmontaje en cada tarea real. |
| Sandbox y privilegios mínimos | FS, red, secretos y herramientas por tarea; denegación por defecto; credencial corta; HITL. | DAislamiento de barandillas y árboles de trabajo. |
CPerfiles de riesgo y capacidades. |
CHub #683 y CRM #1621 aprobaron la provenance sin aprobar el agregado; #688 falló. |
ParcialFalta de gate global aprobada, aprobaciones/capacidades y cobertura longitudinal. |
| Gobernanza de herramienta/MCP | Herramientas mínimas, esquemas claros, alcances, lista de permitidos y auditabilidad. | CMCP canónico e inventario por repositorio. |
CActivación por contexto y fase. |
VEnrutamiento de capacidades y contratos validados. |
AlineadoPruebe el perfil de la herramienta por tarea y controle el costo del contexto. |
| evals de IA | Modelo + harness + entorno; ensayos aislados; graders calibradas; Costo y latencia. | Deval-harness en parte de las habilidades. |
CBaseline de cambio de IA y gates. |
VCorpus técnico 12/12 con enlace fuente/perfil/SHA. |
FuerteEscale hasta 20-50 fallas reales y mida el costo por tarea. |
| Pruebas y atestación | El ejecutor no da fe de sí mismo; enlace de fuente/SHA/perfil; artefacto verificable. | DEvidencia heterogénea sobre IC y PR. |
CContratos de evidencia y provenance definida. |
CManifiesto SHA256SUMS de runtime 0.8 con firma Ed25519; fixture sintética 6/6 Verified; Observer EVD=2/5 y VER=2/9. |
ParcialFalta pack real, cobertura ≥95%, gate global homologada y ventana longitudinal. |
| cadena de suministro | Bloqueo/pin inmutable, SBOM, provenance, constructor confiable y verificación. | CBloqueos, escaneos y acciones parcialmente fijados. |
CRecolectores de línea de base y evidencia. |
VManifiesto SHA256SUMS 0.8 con firma Ed25519 y 9 assets inventariados; Template fijado con rollback 0.7. |
FuerteNo declare el nivel SLSA sin cumplir todos los requisitos. |
| readiness, SLO y reversión | SLI/SLO, presupuesto de errores, reversión probada, runbook y condición de parada. | Dreadiness principalmente manual. |
CSLO, cuadro de mando y gates definidas. |
CObservador firmado: 11 cambios en 2 días; ventana abierta. |
ParcialRequiere ≥20 cambios, 30 días, estabilidad y ejercicios piloto. |
| Aprendizaje de circuito cerrado | La revisión o incidencia se convierte en prueba, eval, control o mejora duradera. | CRevisar-remediar y versionar el historial. |
CRegistros de aprendizaje y propiedad. |
VLa retroalimentación produce controles, evals y regresiones probados. |
AlineadoMedida de recurrencia evitada y efectividad, no número de registros. |
| FinOps y economía unitaria | Costo por unidad de valor/resultado, atención humana y denegación de billetera. | COmisión de implementación y costo por producto. |
CPresupuestos por sucursal, agente y gate. |
CM15: Acciones −47,20%/día; minutos por cambio +28,27%. |
Arriba en la gobernanzaObjetivo incumplido por 2,80 p.p.; la eficiencia de la unidad retrocedió; Modelos faltantes y tiempo humano. |
| Roles sénior y control humano | Senior define intención, riesgo y gusto; autonomía proporcional y aprobaciones claras. | DPersonas y roles de escuadrón. |
CActivación por riesgo/fase y gates humanos. |
CPropietario y decisión explícitos; aprobador técnico único. |
Alineado con la advertenciaEl fundador/CTO es hoy el único aprobador técnico real. |
| Observabilidad agente | Abarca modelos/herramientas, resultados, tokens, costos, políticas y privacidad. | DTelemetría desglosada por producto. |
CEsquema de receipts y métricas de harness. |
CSubconjunto de seguridad de privacidad de OTel GenAI en runtime 0.8, cubierto por el manifiesto SHA256SUMS firmado. |
AtrásFalta la telemetría del producto real vinculada a tokens/costo/resultado/receipt. |
| provenance/closeout de la emisión | Autoría, decisión, implementación, validación y residual reconstruible. | DLiquidaciones inconsistentes y registros no probados. |
DProblema reconocido, aún no hay gate común. |
CADR-0051 y gate de closeout en canónico. |
Arriba en el contrato.Parcial en la flota; La propagación se producirá por contacto normal. |
| Adopción y aseguramiento externo | Usuario independiente, paquete/licencia, soporte, actualización/reversión y paquete de evidencia. | —Sin producto de marco externo. |
DEstrategia de extracción documentada. |
DConformidad/EEP inventariado por el manifiesto SHA256SUMS firmado en 0.8; sin adoptantes externos. |
AtrásNo habrá adoptantes externos independientes hasta que se corte. |
Este sitio sólo publica lo que el artefacto correspondiente le permite concluir. La calificación del producto 3.1 permanece pendiente hasta que la evidencia se vincule al repositorio, el perfil y el SHA.
Las siguientes verticales son hipótesis de aplicación y roadmap. Ninguna representa adopción, operación ni resultados comprobados en este corte público.
No creemos en el reemplazo humano. El objetivo es combinar conducción senior, IA, DoD formal y roles especializados; Las ganancias y los resultados deben medirse en el contexto de cada producto.
Reunimos conocimientos de dominio y de ingeniería para especificar, construir y medir un producto en el contexto de su mercado.