Cobertura del mecanismo
7.9 / 1038 / 48
FORGE 3.2 · revisión del 6 sep 2026
Después de Brownfield, la evolución abarca specs duraderas, trabajo multiagente, gobernanza verificable e integridad del pipeline. El siguiente paso es demostrar que estos controles llegan a cada consumidor y protegen la entrega.
Conciliar capacidades, datos y riesgos antes de decidir qué preservar, consolidar o reconstruir.
Specs persistentes, puestos por máquina, auditorías de organización, PRs por bot y verificadores más rigurosos.
Medir el cuerpo ejecutado, cerrar gates por consumidor y ejercitar despliegue, recuperación y telemetría con límites de datos.
Revisión de base que fundamentó FORGE 3.3; no es su calificación. La recomendación integrada Brownfield sigue suspendida; revisión ejecutada no significa aprobación.
Autoevaluación editorial: 12 dimensiones con igual peso y dos escalas independientes. Las notas no son certificación, percentiles de mercado ni porcentajes de finalización.
38 / 48
20 / 48
Cobertura: 0 sin material localizado; 1 intención/propuesta; 2 contrato documentado; 3 implementación identificada; 4 implementación y pruebas identificadas en el alcance. Una nota alta no prueba despliegue universal.
Evidencia: 0 sin prueba elegible localizada; 1 local, sintética o parcial; 2 ejecución remota acotada; 3 cadena acotada con validación registrada entre componentes; 4 medición longitudinal y verificación independiente de eficacia. La duda o falta de acceso limita la nota, no demuestra inexistencia.
Cada índice = suma de notas ÷ 48 × 10, redondeada a un decimal. Las 12 dimensiones reorganizan el método; no sustituyen los 23 ejes editoriales del inventario de agosto.
Cinco repositorios centrales, 88 workflows y 215 referencias externas de Actions: 215 fijadas a valores SHA completos; otras 25 referencias son locales. Es una inspección sintáctica de archivos fijados, no un censo de la organización ni prueba de ejecución.
Se verificaron fuentes internas mediante commits, ADRs, issues y ejecuciones. No se inspeccionaron las conversaciones completas de Claude Code. La base interna tiene acceso restringido; este resumen público por sí solo no permite reproducir todas las conclusiones. Las fuentes de mercado son primarias y accesibles.
Mapas, instrucciones generadas, recuentos y verificación de enlaces reducen la deriva documental.
Existen verificadores y ejecuciones remotas acotadas; faltan series longitudinales sobre cobertura de contexto e impacto en calidad.
Base interna restringida: Docs · ADR-0074, canon-check, PRs 698/699
Referencia de comparación: OpenAI · Harness engineering · DORA · AI Capabilities Report 2025
Specs duraderas, trazabilidad y rechazo de corpus vacíos fortalecen la evaluación del cambio.
Se observó una ejecución SDD como ineligible-shadow. La propagación del guard y los resultados reales de agentes requieren evidencia por consumidor.
Base interna restringida: Docs · ADR-0074; Infra · PR 625; SCORE · SDD119
Referencia de comparación: Anthropic · Demystifying evals for AI agents · OpenAI · Harness engineering · NIST · SP 800-218A
Worktrees canónicos, puestos por máquina y fleet-doctor abordan colisiones y entornos divergentes.
El aislamiento de directorios no es un sandbox del sistema operativo. Faltan métricas longitudinales de colisiones y recuperación.
Base interna restringida: Docs · ADR-0076/0079; AI Env · PR 187
Referencia de comparación: OpenAI · Harness engineering · NIST · SSDF 1.1
Invariantes de organización, matrices por repositorio y auditorías con caché distinguen desviaciones, excepciones y lecturas denegadas.
Pasaron 372 pruebas locales. La observación remota conserva avisos y lecturas parciales: un workflow verde no es conformidad integral.
Base interna restringida: Docs · ADR-0081; run 34055858909; suite local 6 sep
Referencia de comparación: NIST · SSDF 1.1 · OpenSSF · Scorecard checks
Cancelaciones, veredictos obsoletos y escáneres sin entrada recibieron tratamiento de fallo explícito.
El cuerpo invocado, los checks requeridos y el SHA entregado deben converger. Esta revisión no demostró propagación completa.
Base interna restringida: Infra · PRs 597/599/600/617; Docs · ADR-0082 propuesta
Referencia de comparación: GitHub · Secure use of Actions · OpenSSF · Scorecard checks
PRs de bot y releases por PR separan autoría, revisión y publicación. Una revisión omitida dejó de contar como revisión.
La actividad de revisión no prueba aprobación sustantiva independiente. Las excepciones y la cobertura de gates limitan la garantía.
Base interna restringida: Infra · PRs 620/631; Template · PR 322; ADR-0080 propuesta
Referencia de comparación: OpenSSF · Scorecard checks · NIST · SSDF 1.1
La base 0.20.1 tiene verificación registrada; 0.21.0 se publicó con metadato de inmutabilidad nativa. Las referencias externas de Actions están fijadas en el alcance inspeccionado.
La nota de evidencia incluye la cadena histórica acotada, no una nueva verificación de firma de 0.21.0. Pins y firmas no otorgan un nivel SLSA ni prueban adopción de la flota.
Base interna restringida: Release 0.20.1 · registro público; Infra · release 0.21.0
Referencia de comparación: SLSA · Specification 1.2 · GitHub · Secure use of Actions
Caracterización, conciliación, decisiones de destino, olas reversibles y retirada tienen contratos y pruebas adversariales.
Hubo revisión independiente, pero la aprobación integrada sigue retenida. No se afirma ningún piloto real ni migración de cliente.
Base interna restringida: Docs · ADR-0075; calificación v3; issues 563/584
Referencia de comparación: NIST · SSDF 1.1 · DORA · AI Capabilities Report 2025
Las políticas de herramientas, la provenance y los límites de permisos forman parte del método; las imágenes reforzadas tienen un estándar específico.
Auto mode no equivale a un sandbox. No se demostraron globalmente enforcement adversarial de extremo a extremo ni despliegue de imágenes.
Base interna restringida: Docs · ADR-0047/0049/0078; hardened-base-images
Referencia de comparación: OWASP · Agent Control Standard · MCP · Authorization security considerations · NIST · SP 800-218A
La base histórica conserva trazas y receipts. La nueva propuesta de telemetría exige clasificación de datos y una decisión de perímetro antes de instalar.
La ADR-0083 sigue propuesta. Esta revisión no demuestra telemetría longitudinal integrada ni autoriza automáticamente recopilar prompts.
Base interna restringida: Docs · ADR-0054; ADR-0083 propuesta
Referencia de comparación: Anthropic · Demystifying evals for AI agents · NIST · SP 800-218A · MCP · Authorization security considerations
Presupuestos, menos llamadas, caché condicional y workflows reutilizables abordan desperdicio de infraestructura.
Menos llamadas no equivalen a retorno de negocio. Coste por cambio aceptado, retrabajo y calidad necesitan el mismo denominador.
Base interna restringida: Docs · ADR-0027; auditoría con caché; Infra · reusable workflows
Referencia de comparación: DORA · AI Capabilities Report 2025 · DORA · Software delivery performance metrics
Readiness, evidencia de despliegue y rollback tienen contratos; la revisión reciente expuso diferencias entre documentación y automatización efectiva.
Se deben vincular merge, artifact y despliegue y ejercitar recuperación. Aquí no se midieron las cinco métricas DORA por servicio.
Base interna restringida: Docs · auditoría CI/CD 705/707; corrección documental 725 integrada, sin rollback automático
Referencia de comparación: DORA · Software delivery performance metrics · NIST · SSDF 1.1
El método converge con harness engineering, desarrollo seguro, provenance y evaluaciones de resultados. La brecha principal está en la eficacia demostrada: controles realmente exigidos, recuperación ejercitada y calidad y coste por cambio aceptado. Sin una muestra comparable de otras organizaciones, no hay base para afirmar superioridad mundial.
DORA usa cinco métricas de entrega: lead time del cambio, frecuencia de despliegue, tiempo de recuperación de despliegue fallido, tasa de fallo del cambio y tasa de retrabajo de despliegue. La comparación debe ser por aplicación o servicio; la actividad de agentes y el volumen de commits no sustituyen estos resultados. DORA
Vincular fuente, artifact, checks y despliegue; probar que un fallo relevante bloquea la entrega. Ensayar rollback y registrar tiempo y estado recuperado.
Medir capacidades por contenido ejecutado, no por etiquetas de pins. Definir excepciones con responsable y plazo y demostrar revisión independiente por clase de riesgo.
Resolver las decisiones humanas pendientes de Brownfield, revalidar la cadena convergente y registrar la decisión. Después, ejecutar solo el piloto autorizado y medir las cinco métricas DORA, coste y calidad dentro de un perímetro de datos aprobado.
Las referencias orientan los criterios; no certifican FORGE. No se evaluó un nivel SLSA, no se ejecutó OpenSSF Scorecard ni se implantó el nuevo OWASP ACS en esta revisión.