Lectura ejecutiva · ~60 segundos
La autonomía es la autoridad para actuar, no la inteligencia. El contrato debe variar según su efecto, reversibilidad, sensibilidad e incertidumbre; cuanto mayor es el riesgo, más explícitas deben ser las políticas, la verificación, la evidencia, la revocación y la aceptación humana.
"¿Cuánta autonomía deberíamos darle a la IA?" Parece una pregunta sobre la confianza en el modelo. En la práctica, se trata del sistema: qué acción puede ocurrir, sobre qué datos, en qué entorno, con qué efecto, reversibilidad, supervisión y evidencia.
Un mismo modelo puede recibir amplia autonomía para organizar notas personales y ninguna autoridad para aprobar crédito, publicar una promesa comercial o eliminar datos. La capacidad no determina el grant. La confianza declarada no sustituye el control.
Este artículo presenta una forma práctica de escalar la autonomía sin caer en los extremos de bloquear todo uso o entregar decisiones irreversibles a un ejecutor probabilístico.
Resumen ejecutivo
El NIST AI RMF organiza la gestión de riesgos como una actividad continua a lo largo del ciclo de vida, con una gobernanza que abarca el mapeo, la medición y la gestión. También recomienda diferenciar roles y responsabilidades en entornos humanos-IA. EL OWASP AISVS, por otro lado, ofrece requisitos de seguridad comprobables para sistemas habilitados para IA. Ninguno proporciona autorización universal para un agente específico; el perfil exacto sigue dependiendo del entorno y del modelo de amenaza. [R2-C1] [R2-C3]
La propuesta FORGE consiste en vincular la autonomía a cuatro ejes: efecto, reversibilidad, sensibilidad e incertidumbre. Cuanto más grande sea cualquier eje, más explícitas deben ser las políticas, la verificación, la evidencia y el gate humano. El humano no necesita hacer clic en todo; necesita conservar la autoridad cuando el error es difícil de detectar, atribuir o revertir.
Autonomía no es inteligencia
La inteligencia describe la capacidad de producir o seleccionar acciones. La autonomía describe la autoridad para ejecutarlos sin una nueva aprobación. Mezclar los dos crea el argumento peligroso: “el modelo ha mejorado, por lo que puede hacer más”.
La promoción responsable pide:
- ¿Conoce el sistema el límite de tareas?
- ¿Es verificable la identidad de ejecución?
- ¿Lista permitida de uso de datos y herramientas?
- ¿Existe un presupuesto para la acción, el tiempo y el costo?
- ¿Es el efecto observable y reversible?
- ¿Se detectan fallas críticas antes de salir de la frontera?
- ¿Quién acepta el riesgo residual?
El modelo participa en la ejecución. La organización sigue siendo propietaria de la autoridad.
Los cuatro ejes de acción del riesgo
Efecto
Una sugerencia privada y un mensaje enviado al cliente no tienen el mismo efecto. Lea, escriba, publique, realice transacciones y destruya como clases diferentes, incluso cuando pertenezcan al mismo flujo.
Reversibilidad
Revertir un borrador es simple. Recuperar un secreto expuesto, una transferencia financiera o una decisión regulatoria puede resultar imposible. Cuanto más pequeña sea la ventana de reversión, antes debería aparecer el gate.
Sensibilidad
Los datos públicos, internos, personales, financieros, legales y de credenciales requieren límites distintos. El acceso a los datos no implica permiso para transformarlos o enviarlos.
Incertidumbre
Las tareas con criterios objetivos y un entorno estable respaldan una mayor automatización. La ambigüedad, las excepciones, el cambio de contexto y la evaluación subjetiva aumentan la necesidad de contención y muestreo humanos.
Una escala operativa de cinco niveles
| Nivel | Autoridad de IA | Ejemplo | Gate mínima |
|---|---|---|---|
| 0 | observar | leer los datos permitidos y explicar | registro y minimización |
| 1 | proponer | crear borrador o plan | revisión antes del efecto |
| 2 | realizar reversible | cambiar rama o sandbox | corrector + revertir |
| 3 | correr limitado | actuar externamente en la lista de permitidos | política, límite y muestreo humano |
| 4 | ejecutar crítico | efecto sensible o irreversible | aprobación humana nominal y evidencia sólida |
El nivel 4 no significa "prohibido para siempre". Significa que la ejecución autónoma no es la opción predeterminada. Para reducir el gate, el sistema debe demostrar controles, historial y capacidad para detectar fallas en el alcance exacto, no solo presentar un modelo más nuevo.
El contrato de autonomía
Antes de entregar una herramienta al agente, registre:
| campo | Pregunta |
|---|---|
| Subject | ¿Qué agente, versión, tenant y sesión? |
| Objetivo | ¿Qué resultado delimitado puedes perseguir? |
| Capacidades | ¿Qué herramientas, operaciones y destinos? |
| Datos | ¿Qué clases se pueden leer, escribir o enviar? |
| presupuesto | ¿Cuántas acciones, tiempo, costo y profundidad? |
| Condiciones de parada | ¿Cuándo deberías parar, pedir ayuda o fracasar cerrado? |
| Verificación | ¿Qué debe volverse verde antes de que entre en vigor? |
| evidencia | ¿Qué trace, diff, receipt y decisión se conservarán? |
| Revocación | ¿Cómo quitar autoridad durante la ejecución? |
El contrato debe ser legible para el negocio y ejecutable mediante tecnología. “Usar el sentido común” no es una política.
Gates humanos que realmente ayudan
Un gate humano mal diseñado transfiere ruido: docenas de aprobaciones, contexto insuficiente y presión para hacer clic. El objetivo no es maximizar los clics; es colocar el juicio en el punto donde cambia la decisión.
Una buena solicitud de aprobación muestra:
- acción propuesta y destinatario;
- motivo y pruebas utilizadas;
- datos que saldrán de la frontera;
- alternativas consideradas;
- efectos esperados y retroceso;
- controles ya realizados;
- riesgo residual que la persona está aceptando.
Si la persona necesita reconstruir toda la obra, el agente no ha preparado una decisión; Acabo de enviar una tarea.
Shadow ante autoridad
Para flujos relevantes para el riesgo, ejecute primero sin efectos externos. Compare la acción propuesta con el proceso real, registre divergencias y condiciones de parada de prueba. Shadow produce evidencia sin promover implícitamente la autoridad.
Una secuencia madura podría ser:
- repetición en partido sintético;
- sombra con datos permitidos y sin efecto;
- ejecución reversible con alcance limitado;
- canario con lista de permitidos y supervisión;
- expansión condicionada a métricas e incidencias;
- Reversión automática cuando falla el límite.
El tiempo transcurrido no promueve el sistema. La evidencia revisada puede promover.
La matriz de delegación
| acción | Efecto | reversibles | dado | Incertidumbre | decisión |
|---|---|---|---|---|---|
| resumir documento público | interno | si | publico | bajo | ejecutar |
| preparar propuesta comercial | borrador | si | interno | promedio | proponer |
| enviar propuesta al cliente | externo | parcial | comercial | promedio | aprobación humana |
| cambiar la política de precios | sistémico | parcial | financiero | alto | autoridad humana nominal |
| revocar credencial filtrada | seguridad | si, urgente | secreto | bajo | automatización preautorizada + evidencia |
El último ejemplo muestra por qué “alto efecto = siempre humano” también es simplista. En la respuesta a incidentes, es posible que sea necesario que una acción crítica, delimitada y previamente autorizada sea automática. El contrato es más preciso que la intuición.
Métricas que justifican ampliar la autoridad
No utilice simplemente la tasa de éxito promedio. Tenga en cuenta:
- falla crítica por clase de acción;
- detección antes versus después del efecto;
- tiempo y tasa de reversión;
- divergencia entre propuesta y decisión humana;
- excepciones fuera del contrato;
- concentración de fallas por población o datos;
- costo de supervisión;
- cuasiincidentes y condiciones de parada activadas.
Una parada correcta es una señal de control, no necesariamente una falla del producto.
Lo que este artículo prueba y lo que no prueba
NIST y OWASP respaldan la gestión de riesgos continua, responsabilidades explícitas y requisitos verificables. Las fuentes canónicas FORGE también describen qué controles deben ajustarse al entorno. [R2-C1] [R2-C3]
La escala de cinco niveles y cuatro ejes son una síntesis operativa de FORGE. No reemplazan la evaluación de impacto legal, regulatorio, de seguridad o de dominio. Tampoco garantizan la ausencia de daños. Sirven para evitar que una autoridad tome una decisión basándose únicamente en el nombre del modelo o en una demostración exitosa.
Conclusión
La autonomía segura no es la ausencia de humanos. Es una distribución explícita de la autoridad.
La IA puede ejecutar cada vez más, pero la organización debe decidir dónde comienza el efecto, quién acepta el riesgo, cómo se verifica la acción y qué evidencia permite ampliar o revocar el grant. El objetivo no es mantener personas en cada clic, sino conservar la responsabilidad en los puntos irreversibles.
Lectura anterior: Basado en especificaciones sin autoengaño. Próxima lectura: *Evidencia antes de adjetivo*, el 20/08 en Trustyu Forge.
Nota editorial y de responsabilidad
- Corte de la investigación
- Última revisión
- Correcciones registradas
- No hay correcciones registradas.
Este artículo combina fuentes citadas, análisis y experiencia profesional del autor. Los datos verificables y las afirmaciones fácticas están vinculados a sus respectivas fuentes. Las interpretaciones, hipótesis, proyecciones, recomendaciones y opiniones representan el punto de vista profesional del autor en el momento de la publicación; no constituyen hechos probados, promesas de resultados ni asesoramiento jurídico, financiero o técnico aplicable a un caso concreto. Consulte las fuentes originales y a profesionales cualificados antes de tomar decisiones.
Claims y fuentes
R2-C1
La garantía de la IA necesita pruebas reproducibles y evidencia mensurable asignada a requisitos de verificación explícitos; La prosa política por sí sola es insuficiente.
Límite: Dioptra y AISVS cubren diferentes ámbitos; tampoco lo es una attestation llave en mano de una implementación FORGE. Este es un insumo de diseño de investigación-síntesis; no prueba la adopción del producto, la madurez operativa, la attestation independiente o el resultado.
- NIST — NIST, NIST repositorio de dominio público; extractos de solo análisis
- OWASP Fundación — OWASP Fundación, estándar CC-BY-SA-4.0; extractos de solo análisis
R2-C3
Los privilegios mínimos, la ejecución aislada y la provenance de la cadena de suministro son controles complementarios; no hay sustitutos para los demás en un sistema agente.
Límite: El perfil de control exacto sigue siendo específico del entorno y debe modelarse en función de las amenazas para cada producto. Este es un insumo de diseño de investigación-síntesis; no prueba la adopción del producto, la madurez operativa, la attestation independiente o el resultado.
- OpenAI — OpenAI, repositorio Apache-2.0; extractos de solo análisis
- OWASP Fundación — OWASP Fundación, estándar CC-BY-SA-4.0; extractos de solo análisis
- OpenSSF SLSA — OpenSSF SLSA, CC-BY-4.0 especificación; extractos de solo análisis