¿Qué controles deben ser deterministas y externos al razonamiento del agente?
La fiabilidad puede fallar antes del razonamiento.
La gobernanza deja de ser una frase del prompt cuando el agente está a punto de transferir datos, ejecutar una herramienta o comprometer una acción irreversible. En ese borde importan el permiso, la obligación, la minimización y la posibilidad de explicar o corregir la decisión.
Las fuentes de esta hipótesis describen controles distintos. La prueba útil no es contar mecanismos de seguridad, sino comprobar qué violaciones evitan, qué acciones benignas bloquean y cuánto cuesta decidir antes de producir un efecto real.
Qué aporta cada paper
Las fuentes no son cuatro votos para la misma conclusión. Cada una cubre una pieza distinta y trae un límite que la hipótesis debe conservar.
- MNCDefine la comunicación mínima como una frontera de divulgación: el agente debe compartir sólo lo necesario para la tarea y el destinatario.
- NiyamAIAporta pruebas verificables para que una acción segura no dependa únicamente de que el modelo recuerde una regla en lenguaje natural.
- Deontic Policies for Runtime Governance of Agentic AI SystemsExpresa obligaciones, permisos, prohibiciones y excepciones en una política externa que puede resolver conflictos antes de la acción.
- MinimMueve la minimización al entorno local y reduce la vista de interfaz antes de que el estado abandone la frontera de confianza.
- SkillGateTrata una skill externa como superficie de suministro que debe inspeccionarse antes de incorporarse al comportamiento del agente.
- Resultado a probarEl orden del loop debe mejorar fiabilidad sin romper el presupuesto.
- 01MNC2026-08-03 · v1Fuente primaria ↗
Define la comunicación mínima como una frontera de divulgación: el agente debe compartir sólo lo necesario para la tarea y el destinatario.
Problema que aborda. Eliminar campos sensibles del mensaje no evita que el conocimiento se reenvíe, se registre o se incorpore permanentemente a otra memoria.
Qué aporta. MNC trata la comunicación como una declassification semántica con destinatario, propósito, reenvío, lifetime, logging y memory scope explícitos.
Resultado reportado por la fuente. El protocolo distingue MNC-C para el núcleo, MNC-L para el riesgo acumulado por historial y MNC-D cuando no existe una divulgación segura.
Qué no permite concluir. La clasificación puede fallar cuando el permiso es ambiguo, el historial cambia o no existe una divulgación segura; el protocolo no resuelve por sí mismo la gobernanza.
- 02NiyamAI2026-08-07 · v1Fuente primaria ↗
Aporta pruebas verificables para que una acción segura no dependa únicamente de que el modelo recuerde una regla en lenguaje natural.
Problema que aborda. Los filtros y system prompts operan en el mismo entorno que queremos proteger y no dejan una prueba independiente de que la política se aplicó.
Qué aporta. NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.
Resultado reportado por la fuente. NiyamAI reporta F1 88,5% y 1,1% de falsos positivos; generar una prueba cuesta 2.260,6 ± 218,4 ms y verificarla 53,1 ± 11,8 ms.
Qué no permite concluir. Los tiempos de generar y verificar pruebas dependen del hardware y del verificador, y no muestran por sí solos que la política de seguridad sea completa.
- 03
Expresa obligaciones, permisos, prohibiciones y excepciones en una política externa que puede resolver conflictos antes de la acción.
Problema que aborda. Motores como XACML, Rego o Cedar cubren sobre todo permitir/prohibir, pero no toda la estructura normativa necesaria para agentes autónomos.
Qué aporta. Marco de gobierno runtime para agentes basado en permisos, prohibiciones, obligaciones, dispensas y precedencia entre reglas.
Resultado reportado por la fuente. A payments agent is prohibited from autonomously executing a high-value transaction; a treasury-officer approval credential from the authority named in the policy provides a dispensation, and any permitted transaction that exceeds the regulatory reporting threshold carries a mandatory Currency Transaction Report (CTR) obligation under the Bank Secrecy Act.
Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Deontic Policies in Practice.
- 04Minim2026-06-08 · v1Fuente primaria ↗
Mueve la minimización al entorno local y reduce la vista de interfaz antes de que el estado abandone la frontera de confianza.
Problema que aborda. Los agentes de ordenador suelen enviar demasiado contexto visual/UI a servidores externos, incluyendo códigos, notificaciones privadas o datos de fondo.
Qué aporta. MINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto. Puntúa cada elemento UI por sensibilidad y necesidad para la tarea, manteniendo, abstrayendo o eliminando información. Reduce fugas de datos irrelevantes sin destruir el contexto operativo necesario.
Resultado reportado por la fuente. Higher TCNP indicates better retention of task-relevant context.
Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
- 05SkillGate2026-07-27 · v1Fuente primaria ↗
Trata una skill externa como superficie de suministro que debe inspeccionarse antes de incorporarse al comportamiento del agente.
Problema que aborda. Los archivos SKILL.md y paquetes equivalentes se están convirtiendo en código ejecutable semántico, pero se descargan con controles considerablemente menores que una dependencia tradicional.
Qué aporta. SkillGate analiza paquetes de skills antes de instalarlos en Cursor, Claude Code, Copilot u otros agentes. El objetivo es detectar instrucciones capaces de exfiltrar credenciales, introducir backdoors o redirigir herramientas a endpoints maliciosos.
Resultado reportado por la fuente. We evaluate detection on SkillsBench ( n{=}1{,}650 , 9.1% malicious) and compare SkillGate against existing methods ClawVet and SkillScanner.
Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Results.
El puente es un orden de controles, no una suma de papers.
El puente editorial está en el momento de transición entre intención y efecto: MNC reduce lo que puede salir; MINIM reduce lo que puede observarse; las políticas deontológicas deciden qué está permitido u obligado; NiyamAI y SkillGate comprueban que la evidencia o el comportamiento que habilita la acción no esté comprometido. Es una arquitectura de control en el borde, no una promesa de que el prompt pueda contener toda la gobernanza.
Qué cambia si la dirección es correcta
- Separar la decisión de permiso de la explicación generada por el agente y guardar ambas como artefactos auditables.
- Medir falsos bloqueos, fugas evitadas, latencia y obligaciones posteriores; la seguridad que sólo dice no no informa de su coste operativo.
- Probar skills, herramientas y datos externos como entradas no confiables antes de permitir que modifiquen el contexto o las acciones.
La convergencia arquitectónica es fuerte: las fichas sostienen que consentimiento, política y minimización deben acompañar a la acción. Sigue faltando una comparación común de cobertura, latencia y usabilidad.
Que cinco fuentes primarias cubren seguridad, comunicación, política o minimización y conservan resultados con localizadores.
Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.
Qué comprobé
Cómo intentaría confirmarla o hacerla caer.
Timebox: 2 semanas. Este protocolo es una propuesta editorial; no se ha presentado como resultado de un agente en producción.
Lo que hice bien
La hipótesis une mecanismos complementarios sin venderlos como una plataforma ya validada.
Lo que hice mal o dejé corto
No medí todavía el coste de política, el número de falsos bloqueos ni la carga cognitiva de explicar una decisión.
No valida una arquitectura concreta ni demuestra que más controles produzcan una mejor experiencia para usuarios reales.