# La gobernanza útil vive en el límite de acción, no dentro del prompt
> Hipótesis editorial multi-paper. Resultado del test: supported-by-corpus.

- Página: https://luiseduardodemiguel.com/research-ia/hypotheses/runtime-governance-at-action-boundary
- Test: research-hypotheses:corpus-triangulation:v1
- Fecha de comprobación: 2026-08-19
- Combinación: MNC + NiyamAI + Deontic Policies + MINIM + SkillGate

## Hipótesis

Un agente empresarial necesita evaluar permisos, obligaciones, minimización y contexto justo antes de transferir datos o ejecutar una herramienta; pedirle al modelo que recuerde todas esas reglas no basta.

Pregunta: ¿Qué controles deben ser deterministas y externos al razonamiento del agente?

## Problema y contexto

La gobernanza deja de ser una frase del prompt cuando el agente está a punto de transferir datos, ejecutar una herramienta o comprometer una acción irreversible. En ese borde importan el permiso, la obligación, la minimización y la posibilidad de explicar o corregir la decisión.

Las fuentes de esta hipótesis describen controles distintos. La prueba útil no es contar mecanismos de seguridad, sino comprobar qué violaciones evitan, qué acciones benignas bloquean y cuánto cuesta decidir antes de producir un efecto real.

## Qué aporta cada paper

### MNC — Define la comunicación mínima como una frontera de divulgación: el agente debe compartir sólo lo necesario para la tarea y el destinatario.

- Problema que aborda: Eliminar campos sensibles del mensaje no evita que el conocimiento se reenvíe, se registre o se incorpore permanentemente a otra memoria.
- Qué aporta: MNC trata la comunicación como una declassification semántica con destinatario, propósito, reenvío, lifetime, logging y memory scope explícitos.
- Resultado reportado por la fuente: El protocolo distingue MNC-C para el núcleo, MNC-L para el riesgo acumulado por historial y MNC-D cuando no existe una divulgación segura.
- Qué no permite concluir: La clasificación puede fallar cuando el permiso es ambiguo, el historial cambia o no existe una divulgación segura; el protocolo no resuelve por sí mismo la gobernanza.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/mnc
- Fuente primaria (v1): https://arxiv.org/html/2608.01719v1#S3

### NiyamAI — Aporta pruebas verificables para que una acción segura no dependa únicamente de que el modelo recuerde una regla en lenguaje natural.

- Problema que aborda: Los filtros y system prompts operan en el mismo entorno que queremos proteger y no dejan una prueba independiente de que la política se aplicó.
- Qué aporta: NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.
- Resultado reportado por la fuente: NiyamAI reporta F1 88,5% y 1,1% de falsos positivos; generar una prueba cuesta 2.260,6 ± 218,4 ms y verificarla 53,1 ± 11,8 ms.
- Qué no permite concluir: Los tiempos de generar y verificar pruebas dependen del hardware y del verificador, y no muestran por sí solos que la política de seguridad sea completa.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/niyamai
- Fuente primaria (v1): https://arxiv.org/pdf/2608.07167

### Deontic Policies for Runtime Governance of Agentic AI Systems — Expresa obligaciones, permisos, prohibiciones y excepciones en una política externa que puede resolver conflictos antes de la acción.

- Problema que aborda: Motores como XACML, Rego o Cedar cubren sobre todo permitir/prohibir, pero no toda la estructura normativa necesaria para agentes autónomos.
- Qué aporta: Marco de gobierno runtime para agentes basado en permisos, prohibiciones, obligaciones, dispensas y precedencia entre reglas.
- Resultado reportado por la fuente: A payments agent is prohibited from autonomously executing a high-value transaction; a treasury-officer approval credential from the authority named in the policy provides a dispensation, and any permitted transaction that exceeds the regulatory reporting threshold carries a mandatory Currency Transaction Report (CTR) obligation under the Bank Secrecy Act.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Deontic Policies in Practice.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/deontic-policies-for-runtime-governance-of-agentic-ai-systems
- Fuente primaria (v1): https://arxiv.org/html/2606.19464#S3

### Minim — Mueve la minimización al entorno local y reduce la vista de interfaz antes de que el estado abandone la frontera de confianza.

- Problema que aborda: Los agentes de ordenador suelen enviar demasiado contexto visual/UI a servidores externos, incluyendo códigos, notificaciones privadas o datos de fondo.
- Qué aporta: MINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto. Puntúa cada elemento UI por sensibilidad y necesidad para la tarea, manteniendo, abstrayendo o eliminando información. Reduce fugas de datos irrelevantes sin destruir el contexto operativo necesario.
- Resultado reportado por la fuente: Higher TCNP indicates better retention of task-relevant context.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/minim-privacy-aware-minimal-view-for-agents-via-trusted-local-sanitizati
- Fuente primaria (v1): https://arxiv.org/html/2606.13949#S4

### SkillGate — Trata una skill externa como superficie de suministro que debe inspeccionarse antes de incorporarse al comportamiento del agente.

- Problema que aborda: Los archivos SKILL.md y paquetes equivalentes se están convirtiendo en código ejecutable semántico, pero se descargan con controles considerablemente menores que una dependencia tradicional.
- Qué aporta: SkillGate analiza paquetes de skills antes de instalarlos en Cursor, Claude Code, Copilot u otros agentes. El objetivo es detectar instrucciones capaces de exfiltrar credenciales, introducir backdoors o redirigir herramientas a endpoints maliciosos.
- Resultado reportado por la fuente: We evaluate detection on SkillsBench ( n{=}1{,}650 , 9.1% malicious) and compare SkillGate against existing methods ClawVet and SkillScanner.
- Qué no permite concluir: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Results.
- Ficha: https://luiseduardodemiguel.com/research-ia/markdown/papers/skillgate-cost-efficient-runtime-malicious-skill-file-detection-in-codin
- Fuente primaria (v1): https://arxiv.org/html/2607.25619#S2

## Puente de síntesis

El puente editorial está en el momento de transición entre intención y efecto: MNC reduce lo que puede salir; MINIM reduce lo que puede observarse; las políticas deontológicas deciden qué está permitido u obligado; NiyamAI y SkillGate comprueban que la evidencia o el comportamiento que habilita la acción no esté comprometido. Es una arquitectura de control en el borde, no una promesa de que el prompt pueda contener toda la gobernanza.

## Implicaciones si la dirección es correcta

- Separar la decisión de permiso de la explicación generada por el agente y guardar ambas como artefactos auditables.
- Medir falsos bloqueos, fugas evitadas, latencia y obligaciones posteriores; la seguridad que sólo dice no no informa de su coste operativo.
- Probar skills, herramientas y datos externos como entradas no confiables antes de permitir que modifiquen el contexto o las acciones.

## Resultado y límites

La convergencia arquitectónica es fuerte: las fichas sostienen que consentimiento, política y minimización deben acompañar a la acción. Sigue faltando una comparación común de cobertura, latencia y usabilidad.

Que cinco fuentes primarias cubren seguridad, comunicación, política o minimización y conservan resultados con localizadores.

Límite: Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.
No demuestra: No valida una arquitectura concreta ni demuestra que más controles produzcan una mejor experiencia para usuarios reales.

## Próxima prueba

- Entrada: Un workflow con datos sensibles, tres herramientas y cuatro reglas de permiso/obligación que puedan entrar en conflicto.
- Baseline: Allow/deny estático y filtro de prompt sin minimización de contexto.
- Métrica: Fugas evitadas, acciones válidas bloqueadas, tiempo de decisión, explicabilidad y cumplimiento de obligaciones posteriores.
- Regla de parada: Parar si la protección depende de texto generado por el agente o si la política no puede explicar su decisión.
- Timebox: 2 semanas

## Papers

- [MNC](https://luiseduardodemiguel.com/research-ia/markdown/papers/mnc): https://arxiv.org/abs/2608.01719
- [NiyamAI](https://luiseduardodemiguel.com/research-ia/markdown/papers/niyamai): https://arxiv.org/abs/2608.07167
- [Deontic Policies for Runtime Governance of Agentic AI Systems](https://luiseduardodemiguel.com/research-ia/markdown/papers/deontic-policies-for-runtime-governance-of-agentic-ai-systems): https://mdsoar.org/items/60ae4c6d-6652-4dba-a4a3-631742f25662
- [Minim](https://luiseduardodemiguel.com/research-ia/markdown/papers/minim-privacy-aware-minimal-view-for-agents-via-trusted-local-sanitizati): https://arxiv.org/abs/2606.13949
- [SkillGate](https://luiseduardodemiguel.com/research-ia/markdown/papers/skillgate-cost-efficient-runtime-malicious-skill-file-detection-in-codin): https://arxiv.org/abs/2607.25619