NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
HIPÓTESIS/PUBLICACIÓN 03

POLÍTICAS / PRIVACIDAD / ACCIONES

La gobernanza útil vive en el límite de acción, no dentro del prompt

Un agente empresarial necesita evaluar permisos, obligaciones, minimización y contexto justo antes de transferir datos o ejecutar una herramienta; pedirle al modelo que recuerde todas esas reglas no basta.

COMBINACIÓNMNC + NiyamAI + Deontic Policies + MINIM + SkillGate
TESTtriangulación documental reproducible
ESTADOsupported by corpus
PREGUNTA DE INVESTIGACIÓN

¿Qué controles deben ser deterministas y externos al razonamiento del agente?

PROBLEMA Y CONTEXTO

La fiabilidad puede fallar antes del razonamiento.

La gobernanza deja de ser una frase del prompt cuando el agente está a punto de transferir datos, ejecutar una herramienta o comprometer una acción irreversible. En ese borde importan el permiso, la obligación, la minimización y la posibilidad de explicar o corregir la decisión.

Las fuentes de esta hipótesis describen controles distintos. La prueba útil no es contar mecanismos de seguridad, sino comprobar qué violaciones evitan, qué acciones benignas bloquean y cuánto cuesta decidir antes de producir un efecto real.

EVIDENCE MAP / RESULTADOS DE LAS FUENTES

Qué aporta cada paper

Las fuentes no son cuatro votos para la misma conclusión. Cada una cubre una pieza distinta y trae un límite que la hipótesis debe conservar.

FIGURA / MAPA DE EVIDENCIA5 fuentes, un puente que todavía hay que probar.
SVG estático · sin runtime de gráficos
Mapa de evidencia de la hipótesis5 papers aportan controles distintos que convergen en un orden de lectura, recuperación, organización de evidencia y respuesta bajo presupuesto.FUENTE 01MNCFUENTE 02NiyamAIFUENTE 03Deontic Policies for Runtime Governance of Agentic AI SystemsFUENTE 04MinimFUENTE 05SkillGatePUENTE EDITORIALminimizar → autorizarverificar → actuarsin blindar todo el entornoAFIRMACIÓN A PROBARla frontera de acciónreduce riesgopuente editorial, no resultado conjunto
La figura muestra una síntesis editorial: las flechas no significan que los autores hayan evaluado juntos este workflow.
  1. MNCDefine la comunicación mínima como una frontera de divulgación: el agente debe compartir sólo lo necesario para la tarea y el destinatario.
  2. NiyamAIAporta pruebas verificables para que una acción segura no dependa únicamente de que el modelo recuerde una regla en lenguaje natural.
  3. Deontic Policies for Runtime Governance of Agentic AI SystemsExpresa obligaciones, permisos, prohibiciones y excepciones en una política externa que puede resolver conflictos antes de la acción.
  4. MinimMueve la minimización al entorno local y reduce la vista de interfaz antes de que el estado abandone la frontera de confianza.
  5. SkillGateTrata una skill externa como superficie de suministro que debe inspeccionarse antes de incorporarse al comportamiento del agente.
  6. Resultado a probarEl orden del loop debe mejorar fiabilidad sin romper el presupuesto.
  1. 01
    MNC2026-08-03 · v1
    Fuente primaria ↗

    Define la comunicación mínima como una frontera de divulgación: el agente debe compartir sólo lo necesario para la tarea y el destinatario.

    Problema que aborda. Eliminar campos sensibles del mensaje no evita que el conocimiento se reenvíe, se registre o se incorpore permanentemente a otra memoria.

    Qué aporta. MNC trata la comunicación como una declassification semántica con destinatario, propósito, reenvío, lifetime, logging y memory scope explícitos.

    Resultado reportado por la fuente. El protocolo distingue MNC-C para el núcleo, MNC-L para el riesgo acumulado por historial y MNC-D cuando no existe una divulgación segura.

    Qué no permite concluir. La clasificación puede fallar cuando el permiso es ambiguo, el historial cambia o no existe una divulgación segura; el protocolo no resuelve por sí mismo la gobernanza.

  2. 02

    Aporta pruebas verificables para que una acción segura no dependa únicamente de que el modelo recuerde una regla en lenguaje natural.

    Problema que aborda. Los filtros y system prompts operan en el mismo entorno que queremos proteger y no dejan una prueba independiente de que la política se aplicó.

    Qué aporta. NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.

    Resultado reportado por la fuente. NiyamAI reporta F1 88,5% y 1,1% de falsos positivos; generar una prueba cuesta 2.260,6 ± 218,4 ms y verificarla 53,1 ± 11,8 ms.

    Qué no permite concluir. Los tiempos de generar y verificar pruebas dependen del hardware y del verificador, y no muestran por sí solos que la política de seguridad sea completa.

  3. 03

    Expresa obligaciones, permisos, prohibiciones y excepciones en una política externa que puede resolver conflictos antes de la acción.

    Problema que aborda. Motores como XACML, Rego o Cedar cubren sobre todo permitir/prohibir, pero no toda la estructura normativa necesaria para agentes autónomos.

    Qué aporta. Marco de gobierno runtime para agentes basado en permisos, prohibiciones, obligaciones, dispensas y precedencia entre reglas.

    Resultado reportado por la fuente. A payments agent is prohibited from autonomously executing a high-value transaction; a treasury-officer approval credential from the authority named in the policy provides a dispensation, and any permitted transaction that exceeds the regulatory reporting threshold carries a mandatory Currency Transaction Report (CTR) obligation under the Bank Secrecy Act.

    Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Deontic Policies in Practice.

  4. 04
    Minim2026-06-08 · v1
    Fuente primaria ↗

    Mueve la minimización al entorno local y reduce la vista de interfaz antes de que el estado abandone la frontera de confianza.

    Problema que aborda. Los agentes de ordenador suelen enviar demasiado contexto visual/UI a servidores externos, incluyendo códigos, notificaciones privadas o datos de fondo.

    Qué aporta. MINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto. Puntúa cada elemento UI por sensibilidad y necesidad para la tarea, manteniendo, abstrayendo o eliminando información. Reduce fugas de datos irrelevantes sin destruir el contexto operativo necesario.

    Resultado reportado por la fuente. Higher TCNP indicates better retention of task-relevant context.

    Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 5 Experiments.

  5. 05

    Trata una skill externa como superficie de suministro que debe inspeccionarse antes de incorporarse al comportamiento del agente.

    Problema que aborda. Los archivos SKILL.md y paquetes equivalentes se están convirtiendo en código ejecutable semántico, pero se descargan con controles considerablemente menores que una dependencia tradicional.

    Qué aporta. SkillGate analiza paquetes de skills antes de instalarlos en Cursor, Claude Code, Copilot u otros agentes. El objetivo es detectar instrucciones capaces de exfiltrar credenciales, introducir backdoors o redirigir herramientas a endpoints maliciosos.

    Resultado reportado por la fuente. We evaluate detection on SkillsBench ( n{=}1{,}650 , 9.1% malicious) and compare SkillGate against existing methods ClawVet and SkillScanner.

    Qué no permite concluir. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en Results.

SÍNTESIS EDITORIAL / INFERENCIA DEL AUTOR

El puente es un orden de controles, no una suma de papers.

El puente editorial está en el momento de transición entre intención y efecto: MNC reduce lo que puede salir; MINIM reduce lo que puede observarse; las políticas deontológicas deciden qué está permitido u obligado; NiyamAI y SkillGate comprueban que la evidencia o el comportamiento que habilita la acción no esté comprometido. Es una arquitectura de control en el borde, no una promesa de que el prompt pueda contener toda la gobernanza.

Qué cambia si la dirección es correcta

  • Separar la decisión de permiso de la explicación generada por el agente y guardar ambas como artefactos auditables.
  • Medir falsos bloqueos, fugas evitadas, latencia y obligaciones posteriores; la seguridad que sólo dice no no informa de su coste operativo.
  • Probar skills, herramientas y datos externos como entradas no confiables antes de permitir que modifiquen el contexto o las acciones.
RESULTADO DEL TEST / 2026-08-19

La convergencia arquitectónica es fuerte: las fichas sostienen que consentimiento, política y minimización deben acompañar a la acción. Sigue faltando una comparación común de cobertura, latencia y usabilidad.

Que cinco fuentes primarias cubren seguridad, comunicación, política o minimización y conservan resultados con localizadores.

Este test verifica procedencia, cobertura y coherencia de la síntesis; no sustituye un experimento de producción ni prueba causalidad.

supported by corpus5/5 checks pasados

Qué comprobé

PASSPapers públicos encontrados5/5
PASSLecturas primarias completas5/5
PASSCortes o fechas cubiertos5
PASSLocalizadores disponibles22
PASSReferencias de resultado resueltas3/3
PRÓXIMA PRUEBA / TODAVÍA NO EJECUTADA

Cómo intentaría confirmarla o hacerla caer.

ENTRADAUn workflow con datos sensibles, tres herramientas y cuatro reglas de permiso/obligación que puedan entrar en conflicto.
BASELINEAllow/deny estático y filtro de prompt sin minimización de contexto.
MÉTRICAFugas evitadas, acciones válidas bloqueadas, tiempo de decisión, explicabilidad y cumplimiento de obligaciones posteriores.
PARADAParar si la protección depende de texto generado por el agente o si la política no puede explicar su decisión.

Timebox: 2 semanas. Este protocolo es una propuesta editorial; no se ha presentado como resultado de un agente en producción.

AUTOCRÍTICA / REVISIÓN DEL AUTOR

Lo que hice bien

La hipótesis une mecanismos complementarios sin venderlos como una plataforma ya validada.

Lo que hice mal o dejé corto

No medí todavía el coste de política, el número de falsos bloqueos ni la carga cognitiva de explicar una decisión.

No valida una arquitectura concreta ni demuestra que más controles produzcan una mejor experiencia para usuarios reales.