NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 08

SAFETY · POLÍTICAS · CRIPTOGRAFÍA

NiyamAI: An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

InteresanteLectura primaria completa

El guardrail deja de ser solo una instrucción: se convierte en un contrato de intención cuya aplicación puede verificarse.

AUTHORS / LABAditya Katkar, Om Karkele, Kartik Mandhane, Manisha More y Yash Kashid
FECHA07 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.

EVIDENCIA DISPONIBLE

NiyamAI reporta F1 88,5% y 1,1% de falsos positivos; generar una prueba cuesta 2.260,6 ± 218,4 ms y verificarla 53,1 ± 11,8 ms.

Resultado reportado con fuente enlazada · 4 localizadores disponibles.
LÍMITE

La prueba verifica que el Judge aplicó su clasificación al contrato, no que el Judge o el contrato sean correctos ni que el LLM completo esté alineado; el coste de generación limita el uso a acciones críticas.

SIGUIENTE PRUEBA

Recall de fallos críticos, falsos positivos, latencia de generación/verificación y cobertura de reglas.

EN UNA FRASE

NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.

SEÑALSafety · Políticas · Criptografía
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALMedia
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

NiyamAI reporta F1 88,5% y 1,1% de falsos positivos; generar una prueba cuesta 2.260,6 ± 218,4 ms y verificarla 53,1 ± 11,8 ms.

F1 88,5%; 1,1% FP; 2.260,6 ms generar; 53,1 ms verificar · contexto: 2.000 escenarios de Agent-SafetyBench

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

NiyamAI aborda una debilidad de las defensas habituales frente a prompt injection y llamadas peligrosas: muchas políticas se ejecutan como software dentro del mismo entorno que queremos proteger y no dejan una evidencia independiente de que se aplicaron.

Al comenzar una sesión, el sistema fija un Intent Contract comprometido con SHA-256 que declara herramientas y restricciones. Cada llamada se intercepta y un Judge aislado decide si encaja; cuando la acción es aprobada, se genera una prueba zk-SNARK con EZKL y la herramienta solo se ejecuta después de verificarla.

La evaluación usa 2.000 escenarios de Agent-SafetyBench y compara con NeMo Guardrails, Llama Prompt Guard 2 y GPT-OSS-Safeguard. NiyamAI reporta F1 de 88,5% y 1,1% de falsos positivos, pero con una asimetría operativa fuerte: unos 2,26 segundos para generar cada prueba frente a unos 53 ms para verificarla.

La propuesta es valiosa como arquitectura de acciones críticas, no como sustituto universal de políticas. Una prueba puede demostrar que un Judge aplicó una regla, pero no que esa regla capturaba la intención correcta ni que el Judge entendió bien el contexto. El siguiente experimento debe medir la frontera entre riesgo, latencia y coste de prueba.

DECISIÓN RÁPIDAUsar contratos y pruebas verificables solo para tres acciones de alto impacto y comparar coste, bloqueo correcto y trazabilidad frente a guardrails convencionales.
NO LO SOBREINTERPRETES

La prueba verifica que el Judge aplicó su clasificación al contrato, no que el Judge o el contrato sean correctos ni que el LLM completo esté alineado; el coste de generación limita el uso a acciones críticas.

PROBLEMA
Los filtros y system prompts operan en el mismo entorno que queremos proteger y no dejan una prueba independiente de que la política se aplicó.
MÉTODO
Crea un Intent Contract con herramientas y restricciones, pasa cada acción a un Judge aislado y exige verificar un zk-SNARK generado con EZKL antes de ejecutar.
TIPO DE EVIDENCIA
En 2.000 escenarios de Agent-SafetyBench, NiyamAI reporta F1 88,5% y 1,1% de falsos positivos; generar una prueba cuesta 2.260,6 ± 218,4 ms por acción aprobada y verificarla 53,1 ± 11,8 ms.
LÍMITE
La prueba verifica que el Judge aplicó su clasificación al contrato, no que el Judge o el contrato sean correctos ni que el LLM completo esté alineado; el coste de generación limita el uso a acciones críticas.
FIGURA DE LECTURA / CONTRATOIntención → juicio → prueba → acción
Abrir paper original ↗

El guardrail se convierte en una condición de ejecución verificable.

BINDFijar herramientas y límites
JUDGEEvaluar la llamada
PROVEVerificar antes de ejecutar
PARA RECORDAR

Una prueba verifica la aplicación de la regla; todavía hay que validar que la regla y el juez sean correctos.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / En 2.000 escenarios de Agent-SafetyBench, NiyamAI reporta F1 88,5% y 1,1% de falsos positivos; generar una prueba cuesta 2.260,6 ± 218,4 ms por acción aprobada y verificarla 53,1 ± 11,8 ms.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Crea un Intent Contract con herramientas y restricciones, pasa cada acción a un Judge aislado y exige verificar un zk-SNARK generado con EZKL antes de ejecutar.

QUÉ APORTA

La arquitectura encaja con agentes que ejecutan pagos, comandos o cambios regulados, aunque el coste de generar una prueba obliga a reservarla para acciones críticas.

QUÉ NO PRUEBA

La prueba verifica que el Judge aplicó su clasificación al contrato, no que el Judge o el contrato sean correctos ni que el LLM completo esté alineado; el coste de generación limita el uso a acciones críticas.

Cómo lo llevaría a un proyecto

Usar contratos y pruebas verificables solo para tres acciones de alto impacto y comparar coste, bloqueo correcto y trazabilidad frente a guardrails convencionales.

Pagos agenticOperaciones cloudComplianceAgentes con permisos críticosAuditoría

Preguntas que conviene probar

  • ¿Qué acciones justifican el coste de una prueba criptográfica?
  • ¿Cómo se actualiza un contrato sin dejar una ventana de permisos incoherente?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADA500 escenarios nuevos con niveles de severidad, comparación sin contrato y con NiyamAI en sandbox.
PREGUNTA¿La verificación basada en contratos reduce fallos críticos sin bloquear acciones benignas en un conjunto de amenazas ponderado por severidad?
MÉTRICARecall de fallos críticos, falsos positivos, latencia de generación/verificación y cobertura de reglas.
PARADAParar si se omite más de 1% de los casos críticos o si los falsos positivos superan 2%.

Mi lectura

La verificación criptográfica puede ser una frontera de seguridad útil, pero no convierte automáticamente al juez en una autoridad correcta.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.