PAPERS Y CLAIMSLa evidencia detrás de la hipótesis.
#50 · IA APLICADA · EVALUACIÓN Estudia fugas de credenciales de APIs LLM en apps iOS. Analiza 444 apps filtradas de 1092 candidatas y encuentra 282 con credenciales explotables en tráfico de red. Tres patrones: tokens JWT filtrados, proxies backend sin autenticación y transmisión plaintext de API keys. Tras disclosure, solo el 28% había corregido.
Resultado con fuente enlazada · v3Propone MATM: memoria compartida entre poblaciones de agentes, donde unos agentes guardan trayectorias y otros las recuperan para mejorar tareas futuras.
Resultado con fuente enlazada · v1#69 · AGENTES · RAG · EVALUACIÓN Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas.
Resultado con fuente enlazada · v2Mejora RL de agentes asignando crédito por rol semántico de cada segmento: progreso decisivo, exploración útil, infraestructura sin progreso o regresión. Supera GRPO en ALFWorld, Search-QA y WebShop y reduce turnos de entorno en rollouts completados.
Resultado con fuente enlazada · v3Intenta localizar qué pasos provocaron el fracaso de una trayectoria sin necesitar anotaciones de errores paso a paso. El modelo aprende exclusivamente de trayectorias exitosas y utiliza ese conocimiento para señalar pasos anómalos dentro de ejecuciones fallidas.
Resultado con fuente enlazada · v1#129 · MEMORIA · AGENTES · CODING En vez de resumir continuamente la memoria o meter todo el historial en contexto, PRO-LONG guarda una traza completa y estructurada de interacción y permite que el agente la busque programáticamente, aprovechando precisamente las capacidades adquiridas por los coding agents. En ARC-AGI-3 mejora en promedio 18 puntos frente al agente base y alcanza hasta 76,1% pass\@1 usando 4,2–5,8× menos tokens.
Resultado con fuente enlazada · v2Aries es un framework full-stack para medir agentes como trayectorias completas: inferencia, contexto persistente, herramientas, sandboxes, pausas y reanudaciones. Combina experimentos reproducibles con trazas de una plataforma comercial.
Resultado con fuente enlazada · v1#14 · SKILLS · FIABILIDAD · RUNTIME SkillSentry transforma un skill y trazas previas en una guía de runtime, monitoriza la ejecución y la actualiza con nuevas evidencias. El objetivo no es mejorar la prosa del procedimiento, sino su cumplimiento.
Resultado con fuente enlazada · v1#163 · AGENTES · SEGURIDAD · MULTIMODAL Señal del scout sobre compuertas de seguridad a nivel de paso.
Síntesis editorial; ampliar lectura · por verificar#37 · RAG · MULTILINGÜE · MODELOS EFICIENTES El trabajo construye de extremo a extremo un stack RAG para griego moderno, desde minería de corpus y supervisión sintética hasta embeddings, reranker, reader y el benchmark HERA.
Resultado con fuente enlazada · v1#116 · AGENTES · EVALUACIÓN Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.
Resultado con fuente enlazada · v3