PAPERS Y CLAIMSLa evidencia detrás de la hipótesis.
#66 · IA APLICADA · EVALUACIÓN Explora inferencia estructurada con un enfoque tipo Gibbs alrededor de LLMs.
Resultado con fuente enlazada · v1#70 · RAG · EVALUACIÓN · MODELOS PEQUEÑOS Ataca el conflicto entre conocimiento interno del modelo y contexto recuperado en RAG. Añade un módulo gate ligero que ajusta activaciones internas sin tocar el backbone, entrenando menos del 0,01% de parámetros. Valida en seis datasets y publica código/datasets.
Resultado con fuente enlazada · v1Pipeline para crear sistemas text-to-Cypher sobre knowledge graphs empresariales privados. Genera pares pregunta-query desde grafos existentes, valida con LLM judge y humanos, y entrena con LoRA. Reporta mejoras fuertes en F1 y ejecución sobre queries empresariales coreanas.
Resultado con fuente enlazada · v1#74 · AGENTES · RAG · EVALUACIÓN Benchmark coreano para evaluar búsqueda exhaustiva: no encontrar una respuesta, sino completar tablas enteras de miembros y atributos. Evalúa 20 agentes y muestra que recuperan entidades mejor que filas completas; Item-F1 alto, Row-F1 mucho más bajo.
Resultado con fuente enlazada · v1#77 · IA APLICADA · EVALUACIÓN Scheduler sin entrenamiento para multi-token prediction que adapta la profundidad especulativa según la entropía local del texto. Reporta 1,15x de speedup frente a Hydra y pico de 1,36x frente a Medusa.
Resultado con fuente enlazada · v1Explora si condicionar personalidades menos complacientes puede mejorar seguridad durante fine-tuning. El listado de arXiv lo ubica en safety/fine-tuning con 9 páginas, 8 tablas y 5 figuras.
Resultado con fuente enlazada · v1Mejora RL de agentes asignando crédito por rol semántico de cada segmento: progreso decisivo, exploración útil, infraestructura sin progreso o regresión. Supera GRPO en ALFWorld, Search-QA y WebShop y reduce turnos de entorno en rollouts completados.
Resultado con fuente enlazada · v3Mejora GraphRAG alineando embeddings de grafos con features textuales mediante self-supervised learning con masking adaptativo. Evita enmascarar nodos clave difíciles y mejora GraphQA en cuatro datasets.
Resultado con fuente enlazada · v1Unifica en una política aprendible las operaciones habituales del RAG multi-hop: recuperar, reformular la consulta, criticar evidencia, identificar entidades puente y decidir cuándo existe suficiente soporte.
Resultado con fuente enlazada · v1#110 · EVALUACIÓN · SEGURIDAD · MULTIMODAL Benchmark de seguridad multimodal construido nativamente desde seis países de Asia-Pacífico y ocho idiomas. Evalúa casos donde texto e imagen parecen inocuos por separado, pero su combinación genera riesgos legales o culturales locales.
Resultado con fuente enlazada · v1#113 · MEMORIA · AGENTES · RAG Convierte la investigación web multiagente en un sistema con estado explícito y persistente. Mantiene Frontier Tasks, un grafo de evidencias, mapa de cobertura y memoria de fallos para evitar que los agentes repitan búsquedas inútiles. Además, paraleliza subagentes y registra evidencia y citas durante la ejecución.
Resultado con fuente enlazada · v1#114 · AGENTES · SEGURIDAD Convierte las propias trayectorias completadas por un agente en «skills» retrospectivas expresadas en lenguaje natural. Esas habilidades resumen workflows reutilizables, observaciones decisivas y reglas para evitar fallos; después se destila su efecto de vuelta a la política mediante una señal densa a nivel de token.
Resultado con fuente enlazada · v1Aborda una asimetría creciente: los modelos pueden inferir con contextos enormes, pero el post-training RL suele quedarse alrededor de contextos mucho menores. LongStraw apunta a entrenar mediante RL sobre secuencias de más de dos millones de tokens manteniendo un presupuesto fijo de GPU.
Resultado con fuente enlazada · v3Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos. Propone GEAR, una recompensa que favorece evidencia relevante y penaliza copiar distractores. Mejora hasta +4,6 puntos y reduce simultáneamente longitud del pensamiento y copying.
Resultado con fuente enlazada · v2Compara retrievers basados en Graph Language Models, GNNs y búsqueda vectorial. Los GLM combinan semántica textual y estructura del grafo para recuperar subgrafos relevantes.
Resultado con fuente enlazada · v1Separa dos escalas de recuperación. Un macro-grafo decide la ruta global entre documentos y modalidades; un micro-grafo verifica evidencia visual o textual fina. El retrieval se formula como propagación de mensajes guiada por la consulta.
Resultado con fuente enlazada · v1#157 · AGENTES · SEGURIDAD Utiliza redes bayesianas para acumular señales de incertidumbre procedentes de varios agentes y componentes durante la ejecución, no solo al final.
Resultado con fuente enlazada · v1#35 · SEARCH AGENTS · RL · GENERALIZACIÓN El trabajo combina reinforcement learning para búsqueda con on-policy distillation de expertos de dominios generales para reducir el alignment tax de la especialización.
Resultado con fuente enlazada · v1#37 · RAG · MULTILINGÜE · MODELOS EFICIENTES El trabajo construye de extremo a extremo un stack RAG para griego moderno, desde minería de corpus y supervisión sintética hasta embeddings, reranker, reader y el benchmark HERA.
Resultado con fuente enlazada · v1#12 · AGENTES · APIs · RAG · EVALUACIÓN VAKRA reúne más de 8.000 APIs ejecutables en 62 dominios y evalúa tareas que combinan herramientas, documentos y restricciones en lenguaje natural. El rendimiento cae con fuerza cuando aumenta la profundidad de composición.
Resultado con fuente enlazada · v1#13 · RAG · SQL · CONOCIMIENTO ESTRUCTURADO SAG conserva cada chunk como un evento semánticamente completo junto con sus entidades. En tiempo de consulta, las entidades compartidas actúan como claves de join y crean un vecindario local tipo hipergrafo.
Resultado con fuente enlazada · v1#18 · RETRIEVAL · EMBEDDINGS · ADAPTACIÓN TTT-Embed aprende un vector ligero en el espacio de salida de un encoder congelado usando únicamente scores de ranking. No cambia los pesos del modelo, las etiquetas ni el índice.
Resultado con fuente enlazada · v1#07 · RAG · EVIDENCIA · TRAZABILIDAD ClueWeaver separa un Finder de evidencia y un Interpreter, añade autocontrol para preguntas de alto riesgo y entrena con recompensas orientadas a pistas y citas.
Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026#08 · AGENTES · SERVING · SISTEMAS TOPAS usa dependencias del DAG para programar solicitudes de workflows LLM y reducir el tiempo de finalización del job bajo concurrencia.
Resultado con fuente enlazada · arXiv v1 · 26 agosto 2026Señal del scout sobre ceguera a la evidencia en agentes de búsqueda.
Síntesis editorial; ampliar lectura · por verificar#169 · AGENTES · MODELOS PEQUEÑOS Señal del scout sobre composición o compactación de agentes.
Síntesis editorial; ampliar lectura · por verificar#42 · RAG · EVALUACIÓN · CODING Sustituye el top-K fijo en RAG por selección adaptativa de chunks usando dos señales ya disponibles: similitud bi-encoder y score cross-encoder. Reduce sobre-recuperación en preguntas simples e infra-recuperación en preguntas composicionales. En MS MARCO logra MRR\@10 de 0,401 con 35% menos chunks retenidos; en benchmark interno reduce tokens por query un 34,8%.
Resultado con fuente enlazada · v1#59 · IA APLICADA · EVALUACIÓN Explora Transformers cuyo ancho varía por capa, en vez de mantener la misma dimensión en todo el modelo.
Resultado con fuente enlazada · v1#69 · AGENTES · RAG · EVALUACIÓN Benchmark para agentes de búsqueda que deben decidir cuándo preguntar aclaraciones en vez de seguir buscando. Incluye 211 muestras, 463 ambigüedades y 11 dominios reales. Muestra que detectar ambigüedad y formular buenas preguntas son capacidades distintas.
Resultado con fuente enlazada · v2Señal del scout sobre memoria de horizonte largo en un mundo interactivo.
Síntesis editorial; ampliar lectura · por verificar#159 · AGENTES · EVALUACIÓN · CODING Señal del scout sobre evaluación de refactors de software por agentes.
Síntesis editorial; ampliar lectura · por verificarSeñal del scout sobre generalización extraña y desalineamiento emergente.
Síntesis editorial; ampliar lectura · por verificarSeñal del scout sobre feedback coevolutivo para agentes de búsqueda que se mejoran a sí mismos.
Síntesis editorial; ampliar lectura · por verificar#163 · AGENTES · SEGURIDAD · MULTIMODAL Señal del scout sobre compuertas de seguridad a nivel de paso.
Síntesis editorial; ampliar lectura · por verificar#164 · AGENTES · EVALUACIÓN Señal del scout sobre evaluación o coordinación de agentes bajo el nombre RACE.
Síntesis editorial; ampliar lectura · por verificar#165 · IA APLICADA · EVALUACIÓN Señal del scout sobre diagnósticos correctos acompañados de razonamiento decorativo.
Síntesis editorial; ampliar lectura · por verificar#166 · IA APLICADA · EVALUACIÓN Señal del scout sobre AsymSpec y una posible arquitectura asimétrica.
Síntesis editorial; ampliar lectura · por verificar#167 · AGENTES · SEGURIDAD Señal del scout sobre la confusión entre salida de una herramienta e instrucción ejecutable.
Síntesis editorial; ampliar lectura · por verificarSeñal del scout sobre skills derivadas de conocimiento estructurado o wikis.
Síntesis editorial; ampliar lectura · por verificar