PAPERS Y CLAIMSLa evidencia detrás de la hipótesis.
#40 · RAG · EVALUACIÓN · SEGURIDAD Propone un playground open source para evaluar RAG con LLMs en fábricas inteligentes, usando documentación de múltiples máquinas. Permite configurar modelos, comparar pipelines RAG y evaluar con RAGAS y métricas LLM-as-a-Judge de NVIDIA. Lo prueban en un caso de mantenimiento con unas 600 páginas de documentación y 30 queries.
Resultado con fuente enlazada · v1#42 · RAG · EVALUACIÓN · CODING Sustituye el top-K fijo en RAG por selección adaptativa de chunks usando dos señales ya disponibles: similitud bi-encoder y score cross-encoder. Reduce sobre-recuperación en preguntas simples e infra-recuperación en preguntas composicionales. En MS MARCO logra MRR\@10 de 0,401 con 35% menos chunks retenidos; en benchmark interno reduce tokens por query un 34,8%.
Resultado con fuente enlazada · v1Framework de reranking con LLMs que comprime tokens y evita scoring generativo. En TREC-COVID mantiene estabilidad con listas de hasta 500 documentos, logrando speedups de 4,9x–9,5x frente a reranking listwise generativo.
Resultado con fuente enlazada · v1#47 · AGENTES · SEGURIDAD · MULTIMODAL Método RL para mejorar uso de herramientas en agentes multimodales pequeños. En vez de recompensas binarias frágiles, alinea la atribución del modelo pequeño con la de un profesor más fuerte. En Qwen2.5-VL-3B mejora la precisión VQA un 3% medio en seis test sets.
Resultado con fuente enlazada · v1Extrae bibliotecas de habilidades desde trayectorias GUI: segmenta interacciones, agrupa skills candidatas y entrena una política consciente de esas skills.
Resultado con fuente enlazada · v1#88 · IA APLICADA · EVALUACIÓN Framework de sparse attention para long-context que usa cuantización binaria rotada y aritmética binary-INT4 para estimar atención, con Top-p adaptativo y diseño hardware-aware. Acelera inferencia y reduce I/O manteniendo calidad.
Resultado con fuente enlazada · v1#89 · AGENTES · EVALUACIÓN · SEGURIDAD Benchmark para evaluar cómo agentes modifican políticas ejecutables bajo feedback e interacción acotada. Mide no solo resultado final, sino cómo el agente usa presupuesto, feedback y mecanismos de mejora.
Resultado con fuente enlazada · v1Mide cómo la memoria personalizada cambia no solo la respuesta final, sino la trayectoria de razonamiento. Encuentra drift medio-alto en 4 LLMs y 10 categorías de atributos de usuario; GRPO/DPO reducen el fenómeno, pero no de forma uniforme.
Resultado con fuente enlazada · v2Mejora GraphRAG alineando embeddings de grafos con features textuales mediante self-supervised learning con masking adaptativo. Evita enmascarar nodos clave difíciles y mejora GraphQA en cuatro datasets.
Resultado con fuente enlazada · v1Propone que el harness de un agente —el programa que prepara contexto, llama herramientas, verifica resultados y recupera errores— pueda modificarse durante la propia evaluación. TTHE usa las trazas no etiquetadas producidas por el agente para evolucionar su flujo de ejecución en tiempo de prueba.
Resultado con fuente enlazada · v1Memoria de razonamiento compuesta por módulos pequeños que vinculan subobjetivos con instrucciones reutilizables. El sistema expande la memoria progresivamente y aprende qué módulos seleccionar y combinar para resolver problemas posteriores.
Resultado con fuente enlazada · v1#107 · AGENTES · EVALUACIÓN Rediseña el balanceo de inferencia alrededor de sesiones completas, no de solicitudes individuales. La primera petición se distribuye según carga y las siguientes se enrutan teniendo en cuenta la reutilización de caché.
Resultado con fuente enlazada · v1#111 · AGENTES · EVALUACIÓN Benchmark clínico longitudinal construido con historiales de MIMIC-IV. Simula interacciones multi-sesión y evalúa recuperación factual, razonamiento temporal y decisiones médicas acumuladas a lo largo de múltiples visitas.
Resultado con fuente enlazada · v2#132 · RAG · EVALUACIÓN · SEGURIDAD TAP-RAG no usa la misma estrategia para todas las preguntas. Clasifica si una consulta necesita evidencia visual, local, global o estructural y crea una política de recuperación específica. Puede recorrer el grafo documental, inspeccionar páginas como imágenes cuando importa el layout y abstenerse cuando falta evidencia. Mejora un baseline multimodal RAG en +9,1 puntos en DocBench y +4,5 en MMLongBench-Doc.
Resultado con fuente enlazada · v1Sistema para configurar automáticamente simulaciones CFD en OpenFOAM. Expande queries desde varios ángulos, fusiona rankings, separa retrieval operacional de consultas físicas y divide el trabajo entre Architect, InputWriter y Reviewer. Los seis casos de referencia ejecutan correctamente en OpenFOAM y el Reviewer diagnostica/repara casos deliberadamente corruptos.
Resultado con fuente enlazada · v1#149 · RAG · EVALUACIÓN · CODING Publica una receta end-to-end para entrenar retrievers densos y de interacción tardía. Reconstruye 665 millones de pares públicos de pretraining, crea 1,88 millones de pares supervisados y extiende el entrenamiento a ocho idiomas.
Resultado con fuente enlazada · v2Separa dos escalas de recuperación. Un macro-grafo decide la ruta global entre documentos y modalidades; un micro-grafo verifica evidencia visual o textual fina. El retrieval se formula como propagación de mensajes guiada por la consulta.
Resultado con fuente enlazada · v1#23 · MEMORIA · AGENTES · RETRIEVAL CoEvo-Mem cierra el bucle entre retrieval y memoria: los resultados de las tareas actualizan tanto el routing como los valores y relaciones del grafo de memoria, y esos cambios modifican las recuperaciones futuras.
Resultado con fuente enlazada · v1#30 · SAFETY · POLÍTICAS · CRIPTOGRAFÍA NiyamAI fija herramientas y restricciones al inicio de la sesión, intercepta cada llamada, obtiene el juicio de un componente aislado y exige verificar una prueba zk-SNARK antes de ejecutar.
Resultado con fuente enlazada · v1#18 · RETRIEVAL · EMBEDDINGS · ADAPTACIÓN TTT-Embed aprende un vector ligero en el espacio de salida de un encoder congelado usando únicamente scores de ranking. No cambia los pesos del modelo, las etiquetas ni el índice.
Resultado con fuente enlazada · v1#01 · AGENTES · MÓVIL · EVALUACIÓN MobilePA-Bench reúne 1.705 tareas en 13 dominios funcionales y 212 herramientas, y separa uso básico de herramientas, colaboración entre agentes, memoria y skills.
Resultado con fuente enlazada · arXiv v2 · 25 agosto 2026#05 · RAG · ABSTENCIÓN · EVALUACIÓN The RAT modela por separado éxito de recuperación, abstención, éxito de tarea y éxito del generador sobre 27 configuraciones y 10.000 consultas por condición.
Resultado con fuente enlazada · arXiv v1 · 25 agosto 2026Señal del scout sobre memoria de horizonte largo en un mundo interactivo.
Síntesis editorial; ampliar lectura · por verificarSeñal del scout sobre feedback coevolutivo para agentes de búsqueda que se mejoran a sí mismos.
Síntesis editorial; ampliar lectura · por verificar#166 · IA APLICADA · EVALUACIÓN Señal del scout sobre AsymSpec y una posible arquitectura asimétrica.
Síntesis editorial; ampliar lectura · por verificar#02 · AGENTES · TOOL USE · LATENCIA OODA-Tool entrena módulos especializados para distintos momentos del ciclo OODA y compara el resultado con una adaptación LoRA directa en modelos Qwen3 de 0.6B a 14B.
Resultado con fuente enlazada · arXiv v2 · 27 agosto 2026#17 · RANKING · RECOMMENDACIÓN · SLM MetaStrategy expresa pesos de objetivos, preferencias, restricciones y políticas de posición en JSON. Un compilador ejecuta esa estrategia sobre el sistema de ranking y permite destilar el plan a modelos pequeños.
Resultado con fuente enlazada · v1#26 · RAG · INFRAESTRUCTURA · EFICIENCIA RAG-Stack explora conjuntamente configuraciones algorítmicas y de serving para encontrar fronteras Pareto de calidad-rendimiento sin desplegar y medir exhaustivamente cada candidato.
Resultado con fuente enlazada · v1#31 · DISCOVERY · RECOMENDACIÓN · AGENTES Shape Your Feed combina texto, voz y controles de interfaz para detectar intención, actualizar un perfil semántico persistente y rerankear o podar candidatos en tiempo real.
Resultado con fuente enlazada · v1#87 · AGENTES · EVALUACIÓN Predice rendimiento en benchmarks agentic caros usando un subconjunto pequeño de evaluaciones atómicas. En 14 modelos, 4 benchmarks agentic y 19 no-agentic, logra MAE menor del 4%, Spearman >0.80 y ranking accuracy \~85% con menos del 1% del coste.
Resultado con fuente enlazada · v2#143 · MEMORIA · AGENTES · EVALUACIÓN TransMem guarda una selección dispersa de estados ocultos históricos del modelo y los reutiliza como memoria. En vez de recuperar únicamente texto o resúmenes, conserva representaciones internas que condensan información ya procesada. Un estudiante con memoria aprende a igualar la distribución de un profesor que recibe solo la evidencia relevante.
Resultado con fuente enlazada · v1