PAPERS Y CLAIMSLa evidencia detrás de la hipótesis.
Framework de memoria a largo plazo para LLMs basado en grafos y razonamiento. Ataca el límite del contexto almacenando, actualizando y recuperando interacciones históricas fuera de la ventana del modelo. Reporta una mejora media del 22,72% frente a memorias planas, grafos existentes y otros baselines.
Resultado con fuente enlazada · v1#42 · RAG · EVALUACIÓN · CODING Sustituye el top-K fijo en RAG por selección adaptativa de chunks usando dos señales ya disponibles: similitud bi-encoder y score cross-encoder. Reduce sobre-recuperación en preguntas simples e infra-recuperación en preguntas composicionales. En MS MARCO logra MRR\@10 de 0,401 con 35% menos chunks retenidos; en benchmark interno reduce tokens por query un 34,8%.
Resultado con fuente enlazada · v1#45 · AGENTES · EVALUACIÓN · SEGURIDAD Red-teaming para sistemas multiagente jerárquicos. Usa valores de Shapley para estimar qué agentes contribuyen más a la robustez del sistema y detectar coaliciones vulnerables. Construye benchmarks y entornos en finanzas, software engineering y CRM.
Resultado con fuente enlazada · v2Framework de reranking con LLMs que comprime tokens y evita scoring generativo. En TREC-COVID mantiene estabilidad con listas de hasta 500 documentos, logrando speedups de 4,9x–9,5x frente a reranking listwise generativo.
Resultado con fuente enlazada · v1#47 · AGENTES · SEGURIDAD · MULTIMODAL Método RL para mejorar uso de herramientas en agentes multimodales pequeños. En vez de recompensas binarias frágiles, alinea la atribución del modelo pequeño con la de un profesor más fuerte. En Qwen2.5-VL-3B mejora la precisión VQA un 3% medio en seis test sets.
Resultado con fuente enlazada · v1AIR usa LLMs offline para construir representaciones de intención de usuario y luego las compone eficientemente online para recomendación cross-domain. Reporta alrededor de 400x aceleración de inferencia y A/B testing real en Kuaishou E-commerce con +3,446% de GMV.
Resultado con fuente enlazada · v1Reporte de workshop sobre cómo la IA generativa transforma la búsqueda académica: de recuperar documentos a resumir, recomendar, sintetizar y conversar. Destaca transparencia, credibilidad, integridad investigadora y search-as-learning.
Resultado con fuente enlazada · v1#56 · AGENTES · SEGURIDAD Marco de gobierno runtime para agentes basado en permisos, prohibiciones, obligaciones, dispensas y precedencia entre reglas.
Resultado con fuente enlazada · v1#78 · IA APLICADA · EVALUACIÓN Simulador mundial reforzado con física para manipulación robótica. El listado de arXiv indica GitHub y project website asociados.
Resultado con fuente enlazada · v1Marco para asignar recompensas en cooperativas de IA donde agentes representan a humanos con restricciones de valor distintas. Propone filtrar gradientes según perfiles de valor y liquidar contribuciones acumuladas.
Resultado con fuente enlazada · v1#96 · AGENTES · EVALUACIÓN · CODING Benchmark generativo para agentes que resuelven problemas de programación lineal escritos en texto. Genera problemas con solución conocida por construcción, dificultad ajustable, Docker e instrucciones pensadas para agentes.
Resultado con fuente enlazada · v1Sistema de búsqueda web que crea agentes recursivamente según progresa la investigación. Combina descomposición, expansión de nuevas líneas de búsqueda y colaboración dinámica, evitando que un único agente acumule una trayectoria excesivamente larga.
Resultado con fuente enlazada · v1#108 · MULTIMODAL · MODELOS PEQUEÑOS Modelo visión-lenguaje-acción que incorpora previsión del futuro en un espacio latente compacto. Aprende dinámicas desde un modelo de generación de vídeo congelado, pero elimina esa rama durante inferencia para conservar control en tiempo real.
Resultado con fuente enlazada · v1Observa que el ciclo agentic acción → resultado de herramienta → continuación se parece estructuralmente a una llamada a función: algo externo produce un resultado que después debe incorporarse. Usa código existente a escala internet para crear un objetivo FIM que entrena precisamente esa capacidad.
Resultado con fuente enlazada · v3#121 · SEGURIDAD · MULTIMODAL Modelo de solo 0,8B parámetros que transforma directamente una página en Markdown ordenado, incluyendo texto, fórmulas, tablas y regiones visuales. Combina SFT, RL en una rama 4B, destilación on-policy hacia 0,8B y model fusion.
Resultado con fuente enlazada · v1SIREN estudia algo directamente relacionado con el futuro del SEO: ¿puede una web modificar su contenido para conseguir que un asistente con búsqueda la coloque como recomendación nº1? Manteniendo exactamente las mismas fuentes recuperadas y modificando solamente una página, consigue alcanzar el primer puesto en 62 de 124 intentos; los ataques exitosos se reproducen en sesiones nuevas con una tasa media de 80,5%. Curiosamente, afirmaciones declarativas de ranking y listas sembradas funcionaron mejor que instrucciones explícitas tipo prompt injection.
Resultado con fuente enlazada · v1#131 · AGENTES · EVALUACIÓN · CODING Trata código y tests como dos fuentes potencialmente defectuosas que deben validarse mutuamente. Primero filtra tests incorrectos; después genera/refina múltiples soluciones y finalmente construye un grafo bipartito código-test para identificar conjuntamente qué candidatos y pruebas son fiables. Reporta Pass\@1 de 96,34% en HumanEval, 87,40% en MBPP, 64% en APPS y 51,33% en LiveCodeBench.
Resultado con fuente enlazada · v1#133 · RAG · SEGURIDAD · MODELOS PEQUEÑOS En vez de preguntar simplemente “¿el modelo falló en nuestro red-team?”, calcula límites probabilísticos matemáticamente sólidos sobre la probabilidad de producir contenido dañino. Usa intervalos Clopper-Pearson y búsqueda guiada mediante representaciones latentes para explorar eficientemente ramas peligrosas del árbol autoregresivo.
Resultado con fuente enlazada · v1Trabajo de síntesis sobre la evolución RAG → GraphRAG/KG-RAG → Agentic RAG específicamente para integración de datos empresariales. Pone en el centro verificabilidad, trazabilidad, robustez frente a alucinaciones y coste computacional.
Resultado con fuente enlazada · v1#26 · RAG · INFRAESTRUCTURA · EFICIENCIA RAG-Stack explora conjuntamente configuraciones algorítmicas y de serving para encontrar fronteras Pareto de calidad-rendimiento sin desplegar y medir exhaustivamente cada candidato.
Resultado con fuente enlazada · v1#31 · DISCOVERY · RECOMENDACIÓN · AGENTES Shape Your Feed combina texto, voz y controles de interfaz para detectar intención, actualizar un perfil semántico persistente y rerankear o podar candidatos en tiempo real.
Resultado con fuente enlazada · v1#32 · WORLD MODELS · MEMORIA · PLANIFICACIÓN MemWM añade al world model una memoria de reglas de transición, caches de estado y hechos difíciles de predecir; luego conecta esa imaginación con skills de mundo para planificar.
Resultado con fuente enlazada · v1#09 · GEO · DISCOVERY · INCENTIVOS El trabajo modela la relación entre creadores y motores generativos como un juego repetido. En vez de limitarse a castigar la manipulación, propone recompensar el contenido verificable mediante VCR, Verifiable-Content Rewards.
Resultado con fuente enlazada · v1#17 · RANKING · RECOMMENDACIÓN · SLM MetaStrategy expresa pesos de objetivos, preferencias, restricciones y políticas de posición en JSON. Un compilador ejecuta esa estrategia sobre el sistema de ranking y permite destilar el plan a modelos pequeños.
Resultado con fuente enlazada · v1Señal del scout sobre skills derivadas de conocimiento estructurado o wikis.
Síntesis editorial; ampliar lectura · por verificar#22 · MULTIMODAL · NEGOCIO · BENCHMARK MBA-Bench reúne 30.000 muestras en seis dominios. El pipeline combina imagen, caption, consultas extraídas visualmente y evidencia de mercado recuperada de la web para producir ideas de negocio.
Resultado con fuente enlazada · v1