20–26 JULIO 2026 · #01Imprescindible
SIREN — PAIR-Driven Preference Manipulation in Web-RAG Recommenders
Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann. · 24 julio 2026.
IDEA CENTRALSIREN estudia algo directamente relacionado con el futuro del SEO: ¿puede una web modificar su contenido para conseguir que un asistente con búsqueda la coloque como recomendación nº1? Manteniendo exactamente las mismas fuentes recuperadas y modificando solamente una página, consigue alcanzar el primer puesto en 62 de 124 intentos; los ataques exitosos se reproducen en sesiones nuevas con una tasa media de 80,5%. Curiosamente, afirmaciones declarativas de ranking y listas sembradas funcionaron mejor que instrucciones explícitas tipo prompt injection.
POR QUÉ IMPORTAPendiente de extracción editorial verificable.
Ver problema que intenta resolver
los asistentes web ya son sistemas de ranking, pero sus resultados pueden manipularse a través del contenido que leen. Por qué puede ser importante: es una de las señales más claras que he visto de que GEO/Generative Engine Optimization tendrá una dimensión adversarial similar al SEO, aunque con mecanismos diferentes.
búsqueda generativa, GEO/LLMO, seguridad.auditoría GEOrobustez de buscadores generativos
20–26 JULIO 2026 · #02Imprescindible
PRO-LONG — Programmatic Memory Enables Long-Horizon Reasoning
Alexis Fox, Junlin Wang, Paul Rosu, Bhuwan Dhingra. · 22 julio 2026.
IDEA CENTRALEn vez de resumir continuamente la memoria o meter todo el historial en contexto, PRO-LONG guarda una traza completa y estructurada de interacción y permite que el agente la busque programáticamente, aprovechando precisamente las capacidades adquiridas por los coding agents. En ARC-AGI-3 mejora en promedio 18 puntos frente al agente base y alcanza hasta 76,1% pass\@1 usando 4,2–5,8× menos tokens.
POR QUÉ IMPORTApropone una alternativa conceptual muy buena a “más ventana de contexto”: guardar todo, pero convertir la memoria en algo consultable mediante programas.
Ver problema que intenta resolver
cuanto más historial conserva un agente, más difícil resulta encontrar luego lo que realmente necesita.
agentes, memoria, long-horizon reasoning.coding agentsasistentes de proyecto
20–26 JULIO 2026 · #03Imprescindible
PyroDash — Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference
Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong, Sicong Xia, Jianyao Ma, Yicheng Ding. · 22 julio 2026.
IDEA CENTRALUn modelo pequeño genera normalmente y aprende a emitir un token especial cuando necesita ayuda. Solo entonces transfiere la query y el razonamiento parcial a un LLM grande. No requiere router externo ni acceso a logits del modelo grande. En una configuración reduce el coste de $49,36 a $1,78, usando solo 1,9% de tokens del LLM grande; en otra supera incluso la precisión del baseline LLM-only reduciendo a la vez el coste un 20,4%.
POR QUÉ IMPORTAesta arquitectura podría convertirse en un patrón estándar: SLM por defecto + frontier model bajo demanda.
Ver problema que intenta resolver
usar un frontier model para cada token es económicamente absurdo cuando gran parte del trabajo puede resolverlo un SLM.
SLM, eficiencia, reasoning.copilotosagentes empresariales
20–26 JULIO 2026 · #04Imprescindible
MineValiCoder — Reliable Code Generation with Test Case Quality Mining and Bipartite Graph-Based Mutual Validation
Zhen Zhao, Qihang Yang, Feifei Dai, Xiangfang Li, Bo Li. · 24 julio 2026.
IDEA CENTRALTrata código y tests como dos fuentes potencialmente defectuosas que deben validarse mutuamente. Primero filtra tests incorrectos; después genera/refina múltiples soluciones y finalmente construye un grafo bipartito código-test para identificar conjuntamente qué candidatos y pruebas son fiables. Reporta Pass\@1 de 96,34% en HumanEval, 87,40% en MBPP, 64% en APPS y 51,33% en LiveCodeBench.
POR QUÉ IMPORTAel desarrollo autónomo requiere verificación de los verificadores, no solo generar más tests.
Ver problema que intenta resolver
un coding agent puede “arreglar” código siguiendo un test que también está equivocado.
generación de código, agentes, verificación.coding agentsTDD autónomo
20–26 JULIO 2026 · #05Imprescindible
TAP-RAG — Task-Aware Policy Control for Long-Document Multimodal Question Answering
Zhong Ji, Keqi Jin, Yan Zhang, Jiasheng Li. · 21 julio 2026.
IDEA CENTRALTAP-RAG no usa la misma estrategia para todas las preguntas. Clasifica si una consulta necesita evidencia visual, local, global o estructural y crea una política de recuperación específica. Puede recorrer el grafo documental, inspeccionar páginas como imágenes cuando importa el layout y abstenerse cuando falta evidencia. Mejora un baseline multimodal RAG en +9,1 puntos en DocBench y +4,5 en MMLongBench-Doc.
POR QUÉ IMPORTARAG empieza a convertirse en policy learning/orchestration, no simplemente embedding + top-K.
Ver problema que intenta resolver
buscar una cifra en una tabla y comprender una relación global entre 100 páginas requieren estrategias distintas.
RAG multimodal.contratosinformes financieros
20–26 JULIO 2026 · #06Imprescindible
Sound Probabilistic Safety Bounds for Large Language Models
Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani, Alessandro Abate. · 22 julio 2026.
IDEA CENTRALEn vez de preguntar simplemente “¿el modelo falló en nuestro red-team?”, calcula límites probabilísticos matemáticamente sólidos sobre la probabilidad de producir contenido dañino. Usa intervalos Clopper-Pearson y búsqueda guiada mediante representaciones latentes para explorar eficientemente ramas peligrosas del árbol autoregresivo.
POR QUÉ IMPORTAintroduce lenguaje cercano a certificación estadística, especialmente atractivo para IA regulada.
Ver problema que intenta resolver
una evaluación empírica de seguridad nunca demuestra que un fallo raro no exista.
alignment, safety, evaluación.certificaciónevaluación de modelos
20–26 JULIO 2026 · #07Imprescindible
IteraSim RAG — A Multi-Stage Retrieval-Augmented Agentic Back-End for OpenFOAM CFD
Autores no consignados en el material recibido. · 22 julio 2026.
IDEA CENTRALSistema para configurar automáticamente simulaciones CFD en OpenFOAM. Expande queries desde varios ángulos, fusiona rankings, separa retrieval operacional de consultas físicas y divide el trabajo entre Architect, InputWriter y Reviewer. Los seis casos de referencia ejecutan correctamente en OpenFOAM y el Reviewer diagnostica/repara casos deliberadamente corruptos.
POR QUÉ IMPORTAdemuestra el patrón que considero más valioso para IA industrial: RAG + conocimiento canónico + agentes especializados + ejecución real como verificador.
Ver problema que intenta resolver
configurar correctamente CFD exige conocimiento experto distribuido entre documentación, parámetros y restricciones físicas.
RAG agentic, ingeniería.CAECFD
20–26 JULIO 2026 · #08Imprescindible
Scaling Native Multimodal Pre-Training From Scratch
Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu. · 24 julio 2026.
IDEA CENTRALEstudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM. Encuentra scaling laws diferentes para lenguaje y multimodalidad y deriva una frontera eficiente entre tamaño del modelo, número de tokens y composición text/image. También observa transferencia positiva hacia razonamiento espacial puramente textual.
POR QUÉ IMPORTApodría influir directamente en cómo se diseñe la próxima generación de foundation models.
Ver problema que intenta resolver
conocemos bastante las leyes de escalado del lenguaje, pero mucho menos las de modelos multimodales nativos.
multimodalidad, scaling laws.diseño de VLMsplanificación de datasets y presupuestos de pretraining.
20–26 JULIO 2026 · #09Interesante
GenDB — Instance-Optimized and Customized Query Processing Code Generation via LLM Agents
Jiale Lao, Immanuel Trummer. · 22 julio 2026.
IDEA CENTRALEn vez de seguir ampliando motores SQL genéricos, GenDB hace que agentes generen código de ejecución específico para los datos, hardware y workload concretos. Las queries repetitivas amortizan el coste de generación; un DBMS convencional continúa ejecutando consultas ad hoc. El prototipo incluye fuzz testing e inspección para validar corrección.
POR QUÉ IMPORTAes otra señal del paradigma “generar software especializado en vez de ejecutar software universal”.
Ver problema que intenta resolver
los motores genéricos deben servir miles de patrones aunque una empresa utilice repetidamente unos pocos.
agentes empresariales, bases de datos, generación de código.analyticsdata warehouses
20–26 JULIO 2026 · #10Interesante
Copy Less, Ground More
Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang. · 21 julio 2026.
IDEA CENTRALDetecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos. Propone GEAR, una recompensa que favorece evidencia relevante y penaliza copiar distractores. Mejora hasta +4,6 puntos y reduce simultáneamente longitud del pensamiento y copying.
POR QUÉ IMPORTAcuestiona otra vez la idea de que “pensar más” sea suficiente; importa sobre qué evidencia se piensa.
Ver problema que intenta resolver
más tokens de reasoning no significan necesariamente mejor razonamiento.
reasoning, long-context.long-contextagentes documentales
20–26 JULIO 2026 · #11Interesante
Athena-Brain-8B — An Efficient Robot Brain for General Intelligence and Embodied Interaction
Jialian Li, Junhong Liu, Yuchen Cao et al. · 21 julio 2026.
IDEA CENTRALLLM de 8B diseñado específicamente como cerebro ejecutable localmente para sistemas físicos. Combina SFT general, RL general, entrenamiento embodied y model merging. Mantiene rendimiento cercano a Qwen3-8B thinking en capacidades generales con respuestas mucho más cortas y supera a varios modelos considerablemente mayores en benchmarks embodied zero-shot.
POR QUÉ IMPORTArefuerza la tesis de modelos compactos especializados como controladores locales.
Ver problema que intenta resolver
los frontier models son demasiado pesados y verbosos para control robótico frecuente.
modelos pequeños, embodied AI.robotsAGVs
20–26 JULIO 2026 · #12Interesante
KaPilot — LLM-Assisted Generation of Kani Specifications for Unsafe Rust Verification
Minghua Wang, Yuxi Ling, Mingzhi Gao, Yuwei Liu, Lin Huang. · 24 julio 2026.
IDEA CENTRALSistema multiagente que genera especificaciones formales para verificar código unsafe de Rust con Kani. Agentes separados extraen requisitos de seguridad, generan especificaciones, hacen prechecks y verifican/refinan los candidatos. Logra especificaciones verificables en 88,9% de funciones con ground truth y 71,4% sin él.
POR QUÉ IMPORTApuede ser un puente entre LLMs probabilísticos y garantías formales.
Ver problema que intenta resolver
la verificación formal es potente, pero escribir especificaciones manualmente es uno de sus mayores cuellos de botella.
código, agentes, verificación formal.secure codingsoftware crítico
20–26 JULIO 2026 · #13Interesante
On Improving Faithfulness of Podcasts from Documents
Soumya Dutta, Tejas Indulal Dhamecha, Pannaga Shivaswamy. · 24 julio 2026.
IDEA CENTRALAnaliza sistemáticamente alucinaciones en podcasts generados desde documentos, construyendo un dataset de más de 1.500 documentos en cinco dominios. Incluso modelos avanzados introducen afirmaciones no respaldadas. Su enfoque catch-n-repair detecta turnos infieles y los reescribe manteniendo la conversación.
POR QUÉ IMPORTAel mismo patrón afecta a informes, newsletters, vídeos, resúmenes ejecutivos y contenido generado automáticamente.
Ver problema que intenta resolver
transformar un documento en contenido largo crea oportunidades acumulativas de alucinación.
grounding, multimodal/content generation.NotebookLM-like productspodcasts
20–26 JULIO 2026 · #14Vigilar
Towards Trustworthy and Cost-Efficient Data Integration: From Naïve RAG to Agentic RAG
Chuangtao Ma, Arijit Khan. · 24 julio 2026.
IDEA CENTRALTrabajo de síntesis sobre la evolución RAG → GraphRAG/KG-RAG → Agentic RAG específicamente para integración de datos empresariales. Pone en el centro verificabilidad, trazabilidad, robustez frente a alucinaciones y coste computacional.
POR QUÉ IMPORTAno introduce una técnica disruptiva, pero describe bastante bien hacia dónde se está consolidando la arquitectura enterprise.
Ver problema que intenta resolver
integrar datos corporativos mediante agentes requiere garantías muy distintas de las de un chatbot documental.
enterprise RAG.master data managemententity resolution
20–26 JULIO 2026 · #15Vigilar
GRACE — Fine-Tuning for Sustainable and Accurate Personalization
Yibowen Zhao, Yinan Zhang, Ning Liu, Lizhen Cui, Chunyan Miao. · 24 julio 2026.
IDEA CENTRALIntegra criterios como sostenibilidad o salud directamente en un recomendador preentrenado mediante fine-tuning, evitando entrenar otro modelo desde cero o añadir un costoso reranker. Introduce una aproximación diferenciable a estos objetivos y proyección de gradientes para reducir conflictos entre relevancia personal y sostenibilidad.
POR QUÉ IMPORTAel patrón es más general que “green recommendation”: permite pensar en recomendadores que optimizan múltiples valores explícitos.
Ver problema que intenta resolver
los sistemas de recomendación optimizan engagement/relevancia aunque existan otros objetivos empresariales o sociales.
recomendación, personalización.marketplacesalimentación