NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · ARCHIVE / INGESTION LOG

Todo lo que ha entrado en el radar, sin esconder la deuda.

Este archivo transforma el research que me has enviado en una base navegable: conserva las ideas, separa una fuente primaria enlazada de una lectura completa y evita que una síntesis editorial se haga pasar por evidencia del paper.

169 señales importadas11 cortes semanales169 fichas públicas157 lecturas completas12 lecturas pendientes0 sin fuente primaria
ARCHIVESUPPLIED RESEARCH / SOURCE HYGIENE

El radar completo, con sus huecos a la vista.

He incorporado 11 cortes que has enviado como señales de investigación. Las fichas públicas llevan a una página navegable; la etiqueta de madurez distingue una lectura primaria completa de una síntesis canonizada que todavía necesita lectura editorial profunda.

LEDGER DE IMPORTACIÓN16911 cortes · 169 páginas publicadas0 fuentes primarias pendientes
15 señales encontradas · mostrando 15 · El corpus conserva 169 señales con fuente primaria enlazada y las 169 apuntan a una ficha pública. El corte 24–30 de agosto añade 8 lecturas primarias completas y 12 señales del scout con lectura pendiente; estas últimas se publican como descubrimientos enlazados y no se usan como evidencia. La revisión editorial humana sigue separada del resultado automatizado. La extracción de fuente no convierte automáticamente una inferencia en un reported-result.
20–26 JULIO 2026 · #01Imprescindible

SIREN — PAIR-Driven Preference Manipulation in Web-RAG Recommenders

Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann. · 24 julio 2026.

IDEA CENTRAL

SIREN estudia algo directamente relacionado con el futuro del SEO: ¿puede una web modificar su contenido para conseguir que un asistente con búsqueda la coloque como recomendación nº1? Manteniendo exactamente las mismas fuentes recuperadas y modificando solamente una página, consigue alcanzar el primer puesto en 62 de 124 intentos; los ataques exitosos se reproducen en sesiones nuevas con una tasa media de 80,5%. Curiosamente, afirmaciones declarativas de ranking y listas sembradas funcionaron mejor que instrucciones explícitas tipo prompt injection.

POR QUÉ IMPORTA

Pendiente de extracción editorial verificable.

Ver problema que intenta resolver

los asistentes web ya son sistemas de ranking, pero sus resultados pueden manipularse a través del contenido que leen. Por qué puede ser importante: es una de las señales más claras que he visto de que GEO/Generative Engine Optimization tendrá una dimensión adversarial similar al SEO, aunque con mecanismos diferentes.

búsqueda generativa, GEO/LLMO, seguridad.auditoría GEOrobustez de buscadores generativos
20–26 JULIO 2026 · #02Imprescindible

PRO-LONG — Programmatic Memory Enables Long-Horizon Reasoning

Alexis Fox, Junlin Wang, Paul Rosu, Bhuwan Dhingra. · 22 julio 2026.

IDEA CENTRAL

En vez de resumir continuamente la memoria o meter todo el historial en contexto, PRO-LONG guarda una traza completa y estructurada de interacción y permite que el agente la busque programáticamente, aprovechando precisamente las capacidades adquiridas por los coding agents. En ARC-AGI-3 mejora en promedio 18 puntos frente al agente base y alcanza hasta 76,1% pass\@1 usando 4,2–5,8× menos tokens.

POR QUÉ IMPORTA

propone una alternativa conceptual muy buena a “más ventana de contexto”: guardar todo, pero convertir la memoria en algo consultable mediante programas.

Ver problema que intenta resolver

cuanto más historial conserva un agente, más difícil resulta encontrar luego lo que realmente necesita.

agentes, memoria, long-horizon reasoning.coding agentsasistentes de proyecto
20–26 JULIO 2026 · #03Imprescindible

PyroDash — Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong, Sicong Xia, Jianyao Ma, Yicheng Ding. · 22 julio 2026.

IDEA CENTRAL

Un modelo pequeño genera normalmente y aprende a emitir un token especial cuando necesita ayuda. Solo entonces transfiere la query y el razonamiento parcial a un LLM grande. No requiere router externo ni acceso a logits del modelo grande. En una configuración reduce el coste de $49,36 a $1,78, usando solo 1,9% de tokens del LLM grande; en otra supera incluso la precisión del baseline LLM-only reduciendo a la vez el coste un 20,4%.

POR QUÉ IMPORTA

esta arquitectura podría convertirse en un patrón estándar: SLM por defecto + frontier model bajo demanda.

Ver problema que intenta resolver

usar un frontier model para cada token es económicamente absurdo cuando gran parte del trabajo puede resolverlo un SLM.

SLM, eficiencia, reasoning.copilotosagentes empresariales
20–26 JULIO 2026 · #04Imprescindible

MineValiCoder — Reliable Code Generation with Test Case Quality Mining and Bipartite Graph-Based Mutual Validation

Zhen Zhao, Qihang Yang, Feifei Dai, Xiangfang Li, Bo Li. · 24 julio 2026.

IDEA CENTRAL

Trata código y tests como dos fuentes potencialmente defectuosas que deben validarse mutuamente. Primero filtra tests incorrectos; después genera/refina múltiples soluciones y finalmente construye un grafo bipartito código-test para identificar conjuntamente qué candidatos y pruebas son fiables. Reporta Pass\@1 de 96,34% en HumanEval, 87,40% en MBPP, 64% en APPS y 51,33% en LiveCodeBench.

POR QUÉ IMPORTA

el desarrollo autónomo requiere verificación de los verificadores, no solo generar más tests.

Ver problema que intenta resolver

un coding agent puede “arreglar” código siguiendo un test que también está equivocado.

generación de código, agentes, verificación.coding agentsTDD autónomo
20–26 JULIO 2026 · #05Imprescindible

TAP-RAG — Task-Aware Policy Control for Long-Document Multimodal Question Answering

Zhong Ji, Keqi Jin, Yan Zhang, Jiasheng Li. · 21 julio 2026.

IDEA CENTRAL

TAP-RAG no usa la misma estrategia para todas las preguntas. Clasifica si una consulta necesita evidencia visual, local, global o estructural y crea una política de recuperación específica. Puede recorrer el grafo documental, inspeccionar páginas como imágenes cuando importa el layout y abstenerse cuando falta evidencia. Mejora un baseline multimodal RAG en +9,1 puntos en DocBench y +4,5 en MMLongBench-Doc.

POR QUÉ IMPORTA

RAG empieza a convertirse en policy learning/orchestration, no simplemente embedding + top-K.

Ver problema que intenta resolver

buscar una cifra en una tabla y comprender una relación global entre 100 páginas requieren estrategias distintas.

RAG multimodal.contratosinformes financieros
20–26 JULIO 2026 · #06Imprescindible

Sound Probabilistic Safety Bounds for Large Language Models

Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani, Alessandro Abate. · 22 julio 2026.

IDEA CENTRAL

En vez de preguntar simplemente “¿el modelo falló en nuestro red-team?”, calcula límites probabilísticos matemáticamente sólidos sobre la probabilidad de producir contenido dañino. Usa intervalos Clopper-Pearson y búsqueda guiada mediante representaciones latentes para explorar eficientemente ramas peligrosas del árbol autoregresivo.

POR QUÉ IMPORTA

introduce lenguaje cercano a certificación estadística, especialmente atractivo para IA regulada.

Ver problema que intenta resolver

una evaluación empírica de seguridad nunca demuestra que un fallo raro no exista.

alignment, safety, evaluación.certificaciónevaluación de modelos
20–26 JULIO 2026 · #07Imprescindible

IteraSim RAG — A Multi-Stage Retrieval-Augmented Agentic Back-End for OpenFOAM CFD

Autores no consignados en el material recibido. · 22 julio 2026.

IDEA CENTRAL

Sistema para configurar automáticamente simulaciones CFD en OpenFOAM. Expande queries desde varios ángulos, fusiona rankings, separa retrieval operacional de consultas físicas y divide el trabajo entre Architect, InputWriter y Reviewer. Los seis casos de referencia ejecutan correctamente en OpenFOAM y el Reviewer diagnostica/repara casos deliberadamente corruptos.

POR QUÉ IMPORTA

demuestra el patrón que considero más valioso para IA industrial: RAG + conocimiento canónico + agentes especializados + ejecución real como verificador.

Ver problema que intenta resolver

configurar correctamente CFD exige conocimiento experto distribuido entre documentación, parámetros y restricciones físicas.

RAG agentic, ingeniería.CAECFD
20–26 JULIO 2026 · #08Imprescindible

Scaling Native Multimodal Pre-Training From Scratch

Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu. · 24 julio 2026.

IDEA CENTRAL

Estudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM. Encuentra scaling laws diferentes para lenguaje y multimodalidad y deriva una frontera eficiente entre tamaño del modelo, número de tokens y composición text/image. También observa transferencia positiva hacia razonamiento espacial puramente textual.

POR QUÉ IMPORTA

podría influir directamente en cómo se diseñe la próxima generación de foundation models.

Ver problema que intenta resolver

conocemos bastante las leyes de escalado del lenguaje, pero mucho menos las de modelos multimodales nativos.

multimodalidad, scaling laws.diseño de VLMsplanificación de datasets y presupuestos de pretraining.
20–26 JULIO 2026 · #09Interesante

GenDB — Instance-Optimized and Customized Query Processing Code Generation via LLM Agents

Jiale Lao, Immanuel Trummer. · 22 julio 2026.

IDEA CENTRAL

En vez de seguir ampliando motores SQL genéricos, GenDB hace que agentes generen código de ejecución específico para los datos, hardware y workload concretos. Las queries repetitivas amortizan el coste de generación; un DBMS convencional continúa ejecutando consultas ad hoc. El prototipo incluye fuzz testing e inspección para validar corrección.

POR QUÉ IMPORTA

es otra señal del paradigma “generar software especializado en vez de ejecutar software universal”.

Ver problema que intenta resolver

los motores genéricos deben servir miles de patrones aunque una empresa utilice repetidamente unos pocos.

agentes empresariales, bases de datos, generación de código.analyticsdata warehouses
20–26 JULIO 2026 · #10Interesante

Copy Less, Ground More

Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang. · 21 julio 2026.

IDEA CENTRAL

Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos. Propone GEAR, una recompensa que favorece evidencia relevante y penaliza copiar distractores. Mejora hasta +4,6 puntos y reduce simultáneamente longitud del pensamiento y copying.

POR QUÉ IMPORTA

cuestiona otra vez la idea de que “pensar más” sea suficiente; importa sobre qué evidencia se piensa.

Ver problema que intenta resolver

más tokens de reasoning no significan necesariamente mejor razonamiento.

reasoning, long-context.long-contextagentes documentales
20–26 JULIO 2026 · #11Interesante

Athena-Brain-8B — An Efficient Robot Brain for General Intelligence and Embodied Interaction

Jialian Li, Junhong Liu, Yuchen Cao et al. · 21 julio 2026.

IDEA CENTRAL

LLM de 8B diseñado específicamente como cerebro ejecutable localmente para sistemas físicos. Combina SFT general, RL general, entrenamiento embodied y model merging. Mantiene rendimiento cercano a Qwen3-8B thinking en capacidades generales con respuestas mucho más cortas y supera a varios modelos considerablemente mayores en benchmarks embodied zero-shot.

POR QUÉ IMPORTA

refuerza la tesis de modelos compactos especializados como controladores locales.

Ver problema que intenta resolver

los frontier models son demasiado pesados y verbosos para control robótico frecuente.

modelos pequeños, embodied AI.robotsAGVs
20–26 JULIO 2026 · #12Interesante

KaPilot — LLM-Assisted Generation of Kani Specifications for Unsafe Rust Verification

Minghua Wang, Yuxi Ling, Mingzhi Gao, Yuwei Liu, Lin Huang. · 24 julio 2026.

IDEA CENTRAL

Sistema multiagente que genera especificaciones formales para verificar código unsafe de Rust con Kani. Agentes separados extraen requisitos de seguridad, generan especificaciones, hacen prechecks y verifican/refinan los candidatos. Logra especificaciones verificables en 88,9% de funciones con ground truth y 71,4% sin él.

POR QUÉ IMPORTA

puede ser un puente entre LLMs probabilísticos y garantías formales.

Ver problema que intenta resolver

la verificación formal es potente, pero escribir especificaciones manualmente es uno de sus mayores cuellos de botella.

código, agentes, verificación formal.secure codingsoftware crítico
20–26 JULIO 2026 · #13Interesante

On Improving Faithfulness of Podcasts from Documents

Soumya Dutta, Tejas Indulal Dhamecha, Pannaga Shivaswamy. · 24 julio 2026.

IDEA CENTRAL

Analiza sistemáticamente alucinaciones en podcasts generados desde documentos, construyendo un dataset de más de 1.500 documentos en cinco dominios. Incluso modelos avanzados introducen afirmaciones no respaldadas. Su enfoque catch-n-repair detecta turnos infieles y los reescribe manteniendo la conversación.

POR QUÉ IMPORTA

el mismo patrón afecta a informes, newsletters, vídeos, resúmenes ejecutivos y contenido generado automáticamente.

Ver problema que intenta resolver

transformar un documento en contenido largo crea oportunidades acumulativas de alucinación.

grounding, multimodal/content generation.NotebookLM-like productspodcasts
20–26 JULIO 2026 · #14Vigilar

Towards Trustworthy and Cost-Efficient Data Integration: From Naïve RAG to Agentic RAG

Chuangtao Ma, Arijit Khan. · 24 julio 2026.

IDEA CENTRAL

Trabajo de síntesis sobre la evolución RAG → GraphRAG/KG-RAG → Agentic RAG específicamente para integración de datos empresariales. Pone en el centro verificabilidad, trazabilidad, robustez frente a alucinaciones y coste computacional.

POR QUÉ IMPORTA

no introduce una técnica disruptiva, pero describe bastante bien hacia dónde se está consolidando la arquitectura enterprise.

Ver problema que intenta resolver

integrar datos corporativos mediante agentes requiere garantías muy distintas de las de un chatbot documental.

enterprise RAG.master data managemententity resolution
20–26 JULIO 2026 · #15Vigilar

GRACE — Fine-Tuning for Sustainable and Accurate Personalization

Yibowen Zhao, Yinan Zhang, Ning Liu, Lizhen Cui, Chunyan Miao. · 24 julio 2026.

IDEA CENTRAL

Integra criterios como sostenibilidad o salud directamente en un recomendador preentrenado mediante fine-tuning, evitando entrenar otro modelo desde cero o añadir un costoso reranker. Introduce una aproximación diferenciable a estos objetivos y proyección de gradientes para reducir conflictos entre relevancia personal y sostenibilidad.

POR QUÉ IMPORTA

el patrón es más general que “green recommendation”: permite pensar en recomendadores que optimizan múltiples valores explícitos.

Ver problema que intenta resolver

los sistemas de recomendación optimizan engagement/relevancia aunque existan otros objetivos empresariales o sociales.

recomendación, personalización.marketplacesalimentación