NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026

/ RESEARCH IA · EVIDENCE-LED FIELD NOTES

7—13 SEP 2026 / 15 FUENTES · 21 CLAIMS

De papers aislados a hipótesis que se pueden probar.

Un archivo vivo para conectar evidencia primaria, relaciones entre trabajos y pequeños experimentos. La portada orienta; cada ficha conserva qué está reportado, qué infiero y dónde deja de alcanzar la evidencia.

FICHAS PÚBLICAS
169
LECTURAS PRIMARIAS
157
HIPÓTESIS PUBLICADAS
5
LÍNEAS DE DESARROLLO
8
01LATEST EDITORIAL BRIEF / WHAT CHANGED

Qué merece atención ahora.

El último corte desarrollado antes del archivo completo: la tesis vigente, las señales que la mueven y el siguiente nivel de lectura.

7—13 SEP 2026 · CORTE SEMANAL

La capacidad del agente también depende de cómo se verifica.

Quince trabajos desplazan la unidad de calidad: no basta con medir el modelo. Hay que auditar el benchmark, observar todos los canales de ejecución, comprobar la interfaz real y decidir cuándo recuperar o abstenerse.

Abrir el corte completo
TESIS DE TRABAJO

La capacidad útil aparece en el sistema que rodea al modelo.

Interfaz, memoria, evidencia, recuperación y políticas explican por qué dos agentes con modelos parecidos pueden producir resultados muy distintos.

  1. SEÑALAlgo cambia en varias fuentes.
  2. RELACIÓNLa conexión formula una hipótesis.
  3. PRUEBAUna métrica y una parada deciden si conservarla.
01 / 01

El agente se está convirtiendo en sistema.

Skills, harnesses, assurance y recovery forman una capa técnica alrededor del modelo. El salto de fiabilidad puede venir del proceso, no solo de un modelo más capaz.

02 / 02

RAG enterprise necesita joins verificables.

La arquitectura emergente combina SQL, APIs, documentos, retrieval y políticas. La respuesta deja de ser top-K más LLM y se convierte en una cadena de evidencia.

03 / 03

La visibilidad en IA será una economía de incentivos.

GEO, ranking y retrieval apuntan a un mismo movimiento: hacer explícita la estrategia, medir la atribución y premiar señales que resisten la verificación.

02HYPOTHESES / TESTED AGAINST THE CORPUS

Conectar papers obliga a arriesgar una afirmación.

Estas publicaciones no suman resúmenes: declaran una hipótesis, comprueban procedencia y cobertura, muestran qué la apoya o refuta y dejan un experimento de producción todavía pendiente.

01 / EVIDENCIA / RECUPERACIÓN / DECISIÓNAPOYADA POR EL CORPUS

Un agente fiable necesita un orden de lectura, no solo más capacidad

La triangulación del corpus apoya la dirección: los cuatro trabajos aportan evidencia sobre lectura, recuperación, optimización o diagnóstico. El resultado es convergencia arquitectónica, no una prueba conjunta de causalidad.

5/5 checks documentalesVer prueba y crítica ↗
02 / INTERFAZ / MEMORIA / TIEMPOAPOYO PARCIAL

La unidad evaluable de un agente es sistema + memoria + mundo temporal

La hipótesis queda parcialmente apoyada: cada dimensión aparece medida, pero el corpus no contiene todavía una evaluación conjunta con el mismo agente, tarea y presupuesto.

5/5 checks documentalesVer prueba y crítica ↗
03 / POLÍTICAS / PRIVACIDAD / ACCIONESAPOYADA POR EL CORPUS

La gobernanza útil vive en el límite de acción, no dentro del prompt

La convergencia arquitectónica es fuerte: las fichas sostienen que consentimiento, política y minimización deben acompañar a la acción. Sigue faltando una comparación común de cobertura, latencia y usabilidad.

5/5 checks documentalesVer prueba y crítica ↗
04 / SKILLS / CONTRATOS / MEJORAAPOYO PARCIAL

Una skill reusable vale cuando conserva su contrato de comportamiento

La dirección queda parcialmente apoyada: los trabajos cubren piezas complementarias, pero no presentan una métrica común de reutilización segura ni una historia de rollback entre tareas y repositorios.

5/5 checks documentalesVer prueba y crítica ↗
05 / CAPACIDAD / WORKFLOW / LÍMITEREFUTADA EN SU VERSIÓN FUERTE

Más capacidad del modelo no garantiza fiabilidad de workflow largo

La versión fuerte de la hipótesis queda refutada por el corpus: las evaluaciones muestran que la capacidad no elimina por sí sola los fallos de workflow, interfaz, proactividad o harness. La versión débil —la capacidad ayuda— no queda refutada.

5/5 checks documentalesVer prueba y crítica ↗

Límite común: estos checks validan procedencia, cobertura y coherencia editorial. No prueban causalidad ni sustituyen una comparación controlada en producción.

03PAPER INDEX / FIND THE EVIDENCE

169 fichas para volver a la fuente, no para quedarse en el resumen.

El índice carga doce filas al principio y conserva filtros sobre un conjunto ligero. Cada ficha separa resultado reportado, síntesis editorial, inferencia, límite y siguiente prueba.

12 lecturas destacadas visibles · el índice completo de 169 se carga al buscar o filtrar.

  1. 01AGENTES · MÓVIL · EVALUACIÓNLectura primaria completaMobilePA-BenchUn agente móvil no se evalúa sólo por si pulsa el botón correcto: también debe coordinar herramientas, memoria y subagentes dentro de una tarea real.Imprescindible
  2. 02AGENTES · TOOL USE · LATENCIALectura primaria completaOODA-ToolSeparar observar, orientar, decidir y actuar puede mejorar el uso de herramientas, pero cada llamada secuencial tiene un precio operativo.Imprescindible
  3. 03AGENTES · GUI · SEGURIDADLectura primaria completaAnTrapUn agente de interfaz puede ejecutar la acción esperada y aun así caer en una trampa contextual colocada en el estado del entorno.Imprescindible
  4. 04RAG · RETRIEVAL · DECISIÓNLectura primaria completaMetaRAGLa recuperación útil no consiste en buscar siempre: consiste en aprender cuándo buscar, qué verificar y cuándo dejar de hacerlo.Imprescindible
  5. 05RAG · ABSTENCIÓN · EVALUACIÓNLectura primaria completaThe RATSi retrieval, generación y abstención se mezclan en un único score, es difícil saber si el agente falló por no encontrar, por no responder o por responder cuando debía callar.Imprescindible
  6. 06AGENTES · PLANIFICACIÓN · SEGURIDADLectura primaria completaSPAPlanificar primero permite revisar el flujo de información antes de que un agente convierta una intención en llamadas a herramientas.Imprescindible
  7. 07RAG · EVIDENCIA · TRAZABILIDADLectura primaria completaClueWeaverUna respuesta multi-hop es más auditable cuando el agente conserva las pistas que eligió y puede señalar el párrafo que sostiene cada salto.Imprescindible
  8. 08AGENTES · SERVING · SISTEMASLectura primaria completaTOPASCuando un workflow de agentes tiene forma de grafo, la topología también es una palanca de latencia y utilización.Interesante
  9. 09GEO · DISCOVERY · INCENTIVOSLectura primaria completaMechanism Design for Generative EngineEl descubrimiento dentro de un motor generativo no es solo un problema de contenido: es un problema de incentivos entre quien publica y quien decide qué citar.Imprescindible
  10. 10AGENTES · CODING · HARNESSLectura primaria completaThe Devil Is in the InterfaceCon las mismas capacidades de fondo, cambiar la forma de exponer las herramientas cambia el comportamiento, el coste y la consistencia del agente.Imprescindible
  11. 11SLM · SKILLS · RLLectura primaria completaSKILLERUn modelo fuerte puede enseñar a un modelo pequeño a ejecutar mejor, no transfiriendo pesos, sino produciendo skills que le resulten realmente ejecutables.Imprescindible
  12. 12AGENTES · APIs · RAG · EVALUACIÓNLectura primaria completaVAKRAEl agente empresarial no falla al pulsar una API: falla al conectar entidades, documentos, APIs y políticas sin perder el hilo.Imprescindible

El ranking y la fecha corresponden al corte editorial de agosto de 2026. Las versiones y resultados deben comprobarse en los localizadores de cada ficha.

Ver también las señales y semanas del archivo
04METHOD / SOURCE HYGIENE

Un radar útil deja ver cómo decide.

La publicación completa exige fuente primaria, versión, método, resultado localizable, límite y una próxima prueba acotada.

01 / FUENTEVolver al original.

Autores, versión y localizador permanecen junto al claim que sostienen.

02 / FRONTERAEtiquetar la inferencia.

La aplicación posible nunca se confunde con un resultado de los autores.

03 / SALIDADefinir la parada.

La hipótesis conserva métrica, baseline y condición para abandonarla.