NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IACONCEPT DOSSIER
/ CONCEPTO EMERGENTE · EMERGING

Recovery selectivo en lugar de autocorrección general

Diagnosticar el modo de fallo antes de elegir una recuperación reduce reintentos ciegos y presupuesto desperdiciado.

POR QUÉ APARECE

Aparece en 16 documentos, 14 papers y 6 semanas; conecta 7 líneas del radar.

El concepto se detecta por coincidencia de alias en el corpus de señales y fichas públicas. La coincidencia propone una línea de investigación; no demuestra que los papers compartan mecanismo causal.

NOVEDAD6/10
CONEXIÓN8/10
DOCUMENTOS16
FUENTES PENDIENTES0
PAPERS Y CLAIMS

La evidencia detrás de la hipótesis.

Argumenta que muchos benchmarks castigan formato más que conocimiento. Propone adaptar solo 10 vectores de soft-prompt para separar conocimiento real de capacidad de seguir formato. En 7 modelos y 7 datasets, satura format-following en unas 80 steps y predice mejor el ranking post-training que zero/few-shot.

Resultado con fuente enlazada · v1
#116 · AGENTES · EVALUACIÓN

AgentCompass

Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.

Resultado con fuente enlazada · v3
#117 · MEMORIA · AGENTES · MULTIMODAL

PalmClaw

En lugar de controlar un móvil mediante interminables secuencias de taps y swipes, ejecuta el propio loop agentic, memoria, skills y herramientas directamente en el dispositivo, exponiendo capacidades del teléfono como tools con argumentos y resultados estructurados.

Resultado con fuente enlazada · v1
#135 · MULTIMODAL · MODELOS PEQUEÑOS

Scaling Native Multimodal Pre-Training From Scratch

Estudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM. Encuentra scaling laws diferentes para lenguaje y multimodalidad y deriva una frontera eficiente entre tamaño del modelo, número de tokens y composición text/image. También observa transferencia positiva hacia razonamiento espacial puramente textual.

Resultado con fuente enlazada · v1

Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos. Propone GEAR, una recompensa que favorece evidencia relevante y penaliza copiar distractores. Mejora hasta +4,6 puntos y reduce simultáneamente longitud del pensamiento y copying.

Resultado con fuente enlazada · v2
#152 · MEMORIA · AGENTES · MODELOS PEQUEÑOS

NeSyFS

Representa el estado de creencias del agente mediante un knowledge graph. Un módulo rápido actúa reactivamente; otro lento planifica bajo incertidumbre. La reflexión detecta fallos repetidos y decide cuándo escalar del modo rápido al lento.

Resultado con fuente enlazada · v2
#35 · SEARCH AGENTS · RL · GENERALIZACIÓN

Cross-Domain Hybrid OPD

El trabajo combina reinforcement learning para búsqueda con on-policy distillation de expertos de dominios generales para reducir el alignment tax de la especialización.

Resultado con fuente enlazada · v1
#16 · RECOVERY · REASONING · AGENTES

Diagnosis Before Recovery

El sistema clasifica el error —acción incorrecta, esquema inválido, evidencia insuficiente, ruta API errónea, entre otros— y solo después selecciona el mecanismo de recuperación adecuado.

Resultado con fuente enlazada · v1
#26 · RAG · INFRAESTRUCTURA · EFICIENCIA

RAG-Stack

RAG-Stack explora conjuntamente configuraciones algorítmicas y de serving para encontrar fronteras Pareto de calidad-rendimiento sin desplegar y medir exhaustivamente cada candidato.

Resultado con fuente enlazada · v1
#27 · AGENTIC RAG · EVALUACIÓN · PROCEDIMIENTO

Before Reasoning Can Fail

El paper separa los fallos procedimentales previos a la evidencia de los errores posteriores de lectura y razonamiento, y evalúa Read-Gate como una invariante mínima que obliga a leer antes de finalizar.

Resultado con fuente enlazada · v2
#121 · SEGURIDAD · MULTIMODAL

OvisOCR2 Technical Report

Modelo de solo 0,8B parámetros que transforma directamente una página en Markdown ordenado, incluyendo texto, fórmulas, tablas y regiones visuales. Combina SFT, RL en una rama 4B, destilación on-policy hacia 0,8B y model fusion.

Resultado con fuente enlazada · v1
#122 · AGENTES · EVALUACIÓN

AgentCheck

Workbench open source para introducir fallos controlados en tools MCP —timeouts, datos obsoletos, descripciones manipuladas, etc.— y repetir exactamente el escenario antes y después de aplicar una mitigación.

Resultado con fuente enlazada · v3

Intenta localizar qué pasos provocaron el fracaso de una trayectoria sin necesitar anotaciones de errores paso a paso. El modelo aprende exclusivamente de trayectorias exitosas y utiliza ese conocimiento para señalar pasos anómalos dentro de ejecuciones fallidas.

Resultado con fuente enlazada · v1

LLM de 8B diseñado específicamente como cerebro ejecutable localmente para sistemas físicos. Combina SFT general, RL general, entrenamiento embodied y model merging. Mantiene rendimiento cercano a Qwen3-8B thinking en capacidades generales con respuestas mucho más cortas y supera a varios modelos considerablemente mayores en benchmarks embodied zero-shot.

Resultado con fuente enlazada · v2
SIGUIENTE EXPERIMENTO

¿Qué taxonomía mínima de fallos permite elegir una recuperación mejor que reintentar?

INPUT: Tres clases de fallo observables con playbooks específicos y un fallback seguro.

MÉTRICA: tasa de éxito, pasos, coste y repetición del mismo error

REGLA DE PARADA: Parar si el diagnóstico no supera un reintento controlado o enruta fallos a una acción peligrosa.

HUECOS E INCERTIDUMBRES

↳ No hay huecos editoriales adicionales; mantener vigilancia en el siguiente corte.

LÍMITE DE USO

El soporte del concepto tiene fuente primaria enlazada en esta edición. Los claims reportados se deben leer en el bundle del paper y no inferirse desde la proximidad del punto.

Volver a la nube de conceptos Abrir herramientas MCP