NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IACONCEPT DOSSIER
/ CONCEPTO EMERGENTE · EMERGING

Alineamiento con preferencias y contexto de usuario

La personalización y el ranking intentan inferir preferencias sin confundir una señal de comportamiento con una instrucción permanente.

POR QUÉ APARECE

Aparece en 35 documentos, 25 papers y 11 semanas; conecta 8 líneas del radar.

El concepto se detecta por coincidencia de alias en el corpus de señales y fichas públicas. La coincidencia propone una línea de investigación; no demuestra que los papers compartan mecanismo causal.

NOVEDAD5/10
CONEXIÓN9/10
DOCUMENTOS35
FUENTES PENDIENTES0
PAPERS Y CLAIMS

La evidencia detrás de la hipótesis.

#39 · AGENTES · SEGURIDAD · MULTIMODAL

Minim

MINIM actúa como broker local que filtra el estado de la interfaz antes de enviarlo a un agente remoto. Puntúa cada elemento UI por sensibilidad y necesidad para la tarea, manteniendo, abstrayendo o eliminando información. Reduce fugas de datos irrelevantes sin destruir el contexto operativo necesario.

Resultado con fuente enlazada · v1
#41 · MEMORIA

REAL

Framework de memoria a largo plazo para LLMs basado en grafos y razonamiento. Ataca el límite del contexto almacenando, actualizando y recuperando interacciones históricas fuera de la ventana del modelo. Reporta una mejora media del 22,72% frente a memorias planas, grafos existentes y otros baselines.

Resultado con fuente enlazada · v1
#51 · MODELOS PEQUEÑOS

Atomic Intent Reasoning

AIR usa LLMs offline para construir representaciones de intención de usuario y luego las compone eficientemente online para recomendación cross-domain. Reporta alrededor de 400x aceleración de inferencia y A/B testing real en Kuaishou E-commerce con +3,446% de GMV.

Resultado con fuente enlazada · v1
#61 · EVALUACIÓN · CODING

Multi-LCB

Extiende LiveCodeBench a 12 lenguajes de programación manteniendo controles de contaminación y protocolo de evaluación.

Resultado con fuente enlazada · v1
#89 · AGENTES · EVALUACIÓN · SEGURIDAD

EvoPolicyGym

Benchmark para evaluar cómo agentes modifican políticas ejecutables bajo feedback e interacción acotada. Mide no solo resultado final, sino cómo el agente usa presupuesto, feedback y mecanismos de mejora.

Resultado con fuente enlazada · v1
#90 · MEMORIA

DRIFTLENS

Mide cómo la memoria personalizada cambia no solo la respuesta final, sino la trayectoria de razonamiento. Encuentra drift medio-alto en 4 LLMs y 10 categorías de atributos de usuario; GRPO/DPO reducen el fenómeno, pero no de forma uniforme.

Resultado con fuente enlazada · v2

Introduce los ataques de Agent Data Injection: en lugar de insertar instrucciones maliciosas, el atacante introduce datos falsos que parecen metadatos legítimos, identificadores, formatos de herramientas o respuestas confiables. Los autores demuestran ataques contra agentes web y de programación, incluyendo clics arbitrarios, ejecución remota de código y ataques de cadena de suministro.

Resultado con fuente enlazada · v1

Traslada el comportamiento estable de un agente desde el prompt hacia contratos explícitos: código determinista, schemas, manifests, validaciones y evidencias trazables. El LLM permanece reemplazable y las fuentes documentales conservan autoridad sobre la respuesta.

Resultado con fuente enlazada · v1
#119 · AGENTES

LongStraw

Aborda una asimetría creciente: los modelos pueden inferir con contextos enormes, pero el post-training RL suele quedarse alrededor de contextos mucho menores. LongStraw apunta a entrenar mediante RL sobre secuencias de más de dos millones de tokens manteniendo un presupuesto fijo de GPU.

Resultado con fuente enlazada · v3
#122 · AGENTES · EVALUACIÓN

AgentCheck

Workbench open source para introducir fallos controlados en tools MCP —timeouts, datos obsoletos, descripciones manipuladas, etc.— y repetir exactamente el escenario antes y después de aplicar una mitigación.

Resultado con fuente enlazada · v3

Integra criterios como sostenibilidad o salud directamente en un recomendador preentrenado mediante fine-tuning, evitando entrenar otro modelo desde cero o añadir un costoso reranker. Introduce una aproximación diferenciable a estos objetivos y proyección de gradientes para reducir conflictos entre relevancia personal y sostenibilidad.

Resultado con fuente enlazada · v1
#148 · AGENTES · SEGURIDAD · MULTIMODAL

Piggybacking on Perception

Estudia instrucciones maliciosas que se superponen a la voz legítima del usuario y parecen ruido ambiental o una fuente secundaria. Presenta AudioAgentSecurity, con ocho escenarios reales y diez patrones de ataque, evaluado sobre once agentes multimodales.

Resultado con fuente enlazada · v2
#153 · AGENTES · RAG

RecHarness

Un bandit selecciona la dirección de mejora de un recomendador según resultados históricos; después un LLM formula una hipótesis concreta y genera el cambio de código correspondiente.

Resultado con fuente enlazada · v1
#31 · DISCOVERY · RECOMENDACIÓN · AGENTES

Shape Your Feed

Shape Your Feed combina texto, voz y controles de interfaz para detectar intención, actualizar un perfil semántico persistente y rerankear o podar candidatos en tiempo real.

Resultado con fuente enlazada · v1
#34 · PRIVACIDAD · MULTIAGENTE · POLÍTICAS

MNC

MNC trata la comunicación como una declassification semántica con destinatario, propósito, reenvío, lifetime, logging y memory scope explícitos.

Resultado con fuente enlazada · v1
#17 · RANKING · RECOMMENDACIÓN · SLM

MetaStrategy

MetaStrategy expresa pesos de objetivos, preferencias, restricciones y políticas de posición en JSON. Un compilador ejecuta esa estrategia sobre el sistema de ranking y permite destilar el plan a modelos pequeños.

Resultado con fuente enlazada · v1
#159 · AGENTES · EVALUACIÓN · CODING

SWE Refactor Bench

Señal del scout sobre evaluación de refactors de software por agentes.

Síntesis editorial; ampliar lectura · por verificar
#161 · AGENTES · RAG

CAFE

Señal del scout sobre feedback coevolutivo para agentes de búsqueda que se mejoran a sí mismos.

Síntesis editorial; ampliar lectura · por verificar
#167 · AGENTES · SEGURIDAD

When Tool Outputs Become Commands

Señal del scout sobre la confusión entre salida de una herramienta e instrucción ejecutable.

Síntesis editorial; ampliar lectura · por verificar
#18 · RETRIEVAL · EMBEDDINGS · ADAPTACIÓN

TTT-Embed

TTT-Embed aprende un vector ligero en el espacio de salida de un encoder congelado usando únicamente scores de ranking. No cambia los pesos del modelo, las etiquetas ni el índice.

Resultado con fuente enlazada · v1
#36 · MULTIMODAL · EVALUACIÓN · HALLUCINATION

KnowHal

KnowHal unifica hallucinations de entidad, atributo, relación y conocimiento mediante preguntas positivas y negativas sobre las mismas imágenes.

Resultado con fuente enlazada · v1
#70 · RAG · EVALUACIÓN · MODELOS PEQUEÑOS

SHIFT

Ataca el conflicto entre conocimiento interno del modelo y contexto recuperado en RAG. Añade un módulo gate ligero que ajusta activaciones internas sin tocar el backbone, entrenando menos del 0,01% de parámetros. Valida en seis datasets y publica código/datasets.

Resultado con fuente enlazada · v1
#86 · AGENTES · EVALUACIÓN

ReContext

Método training-free para mejorar razonamiento en contexto largo. Usa señales internas del modelo para construir un pool de evidencia relevante y reinyectarlo antes de la respuesta final, sin podar el contexto original. Mejora en 8 datasets de 128K contexto en Qwen3 y Llama3.

Resultado con fuente enlazada · v1
SIGUIENTE EXPERIMENTO

¿Qué feedback representa una preferencia estable y cuál es sólo una respuesta contextual?

INPUT: Interacciones repetidas con cambios controlados de contexto y feedback explícito.

MÉTRICA: accuracy de preferencia, estabilidad, diversidad y reversibilidad

REGLA DE PARADA: Parar si la personalización hace difícil corregir una inferencia equivocada.

HUECOS E INCERTIDUMBRES

↳ No hay huecos editoriales adicionales; mantener vigilancia en el siguiente corte.

LÍMITE DE USO

El soporte del concepto tiene fuente primaria enlazada en esta edición. Los claims reportados se deben leer en el bundle del paper y no inferirse desde la proximidad del punto.

Volver a la nube de conceptos Abrir herramientas MCP