PAPERS Y CLAIMSLa evidencia detrás de la hipótesis.
Argumenta que muchos benchmarks castigan formato más que conocimiento. Propone adaptar solo 10 vectores de soft-prompt para separar conocimiento real de capacidad de seguir formato. En 7 modelos y 7 datasets, satura format-following en unas 80 steps y predice mejor el ranking post-training que zero/few-shot.
Resultado con fuente enlazada · v1#116 · AGENTES · EVALUACIÓN Infraestructura open source que desacopla tres piezas normalmente mezcladas: Benchmark, Harness y Environment. Añade ejecución asíncrona tolerante a fallos y análisis de trayectorias para diagnosticar comportamientos como reward hacking. Soporta más de 20 benchmarks en cinco dimensiones de capacidad.
Resultado con fuente enlazada · v3#117 · MEMORIA · AGENTES · MULTIMODAL En lugar de controlar un móvil mediante interminables secuencias de taps y swipes, ejecuta el propio loop agentic, memoria, skills y herramientas directamente en el dispositivo, exponiendo capacidades del teléfono como tools con argumentos y resultados estructurados.
Resultado con fuente enlazada · v1#135 · MULTIMODAL · MODELOS PEQUEÑOS Estudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM. Encuentra scaling laws diferentes para lenguaje y multimodalidad y deriva una frontera eficiente entre tamaño del modelo, número de tokens y composición text/image. También observa transferencia positiva hacia razonamiento espacial puramente textual.
Resultado con fuente enlazada · v1Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos. Propone GEAR, una recompensa que favorece evidencia relevante y penaliza copiar distractores. Mejora hasta +4,6 puntos y reduce simultáneamente longitud del pensamiento y copying.
Resultado con fuente enlazada · v2#152 · MEMORIA · AGENTES · MODELOS PEQUEÑOS Representa el estado de creencias del agente mediante un knowledge graph. Un módulo rápido actúa reactivamente; otro lento planifica bajo incertidumbre. La reflexión detecta fallos repetidos y decide cuándo escalar del modo rápido al lento.
Resultado con fuente enlazada · v2#35 · SEARCH AGENTS · RL · GENERALIZACIÓN El trabajo combina reinforcement learning para búsqueda con on-policy distillation de expertos de dominios generales para reducir el alignment tax de la especialización.
Resultado con fuente enlazada · v1#16 · RECOVERY · REASONING · AGENTES El sistema clasifica el error —acción incorrecta, esquema inválido, evidencia insuficiente, ruta API errónea, entre otros— y solo después selecciona el mecanismo de recuperación adecuado.
Resultado con fuente enlazada · v1#26 · RAG · INFRAESTRUCTURA · EFICIENCIA RAG-Stack explora conjuntamente configuraciones algorítmicas y de serving para encontrar fronteras Pareto de calidad-rendimiento sin desplegar y medir exhaustivamente cada candidato.
Resultado con fuente enlazada · v1#27 · AGENTIC RAG · EVALUACIÓN · PROCEDIMIENTO El paper separa los fallos procedimentales previos a la evidencia de los errores posteriores de lectura y razonamiento, y evalúa Read-Gate como una invariante mínima que obliga a leer antes de finalizar.
Resultado con fuente enlazada · v2#121 · SEGURIDAD · MULTIMODAL Modelo de solo 0,8B parámetros que transforma directamente una página en Markdown ordenado, incluyendo texto, fórmulas, tablas y regiones visuales. Combina SFT, RL en una rama 4B, destilación on-policy hacia 0,8B y model fusion.
Resultado con fuente enlazada · v1#122 · AGENTES · EVALUACIÓN Workbench open source para introducir fallos controlados en tools MCP —timeouts, datos obsoletos, descripciones manipuladas, etc.— y repetir exactamente el escenario antes y después de aplicar una mitigación.
Resultado con fuente enlazada · v3Intenta localizar qué pasos provocaron el fracaso de una trayectoria sin necesitar anotaciones de errores paso a paso. El modelo aprende exclusivamente de trayectorias exitosas y utiliza ese conocimiento para señalar pasos anómalos dentro de ejecuciones fallidas.
Resultado con fuente enlazada · v1LLM de 8B diseñado específicamente como cerebro ejecutable localmente para sistemas físicos. Combina SFT general, RL general, entrenamiento embodied y model merging. Mantiene rendimiento cercano a Qwen3-8B thinking en capacidades generales con respuestas mucho más cortas y supera a varios modelos considerablemente mayores en benchmarks embodied zero-shot.
Resultado con fuente enlazada · v2