NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/PAPER 06

REASONING · OPTIMIZACIÓN · AI SCIENTIST

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

ImprescindibleLectura primaria completa

El agente deja de ser el generador de candidatos dentro del optimizador y empieza a decidir qué probar, cómo diagnosticar y cuándo parar.

AUTHORS / LABJunbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu y Zhewei Yao
FECHA07 AGO 2026
LECTURALectura primaria completa
LECTURA DE 60 SEGUNDOS

Lo esencial antes de invertir más tiempo.

HALLAZGO

ReASearch usa un mismo bucle con herramientas, memoria persistente y ejecución Python para optimizar prompts, programas y workflows ML mediante decisiones de búsqueda razonadas.

EVIDENCIA DISPONIBLE

El sistema reporta mejoras de 2% a 40% sobre baselines especializados en 14 tareas de prompts, programas y workflows ML.

Resultado reportado con fuente enlazada · 3 localizadores disponibles.
LÍMITE

La capacidad de búsqueda autónoma depende de las herramientas, evaluadores y presupuestos disponibles; resultados superiores en tareas acotadas no demuestran optimización abierta segura ni económica.

SIGUIENTE PRUEBA

Mejora mediana, robustez a perturbaciones, coste de cómputo y regresiones por tarea.

EN UNA FRASE

ReASearch usa un mismo bucle con herramientas, memoria persistente y ejecución Python para optimizar prompts, programas y workflows ML mediante decisiones de búsqueda razonadas.

SEÑALOptimización · Reasoning · AI scientist
EVIDENCIAResultado reportado con fuente enlazada
CONFIANZA EDITORIALAlta
RESULTADOS / PROCEDENCIA

Qué está reportado y qué conviene comprobar.

Hay resultado reportado con fuente enlazada.
RESULTADO REPORTADO

El sistema reporta mejoras de 2% a 40% sobre baselines especializados en 14 tareas de prompts, programas y workflows ML.

+2% a +40% · baseline: baselines especializados · contexto: 14 tareas de prompts, programas y workflows ML

LECTURA DEL PAPER / SÍNTESIS EDITORIAL

Qué estudiaron y qué cambia.

La síntesis está separada de los resultados reportados y de las inferencias.

ReASearch cambia el papel del modelo dentro de la optimización. En muchos sistemas el LLM propone candidatos, pero un algoritmo externo decide qué candidato probar, cuánto presupuesto queda, cuándo explorar y cuándo terminar. El paper pregunta cuánto de esa política puede internalizar un agente que razona sobre sus propios resultados.

El mismo scaffold se aplica a prompts, programas y workflows de machine learning. El agente puede ejecutar Python, leer resultados, diagnosticar fallos, modificar una propuesta, verificarla, reutilizar memoria persistente y hacer rollback o reiniciar una rama cuando la evidencia lo justifica.

En 14 tareas, los autores reportan que ReASearch es competitivo o superior a optimizadores especializados, con ganancias de 2% a 40% y algunos resultados por encima de soluciones humanas conocidas. Las ablaciones muestran que memoria y herramientas Python contribuyen de forma material: sin ellas el rendimiento cae en varias familias de tareas.

La lectura responsable es tratarlo como un patrón de control experimental, no como una licencia para dejar al agente optimizar sin límites. El valor está en una política capaz de asignar presupuesto y aprender de fallos; el riesgo está en evaluadores débiles, reward hacking y cambios que parecen mejores porque el criterio no mide el coste o la robustez que realmente importan.

DECISIÓN RÁPIDADiseñar un bucle pequeño de optimización con una función de evaluación clara, memoria de experimentos y rollback explícito antes de permitir que el agente explore libremente.
NO LO SOBREINTERPRETES

La capacidad de búsqueda autónoma depende de las herramientas, evaluadores y presupuestos disponibles; resultados superiores en tareas acotadas no demuestran optimización abierta segura ni económica.

PROBLEMA
Los sistemas de optimización suelen depender de controladores externos —evolución, bandits o gradientes textuales— que determinan la política de exploración.
MÉTODO
Usa un mismo agente con herramientas Python, memoria persistente y un bucle de evaluación para decidir qué probar, diagnosticar fallos, editar, verificar, reiniciar o abandonar una rama.
TIPO DE EVIDENCIA
En 14 tareas de prompts, programas y workflows ML, el paper reporta mejoras de 2% a 40% sobre baselines especializados y, en algunos casos, soluciones por encima de resultados humanos conocidos.
LÍMITE
La capacidad de búsqueda autónoma depende de las herramientas, evaluadores y presupuestos disponibles; resultados superiores en tareas acotadas no demuestran optimización abierta segura ni económica.
FIGURA DE LECTURA / OPTIMIZACIÓNHipótesis → ejecución → diagnóstico → siguiente prueba
Abrir paper original ↗

El agente internaliza parte de la política que decide qué experimentar después.

PROPONERElegir una variante
MEDIREjecutar y observar
DECIDIRSeguir, volver o parar
PARA RECORDAR

Optimizar es conservar memoria de lo que ya falló y asignar mejor la siguiente prueba.

Diagrama editorial: resume el mecanismo descrito en la ficha y no sustituye a la figura, tabla o experimento del paper original.
FIGURA PRIMARIA / ESTADO DE USO

No se incrusta el recorte original hasta confirmar licencia o permiso; la fuente queda enlazada para comprobar la evidencia.

Abrir fuente primaria ↗
EVIDENCIA / En 14 tareas de prompts, programas y workflows ML, el paper reporta mejoras de 2% a 40% sobre baselines especializados y, en algunos casos, soluciones por encima de resultados humanos conocidos.
FIELD NOTES / ANOTACIONES

La lectura también deja rastro.

Guarda una observación junto a la evidencia. Tú escribes aquí; los agentes pueden añadir notas por MCP y aparecerán identificados.

MEMORIA PRIVADAEntra para anotar este paper y conectarlo con otros.
Entrar con ChatGPT
LECTURA AMPLIADAMetodología, implicaciones y preguntas para volver al paper.+
LECTURA EN 90 SEGUNDOSLo que conviene llevarse antes de abrir el PDF.
QUÉ HACE

Usa un mismo agente con herramientas Python, memoria persistente y un bucle de evaluación para decidir qué probar, diagnosticar fallos, editar, verificar, reiniciar o abandonar una rama.

QUÉ APORTA

Si la capacidad de distribuir presupuesto, hacer rollback y reverificar emerge dentro del agente, la optimización se vuelve una competencia generalizable entre dominios.

QUÉ NO PRUEBA

La capacidad de búsqueda autónoma depende de las herramientas, evaluadores y presupuestos disponibles; resultados superiores en tareas acotadas no demuestran optimización abierta segura ni económica.

Cómo lo llevaría a un proyecto

Diseñar un bucle pequeño de optimización con una función de evaluación clara, memoria de experimentos y rollback explícito antes de permitir que el agente explore libremente.

Optimización de promptsEvolución de códigoAutoMLWorkflows de datosAI scientist

Preguntas que conviene probar

  • ¿Qué decisiones de búsqueda puede asumir el agente sin supervisión?
  • ¿Qué evidencia obliga a hacer rollback en vez de seguir acumulando cambios?
PLANTILLA DE PRUEBA / INFERENCIA EDITORIAL

Si tuviera que convertirlo en una prueba mañana.

ENTRADACinco tareas holdout de prompts, programas y ML, baseline especializado frente al sistema con presupuesto fijo y tres semillas.
PREGUNTA¿La optimización de artefactos conserva una mejora mediana cuando se congela el evaluador y se usan tareas nuevas?
MÉTRICAMejora mediana, robustez a perturbaciones, coste de cómputo y regresiones por tarea.
PARADAParar si la mejora mediana es menor de 5% o si una tarea crítica regresa más de 10%.

Mi lectura

La diferencia entre generar y optimizar es elegir el siguiente experimento con memoria de lo que ya falló.

Esta última frase es una inferencia editorial a partir del paper y de sus posibles implicaciones; no es una afirmación de los autores.