Investigar es coordinar evidencia y decisiones.
La Mesa de campo reúne los roles que hacen avanzar Research IA: descubrir, leer, localizar, relacionar, revisar y sintetizar. No es un dashboard de actividad; es una frontera explícita entre lo que puede proponer un agente y lo que todavía debe decidir una persona.
Una señal no es conocimiento hasta que deja una traza.
El sistema conserva el orden porque cada etapa produce un objeto distinto. Buscar propone; leer verifica; revisar encuentra huecos; aprobar decide.
- 01Capturar
Una señal entra con URL, fecha y origen.
- 02Leer
El agente abre la fuente; buscar no cuenta como leer.
- 03Extraer evidencia
Claims, cifras y localizadores quedan separados.
- 04Revisar
El editor detecta huecos, límites y sobreinterpretaciones.
- 05Aprobar
Luis decide qué se publica o qué vuelve a revisión.
- 06Publicar
La versión aprobada se proyecta al radar y al MCP.
La salud actual es visible antes de pedir más automatización.
La continuidad vive en la memoria, no en un agente oculto.
Las corridas se ejecutan en ChatGPT/Codex y terminan. D1 conserva lo que hace falta para retomarlas: tareas, runs, eventos, evidencia, relaciones y aprobaciones.
Sin sesión, el sitio muestra sólo el contrato público; los agentes no se ejecutan aquí.
Cada agente tiene una misión y un límite.
La especialización no busca repartir complejidad por estética; busca que una función no pueda saltarse la evidencia que otra debe comprobar.
Scout
Encontrar señales candidatas sin confundir novedad con evidencia.
Reader / Evidence
Convertir una fuente primaria en claims comprobables y localizadores concretos.
Graph Curator
Proponer qué conecta, contradice o extiende una pieza del radar.
Editor-agent
Detectar huecos y mejorar la ficha sin inventar evidencia.
Weekly Synthesizer
Convertir piezas aprobadas en un corte que explique qué ha cambiado.
Memory Steward
Conservar sólo memoria que pueda cambiar una decisión posterior.
Evaluator
Comprobar que el sistema sigue siendo trazable, usable y publicable.
Una corrida completa, con la frontera de publicación visible.
Esta prueba recorre un paper real con especialistas acotados. Sirve para inspeccionar handoffs y excepciones antes de persistir ejecuciones o conectar modelos externos.
CoEvo-Mem: Co-Evolving Retrieval Policy and Memory Bank for LLM Agents
- 01→ reader-evidenceScoutCOMPLETADO
Candidato aceptado para lectura primaria.
https://arxiv.org/abs/2608.01739 está registrada como fuente canónica. - 02→ graph-curatorReader / EvidenceCOMPLETADO
1 claim(s), 3 locator(s) y 2 límite(s) estructurados.
Existe al menos un resultado reportado con locator. - 03→ editor-agentGraph CuratorCOMPLETADO
3 relación(es) con papers disponibles para explorar.
vakra, ttt-embed, vibelifebench - 04→ human-publication-gateEditor-agentCOMPLETADO
needs-review · 97/100 · 1 hallazgo(s).
Añadir una figura o tabla primaria cuando el permiso lo permita; si no, explicar la decisión y enlazar el original. - 05→ publishedhuman-publication-gateESPERA HUMANA
No publica automáticamente; espera una decisión humana ligada a esta versión.
La frontera de publicación está definida en el contrato editorial y en MCP.
GATE: La ejecución puede preparar y revisar; no puede aprobar ni desplegar contenido en tu nombre.
La primera corrida ya deja una memoria retomable.
Este es el contrato de la edición semanal persistida en D1: el sitio no ejecuta agentes vivos; conserva el resultado, las decisiones y el punto exacto desde el que otro agente puede continuar.
Corte semanal procesado; source-pending conservado como señal.
completedClaims de los 29 papers con localizadores y límites.
completedRelaciones tipadas con confianza y claims de apoyo.
completedConceptos multi-paper y multi-week listos para dossier.
completedRevisión editorial completa del corpus público.
completedAutorización automática trazada para esta corrida.
completedResultado publicado y versionado con el run.
completedLa Mesa no oculta lo que aún necesita criterio.
La cola se ordena por excepción: primero los bloqueos, después los avisos y al final lo que ya puede continuar sin intervención.
Cola de revisión editorial
2 fichas listas, 167 con avisos y 0 bloqueadas sobre 169.
SIGUIENTE: Resolver los avisos empezando por resultados con localizadores exactos y recursos comprobables.Ledger de evidencia
157/169 fichas ya tienen un resultado reportado enlazado; 169 lecturas narrativas están completas y sólo 2 fichas tienen figura primaria registrada.
SIGUIENTE: Completar los resultados de las fichas restantes y añadir tabla/figura/página cuando la fuente lo permita.Delta semanal del radar
11 cortes disponibles, 9 ejes y 169/169 señales clasificadas.
SIGUIENTE: Añadir el siguiente corte y explicar qué cambió, no sólo acumular puntos.Canonización del archivo histórico
169 señales importadas en 11 cortes; 169 apuntan a fichas públicas, 157 tienen lectura primaria completa y 12 esperan lectura editorial profunda. 0 esperan URL primaria verificable.
SIGUIENTE: Recuperar la fuente canónica de las entradas pendientes y sólo entonces promover sus claims al ledger de evidencia.Conceptos emergentes multi-paper
16 candidatos con soporte multi-paper; 16 reaparecen en al menos dos semanas y 0 necesitan ampliar fuente primaria.
SIGUIENTE: Abrir el dossier del concepto y comprobar si la coincidencia editorial se sostiene con claims, no sólo con alias.Recursos reproducibles
12 fichas no declaran código, dataset o demo público; eso debe distinguirse de un fallo de la fuente.
SIGUIENTE: Registrar explícitamente 'no público' o añadir tipo, licencia y fecha de comprobación del recurso.Puerta de publicación humana
No existe publicación automática en MCP; la fuente y el despliegue siguen siendo la frontera de aprobación.
SIGUIENTE: Aprobar una ficha sólo cuando su versión, evidencia y review estén ligadas al mismo estado.4 líneas necesitan una siguiente decisión. El sistema no las convierte en publicación automática.
Lo que se ha comprobado también forma parte de la memoria.
Estos registros estáticos muestran checks públicos del repositorio. Las corridas persistidas del usuario aparecen arriba cuando existe sesión y D1 disponible.
Evaluación del Product Harness
200 findings, 20 áreas y 6 casos de evaluación pasados.
VERIFICADOSmoke test de MCP editorial
initialize, tools/list, contrato, paper:vakra, paper:coevo-mem y cola de 169 reviews.
VERIFICADOPublicación del corte 03—09 AGO
15 papers, tesis semanal, señales, radar histórico y archivo navegable.
PUBLICADOCorrida semanal 10–16 AGO 2026
9 artefactos durables: run, claims, relaciones, conceptos, review, aprobación y resultado.
PUBLICADOMás autonomía exige mejores pruebas, no menos responsabilidad.
Los agentes pueden preparar, trazar y dejar una aprobación pendiente. Luis decide qué se incorpora al sitio y qué despliegue sale a producción.