/ RESEARCH IA · HYPOTHESES / MULTI-PAPER SYNTHESIS
Ideas que solo aparecen cuando varios papers se leen juntos.
Estas publicaciones convierten conexiones del archivo en hipótesis explícitas. Cada una conserva sus fuentes, pasa un test de procedencia y termina con un experimento pequeño que todavía no se ha ejecutado en producción.
5 hipótesis, una frontera visible entre evidencia y apuesta.
El test comprueba que las fuentes existen, tienen lectura primaria, resultados localizables y una relación multi-paper coherente. No ejecuta un agente real ni sustituye una réplica.
Un agente fiable necesita un orden de lectura, no solo más capacidad
Cuando un agente busca, abre la evidencia, recupera el contexto útil y solo después responde, el harness puede reducir errores de procedimiento sin convertir una síntesis plausible en una afirmación verificada.
La unidad evaluable de un agente es sistema + memoria + mundo temporal
Un modelo aislado no describe la fiabilidad de un agente que opera herramientas: la interfaz que recibe, la memoria que conserva y el mundo que cambia forman una unidad de evaluación.
La gobernanza útil vive en el límite de acción, no dentro del prompt
Un agente empresarial necesita evaluar permisos, obligaciones, minimización y contexto justo antes de transferir datos o ejecutar una herramienta; pedirle al modelo que recuerde todas esas reglas no basta.
Una skill reusable vale cuando conserva su contrato de comportamiento
La reutilización de skills no debería medirse por cuántos archivos produce un agente, sino por si el contrato, las pruebas, las reglas acumuladas y el rollback permiten transferir una mejora sin transportar un fallo.
Más capacidad del modelo no garantiza fiabilidad de workflow largo
La hipótesis ingenua es que un modelo más capaz resolverá de forma automática tareas largas y situadas. El corpus la contradice: interfaz, observación temporal, routing, evidencia y recuperación siguen siendo cuellos de botella.