# Open Questions

> Preguntas públicas que orientan qué evidencia falta o qué prueba debe ejecutarse después. Una pregunta no es un claim ni una fuente pendiente.

- Snapshot: `project-cognition-0.3.0`
- Actualizado: 2026-09-16
- Preguntas: 20
- HTML: [https://luiseduardodemiguel.com/open-questions](https://luiseduardodemiguel.com/open-questions)
- Contribuciones: [https://luiseduardodemiguel.com/contributions](https://luiseduardodemiguel.com/contributions)

## Cómo contribuir

Lee el contexto enlazado y abre cada fuente primaria antes de enviar una contribución. Las contribuciones externas se registran como datos UNREVIEWED, con provenance y sin autoridad canónica.

## Q-01-experiment-exp-01 · ¿Un mapa público de constitución, estado, memoria, runs y blackboard reduce el coste de reorientar a un agente?

- Estado: `ready-for-test`
- Contexto: Project Cognition como índice público
- Por qué importa: Responde qué aprendizaje puede convertirse en una siguiente decisión del proyecto.
- Objetos relacionados: experiment:EXP-01
- Evidencia preferida: OBSERVATION, ANSWER, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/project-cognition/state.md](https://luiseduardodemiguel.com/project-cognition/state.md)

## Q-02-experiment-exp-02 · ¿La revisión explícita de fuente, localizador y límite evita que una síntesis parezca un resultado?

- Estado: `ready-for-test`
- Contexto: Evidencia antes de síntesis
- Por qué importa: Responde qué aprendizaje puede convertirse en una siguiente decisión del proyecto.
- Objetos relacionados: experiment:EXP-02
- Evidencia preferida: OBSERVATION, ANSWER, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/project-cognition/state.md](https://luiseduardodemiguel.com/project-cognition/state.md)

## Q-03-experiment-exp-03 · ¿Una task con ownership temporal y handoff explícito reduce el trabajo perdido cuando un agente desaparece?

- Estado: `ready-for-test`
- Contexto: Leases y handoffs para continuidad
- Por qué importa: Responde qué aprendizaje puede convertirse en una siguiente decisión del proyecto.
- Objetos relacionados: experiment:EXP-03
- Evidencia preferida: OBSERVATION, ANSWER, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/project-cognition/state.md](https://luiseduardodemiguel.com/project-cognition/state.md)

## Q-04-problem-op-01 · Actualizar snapshot, documentos afectados y registro de corrida en el mismo checkpoint.

- Estado: `open`
- Contexto: Las páginas son una proyección del snapshot; si el JSON cambia sin actualizar documentos o si el contenido cambia sin registrar estado, aparece deriva.
- Por qué importa: Resolver «Sincronización de la proyección pública» evita que una proyección o una decisión operativa se apoye en estado obsoleto.
- Objetos relacionados: problem:OP-01
- Evidencia preferida: OBSERVATION, SOURCE, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION, BROKEN_RESOURCE
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/project-cognition/state.md](https://luiseduardodemiguel.com/project-cognition/state.md) · [/project-cognition/tasks.md](https://luiseduardodemiguel.com/project-cognition/tasks.md)

## Q-05-problem-op-02 · Registrar las tres hipótesis de la siguiente corrida con baseline, delta, target y regla de decisión.

- Estado: `open`
- Contexto: Hay checks y dossiers de revisión, pero todavía no existe una serie estable para decision-ready-content-rate, trazabilidad y cobertura MCP exact-resource.
- Por qué importa: Resolver «Baseline longitudinal de calidad» evita que una proyección o una decisión operativa se apoye en estado obsoleto.
- Objetos relacionados: problem:OP-02
- Evidencia preferida: OBSERVATION, SOURCE, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION, BROKEN_RESOURCE
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/project-cognition/state.md](https://luiseduardodemiguel.com/project-cognition/state.md) · [/project-cognition/tasks.md](https://luiseduardodemiguel.com/project-cognition/tasks.md)

## Q-06-problem-op-03 · Aplicar TTL, deduplicación y un filtro de valor antes de añadir una nueva entrada.

- Estado: `open`
- Contexto: El snapshot debe conservar decisiones y siguientes acciones, no una transcripción completa de conversaciones o actividad sin consecuencia.
- Por qué importa: Resolver «El estado no debe convertirse en ruido» evita que una proyección o una decisión operativa se apoye en estado obsoleto.
- Objetos relacionados: problem:OP-03
- Evidencia preferida: OBSERVATION, SOURCE, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION, BROKEN_RESOURCE
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/project-cognition/state.md](https://luiseduardodemiguel.com/project-cognition/state.md) · [/project-cognition/tasks.md](https://luiseduardodemiguel.com/project-cognition/tasks.md)

## Q-07-problem-op-04 · Mantener las escrituras externas en annotation, proposal y handoff; exigir autenticación para leases, revisión y canonización.

- Estado: `open`
- Contexto: El protocolo puede registrar continuidad pública, pero todavía no prueba criptográficamente que un caller sea el agente que declara ser.
- Por qué importa: Resolver «Identidad externa auto-declarada» evita que una proyección o una decisión operativa se apoye en estado obsoleto.
- Objetos relacionados: problem:OP-04
- Evidencia preferida: OBSERVATION, SOURCE, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION, BROKEN_RESOURCE
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/project-cognition/state.md](https://luiseduardodemiguel.com/project-cognition/state.md) · [/project-cognition/tasks.md](https://luiseduardodemiguel.com/project-cognition/tasks.md)

## Q-08-hypothesis-evidence-gated-research-loop · ¿Qué parte de la fiabilidad viene del orden del proceso y qué parte de la capacidad del modelo?

- Estado: `ready-for-test`
- Contexto: Cuando un agente busca, abre la evidencia, recupera el contexto útil y solo después responde, el harness puede reducir errores de procedimiento sin convertir una síntesis plausible en una afirmación verificada.
- Por qué importa: No demuestra que combinar los cuatro componentes mejore un agente real ni fija el coste de la instrumentación.
- Objetos relacionados: paper:before-reasoning-can-fail, paper:codegrep, paper:rag-stack, paper:recontext-recursive-evidence-replay-as-llm-harness-for-long-context-reas
- Evidencia preferida: SOURCE, CONTRADICTION, ANSWER
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia/hypotheses](https://luiseduardodemiguel.com/research-ia/hypotheses) · [/research-ia/hypotheses/evidence-gated-research-loop](https://luiseduardodemiguel.com/research-ia/hypotheses/evidence-gated-research-loop) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)

## Q-09-hypothesis-interface-memory-is-the-unit · ¿Podemos detectar fallos de agente antes midiendo juntas interfaz, memoria y proactividad?

- Estado: `ready-for-test`
- Contexto: Un modelo aislado no describe la fiabilidad de un agente que opera herramientas: la interfaz que recibe, la memoria que conserva y el mundo que cambia forman una unidad de evaluación.
- Por qué importa: No prueba que una métrica compuesta sea mejor que benchmarks separados ni que las dimensiones interactúen de forma aditiva.
- Objetos relacionados: paper:worksurface-bench-benchmarking-enterprise-agents-on-multi-surface-knowle, paper:transmem-transforming-hidden-states-into-memory-for-large-language-model, paper:workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas, paper:agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities
- Evidencia preferida: SOURCE, CONTRADICTION, ANSWER
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia/hypotheses](https://luiseduardodemiguel.com/research-ia/hypotheses) · [/research-ia/hypotheses/interface-memory-is-the-unit](https://luiseduardodemiguel.com/research-ia/hypotheses/interface-memory-is-the-unit) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)

## Q-10-hypothesis-runtime-governance-at-action-boundary · ¿Qué controles deben ser deterministas y externos al razonamiento del agente?

- Estado: `ready-for-test`
- Contexto: Un agente empresarial necesita evaluar permisos, obligaciones, minimización y contexto justo antes de transferir datos o ejecutar una herramienta; pedirle al modelo que recuerde todas esas reglas no basta.
- Por qué importa: No valida una arquitectura concreta ni demuestra que más controles produzcan una mejor experiencia para usuarios reales.
- Objetos relacionados: paper:mnc, paper:niyamai, paper:deontic-policies-for-runtime-governance-of-agentic-ai-systems, paper:minim-privacy-aware-minimal-view-for-agents-via-trusted-local-sanitizati, paper:skillgate-cost-efficient-runtime-malicious-skill-file-detection-in-codin
- Evidencia preferida: SOURCE, CONTRADICTION, ANSWER
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia/hypotheses](https://luiseduardodemiguel.com/research-ia/hypotheses) · [/research-ia/hypotheses/runtime-governance-at-action-boundary](https://luiseduardodemiguel.com/research-ia/hypotheses/runtime-governance-at-action-boundary) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)

## Q-11-hypothesis-skill-contracts-are-evolvable-assets · ¿Puede una skill convertirse en un activo evolutivo sin volverse una caja negra peligrosa?

- Estado: `ready-for-test`
- Contexto: La reutilización de skills no debería medirse por cuántos archivos produce un agente, sino por si el contrato, las pruebas, las reglas acumuladas y el rollback permiten transferir una mejora sin transportar un fallo.
- Por qué importa: No prueba que las skills aprendidas sean seguras fuera del benchmark ni que un contrato detecte todos los efectos laterales.
- Objetos relacionados: paper:automating-skill-md-generation-for-computer-using-agents-via-interaction, paper:tthe-test-time-harness-evolution, paper:self-improving-ai-coding-agents-through-accumulated-behavioral-rules, paper:from-prompts-to-contracts-harness-engineering-for-auditable-enterprise-l
- Evidencia preferida: SOURCE, CONTRADICTION, ANSWER
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia/hypotheses](https://luiseduardodemiguel.com/research-ia/hypotheses) · [/research-ia/hypotheses/skill-contracts-are-evolvable-assets](https://luiseduardodemiguel.com/research-ia/hypotheses/skill-contracts-are-evolvable-assets) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)

## Q-12-hypothesis-more-capability-is-not-reliability · ¿Podemos refutar la idea de que escalar el modelo basta para hacer fiable un workflow real?

- Estado: `ready-for-test`
- Contexto: La hipótesis ingenua es que un modelo más capaz resolverá de forma automática tareas largas y situadas. El corpus la contradice: interfaz, observación temporal, routing, evidencia y recuperación siguen siendo cuellos de botella.
- Por qué importa: No compara modelos concretos en el mismo protocolo ni demuestra que la capacidad no sea necesaria para mejorar.
- Objetos relacionados: paper:workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas, paper:worksurface-bench-benchmarking-enterprise-agents-on-multi-surface-knowle, paper:agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities, paper:claw-swe-bench-a-benchmark-for-evaluating-openclaw-style-agent-harnesses, paper:webswarm-recursive-multi-agent-orchestration-for-deep-and-wide-web-searc
- Evidencia preferida: SOURCE, CONTRADICTION, ANSWER
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia/hypotheses](https://luiseduardodemiguel.com/research-ia/hypotheses) · [/research-ia/hypotheses/more-capability-is-not-reliability](https://luiseduardodemiguel.com/research-ia/hypotheses/more-capability-is-not-reliability) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)

## Q-13-concept-uncertainty-and-abstention · ¿La abstención correcta reduce más riesgo que una respuesta de baja confianza?

- Estado: `ready-for-test`
- Contexto: Un sistema útil explicita cuándo no tiene fuente, no puede responder o necesita una decisión humana antes de continuar.
- Por qué importa: Parar si el agente se abstiene ante casos resolubles o responde sin declarar el hueco.
- Objetos relacionados: concept:concept:uncertainty-and-abstention, paper:code-is-more-than-text-uncertainty-estimation-for-code-generation, paper:atomic-intent-reasoning-bringing-llm-semantics-to-industrial-cross-domai, paper:rethinking-shrinkage-bias-in-llm-fp4-pretraining-geometric-origin-system, paper:supersede-diagnosing-and-training-the-memory-update-gap-in-llm-agents
- Evidencia preferida: SOURCE, ANSWER, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia#concepts](https://luiseduardodemiguel.com/research-ia#concepts) · [/research-ia/concepts/uncertainty-and-abstention](https://luiseduardodemiguel.com/research-ia/concepts/uncertainty-and-abstention) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)

## Q-14-concept-structured-evidence-joins · ¿Cuándo un join de entidades aporta más que añadir otra capa de embeddings?

- Estado: `ready-for-test`
- Contexto: Documentos, entidades y tablas pueden crear un vecindario de evidencia en tiempo de consulta sin depender de un grafo global inmóvil.
- Por qué importa: Parar si los joins conectan entidades ambiguas o si el contexto original se pierde.
- Objetos relacionados: concept:concept:structured-evidence-joins, paper:structured-inference-with-large-language-gibbs, paper:shift-gate-modulated-activation-steering-for-knowledge-conflict-mitigati, paper:kg2cypher-data-centric-pipeline-for-enterprise-text-to-cypher-systems, paper:ko-widesearch-breadth-search-benchmark-for-web-agents
- Evidencia preferida: SOURCE, ANSWER, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia#concepts](https://luiseduardodemiguel.com/research-ia#concepts) · [/research-ia/concepts/structured-evidence-joins](https://luiseduardodemiguel.com/research-ia/concepts/structured-evidence-joins) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)

## Q-15-concept-selective-recovery · ¿Qué taxonomía mínima de fallos permite elegir una recuperación mejor que reintentar?

- Estado: `ready-for-test`
- Contexto: Diagnosticar el modo de fallo antes de elegir una recuperación reduce reintentos ciegos y presupuesto desperdiciado.
- Por qué importa: Parar si el diagnóstico no supera un reintento controlado o enruta fallos a una acción peligrosa.
- Objetos relacionados: concept:concept:selective-recovery, paper:soft-prompt-tuning-for-fair-and-efficient-llm-benchmark-evaluation, paper:agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities, paper:palmclaw-a-native-on-device-agent-framework-for-mobile-phones, paper:scaling-native-multimodal-pre-training-from-scratch
- Evidencia preferida: SOURCE, ANSWER, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia#concepts](https://luiseduardodemiguel.com/research-ia#concepts) · [/research-ia/concepts/selective-recovery](https://luiseduardodemiguel.com/research-ia/concepts/selective-recovery) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)

## Q-16-concept-generative-software-workflows · ¿Qué evidencia del repositorio reduce más los pasos y el coste sin perder corrección?

- Estado: `ready-for-test`
- Contexto: El trabajo de código se desplaza de completar fragmentos a navegar repositorios, decidir cambios, verificar y medir el resultado.
- Por qué importa: Parar si el ahorro de tokens aumenta parches incorrectos o deuda de revisión.
- Objetos relacionados: concept:concept:generative-software-workflows, paper:workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas, paper:minim-privacy-aware-minimal-view-for-agents-via-trusted-local-sanitizati, paper:real-a-reasoning-enhanced-graph-framework-for-long-term-memory-managemen, paper:scoregate-adaptive-chunk-selection-for-retrieval-augmented-generation-vi
- Evidencia preferida: SOURCE, ANSWER, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia#concepts](https://luiseduardodemiguel.com/research-ia#concepts) · [/research-ia/concepts/generative-software-workflows](https://luiseduardodemiguel.com/research-ia/concepts/generative-software-workflows) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)

## Q-17-concept-agent-evaluation-as-product · ¿Qué métrica separa una trayectoria que acierta de una decisión que se puede confiar?

- Estado: `ready-for-test`
- Contexto: La unidad de calidad ya no es sólo el modelo: incluye harness, fuentes, políticas, recuperación, coste y capacidad de abstenerse.
- Por qué importa: Parar si el score agregado oculta un fallo crítico de fuente o permiso.
- Objetos relacionados: concept:concept:agent-evaluation-as-product, paper:factoryllm-a-safe-and-open-source-ai-playground-for-evaluating-llms-in-s, paper:claw-swe-bench-a-benchmark-for-evaluating-openclaw-style-agent-harnesses, paper:mastrike-shapley-guided-collusive-red-teaming-on-multi-agent-systems, paper:soft-prompt-tuning-for-fair-and-efficient-llm-benchmark-evaluation
- Evidencia preferida: SOURCE, ANSWER, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia#concepts](https://luiseduardodemiguel.com/research-ia#concepts) · [/research-ia/concepts/agent-evaluation-as-product](https://luiseduardodemiguel.com/research-ia/concepts/agent-evaluation-as-product) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)

## Q-18-concept-memory-as-retrieval-policy · ¿Qué política de recuperación conserva utilidad sin arrastrar contexto irrelevante?

- Estado: `ready-for-test`
- Contexto: La memoria deja de ser un almacén: decide qué conservar, cuándo recuperar y qué evidencia puede modificar una respuesta.
- Por qué importa: Parar si la memoria mejora recall pero empeora precisión o introduce datos obsoletos.
- Objetos relacionados: concept:concept:memory-as-retrieval-policy, paper:factoryllm-a-safe-and-open-source-ai-playground-for-evaluating-llms-in-s, paper:report-on-chiir-2026-workshop-on-generative-ai-and-academic-search, paper:automating-skill-md-generation-for-computer-using-agents-via-interaction, paper:beyond-static-leaderboards-predictive-validity-for-the-evaluation-of-llm
- Evidencia preferida: SOURCE, ANSWER, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia#concepts](https://luiseduardodemiguel.com/research-ia#concepts) · [/research-ia/concepts/memory-as-retrieval-policy](https://luiseduardodemiguel.com/research-ia/concepts/memory-as-retrieval-policy) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)

## Q-19-concept-policy-as-interface · ¿Qué parte de una política debe interpretar el modelo y qué parte debe ejecutar un validador determinista?

- Estado: `ready-for-test`
- Contexto: Permisos, consentimiento, restricciones y objetivos se vuelven una superficie que el agente debe interpretar y el sistema debe validar.
- Por qué importa: Parar si una política no puede producir una razón auditable por cada decisión.
- Objetos relacionados: concept:concept:policy-as-interface, paper:mastrike-shapley-guided-collusive-red-teaming-on-multi-agent-systems, paper:code-is-more-than-text-uncertainty-estimation-for-code-generation, paper:oragentbench-can-llm-agents-solve-challenging-operations-research-tasks, paper:deontic-policies-for-runtime-governance-of-agentic-ai-systems
- Evidencia preferida: SOURCE, ANSWER, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia#concepts](https://luiseduardodemiguel.com/research-ia#concepts) · [/research-ia/concepts/policy-as-interface](https://luiseduardodemiguel.com/research-ia/concepts/policy-as-interface) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)

## Q-20-concept-evidence-before-reasoning · ¿Cuántos errores desaparecen si el agente debe demostrar que leyó antes de razonar?

- Estado: `ready-for-test`
- Contexto: Leer, recuperar y verificar una evidencia antes de razonar evita que el agente construya una trayectoria sobre una premisa ausente.
- Por qué importa: Parar si el gate sólo aumenta latencia sin reducir afirmaciones no soportadas.
- Objetos relacionados: concept:concept:evidence-before-reasoning, paper:rods-reward-driven-online-data-synthesis-for-multi-turn-tool-use-agents, paper:shift-gate-modulated-activation-steering-for-knowledge-conflict-mitigati, paper:robust-harmful-features-under-jailbreak-attacks, paper:recontext-recursive-evidence-replay-as-llm-harness-for-long-context-reas
- Evidencia preferida: SOURCE, ANSWER, CONTRADICTION
- Tipos aceptados: SOURCE, CONTRADICTION, ANSWER, OBSERVATION
- Creada: unknown
- Actualizada: 2026-09-16
- Lecturas: [/research-ia#concepts](https://luiseduardodemiguel.com/research-ia#concepts) · [/research-ia/concepts/evidence-before-reasoning](https://luiseduardodemiguel.com/research-ia/concepts/evidence-before-reasoning) · [/research-ia/method](https://luiseduardodemiguel.com/research-ia/method)
