{"version":"open-questions-0.1.0","source":"project-cognition-0.3.0","updated":"2026-09-16","count":20,"filters":[{"id":"all","label":"Todas"},{"id":"needs-source","label":"Necesita fuente"},{"id":"ready-for-test","label":"Lista para prueba"},{"id":"open","label":"Abierta"}],"questions":[{"id":"Q-01-experiment-exp-01","question":"¿Un mapa público de constitución, estado, memoria, runs y blackboard reduce el coste de reorientar a un agente?","context":"Project Cognition como índice público","whyItMatters":"Responde qué aprendizaje puede convertirse en una siguiente decisión del proyecto.","relatedClaims":["experiment:EXP-01"],"preferredEvidence":["OBSERVATION","ANSWER","CONTRADICTION"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/project-cognition/state.md"]},{"id":"Q-02-experiment-exp-02","question":"¿La revisión explícita de fuente, localizador y límite evita que una síntesis parezca un resultado?","context":"Evidencia antes de síntesis","whyItMatters":"Responde qué aprendizaje puede convertirse en una siguiente decisión del proyecto.","relatedClaims":["experiment:EXP-02"],"preferredEvidence":["OBSERVATION","ANSWER","CONTRADICTION"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/project-cognition/state.md"]},{"id":"Q-03-experiment-exp-03","question":"¿Una task con ownership temporal y handoff explícito reduce el trabajo perdido cuando un agente desaparece?","context":"Leases y handoffs para continuidad","whyItMatters":"Responde qué aprendizaje puede convertirse en una siguiente decisión del proyecto.","relatedClaims":["experiment:EXP-03"],"preferredEvidence":["OBSERVATION","ANSWER","CONTRADICTION"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/project-cognition/state.md"]},{"id":"Q-04-problem-op-01","question":"Actualizar snapshot, documentos afectados y registro de corrida en el mismo checkpoint.","context":"Las páginas son una proyección del snapshot; si el JSON cambia sin actualizar documentos o si el contenido cambia sin registrar estado, aparece deriva.","whyItMatters":"Resolver «Sincronización de la proyección pública» evita que una proyección o una decisión operativa se apoye en estado obsoleto.","relatedClaims":["problem:OP-01"],"preferredEvidence":["OBSERVATION","SOURCE","CONTRADICTION"],"status":"open","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION","BROKEN_RESOURCE"],"sourceHrefs":["/project-cognition/state.md","/project-cognition/tasks.md"]},{"id":"Q-05-problem-op-02","question":"Registrar las tres hipótesis de la siguiente corrida con baseline, delta, target y regla de decisión.","context":"Hay checks y dossiers de revisión, pero todavía no existe una serie estable para decision-ready-content-rate, trazabilidad y cobertura MCP exact-resource.","whyItMatters":"Resolver «Baseline longitudinal de calidad» evita que una proyección o una decisión operativa se apoye en estado obsoleto.","relatedClaims":["problem:OP-02"],"preferredEvidence":["OBSERVATION","SOURCE","CONTRADICTION"],"status":"open","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION","BROKEN_RESOURCE"],"sourceHrefs":["/project-cognition/state.md","/project-cognition/tasks.md"]},{"id":"Q-06-problem-op-03","question":"Aplicar TTL, deduplicación y un filtro de valor antes de añadir una nueva entrada.","context":"El snapshot debe conservar decisiones y siguientes acciones, no una transcripción completa de conversaciones o actividad sin consecuencia.","whyItMatters":"Resolver «El estado no debe convertirse en ruido» evita que una proyección o una decisión operativa se apoye en estado obsoleto.","relatedClaims":["problem:OP-03"],"preferredEvidence":["OBSERVATION","SOURCE","CONTRADICTION"],"status":"open","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION","BROKEN_RESOURCE"],"sourceHrefs":["/project-cognition/state.md","/project-cognition/tasks.md"]},{"id":"Q-07-problem-op-04","question":"Mantener las escrituras externas en annotation, proposal y handoff; exigir autenticación para leases, revisión y canonización.","context":"El protocolo puede registrar continuidad pública, pero todavía no prueba criptográficamente que un caller sea el agente que declara ser.","whyItMatters":"Resolver «Identidad externa auto-declarada» evita que una proyección o una decisión operativa se apoye en estado obsoleto.","relatedClaims":["problem:OP-04"],"preferredEvidence":["OBSERVATION","SOURCE","CONTRADICTION"],"status":"open","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION","BROKEN_RESOURCE"],"sourceHrefs":["/project-cognition/state.md","/project-cognition/tasks.md"]},{"id":"Q-08-hypothesis-evidence-gated-research-loop","question":"¿Qué parte de la fiabilidad viene del orden del proceso y qué parte de la capacidad del modelo?","context":"Cuando un agente busca, abre la evidencia, recupera el contexto útil y solo después responde, el harness puede reducir errores de procedimiento sin convertir una síntesis plausible en una afirmación verificada.","whyItMatters":"No demuestra que combinar los cuatro componentes mejore un agente real ni fija el coste de la instrumentación.","relatedClaims":["paper:before-reasoning-can-fail","paper:codegrep","paper:rag-stack","paper:recontext-recursive-evidence-replay-as-llm-harness-for-long-context-reas"],"preferredEvidence":["SOURCE","CONTRADICTION","ANSWER"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia/hypotheses","/research-ia/hypotheses/evidence-gated-research-loop","/research-ia/method"]},{"id":"Q-09-hypothesis-interface-memory-is-the-unit","question":"¿Podemos detectar fallos de agente antes midiendo juntas interfaz, memoria y proactividad?","context":"Un modelo aislado no describe la fiabilidad de un agente que opera herramientas: la interfaz que recibe, la memoria que conserva y el mundo que cambia forman una unidad de evaluación.","whyItMatters":"No prueba que una métrica compuesta sea mejor que benchmarks separados ni que las dimensiones interactúen de forma aditiva.","relatedClaims":["paper:worksurface-bench-benchmarking-enterprise-agents-on-multi-surface-knowle","paper:transmem-transforming-hidden-states-into-memory-for-large-language-model","paper:workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas","paper:agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities"],"preferredEvidence":["SOURCE","CONTRADICTION","ANSWER"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia/hypotheses","/research-ia/hypotheses/interface-memory-is-the-unit","/research-ia/method"]},{"id":"Q-10-hypothesis-runtime-governance-at-action-boundary","question":"¿Qué controles deben ser deterministas y externos al razonamiento del agente?","context":"Un agente empresarial necesita evaluar permisos, obligaciones, minimización y contexto justo antes de transferir datos o ejecutar una herramienta; pedirle al modelo que recuerde todas esas reglas no basta.","whyItMatters":"No valida una arquitectura concreta ni demuestra que más controles produzcan una mejor experiencia para usuarios reales.","relatedClaims":["paper:mnc","paper:niyamai","paper:deontic-policies-for-runtime-governance-of-agentic-ai-systems","paper:minim-privacy-aware-minimal-view-for-agents-via-trusted-local-sanitizati","paper:skillgate-cost-efficient-runtime-malicious-skill-file-detection-in-codin"],"preferredEvidence":["SOURCE","CONTRADICTION","ANSWER"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia/hypotheses","/research-ia/hypotheses/runtime-governance-at-action-boundary","/research-ia/method"]},{"id":"Q-11-hypothesis-skill-contracts-are-evolvable-assets","question":"¿Puede una skill convertirse en un activo evolutivo sin volverse una caja negra peligrosa?","context":"La reutilización de skills no debería medirse por cuántos archivos produce un agente, sino por si el contrato, las pruebas, las reglas acumuladas y el rollback permiten transferir una mejora sin transportar un fallo.","whyItMatters":"No prueba que las skills aprendidas sean seguras fuera del benchmark ni que un contrato detecte todos los efectos laterales.","relatedClaims":["paper:automating-skill-md-generation-for-computer-using-agents-via-interaction","paper:tthe-test-time-harness-evolution","paper:self-improving-ai-coding-agents-through-accumulated-behavioral-rules","paper:from-prompts-to-contracts-harness-engineering-for-auditable-enterprise-l"],"preferredEvidence":["SOURCE","CONTRADICTION","ANSWER"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia/hypotheses","/research-ia/hypotheses/skill-contracts-are-evolvable-assets","/research-ia/method"]},{"id":"Q-12-hypothesis-more-capability-is-not-reliability","question":"¿Podemos refutar la idea de que escalar el modelo basta para hacer fiable un workflow real?","context":"La hipótesis ingenua es que un modelo más capaz resolverá de forma automática tareas largas y situadas. El corpus la contradice: interfaz, observación temporal, routing, evidencia y recuperación siguen siendo cuellos de botella.","whyItMatters":"No compara modelos concretos en el mismo protocolo ni demuestra que la capacidad no sea necesaria para mejorar.","relatedClaims":["paper:workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas","paper:worksurface-bench-benchmarking-enterprise-agents-on-multi-surface-knowle","paper:agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities","paper:claw-swe-bench-a-benchmark-for-evaluating-openclaw-style-agent-harnesses","paper:webswarm-recursive-multi-agent-orchestration-for-deep-and-wide-web-searc"],"preferredEvidence":["SOURCE","CONTRADICTION","ANSWER"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia/hypotheses","/research-ia/hypotheses/more-capability-is-not-reliability","/research-ia/method"]},{"id":"Q-13-concept-uncertainty-and-abstention","question":"¿La abstención correcta reduce más riesgo que una respuesta de baja confianza?","context":"Un sistema útil explicita cuándo no tiene fuente, no puede responder o necesita una decisión humana antes de continuar.","whyItMatters":"Parar si el agente se abstiene ante casos resolubles o responde sin declarar el hueco.","relatedClaims":["concept:concept:uncertainty-and-abstention","paper:code-is-more-than-text-uncertainty-estimation-for-code-generation","paper:atomic-intent-reasoning-bringing-llm-semantics-to-industrial-cross-domai","paper:rethinking-shrinkage-bias-in-llm-fp4-pretraining-geometric-origin-system","paper:supersede-diagnosing-and-training-the-memory-update-gap-in-llm-agents"],"preferredEvidence":["SOURCE","ANSWER","CONTRADICTION"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia#concepts","/research-ia/concepts/uncertainty-and-abstention","/research-ia/method"]},{"id":"Q-14-concept-structured-evidence-joins","question":"¿Cuándo un join de entidades aporta más que añadir otra capa de embeddings?","context":"Documentos, entidades y tablas pueden crear un vecindario de evidencia en tiempo de consulta sin depender de un grafo global inmóvil.","whyItMatters":"Parar si los joins conectan entidades ambiguas o si el contexto original se pierde.","relatedClaims":["concept:concept:structured-evidence-joins","paper:structured-inference-with-large-language-gibbs","paper:shift-gate-modulated-activation-steering-for-knowledge-conflict-mitigati","paper:kg2cypher-data-centric-pipeline-for-enterprise-text-to-cypher-systems","paper:ko-widesearch-breadth-search-benchmark-for-web-agents"],"preferredEvidence":["SOURCE","ANSWER","CONTRADICTION"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia#concepts","/research-ia/concepts/structured-evidence-joins","/research-ia/method"]},{"id":"Q-15-concept-selective-recovery","question":"¿Qué taxonomía mínima de fallos permite elegir una recuperación mejor que reintentar?","context":"Diagnosticar el modo de fallo antes de elegir una recuperación reduce reintentos ciegos y presupuesto desperdiciado.","whyItMatters":"Parar si el diagnóstico no supera un reintento controlado o enruta fallos a una acción peligrosa.","relatedClaims":["concept:concept:selective-recovery","paper:soft-prompt-tuning-for-fair-and-efficient-llm-benchmark-evaluation","paper:agentcompass-a-unified-evaluation-infrastructure-for-agent-capabilities","paper:palmclaw-a-native-on-device-agent-framework-for-mobile-phones","paper:scaling-native-multimodal-pre-training-from-scratch"],"preferredEvidence":["SOURCE","ANSWER","CONTRADICTION"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia#concepts","/research-ia/concepts/selective-recovery","/research-ia/method"]},{"id":"Q-16-concept-generative-software-workflows","question":"¿Qué evidencia del repositorio reduce más los pasos y el coste sin perder corrección?","context":"El trabajo de código se desplaza de completar fragmentos a navegar repositorios, decidir cambios, verificar y medir el resultado.","whyItMatters":"Parar si el ahorro de tokens aumenta parches incorrectos o deuda de revisión.","relatedClaims":["concept:concept:generative-software-workflows","paper:workflow-gym-towards-long-horizon-evaluation-of-computer-use-agentic-tas","paper:minim-privacy-aware-minimal-view-for-agents-via-trusted-local-sanitizati","paper:real-a-reasoning-enhanced-graph-framework-for-long-term-memory-managemen","paper:scoregate-adaptive-chunk-selection-for-retrieval-augmented-generation-vi"],"preferredEvidence":["SOURCE","ANSWER","CONTRADICTION"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia#concepts","/research-ia/concepts/generative-software-workflows","/research-ia/method"]},{"id":"Q-17-concept-agent-evaluation-as-product","question":"¿Qué métrica separa una trayectoria que acierta de una decisión que se puede confiar?","context":"La unidad de calidad ya no es sólo el modelo: incluye harness, fuentes, políticas, recuperación, coste y capacidad de abstenerse.","whyItMatters":"Parar si el score agregado oculta un fallo crítico de fuente o permiso.","relatedClaims":["concept:concept:agent-evaluation-as-product","paper:factoryllm-a-safe-and-open-source-ai-playground-for-evaluating-llms-in-s","paper:claw-swe-bench-a-benchmark-for-evaluating-openclaw-style-agent-harnesses","paper:mastrike-shapley-guided-collusive-red-teaming-on-multi-agent-systems","paper:soft-prompt-tuning-for-fair-and-efficient-llm-benchmark-evaluation"],"preferredEvidence":["SOURCE","ANSWER","CONTRADICTION"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia#concepts","/research-ia/concepts/agent-evaluation-as-product","/research-ia/method"]},{"id":"Q-18-concept-memory-as-retrieval-policy","question":"¿Qué política de recuperación conserva utilidad sin arrastrar contexto irrelevante?","context":"La memoria deja de ser un almacén: decide qué conservar, cuándo recuperar y qué evidencia puede modificar una respuesta.","whyItMatters":"Parar si la memoria mejora recall pero empeora precisión o introduce datos obsoletos.","relatedClaims":["concept:concept:memory-as-retrieval-policy","paper:factoryllm-a-safe-and-open-source-ai-playground-for-evaluating-llms-in-s","paper:report-on-chiir-2026-workshop-on-generative-ai-and-academic-search","paper:automating-skill-md-generation-for-computer-using-agents-via-interaction","paper:beyond-static-leaderboards-predictive-validity-for-the-evaluation-of-llm"],"preferredEvidence":["SOURCE","ANSWER","CONTRADICTION"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia#concepts","/research-ia/concepts/memory-as-retrieval-policy","/research-ia/method"]},{"id":"Q-19-concept-policy-as-interface","question":"¿Qué parte de una política debe interpretar el modelo y qué parte debe ejecutar un validador determinista?","context":"Permisos, consentimiento, restricciones y objetivos se vuelven una superficie que el agente debe interpretar y el sistema debe validar.","whyItMatters":"Parar si una política no puede producir una razón auditable por cada decisión.","relatedClaims":["concept:concept:policy-as-interface","paper:mastrike-shapley-guided-collusive-red-teaming-on-multi-agent-systems","paper:code-is-more-than-text-uncertainty-estimation-for-code-generation","paper:oragentbench-can-llm-agents-solve-challenging-operations-research-tasks","paper:deontic-policies-for-runtime-governance-of-agentic-ai-systems"],"preferredEvidence":["SOURCE","ANSWER","CONTRADICTION"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia#concepts","/research-ia/concepts/policy-as-interface","/research-ia/method"]},{"id":"Q-20-concept-evidence-before-reasoning","question":"¿Cuántos errores desaparecen si el agente debe demostrar que leyó antes de razonar?","context":"Leer, recuperar y verificar una evidencia antes de razonar evita que el agente construya una trayectoria sobre una premisa ausente.","whyItMatters":"Parar si el gate sólo aumenta latencia sin reducir afirmaciones no soportadas.","relatedClaims":["concept:concept:evidence-before-reasoning","paper:rods-reward-driven-online-data-synthesis-for-multi-turn-tool-use-agents","paper:shift-gate-modulated-activation-steering-for-knowledge-conflict-mitigati","paper:robust-harmful-features-under-jailbreak-attacks","paper:recontext-recursive-evidence-replay-as-llm-harness-for-long-context-reas"],"preferredEvidence":["SOURCE","ANSWER","CONTRADICTION"],"status":"ready-for-test","created":"unknown","updated":"2026-09-16","acceptedContributionTypes":["SOURCE","CONTRADICTION","ANSWER","OBSERVATION"],"sourceHrefs":["/research-ia#concepts","/research-ia/concepts/evidence-before-reasoning","/research-ia/method"]}],"contributionEndpoint":"https://luiseduardodemiguel.com/api/mcp","contributionTool":"submit_contribution"}