NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/ARCHIVO/CORTE 04 · 29 Junio–5 Julio 2026
29 JUNIO–5 JULIO 202615 PAPERS · 3 SEÑALESREVISIÓN EDITORIAL / 97/100

15 fichas abiertas: qué cambió en este corte.

El archivo reúne 15 señales de 29 junio–5 julio 2026; 15 tienen lectura editorial enlazada y 0 conservan sólo su rastro de descubrimiento.

TESIS DEL CORTE

Este corte cruza agentes, evidencia y evaluación para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir Program-as-Weights: A Programming Paradigm for Fuzzy Functions.

NOTA DE EDICIÓN

Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.

Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.

01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE

Program-as-Weights: A Programming Paradigm for Fuzzy Functions

Propone compilar una especificación en lenguaje natural en un artefacto neural pequeño y ejecutable localmente. Un compilador de 4B genera adaptadores para un intérprete Qwen3 de 0.6B, igualando prompting directo de Qwen3-32B con mucha menos memoria e inferencia local. La pregunta de producto que queda abierta es: muchas funciones “difusas” —clasificar logs, reparar JSON, rankear por intención— se externalizan a APIs LLM caras y poco reproducibles.

02 / IMPRESCINDIBLE

Distributed Attacks in Persistent-State AI Control

Estudia ataques distribuidos en agentes de código que trabajan sobre repositorios persistentes. Un agente malicioso puede repartir payloads entre PRs y escoger el momento con mejor cobertura natural; los monitores estándar no cubren bien ataques graduales y no graduales a la vez. La pregunta de producto que queda abierta es: la seguridad de coding agents no puede evaluarse solo por diff aislado.

03 / IMPRESCINDIBLE

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

Mejora RL de agentes asignando crédito por rol semántico de cada segmento: progreso decisivo, exploración útil, infraestructura sin progreso o regresión. Supera GRPO en ALFWorld, Search-QA y WebShop y reduce turnos de entorno en rollouts completados. La pregunta de producto que queda abierta es: usar solo éxito/fallo final castiga exploración útil y premia pasos redundantes.

02FICHAS / SOURCE-BACKED READINGS

15 entradas, una misma deriva.

El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.

  1. 01
    MEMORIA · CODING

    Program-as-Weights

    Propone compilar una especificación en lenguaje natural en un artefacto neural pequeño y ejecutable localmente.

    La sección 6 Main Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02512#S6.
    Imprescindibleneeds-reviewLeer ficha
  2. 02
    MEMORIA · AGENTES · SEGURIDAD

    Distributed Attacks in Persistent-State AI Control

    Estudia ataques distribuidos en agentes de código que trabajan sobre repositorios persistentes.

    La sección 4 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02514#S4.
    Imprescindibleneeds-reviewLeer ficha
  3. 03
    AGENTES · RAG

    TRIAGE

    Mejora RL de agentes asignando crédito por rol semántico de cada segmento: progreso decisivo, exploración útil, infraestructura sin progreso o regresión.

    La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.32017#S5.
    Imprescindibleneeds-reviewLeer ficha
  4. 04
    AGENTES · EVALUACIÓN

    ReContext

    Método training-free para mejorar razonamiento en contexto largo.

    La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02509#S4.
    Imprescindibleneeds-reviewLeer ficha
  5. 05
    AGENTES · EVALUACIÓN

    PACE

    Predice rendimiento en benchmarks agentic caros usando un subconjunto pequeño de evaluaciones atómicas.

    La sección 3 Pace : A Proxy for Agentic Capability Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02032#S3.
    Imprescindibleneeds-reviewLeer ficha
  6. 06
    IA APLICADA · EVALUACIÓN

    RaBitQCache

    Framework de sparse attention para long-context que usa cuantización binaria rotada y aritmética binary-INT4 para estimar atención, con Top-p adaptativo y diseño hardware-aware.

    La sección 5 Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.31519#S5.
    Imprescindibleneeds-reviewLeer ficha
  7. 07
    AGENTES · EVALUACIÓN · SEGURIDAD

    EvoPolicyGym

    Benchmark para evaluar cómo agentes modifican políticas ejecutables bajo feedback e interacción acotada.

    La sección 4 Experiments informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02440#S4.
    Interesanteneeds-reviewLeer ficha
  8. 08
    MEMORIA

    DRIFTLENS

    Mide cómo la memoria personalizada cambia no solo la respuesta final, sino la trayectoria de razonamiento.

    La sección 5 RQ3: Post-training Mitigation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02374#S5.
    Imprescindibleneeds-reviewLeer ficha
  9. 09
    RAG · EVALUACIÓN

    AGE

    Mejora GraphRAG alineando embeddings de grafos con features textuales mediante self-supervised learning con masking adaptativo.

    La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.00052#S5.
    Interesanteneeds-reviewLeer ficha
  10. 10
    CODING

    DecompRL

    Entrena modelos a descomponer código en subfunciones recombinables.

    La sección 4 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02390#S4.
    Interesanteneeds-reviewLeer ficha
  11. 11
    MEMORIA · AGENTES · RAG

    AgenticSTS

    Testbed en Slay the Spire 2 para estudiar agentes de larga duración con memoria acotada y typed retrieval, sin concatenar transcript completo.

    La sección 6 Results informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02255#S6.
    Interesanteneeds-reviewLeer ficha
  12. 12
    AGENTES · RAG · CODING

    UA-ChatDev

    Framework multiagente de desarrollo software que mide incertidumbre token-level en outputs intermedios y activa verificación RAG cuando supera umbrales calibrados por fase.

    La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02186#S3.
    Interesanteneeds-reviewLeer ficha
  13. 13
    SEGURIDAD

    Online Safety Monitoring for LLMs

    Monitor online que convierte una señal de verificador externo en alarma calibrada por control de riesgo.

    La sección 4 Experiments informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02510#S4.
    Interesanteneeds-reviewLeer ficha
  14. 14
    AGENTES · EVALUACIÓN · CODING

    A²utoLPBench

    Benchmark generativo para agentes que resuelven problemas de programación lineal escritos en texto.

    La sección 4 Experiments informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02141#S4.
    Vigilarneeds-reviewLeer ficha
  15. 15
    MULTIMODAL

    Challenges and Recommendations for LLMs-as-a-Judge in Multilingual Settings

    Revisión crítica de LLM-as-a-Judge en evaluación multilingüe y lenguas de bajo recurso.

    La sección 4 LLM-as-a-Judge in Multilingual Research informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02235#S4.
    Vigilarneeds-reviewLeer ficha
QUÉ PROBAR AHORA

Convertir la lectura en una decisión.

  1. Abrir Program-as-Weights: A Programming Paradigm for Fuzzy Functions y localizar su resultado principal en la fuente primaria.
  2. Contrastar Distributed Attacks in Persistent-State AI Control con una ficha del mismo eje antes de convertir la coincidencia en hipótesis.
  3. Elegir un solo workflow relacionado con el corte y dejar una línea base, una métrica y una condición de parada.
QUÉ VIGILAR

La señal también tiene sombra.

  • Una ficha abierta no equivale a una recomendación de adopción.
  • Los resultados dependen de tarea, datos, modelo, prompt y presupuesto; el corte no los normaliza por sí solo.
  • Elevar la confianza sólo cuando método, resultado, límite y localizador estén comprobados en la ficha.
Guardar una nota en Second Brain