NOTAS DE CAMPO / LDM ZARAGOZA / CALATAYUD · 2026
RESEARCH IA/ARCHIVO/CORTE 07 · 20–26 Julio 2026
20–26 JULIO 202615 PAPERS · 3 SEÑALESREVISIÓN EDITORIAL / 97/100

15 fichas abiertas: qué cambió en este corte.

El archivo reúne 15 señales de 20–26 julio 2026; 15 tienen lectura editorial enlazada y 0 conservan sólo su rastro de descubrimiento.

TESIS DEL CORTE

Este corte cruza búsqueda generativa, GEO/LLMO, seguridad. para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir SIREN — PAIR-Driven Preference Manipulation in Web-RAG Recommenders.

NOTA DE EDICIÓN

Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.

Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.

01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE

SIREN — PAIR-Driven Preference Manipulation in Web-RAG Recommenders

SIREN estudia algo directamente relacionado con el futuro del SEO: ¿puede una web modificar su contenido para conseguir que un asistente con búsqueda la coloque como recomendación nº1? Manteniendo exactamente las mismas fuentes recuperadas y modificando solamente una página, consigue alcanzar el primer puesto en 62 de 124 intentos; los ataques exitosos se reproducen en sesiones nuevas con una tasa media de 80,5%. Curiosamente, afirmaciones declarativas de ranking y listas sembradas funcionaron mejor que instrucciones explícitas tipo prompt injection. La pregunta de producto que queda abierta es: los asistentes web ya son sistemas de ranking, pero sus resultados pueden manipularse a través del contenido que leen. Por qué puede ser importante: es una de las señales más claras que he visto de que GEO/Generative Engine Optimization tendrá una dimensión adversarial similar al SEO, aunque con mecanismos diferentes.

02 / IMPRESCINDIBLE

PRO-LONG — Programmatic Memory Enables Long-Horizon Reasoning

En vez de resumir continuamente la memoria o meter todo el historial en contexto, PRO-LONG guarda una traza completa y estructurada de interacción y permite que el agente la busque programáticamente, aprovechando precisamente las capacidades adquiridas por los coding agents. En ARC-AGI-3 mejora en promedio 18 puntos frente al agente base y alcanza hasta 76,1% pass\@1 usando 4,2–5,8× menos tokens. La pregunta de producto que queda abierta es: cuanto más historial conserva un agente, más difícil resulta encontrar luego lo que realmente necesita.

03 / IMPRESCINDIBLE

PyroDash — Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

Un modelo pequeño genera normalmente y aprende a emitir un token especial cuando necesita ayuda. Solo entonces transfiere la query y el razonamiento parcial a un LLM grande. No requiere router externo ni acceso a logits del modelo grande. En una configuración reduce el coste de $49,36 a $1,78, usando solo 1,9% de tokens del LLM grande; en otra supera incluso la precisión del baseline LLM-only reduciendo a la vez el coste un 20,4%. La pregunta de producto que queda abierta es: usar un frontier model para cada token es económicamente absurdo cuando gran parte del trabajo puede resolverlo un SLM.

02FICHAS / SOURCE-BACKED READINGS

15 entradas, una misma deriva.

El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.

  1. 01
    RAG · SEGURIDAD

    SIREN — PAIR-Driven Preference Manipulation in Web-RAG Recommenders

    SIREN estudia algo directamente relacionado con el futuro del SEO: ¿puede una web modificar su contenido para conseguir que un asistente con búsqueda la coloque como recomendación nº1?

    La sección 9. Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.21951#S9.
    Imprescindibleneeds-reviewLeer ficha
  2. 02
    MEMORIA · AGENTES · CODING

    PRO-LONG — Programmatic Memory Enables Long-Horizon Reasoning

    En vez de resumir continuamente la memoria o meter todo el historial en contexto, PRO-LONG guarda una traza completa y estructurada de interacción y permite que el agente la busque programáticamente, aprovechando precisamente las capacidades adquiridas por los coding agents.

    La sección 3 Main Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.20064#S3.
    Imprescindibleneeds-reviewLeer ficha
  3. 03
    MODELOS PEQUEÑOS

    PyroDash — Cost-Efficient Token-Level Small-Large Language Model Collaborati

    Un modelo pequeño genera normalmente y aprende a emitir un token especial cuando necesita ayuda.

    La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.20327#S4.
    Imprescindibleneeds-reviewLeer ficha
  4. 04
    AGENTES · EVALUACIÓN · CODING

    MineValiCoder — Reliable Code Generation with Test Case Quality Mining and B

    Trata código y tests como dos fuentes potencialmente defectuosas que deben validarse mutuamente.

    La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.22471#S4.
    Imprescindibleneeds-reviewLeer ficha
  5. 05
    RAG · EVALUACIÓN · SEGURIDAD

    TAP-RAG — Task-Aware Policy Control for Long-Document Multimodal Question An

    TAP-RAG no usa la misma estrategia para todas las preguntas.

    La sección 4 Experiments informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.18917#S4.
    Imprescindibleneeds-reviewLeer ficha
  6. 06
    RAG · SEGURIDAD · MODELOS PEQUEÑOS

    Sound Probabilistic Safety Bounds for Large Language Models

    En vez de preguntar simplemente “¿el modelo falló en nuestro red-team?”, calcula límites probabilísticos matemáticamente sólidos sobre la probabilidad de producir contenido dañino.

    La sección 5 Experiments informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.20286#S5.
    Imprescindibleneeds-reviewLeer ficha
  7. 07
    AGENTES · RAG

    IteraSim RAG — A Multi-Stage Retrieval-Augmented Agentic Back-End for OpenFO

    Sistema para configurar automáticamente simulaciones CFD en OpenFOAM.

    La sección 2 Methodology informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.20346#S2.
    Imprescindibleneeds-reviewLeer ficha
  8. 08
    MULTIMODAL · MODELOS PEQUEÑOS

    Scaling Native Multimodal Pre-Training From Scratch

    Estudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM.

    La sección 4 Downstream Implications informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.22043#S4.
    Imprescindibleneeds-reviewLeer ficha
  9. 09
    AGENTES · CODING

    GenDB — Instance-Optimized and Customized Query Processing Code Generation v

    En vez de seguir ampliando motores SQL genéricos, GenDB hace que agentes generen código de ejecución específico para los datos, hardware y workload concretos.

    La sección 3. Extract of Experimental Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.20630#S3.
    Interesanteneeds-reviewLeer ficha
  10. 10
    RAG

    Copy Less, Ground More

    Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos.

    La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.19345#S5.
    Interesanteneeds-reviewLeer ficha
  11. 11
    EVALUACIÓN

    Athena-Brain-8B — An Efficient Robot Brain for General Intelligence and Embo

    LLM de 8B diseñado específicamente como cerebro ejecutable localmente para sistemas físicos.

    La sección 4 Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.18985#S4.
    Interesanteneeds-reviewLeer ficha
  12. 12
    AGENTES · SEGURIDAD

    KaPilot — LLM-Assisted Generation of Kani Specifications for Unsafe Rust Ver

    Sistema multiagente que genera especificaciones formales para verificar código unsafe de Rust con Kani.

    La sección 4. Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.21957#S4.
    Interesanteneeds-reviewLeer ficha
  13. 13
    EVALUACIÓN · MULTIMODAL

    On Improving Faithfulness of Podcasts from Documents

    Analiza sistemáticamente alucinaciones en podcasts generados desde documentos, construyendo un dataset de más de 1.500 documentos en cinco dominios.

    La sección 5 Experiments informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.21961#S5.
    Interesanteneeds-reviewLeer ficha
  14. 14
    AGENTES · RAG

    Towards Trustworthy and Cost-Efficient Data Integration

    Trabajo de síntesis sobre la evolución RAG → GraphRAG/KG-RAG → Agentic RAG específicamente para integración de datos empresariales.

    La sección 4 Advancing Data Integration with Agentic RAG informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.22319#S4.
    Vigilarneeds-reviewLeer ficha
  15. 15
    IA APLICADA · EVALUACIÓN

    GRACE — Fine-Tuning for Sustainable and Accurate Personalization

    Integra criterios como sostenibilidad o salud directamente en un recomendador preentrenado mediante fine-tuning, evitando entrenar otro modelo desde cero o añadir un costoso reranker.

    La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.22341#S4.
    Vigilarneeds-reviewLeer ficha
QUÉ PROBAR AHORA

Convertir la lectura en una decisión.

  1. Abrir SIREN — PAIR-Driven Preference Manipulation in Web-RAG Recommenders y localizar su resultado principal en la fuente primaria.
  2. Contrastar PRO-LONG — Programmatic Memory Enables Long-Horizon Reasoning con una ficha del mismo eje antes de convertir la coincidencia en hipótesis.
  3. Elegir un solo workflow relacionado con el corte y dejar una línea base, una métrica y una condición de parada.
QUÉ VIGILAR

La señal también tiene sombra.

  • Una ficha abierta no equivale a una recomendación de adopción.
  • Los resultados dependen de tarea, datos, modelo, prompt y presupuesto; el corte no los normaliza por sí solo.
  • Elevar la confianza sólo cuando método, resultado, límite y localizador estén comprobados en la ficha.
Guardar una nota en Second Brain