Este corte cruza búsqueda generativa, GEO/LLMO, seguridad. para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir SIREN — PAIR-Driven Preference Manipulation in Web-RAG Recommenders.
NOTA DE EDICIÓN
Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.
Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.
01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE
SIREN — PAIR-Driven Preference Manipulation in Web-RAG Recommenders
SIREN estudia algo directamente relacionado con el futuro del SEO: ¿puede una web modificar su contenido para conseguir que un asistente con búsqueda la coloque como recomendación nº1? Manteniendo exactamente las mismas fuentes recuperadas y modificando solamente una página, consigue alcanzar el primer puesto en 62 de 124 intentos; los ataques exitosos se reproducen en sesiones nuevas con una tasa media de 80,5%. Curiosamente, afirmaciones declarativas de ranking y listas sembradas funcionaron mejor que instrucciones explícitas tipo prompt injection. La pregunta de producto que queda abierta es: los asistentes web ya son sistemas de ranking, pero sus resultados pueden manipularse a través del contenido que leen. Por qué puede ser importante: es una de las señales más claras que he visto de que GEO/Generative Engine Optimization tendrá una dimensión adversarial similar al SEO, aunque con mecanismos diferentes.
En vez de resumir continuamente la memoria o meter todo el historial en contexto, PRO-LONG guarda una traza completa y estructurada de interacción y permite que el agente la busque programáticamente, aprovechando precisamente las capacidades adquiridas por los coding agents. En ARC-AGI-3 mejora en promedio 18 puntos frente al agente base y alcanza hasta 76,1% pass\@1 usando 4,2–5,8× menos tokens. La pregunta de producto que queda abierta es: cuanto más historial conserva un agente, más difícil resulta encontrar luego lo que realmente necesita.
PyroDash — Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference
Un modelo pequeño genera normalmente y aprende a emitir un token especial cuando necesita ayuda. Solo entonces transfiere la query y el razonamiento parcial a un LLM grande. No requiere router externo ni acceso a logits del modelo grande. En una configuración reduce el coste de $49,36 a $1,78, usando solo 1,9% de tokens del LLM grande; en otra supera incluso la precisión del baseline LLM-only reduciendo a la vez el coste un 20,4%. La pregunta de producto que queda abierta es: usar un frontier model para cada token es económicamente absurdo cuando gran parte del trabajo puede resolverlo un SLM.
El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.
01
RAG · SEGURIDAD
SIREN — PAIR-Driven Preference Manipulation in Web-RAG Recommenders
SIREN estudia algo directamente relacionado con el futuro del SEO: ¿puede una web modificar su contenido para conseguir que un asistente con búsqueda la coloque como recomendación nº1?
La sección 9. Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.21951#S9.
En vez de resumir continuamente la memoria o meter todo el historial en contexto, PRO-LONG guarda una traza completa y estructurada de interacción y permite que el agente la busque programáticamente, aprovechando precisamente las capacidades adquiridas por los coding agents.
La sección 3 Main Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.20064#S3.
PyroDash — Cost-Efficient Token-Level Small-Large Language Model Collaborati
Un modelo pequeño genera normalmente y aprende a emitir un token especial cuando necesita ayuda.
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.20327#S4.
MineValiCoder — Reliable Code Generation with Test Case Quality Mining and B
Trata código y tests como dos fuentes potencialmente defectuosas que deben validarse mutuamente.
La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.22471#S4.
TAP-RAG — Task-Aware Policy Control for Long-Document Multimodal Question An
TAP-RAG no usa la misma estrategia para todas las preguntas.
La sección 4 Experiments informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.18917#S4.
Sound Probabilistic Safety Bounds for Large Language Models
En vez de preguntar simplemente “¿el modelo falló en nuestro red-team?”, calcula límites probabilísticos matemáticamente sólidos sobre la probabilidad de producir contenido dañino.
La sección 5 Experiments informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.20286#S5.
IteraSim RAG — A Multi-Stage Retrieval-Augmented Agentic Back-End for OpenFO
Sistema para configurar automáticamente simulaciones CFD en OpenFOAM.
La sección 2 Methodology informa 3 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.20346#S2.
Scaling Native Multimodal Pre-Training From Scratch
Estudia sistemáticamente cómo escalan modelos entrenados multimodalmente desde cero, en lugar de añadir posteriormente visión a un LLM.
La sección 4 Downstream Implications informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.22043#S4.
GenDB — Instance-Optimized and Customized Query Processing Code Generation v
En vez de seguir ampliando motores SQL genéricos, GenDB hace que agentes generen código de ejecución específico para los datos, hardware y workload concretos.
La sección 3. Extract of Experimental Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.20630#S3.
Detecta un fallo llamativo: al aumentar el contexto, los modelos empiezan a copiar grandes fragmentos del prompt dentro de su razonamiento en vez de procesarlos.
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.19345#S5.
Athena-Brain-8B — An Efficient Robot Brain for General Intelligence and Embo
LLM de 8B diseñado específicamente como cerebro ejecutable localmente para sistemas físicos.
La sección 4 Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.18985#S4.
KaPilot — LLM-Assisted Generation of Kani Specifications for Unsafe Rust Ver
Sistema multiagente que genera especificaciones formales para verificar código unsafe de Rust con Kani.
La sección 4. Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.21957#S4.
On Improving Faithfulness of Podcasts from Documents
Analiza sistemáticamente alucinaciones en podcasts generados desde documentos, construyendo un dataset de más de 1.500 documentos en cinco dominios.
La sección 5 Experiments informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.21961#S5.
Towards Trustworthy and Cost-Efficient Data Integration
Trabajo de síntesis sobre la evolución RAG → GraphRAG/KG-RAG → Agentic RAG específicamente para integración de datos empresariales.
La sección 4 Advancing Data Integration with Agentic RAG informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.22319#S4.
GRACE — Fine-Tuning for Sustainable and Accurate Personalization
Integra criterios como sostenibilidad o salud directamente en un recomendador preentrenado mediante fine-tuning, evitando entrenar otro modelo desde cero o añadir un costoso reranker.
La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.22341#S4.