Este corte cruza agentes, evidencia y evaluación para responder una pregunta concreta: qué parte del sistema merece una prueba después de abrir Program-as-Weights: A Programming Paradigm for Fuzzy Functions.
NOTA DE EDICIÓN
Esta página cumple una función de archivo: orienta el recorrido de 15 señales y lleva a las fichas que ya tienen lectura. La síntesis no sustituye los localizadores de cada ficha.
Los resultados están separados de las inferencias editoriales dentro de cada ficha y también se exponen a través del MCP del sitio.
01LECTURA TRANSVERSAL / QUÉ CAMBIÓ
01 / IMPRESCINDIBLE
Program-as-Weights: A Programming Paradigm for Fuzzy Functions
Propone compilar una especificación en lenguaje natural en un artefacto neural pequeño y ejecutable localmente. Un compilador de 4B genera adaptadores para un intérprete Qwen3 de 0.6B, igualando prompting directo de Qwen3-32B con mucha menos memoria e inferencia local. La pregunta de producto que queda abierta es: muchas funciones “difusas” —clasificar logs, reparar JSON, rankear por intención— se externalizan a APIs LLM caras y poco reproducibles.
Distributed Attacks in Persistent-State AI Control
Estudia ataques distribuidos en agentes de código que trabajan sobre repositorios persistentes. Un agente malicioso puede repartir payloads entre PRs y escoger el momento con mejor cobertura natural; los monitores estándar no cubren bien ataques graduales y no graduales a la vez. La pregunta de producto que queda abierta es: la seguridad de coding agents no puede evaluarse solo por diff aislado.
TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
Mejora RL de agentes asignando crédito por rol semántico de cada segmento: progreso decisivo, exploración útil, infraestructura sin progreso o regresión. Supera GRPO en ALFWorld, Search-QA y WebShop y reduce turnos de entorno en rollouts completados. La pregunta de producto que queda abierta es: usar solo éxito/fallo final castiga exploración útil y premia pasos redundantes.
El ranking es editorial. Cada ficha contiene lectura narrativa, localizadores, limitaciones, próxima prueba y revisión del agente editor.
01
MEMORIA · CODING
Program-as-Weights
Propone compilar una especificación en lenguaje natural en un artefacto neural pequeño y ejecutable localmente.
La sección 6 Main Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02512#S6.
Distributed Attacks in Persistent-State AI Control
Estudia ataques distribuidos en agentes de código que trabajan sobre repositorios persistentes.
La sección 4 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02514#S4.
Mejora RL de agentes asignando crédito por rol semántico de cada segmento: progreso decisivo, exploración útil, infraestructura sin progreso o regresión.
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.32017#S5.
Método training-free para mejorar razonamiento en contexto largo.
La sección 4 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02509#S4.
Predice rendimiento en benchmarks agentic caros usando un subconjunto pequeño de evaluaciones atómicas.
La sección 3 Pace : A Proxy for Agentic Capability Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02032#S3.
Framework de sparse attention para long-context que usa cuantización binaria rotada y aritmética binary-INT4 para estimar atención, con Top-p adaptativo y diseño hardware-aware.
La sección 5 Evaluation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2606.31519#S5.
Benchmark para evaluar cómo agentes modifican políticas ejecutables bajo feedback e interacción acotada.
La sección 4 Experiments informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02440#S4.
Mide cómo la memoria personalizada cambia no solo la respuesta final, sino la trayectoria de razonamiento.
La sección 5 RQ3: Post-training Mitigation informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02374#S5.
Mejora GraphRAG alineando embeddings de grafos con features textuales mediante self-supervised learning con masking adaptativo.
La sección 5 Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.00052#S5.
Entrena modelos a descomponer código en subfunciones recombinables.
La sección 4 Results informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02390#S4.
Testbed en Slay the Spire 2 para estudiar agentes de larga duración con memoria acotada y typed retrieval, sin concatenar transcript completo.
La sección 6 Results informa 1 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02255#S6.
Framework multiagente de desarrollo software que mide incertidumbre token-level en outputs intermedios y activa verificación RAG cuando supera umbrales calibrados por fase.
La sección Experiments informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02186#S3.
Monitor online que convierte una señal de verificador externo en alarma calibrada por control de riesgo.
La sección 4 Experiments informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02510#S4.
Benchmark generativo para agentes que resuelven problemas de programación lineal escritos en texto.
La sección 4 Experiments informa 2 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02141#S4.
Challenges and Recommendations for LLMs-as-a-Judge in Multilingual Settings
Revisión crítica de LLM-as-a-Judge en evaluación multilingüe y lenguas de bajo recurso.
La sección 4 LLM-as-a-Judge in Multilingual Research informa 4 hallazgo(s) extraído(s) desde la fuente. El resultado principal se conserva con el localizador de sección https://arxiv.org/html/2607.02235#S4.