# Distributed Attacks in Persistent-State AI Control
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/distributed-attacks-in-persistent-state-ai-control
- Fuente primaria: https://arxiv.org/abs/2607.02514
- Versión leída: v2
- Fuente comprobada: 2026-08-19 · lectura primaria completa; extracción editorial automatizada, revisión humana pendiente
- Autores: Josh Hills, Ida Caspary, Asa Cooper Stickland
- Fecha del corte: 2 JULIO 2026.
- Área: MEMORIA · AGENTES · SEGURIDAD

## Tesis y contexto

Estudia ataques distribuidos en agentes de código que trabajan sobre repositorios persistentes. Un agente malicioso puede repartir payloads entre PRs y escoger el momento con mejor cobertura natural; los monitores estándar no cubren bien ataques graduales y no graduales a la vez.

- Problema: La seguridad de coding agents no puede evaluarse solo por diff aislado.
- Por qué importa: Si los agentes empiezan a abrir PRs reales, el historial persistente es una superficie de ataque central.

## Evidencia reportada

- **reported-result**: Link-tracker reduces gradual evasion to 65\% on CLI tasks and 44\% on Flask tasks (Figure 5 ). [localizador](https://arxiv.org/html/2607.02514#S4)
- **reported-result**: This is a large improvement on our other diff-based monitors. [localizador](https://arxiv.org/html/2607.02514#S4)
- **reported-result**: Across both task families, link-tracker outperforms task-description and full-diffs under the GPT-4o monitor. [localizador](https://arxiv.org/html/2607.02514#S4)
- **reported-result**: In contrast to the monitoring success with link-tracker, simply giving a monitor more raw history does not improve detection. [localizador](https://arxiv.org/html/2607.02514#S4)

## Lectura y límite

- Método: La lectura de 2 The Iterative VibeCoding Setting describe la intervención y su construcción: A simulated user provides a fixed sequence of main tasks to an AI coding assistant building software iteratively. The interaction takes place across PRs, with each PR extending the tool from earlier ones. Code persists between PRs via git commits. In our main experiments, the agent has no cross-PR conversation memory. This isolates the effect of persistent code from that of session memory, so we do not necessarily model the strongest possible memory-enabled attacker. This is an example task sequence from the CLI task family (the uptime-monitor sequence):
- Límite: La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Results.
- Confianza editorial: Media
- Limitación: El cierre de la fuente señala: Both task families remain much smaller than enterprise codebases; real deployments have larger repositories, deeper dependencies, CI/CD, and multi-developer histories. We ensemble across monitor types but not across models; multi-model ensembles would be an interesting next step. The reported experiments use no cross-PR memory; preliminary memory experiments are in Appendix D . Gradual evasion numbers carry selection bias because the runs that succeed are…
- Limitación: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 4 Results.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2607.02514): tipo abstract
- [HTML · lectura completa](https://arxiv.org/html/2607.02514): tipo abstract
- [Método · 2 The Iterative VibeCoding Setting](https://arxiv.org/html/2607.02514#S2): tipo section
- [Evaluación · 4 Results](https://arxiv.org/html/2607.02514#S4): tipo section
- [Cierre · 6 Discussion](https://arxiv.org/html/2607.02514#S6): tipo section

## Próxima prueba

- ¿La propuesta mejora revisión de PRs agentic frente a la línea base actual?
- Métrica: Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
- Regla de parada: Parar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

## Recursos reproducibles
- [https://github.com/josh-hills/control-arena-persistent-state-eval](https://github.com/josh-hills/control-arena-persistent-state-eval)
- [Link](https://github.com/UKGovernmentBEIS/control-arena)
- [Link](https://github.com/UKGovernmentBEIS/inspect_ai)
- [the following issues](https://github.com/arXiv/html_feedback/issues)

## Enlaces relacionados

- [CoEvo-Mem](https://luiseduardodemiguel.com/research-ia/markdown/papers/coevo-mem)
- [Agent Memory Distillation](https://luiseduardodemiguel.com/research-ia/markdown/papers/agent-memory-distillation)
- [LiveMem](https://luiseduardodemiguel.com/research-ia/markdown/papers/livemem)