# MAStrike: Shapley-Guided Collusive Red-Teaming on Multi-Agent Systems
> Ficha editorial pública de Research IA. Estado: Lectura primaria completa. La interpretación editorial no sustituye la fuente primaria.

- Página canónica: https://luiseduardodemiguel.com/research-ia/papers/mastrike-shapley-guided-collusive-red-teaming-on-multi-agent-systems
- Fuente primaria: https://arxiv.org/abs/2606.12918
- Versión leída: v2
- Fuente comprobada: 2026-08-19 · lectura primaria completa; extracción editorial automatizada, revisión humana pendiente
- Autores: Chejian Xu, Zhaorun Chen, Jingyang Zhang, Freddy Lecue, Avni Kothari, Sarah Tan, Wenbo Guo, Bo Li
- Fecha del corte: V1 11 JUNIO 2026; V2 12 JUNIO 2026.
- Área: AGENTES · EVALUACIÓN · SEGURIDAD

## Tesis y contexto

Red-teaming para sistemas multiagente jerárquicos. Usa valores de Shapley para estimar qué agentes contribuyen más a la robustez del sistema y detectar coaliciones vulnerables. Construye benchmarks y entornos en finanzas, software engineering y CRM.

- Problema: La seguridad de un sistema multiagente no es la suma de seguridades individuales; los ataques pueden coordinarse entre roles.
- Por qué importa: Las empresas están empezando a diseñar equipos de agentes, y esa arquitectura introduce superficies de ataque nuevas: colusión, escalada de privilegios, manipulación entre agentes.

## Evidencia reportada

- **reported-result**: Among the domains, they achieve strong performance in engineering tasks, demonstrating superior coding capabilities, with near-perfect success rates on code changes, DevOps, and data operations. [localizador](https://arxiv.org/html/2606.12918#S6)
- **reported-result**: Finance tasks show moderate difficulty, with consistent performance on card and payment operations but noticeably lower success on account access. [localizador](https://arxiv.org/html/2606.12918#S6)
- **reported-result**: Overall, Gemini 3.1 Pro achieves the highest average success rate (72.3%), followed by Claude Opus 4.7 (69.6%) and GPT-5.5 (64.8%), but all models exhibit significant variance across tasks. [localizador](https://arxiv.org/html/2606.12918#S6)

## Lectura y límite

- Método: La lectura de 2 Related Work describe la intervención y su construcción: Existing methods to red-team MAS apply techniques such as malicious content injection, persuasion, manipulating agent traits, and communication-based attacks 13 ; 2 ; 27 ; 11 ; 8 . However, they rely on heuristic choices to select the attacking agent(s) and do not model connections between agents. There have been efforts to study connections between agents, such as 10 who identified three types of behaviors in MAS that could increase the risks of system failure, namely conflict, miscoordination, collusion. However, they do not propose approaches to measure these failures, or leverage these behaviors to improve…
- Límite: La lectura primaria permite comprobar método y resultados en el HTML, pero no convierte sus conclusiones en validación independiente. La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Experiments.
- Confianza editorial: Media
- Limitación: El cierre de la fuente señala: We propose MAStrike , an end-to-end framework for collusive red-teaming in hierarchical MAS that leverages agent-level Shapley value analysis to quantify each agent’s marginal contribution to system robustness under task-specific distributions. We design an autonomous red-teaming agent guided by Shapley values to identify vulnerable coalitions and generate coordinated, role-aware adversarial manipulations. Extensive experiments across multiple MAS…
- Limitación: La ficha no demuestra transferencia fuera de los datasets, modelos, herramientas y condiciones descritos en 6 Experiments.

## Localizadores de evidencia
- [Fuente primaria · canonical](https://arxiv.org/abs/2606.12918): tipo abstract
- [HTML · lectura completa](https://arxiv.org/html/2606.12918): tipo abstract
- [Método · 2 Related Work](https://arxiv.org/html/2606.12918#S2): tipo section
- [Evaluación · 6 Experiments](https://arxiv.org/html/2606.12918#S6): tipo section
- [Cierre · 7 Conclusion](https://arxiv.org/html/2606.12918#S7): tipo section

## Próxima prueba

- ¿La propuesta mejora auditoría de sistemas multiagente frente a la línea base actual?
- Métrica: Comparar la métrica principal de la fuente junto con calidad, coste, latencia y tasa de errores.
- Regla de parada: Parar si no aparece una mejora reproducible o si aumenta el riesgo, la complejidad o el coste sin compensación.

## Recursos reproducibles
- [the following issues](https://github.com/arXiv/html_feedback/issues)
- [list of packages that need conversion](https://github.com/brucemiller/LaTeXML/wiki/Porting-LaTeX-packages-for-LaTeXML)
- [developer contributions](https://github.com/brucemiller/LaTeXML/issues)

## Enlaces relacionados

- [VAKRA](https://luiseduardodemiguel.com/research-ia/markdown/papers/vakra)
- [The Devil Is in the Interface](https://luiseduardodemiguel.com/research-ia/markdown/papers/devil-interface)
- [SkillSentry](https://luiseduardodemiguel.com/research-ia/markdown/papers/skillsentry)