Hugging Face Daily PapersPengyu Zhu, Jingyi Yang, Yi Liu, Li Sun, Sen Su1 min readpaperadvanced
SkillDRE: Dual-Stage Red-Team Evolution of Agent Skills via Pre-Execution and Runtime Feedback
Summary
SkillDRE is an automated framework that evolves malicious AI agent skills using a dual-stage feedback loop, combining pre-execution scanning and runtime defense feedback. It achieved a 45.28% attack success rate against victim models, significantly outperforming baselines while bypassing scanners and maintaining benign functionality.
- SkillDRE automates red-teaming for AI agent skills by evolving malicious payloads.
- It uses a dual-stage feedback loop: scanner-guided pre-execution and runtime-guided refinement.
- Malicious skills are evolved to bypass defenses while preserving benign task capability.
- Achieved 45.28% attack success rate, exceeding the strongest baseline by 40.3%.
AI safety and security engineers should care as this framework demonstrates a robust method for evolving evasive malicious AI agent skills, exposing potential vulnerabilities in current defense strategies.
8/10