Exploiting Attackability for Effective Textual Adversarial Attacks
摘要
Deep learning models have achieved remarkable success across various domains, yet their susceptibility to adversarial attacks remains a pressing concern. While recent advancements in adversarial attacks have aimed to enhance model defenses, many existing techniques suffer from drawbacks such as higher perturbation rates, higher query count, reduced textual similarity, or lower success rates. This paper addresses this problematic by proposing a dynamic search strategy that leverages the concept of attackability to guide and optimise the generation of adversarial attacks. The method seeks to improve the quality of generated adversarial samples via minimizing perturbation rates, query count, and maintaining high success rates. Experimental results demonstrate its effectiveness compared to existing techniques, representing a significant advancement in the field of adversarial attack generation.