RL-FAT Improves Adversarial Robustness and Fairness in Neural Networks.

Tejaswini Medi, Levan Mikeladze, Margret Keuper· September 1, 2026 View original

Key takeaways

  • Adversarial training can create class-wise robustness imbalances in neural networks.
  • RL-FAT uses reinforcement learning to improve both robustness and fairness.
  • Policy-gradient feedback helps models adaptively focus on class-wise misclassifications.
  • A fairness-emphasis loss mitigates robustness disparities across categories.

Who benefits

HealthcareAutomotiveSecurityFinanceAI Development

Summary

RL-FAT is a reinforcement learning-inspired framework for fair adversarial training that addresses class-wise robustness disparities in deep neural networks. It uses policy-gradient feedback and a fairness-emphasis loss to balance robustness across different categories, improving overall robust accuracy and reducing imbalance.

Deep neural networks are vulnerable to adversarial attacks, and while adversarial training (AT) improves robustness, it often creates imbalances, making some classes disproportionately vulnerable. To address this, researchers propose RL-FAT (Reinforcement Learning for Fair Adversarial Training), a novel framework designed to enhance both robustness and fairness. RL-FAT interprets the model's prediction distribution as a policy and uses policy-gradient based feedback from adversarial predictions. It combines correctness-based rewards with class-wise value estimates to compute specific advantages, allowing the model to adaptively focus on misclassified examples within each class. Additionally, a fairness-emphasis adversarial loss is introduced, applying stronger training pressure to classes with high adversarial loss, thereby mitigating robustness disparities. Experiments show RL-FAT significantly reduces class-wise robustness imbalance while maintaining competitive robust accuracy.

Why it matters

For professionals deploying AI in sensitive applications, ensuring fair and balanced robustness across all data categories is critical for trust, ethical compliance, and reliable performance, especially in vision tasks.

How to implement this in your domain

  1. 1Evaluate existing models for class-wise robustness disparities using adversarial attacks.
  2. 2Consider integrating RL-FAT's policy-gradient feedback mechanism into adversarial training pipelines.
  3. 3Implement the fairness-emphasis adversarial loss to prioritize vulnerable classes during training.
  4. 4Benchmark the fairness and robustness improvements against standard adversarial training methods.

Original post by Tejaswini Medi, Levan Mikeladze, Margret Keuper

"arXiv:2608.29247v1 Announce Type: new Abstract: Deep neural networks remain highly vulnerable to adversarial perturbations, and adversarial training (AT) has become a widely used approach for improving robustness. However, improvements in average robust accuracy often mask substa…"

View on X

Originally posted by Tejaswini Medi, Levan Mikeladze, Margret Keuper on X · view source

Want to go deeper?

Turn these trends into skills with Learnijoy's hands-on AI & tech courses.

Explore courses