#adversarial-robustness
-
Adversarial Training Best Practices That Survive Evaluation
A practitioner's guide to adversarial training: pick a threat model, run PGD-AT correctly, catch robust overfitting, and evaluate with AutoAttack.
-
Testing Robustness Against Unforeseen Adversaries: The UAR Metric
OpenAI's Unforeseen Attack Robustness metric scores classifiers against adversarial perturbations they never trained on. What it measures and misses.
-
Universal Adversarial Perturbations: One Vector That Fools Inputs
Universal adversarial perturbations are input-agnostic: one crafted noise vector causes misclassification across most inputs and transfers between models.