AIF360/aif360/algorithms/inprocessing/adversarial_debiasing.py at main · Trusted-AI/AIF360
algorithmic-fairnessadversarial-debiasingtensorflowbias-mitigation
Abstraction: AIF360 in-processing adversarial debiasing classifier implementation in TensorFlow
Key points:
- Implements AdversarialDebiasing, an in-processing fairness technique from Zhang, Lemoine, Mitchell (AAAI/ACM 2018)
- Trains a classifier to maximize prediction accuracy while minimizing an adversary's ability to infer the protected attribute from predictions
- Key hyperparameter: adversary_loss_weight (default 0.1) controls strength of debiasing vs. accuracy trade-off
- Classifier gradients are projected away from adversary gradient direction to prevent protected attribute leakage
- Requires TensorFlow v1 (graph mode); raises RuntimeError in eager execution mode
Connections: Aif360 · Ibm · Algorithmic Fairness · Adversarial Learning · Bias Mitigation