← AI Terminology
Fairness Metric
A fairness metric is a quantitative measure that captures whether an ML model's predictions or errors are equitably distributed across different demographic groups — formalising a specific definition of what "fair" means in the context of that application.
No single fairness metric is universally applicable; different definitions are mathematically incompatible in general.
No single fairness metric is universally applicable; different definitions are mathematically incompatible in general.
Why It Matters in AI
Claiming a model is "fair" without a precise metric is meaningless — fairness has multiple incompatible definitions. A credit model can satisfy demographic parity (equal approval rates) while violating equalised odds (unequal error rates across groups). Choosing the right fairness metric is a value judgement about which errors matter most for the use case, and it has legal and ethical consequences.
Key Points
| Aspect | Description |
|---|---|
| Tools | Fairlearn, IBM AI Fairness 360, Aequitas, What-If Tool |
| Calibration | Same meaning of predicted probabilities across groups — P(y=1 |
| Impossibility | Chouldechova (2017): demographic parity + equalised odds + calibration cannot all hold simultaneously when base rates differ |
| Equalised odds | Equal TPR and FPR across groups — same accuracy of positive and negative predictions |
| Demographic parity | Equal positive prediction rates across groups — P(ŷ=1 |
| Individual fairness | Similar individuals receive similar predictions — requires a similarity metric |
Simple Analogy
"Fair" has multiple valid meanings in a hiring context: equal offer rates for all groups (demographic parity), equal accuracy of predictions about who will succeed (equalised odds), or equal meaning of confidence scores (calibration). Meeting one often violates another — choosing which is a policy decision, not a technical one.
Common Usage Examples
fairlearn.metrics.demographic_parity_difference(y_true, y_pred, sensitive_features=df['gender'])- COMPAS analysis: instrument satisfies calibration but violates equalised odds for Black defendants
- EU AI Act high-risk AI systems: must report performance disaggregated by demographic groups
MetricFrame.by_group— displays metric breakdown per sensitive attribute value- Fairness-aware training: reweigh minority group examples or apply adversarial debiasing
Summary
In short: Fairness metrics formalise what "equitable" means for an AI system — and since definitions are mathematically incompatible, choosing one is an explicit value judgement, not a neutral technical choice.