← AI Terminology

Fairness Metric

A fairness metric is a quantitative measure that captures whether an ML model's predictions or errors are equitably distributed across different demographic groups — formalising a specific definition of what "fair" means in the context of that application.

No single fairness metric is universally applicable; different definitions are mathematically incompatible in general.
Why It Matters in AI
Claiming a model is "fair" without a precise metric is meaningless — fairness has multiple incompatible definitions. A credit model can satisfy demographic parity (equal approval rates) while violating equalised odds (unequal error rates across groups). Choosing the right fairness metric is a value judgement about which errors matter most for the use case, and it has legal and ethical consequences.
Key Points
Aspect Description
Tools Fairlearn, IBM AI Fairness 360, Aequitas, What-If Tool
Calibration Same meaning of predicted probabilities across groups — P(y=1
Impossibility Chouldechova (2017): demographic parity + equalised odds + calibration cannot all hold simultaneously when base rates differ
Equalised odds Equal TPR and FPR across groups — same accuracy of positive and negative predictions
Demographic parity Equal positive prediction rates across groups — P(ŷ=1
Individual fairness Similar individuals receive similar predictions — requires a similarity metric
Simple Analogy
"Fair" has multiple valid meanings in a hiring context: equal offer rates for all groups (demographic parity), equal accuracy of predictions about who will succeed (equalised odds), or equal meaning of confidence scores (calibration). Meeting one often violates another — choosing which is a policy decision, not a technical one.
Common Usage Examples
  • fairlearn.metrics.demographic_parity_difference(y_true, y_pred, sensitive_features=df['gender'])
  • COMPAS analysis: instrument satisfies calibration but violates equalised odds for Black defendants
  • EU AI Act high-risk AI systems: must report performance disaggregated by demographic groups
  • MetricFrame.by_group — displays metric breakdown per sensitive attribute value
  • Fairness-aware training: reweigh minority group examples or apply adversarial debiasing
Summary
In short: Fairness metrics formalise what "equitable" means for an AI system — and since definitions are mathematically incompatible, choosing one is an explicit value judgement, not a neutral technical choice.