Existuje třetí možnost průměrování metrik při nerovnováze tříd a jak se počítá?
sobes.tech AI
Odpověď od AI
Když je ve třídících úlohách nerovnováha tříd, často se používají tři možnosti průměru metrik (například přesnost, recall, F1):
-
Makro-průměr: vypočítá metriku samostatně pro každou třídu a poté je průměruje bez ohledu na počet příkladů v třídách. To dává stejnou váhu každé třídě.
-
Mikro-průměr: spojuje všechny pravdivé pozitivní, falešné pozitivní a falešné negativní ze všech tříd a poté vypočítá metriku. Tím se zohlední celkový přínos všech příkladů.
-
Vážený průměr: vypočítá metriku pro každou třídu a poté je průměruje s váhami úměrnými počtu příkladů v každé třídě. To umožňuje zohlednit nerovnováhu a dát větší váhu třídám s větším zastoupením.
Formálně se vážený průměr pro metriku M počítá takto:
[ M_{weighted} = \sum_{i=1}^C w_i \times M_i, \quad w_i = \frac{N_i}{\sum_{j=1}^C N_j} ]
děle:
- (C) — počet tříd,
- (M_i) — metriku pro třídu (i),
- (N_i) — počet příkladů třídy (i).
Vážený průměr pomáhá získat realističtější odhad kvality modelu při nerovnováze tříd a zachovává vliv každé třídy úměrně její frekvenci.