11 · Prawa i prawdy · 3 min czytania · aktualizacja
Co to jest zasada Pareto 80/20 i czy naprawdę działa?
W skrócie
W wielu zjawiskach niewielka część przyczyn odpowiada za większość skutków. Skąd bierze się ta nierówność i kiedy 80/20 jest prawdą, a kiedy sloganem.
Co to jest
W wielu zjawiskach mniejszość przyczyn odpowiada za większość skutków — umownie 20% przyczyn daje 80% efektów. Nazwę „zasada Pareto” nadał jej Joseph Juran, specjalista od jakości, w „Quality Control Handbook” z 1951 roku, odwołując się do Vilfreda Pareta, który w „Cours d’économie politique” (1896–1897) pokazał, że rozkład dochodów i majątku ma postać potęgową: niewielka grupa posiada większość bogactwa.
Juran ujął to jako „nieliczne istotne i liczne błahe” (vital few, trivial many): kilka typów wad odpowiada za większość reklamacji, kilku klientów za większość przychodu, kilka modułów za większość błędów w programie. Praktyczny wniosek: zanim zaczniesz poprawiać wszystko, znajdź te nieliczne przyczyny.
Liczby 80 i 20 nie są prawem przyrody. To etykieta dla zjawiska „silnie nierówny rozkład”. W konkretnych danych może to być 70/30, 90/10 albo 63/20 — a w wielu danych nierówności nie ma wcale.
Mechanizm — dlaczego tak działa
Zasada Pareto opisuje rozkłady o ciężkim ogonie, przede wszystkim potęgowe. W rozkładzie Pareto udział najwyższych p% obserwacji w sumie wynosi p^(1 − 1/α), gdzie α to wykładnik ogona. Dokładne 80/20 wychodzi dla α ≈ 1,16. Mniejsze α daje jeszcze większą koncentrację, większe — mniejszą.
Skąd biorą się takie rozkłady? Najczęściej z procesów multiplikatywnych i kumulatywnej przewagi: kto ma dużo, łatwiej zdobywa więcej. Majątek rośnie procentowo, popularne strony zdobywają więcej linków, cytowane prace są częściej cytowane. Małe początkowe różnice, mnożone przez wiele okresów, rozjeżdżają się w ogromne nierówności. To ten sam mechanizm, który stoi za prawem Zipfa.
Gdy zjawisko jest sumą wielu niezależnych, ograniczonych wpływów (wzrost, masa ciała, czas reakcji), rozkład jest bliski normalnego i zasady Pareto nie ma: 20% największych obserwacji daje niewiele więcej niż 20% sumy.
Uwaga na typowe nieporozumienia. Po pierwsze, 80 i 20 nie muszą sumować się do 100 — dotyczą różnych zbiorów (przyczyn i skutków). Po drugie, zasada nie mówi, że pozostałe 80% przyczyn można zignorować: ogon bywa ważny (rzadkie, ale groźne błędy). Po trzecie, rozkłady potęgowe trudno odróżnić od innych skośnych rozkładów na oko; formalne dopasowanie wymaga ostrożności.
Na przykładzie
Ceny biletów na Titanicu (891 pasażerów): 20% pasażerów z najdroższymi biletami zapłaciło 63,2% sumy wszystkich opłat. Najdroższe 10% — 45,1%, a zaledwie 9 osób (1%) — 10,9%. Tańsza połowa pasażerów zapłaciła łącznie 13,5%. Silna nierówność, ale „63/20”, nie „80/20”.
Ten sam kształt w modelu: las losowy (500 drzew, random_state=0) na Breast Cancer Wisconsin. Sześć z 30 cech (20%) — m.in. „worst perimeter”, „worst concave points”, „worst radius” — skupia 62,9% ważności (miara oparta na nieczystości), a cała słabsza połowa, 15 cech, tylko 10,2%. Dla kontrastu masa ciała pingwinów Palmer: 20% najcięższych osobników to 25,8% łącznej masy — rozkład bliski normalnego, Pareta brak.
Dane: Titanic Palmer Penguins (pingwiny z Antarktydy) Breast Cancer Wisconsin (diagnostyka raka piersi)
W praktyce
- Krzywa koncentracji w pandas:
s.sort_values(ascending=False).cumsum() / s.sum(); sprawdź, jaki odsetek daje górne 20%. - Analiza błędów modelu: pogrupuj błędne predykcje po kategorii, źródle czy segmencie (
df[err].groupby('segment').size().sort_values()); zwykle kilka grup daje większość pomyłek. - Selekcja cech: kilka cech często niesie większość sygnału, ale ważności z
feature_importances_są obciążone — potwierdź wynikpermutation_importance. - W danych o ciężkim ogonie (przychody, czas sesji) używaj mediany i logarytmu; średnia jest zdominowana przez nieliczne skrajne wartości.
- Nie wycinaj „mało ważnego” ogona bez sprawdzenia: rzadkie klasy lub przypadki brzegowe mogą być kluczowe dla jakości.
Najczęstsze pytania
- Czy zasada Pareto to zawsze dokładnie 80/20?
- Nie. To umowna etykieta silnej nierówności. Rzeczywiste proporcje bywają 70/30, 90/10 czy 63/20, a w danych o rozkładzie zbliżonym do normalnego nierówności praktycznie nie ma.
- Skąd się bierze rozkład 80/20?
- Najczęściej z procesów, w których przewaga się kumuluje: wzrost procentowy, „bogaci się bogacą”, efekty sieciowe. Takie procesy wytwarzają rozkłady potęgowe o ciężkim ogonie.
- Jak wykorzystać zasadę Pareto w uczeniu maszynowym?
- W analizie błędów (kilka segmentów daje większość pomyłek), w czyszczeniu danych (kilka źródeł daje większość problemów) i w doborze cech. Za każdym razem warto zmierzyć rzeczywistą koncentrację, zamiast zakładać 80/20.
Źródła
- Vilfredo Pareto, „Cours d’économie politique”, Lozanna 1896–1897.
- Joseph M. Juran, „Quality Control Handbook”, McGraw-Hill, 1951.
- Mark E. J. Newman, „Power laws, Pareto distributions and Zipf’s law”, Contemporary Physics 46(5), 2005, s. 323–351.
- Aaron Clauset, Cosma R. Shalizi, Mark E. J. Newman, „Power-law distributions in empirical data”, SIAM Review 51(4), 2009, s. 661–703.