ML Atlas

11 · Prawa i prawdy · 3 min czytania · aktualizacja

Co to jest zasada Pareto 80/20 i czy naprawdę działa?

W skrócie

W wielu zjawiskach niewielka część przyczyn odpowiada za większość skutków. Skąd bierze się ta nierówność i kiedy 80/20 jest prawdą, a kiedy sloganem.

Co to jest

W wielu zjawiskach mniejszość przyczyn odpowiada za większość skutków — umownie 20% przyczyn daje 80% efektów. Nazwę „zasada Pareto” nadał jej Joseph Juran, specjalista od jakości, w „Quality Control Handbook” z 1951 roku, odwołując się do Vilfreda Pareta, który w „Cours d’économie politique” (1896–1897) pokazał, że rozkład dochodów i majątku ma postać potęgową: niewielka grupa posiada większość bogactwa.

Juran ujął to jako „nieliczne istotne i liczne błahe” (vital few, trivial many): kilka typów wad odpowiada za większość reklamacji, kilku klientów za większość przychodu, kilka modułów za większość błędów w programie. Praktyczny wniosek: zanim zaczniesz poprawiać wszystko, znajdź te nieliczne przyczyny.

Liczby 80 i 20 nie są prawem przyrody. To etykieta dla zjawiska „silnie nierówny rozkład”. W konkretnych danych może to być 70/30, 90/10 albo 63/20 — a w wielu danych nierówności nie ma wcale.

Mechanizm — dlaczego tak działa

Zasada Pareto opisuje rozkłady o ciężkim ogonie, przede wszystkim potęgowe. W rozkładzie Pareto udział najwyższych p% obserwacji w sumie wynosi p^(1 − 1/α), gdzie α to wykładnik ogona. Dokładne 80/20 wychodzi dla α ≈ 1,16. Mniejsze α daje jeszcze większą koncentrację, większe — mniejszą.

Skąd biorą się takie rozkłady? Najczęściej z procesów multiplikatywnych i kumulatywnej przewagi: kto ma dużo, łatwiej zdobywa więcej. Majątek rośnie procentowo, popularne strony zdobywają więcej linków, cytowane prace są częściej cytowane. Małe początkowe różnice, mnożone przez wiele okresów, rozjeżdżają się w ogromne nierówności. To ten sam mechanizm, który stoi za prawem Zipfa.

Gdy zjawisko jest sumą wielu niezależnych, ograniczonych wpływów (wzrost, masa ciała, czas reakcji), rozkład jest bliski normalnego i zasady Pareto nie ma: 20% największych obserwacji daje niewiele więcej niż 20% sumy.

Uwaga na typowe nieporozumienia. Po pierwsze, 80 i 20 nie muszą sumować się do 100 — dotyczą różnych zbiorów (przyczyn i skutków). Po drugie, zasada nie mówi, że pozostałe 80% przyczyn można zignorować: ogon bywa ważny (rzadkie, ale groźne błędy). Po trzecie, rozkłady potęgowe trudno odróżnić od innych skośnych rozkładów na oko; formalne dopasowanie wymaga ostrożności.

Na przykładzie

Ceny biletów na Titanicu (891 pasażerów): 20% pasażerów z najdroższymi biletami zapłaciło 63,2% sumy wszystkich opłat. Najdroższe 10% — 45,1%, a zaledwie 9 osób (1%) — 10,9%. Tańsza połowa pasażerów zapłaciła łącznie 13,5%. Silna nierówność, ale „63/20”, nie „80/20”.

Ten sam kształt w modelu: las losowy (500 drzew, random_state=0) na Breast Cancer Wisconsin. Sześć z 30 cech (20%) — m.in. „worst perimeter”, „worst concave points”, „worst radius” — skupia 62,9% ważności (miara oparta na nieczystości), a cała słabsza połowa, 15 cech, tylko 10,2%. Dla kontrastu masa ciała pingwinów Palmer: 20% najcięższych osobników to 25,8% łącznej masy — rozkład bliski normalnego, Pareta brak.

Dane: Titanic Palmer Penguins (pingwiny z Antarktydy) Breast Cancer Wisconsin (diagnostyka raka piersi)

W praktyce

  • Krzywa koncentracji w pandas: s.sort_values(ascending=False).cumsum() / s.sum(); sprawdź, jaki odsetek daje górne 20%.
  • Analiza błędów modelu: pogrupuj błędne predykcje po kategorii, źródle czy segmencie (df[err].groupby('segment').size().sort_values()); zwykle kilka grup daje większość pomyłek.
  • Selekcja cech: kilka cech często niesie większość sygnału, ale ważności z feature_importances_ są obciążone — potwierdź wynik permutation_importance.
  • W danych o ciężkim ogonie (przychody, czas sesji) używaj mediany i logarytmu; średnia jest zdominowana przez nieliczne skrajne wartości.
  • Nie wycinaj „mało ważnego” ogona bez sprawdzenia: rzadkie klasy lub przypadki brzegowe mogą być kluczowe dla jakości.

Najczęstsze pytania

Czy zasada Pareto to zawsze dokładnie 80/20?
Nie. To umowna etykieta silnej nierówności. Rzeczywiste proporcje bywają 70/30, 90/10 czy 63/20, a w danych o rozkładzie zbliżonym do normalnego nierówności praktycznie nie ma.
Skąd się bierze rozkład 80/20?
Najczęściej z procesów, w których przewaga się kumuluje: wzrost procentowy, „bogaci się bogacą”, efekty sieciowe. Takie procesy wytwarzają rozkłady potęgowe o ciężkim ogonie.
Jak wykorzystać zasadę Pareto w uczeniu maszynowym?
W analizie błędów (kilka segmentów daje większość pomyłek), w czyszczeniu danych (kilka źródeł daje większość problemów) i w doborze cech. Za każdym razem warto zmierzyć rzeczywistą koncentrację, zamiast zakładać 80/20.

Źródła

  • Vilfredo Pareto, „Cours d’économie politique”, Lozanna 1896–1897.
  • Joseph M. Juran, „Quality Control Handbook”, McGraw-Hill, 1951.
  • Mark E. J. Newman, „Power laws, Pareto distributions and Zipf’s law”, Contemporary Physics 46(5), 2005, s. 323–351.
  • Aaron Clauset, Cosma R. Shalizi, Mark E. J. Newman, „Power-law distributions in empirical data”, SIAM Review 51(4), 2009, s. 661–703.

Zobacz też