Uvod
Zamislite situaciju u kojoj se čini da je nešto istinito za svaku pojedinu grupu, ali kada te grupe spojite, istina se potpuno preokrene. Zvuči kao magija ili logička zagonetka, zar ne? Upravo takav fascinantan fenomen krije se iza Simpsonovog paradoksa. On nas uči da naša intuicija, kada je riječ o podacima i statistikama, često može biti zavaravajuća, pogotovo kada ne uzimamo u obzir sve relevantne faktore. Simpsonov paradoks nije samo statistička zanimljivost; to je duboko upozorenje o opasnostima prebrzog zaključivanja i podsjetnik na važnost pažljivog razmatranja konteksta i strukture podataka. Njegova pojava može imati dalekosežne posljedice u medicini, ekonomiji, društvenim znanostima, pa čak i u svakodnevnom životu, dovodeći nas do pogrešnih zaključaka i loših odluka.
Što je paradoks?

Simpsonov paradoks je statistički fenomen u kojem se trend koji se promatra u nekoliko različitih skupina podataka preokreće ili nestaje kada se te skupine kombiniraju. Drugim riječima, ako je varijabla A bolja od varijable B unutar svake od podskupina, može se dogoditi da je varijabla B bolja od varijable A kada se sve podskupine spoje u jednu cjelinu. To nije logička proturječnost u smislu da je nešto istovremeno istinito i lažno, već je to statistička iluzija nastala zbog nejednake distribucije takozvane “zbunjujuće varijable” (eng. confounding variable) među podskupinama. Paradoks nas prisiljava da preispitamo kako tumačimo statističke podatke i kako donosimo uzročne zaključke.
Povijest nastanka
Iako je nazvan po Edwardu Simpsonu, slične su pojave primijećene i opisane mnogo prije njegovog rada. Karl Pearson je 1899. godine uočio sličan efekt, a George Udny Yule 1903. godine. Benjamin W. Bronfenbrenner je 1943. godine opisao primjer iz ekonomije. Međutim, Edward H. Simpson je 1951. godine u svom radu “The Interpretation of Interaction in Contingency Tables” formalno definirao i analizirao ovaj fenomen, dajući mu naziv koji se danas koristi. Njegov rad je pomogao u standardizaciji razumijevanja i prepoznavanja ovog statističkog izazova, čineći ga ključnim konceptom u statistici i metodologiji istraživanja.
Tko ga je osmislio?
Paradoks je dobio ime po britanskom statističaru Edwardu H. Simpsonu. Rođen je 1922. godine, a umro 2019. Simpson je bio istaknuti matematičar i statističar koji je radio u različitim područjima, uključujući statistiku u vojsci tijekom Drugog svjetskog rata. Njegov rad iz 1951. godine, u kojem je detaljno opisao fenomen koji danas poznajemo kao Simpsonov paradoks, postao je temelj za razumijevanje kako agregiranje podataka može dovesti do pogrešnih zaključaka. Simpsonov doprinos leži u formalizaciji i jasnom objašnjenju ovog statističkog problema, čineći ga dostupnim za analizu i raspravu unutar šire znanstvene zajednice.
Objašnjenje korak po korak

Uzmimo klasičan primjer iz stvarnog života: studiju o stopama uspješnosti upisa na dodiplomske studije na Sveučilištu Berkeley 1973. godine. Tada se postavilo pitanje diskriminiraju li odjeli muškarce u odnosu na žene.
Korak 1: Agregirani podaci
Na prvi pogled, ukupni podaci pokazivali su da je stopa upisa za muškarce bila viša nego za žene:
**Muškarci:** 8442 prijavljena, 3738 primljenih (stopa upisa: oko 44%)
**Žene:** 4321 prijavljena, 1494 primljene (stopa upisa: oko 35%)
Ovi podaci sugeriraju da su muškarci imali znatno veću vjerojatnost upisa, što je izazvalo sumnju na spolnu diskriminaciju u korist muškaraca.
Korak 2: Podjela na podskupine (po odjelima)
Međutim, kada su statističari odlučili analizirati podatke po pojedinim odjelima, slika se drastično promijenila. Sveučilište je imalo mnogo odjela, a mi ćemo ovdje pojednostaviti i promatrati samo dva hipotetska odjela, Odjel A i Odjel B, koji su ključni za ilustraciju paradoksa.
Odjel A (Visoka stopa upisa, popularan među muškarcima)
**Muškarci:** 800 prijavljenih, 500 primljenih (stopa upisa: 62.5%)
**Žene:** 100 prijavljenih, 80 primljenih (stopa upisa: 80%)
U Odjelu A, žene su imale višu stopu upisa od muškaraca.
Odjel B (Niska stopa upisa, popularan među ženama)
**Muškarci:** 50 prijavljenih, 10 primljenih (stopa upisa: 20%)
**Žene:** 900 prijavljenih, 100 primljenih (stopa upisa: 11.1%)
U Odjelu B, muškarci su imali višu stopu upisa od žena.
Primijetite da u ovom pojednostavljenom primjeru, u Odjelu A žene imaju bolju stopu, a u Odjelu B muškarci imaju bolju stopu. Međutim, u stvarnom Berkeley slučaju, za većinu odjela, žene su imale jednaku ili višu stopu upisa od muškaraca unutar pojedinih odjela.
Korak 3: Spajanje podataka i pojava paradoksa (hipotetski primjer za jasnoću)
Da bismo demonstrirali kako se paradoks očituje, zamislimo malo drugačiji scenarij za Odjel B, gdje je razlika u broju prijava ključna:
Odjel A (Visoka stopa upisa)
**Muškarci:** 100 prijavljenih, 80 primljenih (80% uspješnosti)
**Žene:** 50 prijavljenih, 45 primljenih (90% uspješnosti)
Ovdje, žene imaju bolju stopu upisa.
Odjel B (Niska stopa upisa)
**Muškarci:** 1000 prijavljenih, 100 primljenih (10% uspješnosti)
**Žene:** 1000 prijavljenih, 110 primljenih (11% uspješnosti)
Ovdje, žene također imaju bolju stopu upisa.
Dakle, u oba odjela, žene imaju bolju stopu upisa od muškaraca. Sada ih spojimo:
**Ukupno Muškarci:** 100 + 1000 = 1100 prijavljenih, 80 + 100 = 180 primljenih (stopa upisa: oko 16.4%)
**Ukupno Žene:** 50 + 1000 = 1050 prijavljenih, 45 + 110 = 155 primljenih (stopa upisa: oko 14.8%)
Iznenada, kada se podaci agregiraju, muškarci imaju višu ukupnu stopu upisa! Unatoč tome što su žene imale bolju stopu upisa u svakom pojedinom odjelu.
Objašnjenje fenomena
Zašto se ovo dogodilo? Ključ leži u “zbunjujućoj varijabli” – u ovom slučaju, to je težina odjela ili popularnost odjela. Žene su se u većem broju prijavljivale na odjele koji su imali nižu ukupnu stopu upisa (npr. Odjel B), dok su se muškarci u većem broju prijavljivali na odjele s višom stopom upisa (npr. Odjel A). Zato, iako su žene bile jednako, ili čak uspješnije, unutar svakog pojedinog odjela, njihova ukupna stopa je pala jer su se češće natjecale za mjesta u odjelima gdje je konkurencija bila oštrija. Simpsonov paradoks nas uči da je ključno uzeti u obzir skrivene varijable i strukturu podataka prije donošenja zaključaka.
Zašto je važan?
Simpsonov paradoks ima iznimnu važnost u brojnim područjima:
**Statistika i istraživanje:** Upozorava istraživače na opasnosti agregiranja podataka bez uzimanja u obzir skrivenih varijabli koje mogu utjecati na rezultate. Ključan je za razumijevanje metodologije i valjanosti zaključaka.
**Medicina i farmakologija:** Lijek koji se čini učinkovitijim za podskupine pacijenata (npr. mlađe i starije) može se pokazati manje učinkovitim kada se svi pacijenti promatraju zajedno, ili obrnuto. To je ključno za dizajn kliničkih ispitivanja i interpretaciju rezultata.
**Ekonomija i društvene znanosti:** Može objasniti prividne diskriminacije u plaćama, zapošljavanju ili obrazovanju, kada se ne uzmu u obzir faktori poput industrije, iskustva ili razine obrazovanja.
**Donošenje odluka:** Poduzeća i vlade mogu donijeti pogrešne strateške odluke ako se oslanjaju samo na agregirane podatke bez dublje analize podskupina.
**Kritičko razmišljanje:** Potiče nas da budemo skeptični prema jednostavnim statističkim brojkama i da uvijek tražimo dublji kontekst i potencijalne zbunjujuće varijable.
Najčešće interpretacije

Simpsonov paradoks nije “pravi” paradoks u smislu logičke kontradikcije, već je statistički fenomen koji zahtijeva pažljivo tumačenje. Najčešće interpretacije uključuju:
**Upozorenje na zbunjujuće varijable:** Primarno se tumači kao demonstracija važnosti kontrole za zbunjujuće varijable. Paradoks nastaje kada se važna treća varijabla (npr. težina bolesti, odjel na fakultetu) zanemari u agregiranoj analizi.
**Kauzalna interpretacija:** Filozof i računalni znanstvenik Judea Pearl ističe da Simpsonov paradoks naglašava razliku između statističke korelacije i kauzalnosti. Agregirani podaci mogu pokazivati korelaciju, ali ne nužno i uzročno-posljedičnu vezu. Ispravna interpretacija ovisi o kauzalnom modelu koji stoji iza podataka. Ponekad je ispravno gledati podgrupe, ponekad agregat, ovisno o tome što želimo saznati (npr. ako želimo znati “koji lijek je bolji za mene, s obzirom na moju težinu bolesti?” gledamo podgrupe; ako želimo znati “koji lijek je bolji za ukupnu populaciju?” to je složenije i ovisi o distribuciji bolesti u populaciji).
**Problem izbora razine agregacije:** Paradoks pokazuje da ne postoji uvijek jedna “ispravna” razina agregacije podataka. Ovisno o pitanju koje postavljamo, trebamo odabrati promatranje podskupina ili cjeline, uzimajući u obzir kauzalne veze.
Kritike
Iako je Simpsonov paradoks široko prihvaćen i proučavan, postoje i određene kritike ili
📚 Za više misaonih paradoksa posjetite Filozofija – vaš vodič kroz povijest mišljenja.
