Een krantenkop meldt: ‘Nieuw dieetpil statistisch bewezen effectief.’ Klinkt veelbelovend. Maar dan lees je verder en ontdek je dat deelnemers gemiddeld 0,3 kilogram zijn afgevallen over zes maanden. Dat is minder dan een pak suiker. Toch klopt die kop technisch gezien. Precies daar wringt de schoen: statistisch significant is niet hetzelfde als betekenisvol in de echte wereld. Praktische significantie is het begrip dat dat onderscheid maakt, en het wordt in wetenschappelijke kringen steeds luider bepleit als minstens zo belangrijk als de klassieke p-waarde.
Wat betekent ‘significant’ eigenlijk?
In het dagelijks leven betekent ‘significant’ zoiets als: belangrijk, opvallend, de moeite waard. In statistiek betekent het iets heel anders: de kans dat een gemeten verschil puur door toeval is ontstaan, is klein genoeg om te concluderen dat er waarschijnlijk een echt effect is. Dat klinkt vergelijkbaar, maar het is een fundamenteel andere vraag.
Nieuwsberichten en beleidsadviezen gebruiken die twee betekenissen door elkaar, en dat zorgt voor een hoop misverstanden. Een statistisch significant resultaat kan volkomen onbelangrijk zijn voor jou als patiënt, werknemer of consument.
Wat zegt een p-waarde wél, en wat niet?
De p-waarde, vaak p < 0,05, is de drempel die onderzoekers traditioneel hanteren. Als de p-waarde onder die drempel valt, heet een resultaat ‘significant’. Maar die waarde vertelt je slechts één ding: hoe waarschijnlijk het is dat je dit resultaat zou zien als er in werkelijkheid geen effect bestaat.
Wat de p-waarde níet vertelt: hoe groot het effect is, of het effect voelbaar is, of het iemands leven verbetert, of de studie goed opgezet was. Een p-waarde van 0,001 klinkt indrukwekkend, maar zegt niks over of het gevonden effect ook iets uitmaakt.
Wat is praktische significantie dan precies?
Stel: een farmaceutisch bedrijf test een nieuw bloeddrukverlagend middel. De uitkomst is statistisch significant met p < 0,01. Mooi. Maar het gemiddelde verschil met de controlegroep is 1 mmHg bloeddruk. Dat is de marge die je al krijgt door even diep adem te halen. Klinisch gezien is een daling van minstens 5 tot 10 mmHg nodig om risico op een hartaanval merkbaar te verlagen.
Dat is praktische significantie in een notendop: het gaat om de vraag of een effect groot genoeg is om er iets aan te hebben. Een verschil kan reëel zijn, maar tegelijk zo klein dat het in de praktijk niet uitmaakt.
Hoe meten onderzoekers praktische significantie?
Er zijn een paar maten die onderzoekers hiervoor gebruiken, en ze zijn minder mysterieus dan ze klinken.
- Cohens d: vergelijkt het verschil tussen twee groepen in verhouding tot de spreiding van de scores. Een d van 0,2 geldt als klein, 0,5 als middelgroot, 0,8 als groot. Een medicijn met d = 0,1 werkt misschien statistisch, maar het effect is nauwelijks meetbaar in een individuele patiënt.
- Relatief risico: als een interventie een risico van 2% verlaagt naar 1%, is dat een relatieve risicoreductie van 50%. Klinkt enorm. Maar in absolute termen: je moet 100 mensen behandelen om één geval te voorkomen.
- NNT (number needed to treat): hoeveel mensen moeten een behandeling ondergaan om bij één persoon een positief effect te bereiken? Een NNT van 5 is uitstekend. Een NNT van 500 betekent dat 499 mensen de behandeling (met mogelijke bijwerkingen en kosten) ondergaan zonder baat.
In de economie werkt het vergelijkbaar. Een beleidswijziging die de arbeidsparticipatie ‘significant’ verhoogt met 0,002 procentpunt levert nationaal misschien 80 extra banen op. Dat is statistisch gezien een reëel effect, maar politiek en maatschappelijk is het nauwelijks noemenswaardig voor een land van miljoenen arbeidsplaatsen.
Het probleem met grote steekproeven
Hier wordt het paradoxaal. Hoe meer mensen je onderzoekt, hoe makkelijker je statistische significantie bereikt, ook voor volkomen triviale effecten.
Met een miljoen respondenten kun je aantonen dat mensen die op dinsdag worden geboren gemiddeld 0,4 centimeter kleiner zijn dan mensen die op woensdag worden geboren, met p < 0,001. Dat is statistisch gezien ‘echt’, maar het is zinloos. De p-waarde meet alleen of een effect er waarschijnlijk is, niet of het de moeite waard is om over na te denken. Bij grote datasets verliest die p-waarde daardoor bijna al zijn informatiewaarde.
Drie concrete voorbeelden
Gezondheid: Een veelbesproken dieetinterventie wordt gepresenteerd met p < 0,001. Deelnemers verloren gemiddeld 0,3 kilogram in zes maanden, vergeleken met de controlegroep. Statistisch echt. Maar wie een gewichtsverlies van 5 tot 10 procent nodig heeft om gezondheidsvoordelen te boeken, heeft hier helemaal niets aan.
Economie: Een overheid voert een subsidieregeling in om werklozen sneller aan werk te helpen. De arbeidsparticipatie stijgt statistisch significant. Bij nadere lezing: het gaat om 80 extra banen nationaal, in een arbeidsmarkt van miljoenen. De kosten van de regeling overtreffen de baten per gecreëerde baan vele malen.
Technologie: Een groot platform voert een A/B-test uit op de kleur van een knop. De klikratio verbetert statistisch significant. Het werkelijke verschil is 0,02 procentpunt. Bij tien miljoen gebruikers zijn dat 2.000 extra klikken, wat voor een advertentieplatform toch zinvol kan zijn. Maar voor een kleinere webshop is diezelfde test betekenisloos.
Wanneer is een klein effect tóch relevant?
Nuance is hier op zijn plaats. Er zijn situaties waarbij elk klein effect telt, ook zonder praktische significantie in de klassieke zin.
Bij veiligheidsonderzoek naar zeldzame bijwerkingen van een vaccin of medicijn wil je elk signaal serieus nemen, ook als het effect klein is. Als een stof bij 1 op de 100.000 gebruikers een ernstige reactie veroorzaakt, is dat statistisch ‘klein’, maar voor beleid rondom grote populaties is het cruciaal. De context en de inzet bepalen dus altijd mee wat ‘praktisch relevant’ betekent.
Hoe herken je als lezer of een studie ook echt iets betekent?
Je hoeft geen statisticus te zijn om de juiste vragen te stellen. Stel jezelf bij elk wetenschappelijk bericht de volgende vijf vragen:
- Is de effectgrootte vermeld, niet alleen de p-waarde?
- Wordt het effect vergeleken met een controlegroep, of alleen intern gemeten?
- Worden klinische of maatschappelijke drempelwaarden benoemd? Wat geldt in de praktijk als een betekenisvol verschil?
- Wie financierde het onderzoek? Een partij die belang heeft bij een positief resultaat heeft een prikkel om grote steekproeven te gebruiken en op p-waarden te sturen.
- Is de studie gepreregistreerd? Dan staat het opzet vast vóór de data worden verzameld, wat cherry-picking van significante resultaten tegengaat.
Wat verandert er in de wetenschap?
De discussie over praktische significantie is niet nieuw, maar ze wint duidelijk aan kracht. Tijdschriften als Nature en toonaangevende medische journals vragen steeds vaker om effectgrootten naast p-waarden als voorwaarde voor publicatie. De American Statistical Association heeft herhaaldelijk en nadrukkelijk gewaarschuwd tegen het blindelings vertrouwen op p < 0,05 als enige maatstaf voor een goed onderzoeksresultaat.
Sommige journals experimenteren met het helemaal weglaten van p-waarden en vragen onderzoekers in plaats daarvan om betrouwbaarheidsintervallen en effectgrootten centraal te stellen. Het is een verschuiving die traag gaat, want gewoontes in de wetenschap veranderen niet van de ene op de andere dag. Maar de richting is duidelijk.
Wat onthoud je hiervan morgen?
Gebruik bij elk onderzoeksresultaat dat je tegenkomt een simpele beslisboom. Is het resultaat statistisch significant? Goed, dat is een begin. Maar vraag dan meteen: hoe groot is het effect? Vergelijk dat vervolgens met de drempelwaarde die er in de praktijk toe doet. Bij bloeddruk is dat minimaal 5 mmHg. Bij gewichtsverlies eerder 5 kilogram dan 0,3. Bij arbeidsmarktbeleid eerder duizenden banen dan tientallen. Trek pas daarna een conclusie over of het resultaat iets verandert in de echte wereld.
Statistisch significant is het begin van een gesprek, niet het einde.
Praktische significantie is geen technisch detail voor statistici. Het is de vraag die elke lezer, beleidsmaker en patiënt zou moeten stellen: verandert dit resultaat ook echt iets? Een p-waarde onder 0,05 is een signaal dat een effect waarschijnlijk niet op toeval berust, meer niet. Of dat effect groot genoeg is om te tellen in je leven, je behandeling of je beleid, dat vergt een tweede stap. Die stap is minstens even belangrijk als de eerste, en je kunt er maar beter aan wennen hem altijd te zetten.