Ga naar de inhoud
Home/Blog/Data analyseren/Nulhypothese opstellen: H0 en H1 in marktonderzoek
Data analyseren

Nulhypothese opstellen: H0 en H1 in marktonderzoek

Een nulhypothese (H0) is de uitspraak dat er geen effect, verschil of samenhang is in je data: de nieuwe verpakking verkoopt niet beter, de twee doelgroepen verschillen niet, de campagne verandert niets. De alternatieve hypothese (H1) stelt het omgekeerde: er is wel een effect. In marktonderzoek stel je een nulhypothese op door je onderzoeksvraag te vertalen naar twee meetbare, elkaar uitsluitende uitspraken, waarna een statistische toets bepaalt of de data genoeg bewijs leveren om H0 te verwerpen. Je bewijst een nulhypothese nooit, je verwerpt haar of je houdt haar aan.

Bijna elk kwantitatief marktonderzoek draait in de kern om een vraag met een ja of nee: werkt de nieuwe prijs, verschilt deze doelgroep echt van die andere, zit er samenhang tussen twee kenmerken. Om zo’n vraag netjes met cijfers te beantwoorden, vertaal je ze eerst naar een hypothese. De nulhypothese is daarbij het ankerpunt. Wie dat anker verkeerd legt, krijgt een toets die technisch klopt maar de verkeerde vraag beantwoordt. Dit artikel laat zien wat een nulhypothese precies is, hoe je ze samen met de alternatieve hypothese opstelt, en welke fouten je als onderzoeker moet vermijden.

Wat is een nulhypothese?

Een nulhypothese is de uitspraak die stelt dat er niets aan de hand is. Geen verschil tussen groepen, geen effect van een ingreep, geen verband tussen twee variabelen. Het is bewust de saaie, behoudende uitspraak: de status quo. Je gaat ervan uit dat deze klopt, tenzij de data je dwingen om haar los te laten.

Dat lijkt tegendraads, want meestal hoop je juist dat er wel een effect is. Toch is het de logische basis van statistisch toetsen. Je kunt met data namelijk niet hard bewijzen dat iets waar is, maar wel laten zien dat iets zeer onwaarschijnlijk is. De nulhypothese is die onwaarschijnlijke kandidaat. Als je meet dat de nieuwe productpagina 5,2 procent conversie haalt tegen 4,0 procent voor de oude, en dat verschil is onder de aanname dat er geen verschil bestaat bijzonder onwaarschijnlijk, dan verwerp je die aanname. Het effect dat overblijft, ondersteunt je alternatieve hypothese.

De denkwijze gaat terug op twee stromingen uit de vroege twintigste eeuw. Ronald Fisher introduceerde in 1925 de nulhypothese en de p-waarde als maat voor hoe goed de data erbij passen. Jerzy Neyman en Egon Pearson voegden in 1933 de alternatieve hypothese toe, samen met het idee van beslissingsfouten en een vooraf gekozen beslisregel. De aanpak die onderzoekers vandaag gebruiken, is een praktische combinatie van beide. Wil je dieper in op de beslisregel zelf, dan legt ons artikel over statistische significantie en de p-waarde uit hoe je de uitkomst van een toets leest.

Nulhypothese versus alternatieve hypothese

De nulhypothese en de alternatieve hypothese horen altijd als paar bij elkaar. Samen dekken ze alle mogelijke uitkomsten af en ze sluiten elkaar uit: precies een van de twee is waar. De alternatieve hypothese is doorgaans de uitspraak die je als onderzoeker interessant vindt, bijvoorbeeld dat een campagne wel degelijk werkt. De onderstaande tabel zet de twee naast elkaar.

Aspect Nulhypothese (H0) Alternatieve hypothese (H1)
Wat ze stelt Geen effect, geen verschil, geen samenhang Wel een effect, verschil of samenhang
Rol in de toets Uitgangspunt dat je probeert te verwerpen Conclusie als je H0 verwerpt
Wat je ermee kan Verwerpen of aanhouden Ondersteunen, nooit hard bewijzen
Voorbeeld gemiddelden Gemiddelde tevredenheid groep A is gelijk aan groep B Gemiddelde tevredenheid groep A is niet gelijk aan groep B
Typische formulering is gelijk aan, verschilt niet verschilt, is groter dan, is kleiner dan

Let op de derde regel. Houd je H0 aan, dan heb je niet bewezen dat er geen effect is. Je hebt alleen onvoldoende bewijs gevonden voor een effect. Afwezigheid van bewijs is geen bewijs van afwezigheid. Dat onderscheid klinkt pietluttig, maar het voorkomt de klassieke blunder waarbij een rapport concludeert dat er geen verschil is terwijl de steekproef simpelweg te klein was om een echt verschil op te pikken.

Hoe stel je een hypothese op?

Een goede hypothese begint niet bij de statistiek maar bij je onderzoeksvraag en het businessprobleem erachter. Van daaruit werk je in vier stappen naar twee toetsbare uitspraken.

Stap 1: begin bij een scherpe onderzoeksvraag

Een vraag als of de nieuwe verpakking het goed doet, is te vaag om te toetsen. Scherp ze aan tot iets meetbaars: verkoopt product X met de nieuwe verpakking meer dan met de oude in dezelfde periode. Pas als de vraag concreet is, kan ze een hypothese worden.

Stap 2: benoem de variabelen

Elke hypothese verbindt twee of meer variabelen: een die je verandert of vergelijkt (verpakking oud of nieuw) en een die je meet (aantal verkochte stuks). Maak expliciet hoe je elke variabele meet. Dat heet operationaliseren, en het meetniveau dat je zo vastlegt bepaalt welke toets straks past.

Stap 3: kies de richting

Verwacht je enkel een verschil, of verwacht je een specifieke kant op? Dat de nieuwe verpakking anders verkoopt, is een tweezijdige verwachting. Dat ze meer verkoopt, is eenzijdig. Die keuze maak je vooraf, op grond van theorie of eerder onderzoek, nooit achteraf op basis van wat je toevallig ziet.

Stap 4: schrijf H0 en H1 uit

Formuleer nu de nulhypothese als de uitspraak zonder effect, en de alternatieve hypothese als het spiegelbeeld. Houd ze kort en ondubbelzinnig. Een hypothese die je op twee manieren kan lezen, levert later een conclusie op die niemand vertrouwt. Een correct opgestelde hypothese ligt vast voordat je ook maar een rij data bekijkt.

Eenzijdig of tweezijdig toetsen?

De richting uit stap 3 bepaalt of je eenzijdig of tweezijdig toetst. Dat is geen detail: het verandert hoe makkelijk je een effect significant krijgt. Bij een tweezijdige toets verdeel je je foutmarge over beide kanten, bij een eenzijdige toets zet je ze volledig op een kant. Daardoor pikt een eenzijdige toets een effect in de verwachte richting sneller op, maar hij ziet een effect in de andere richting helemaal niet.

Kenmerk Tweezijdig toetsen Eenzijdig toetsen
Vraag Is er een verschil, in welke richting dan ook? Is het groter (of kleiner) dan?
Alternatieve hypothese A is niet gelijk aan B A is groter dan B
Foutmarge Verdeeld over twee staarten Volledig in een staart
Gevoeligheid Lager voor een effect in een richting Hoger, maar blind voor de andere richting
Wanneer kiezen Standaardkeuze, geen sterke voorverwachting Alleen bij een stevig onderbouwde richting vooraf

In de praktijk is tweezijdig de veilige standaard. Kies alleen eenzijdig als je echt op voorhand kan beargumenteren dat een effect in de andere richting onmogelijk of irrelevant is. Je geeft die keuze bij elke toets apart op: bij een t-toets tussen twee gemiddelden scheelt ze letterlijk de helft van je foutmarge. Achteraf naar eenzijdig overschakelen omdat je p-waarde net niet onder de 0,05 kwam, is een vorm van resultaten masseren die je conclusie waardeloos maakt.

Type I-fout en Type II-fout

Een toets is een beslissing onder onzekerheid, en dus kan je je vergissen. Er zijn precies twee manieren waarop dat gebeurt. Bij een Type I-fout verwerp je de nulhypothese terwijl ze eigenlijk waar is: een vals alarm, je ziet een effect dat er niet is. De kans hierop heet alfa en die kies je zelf, meestal op 5 procent. Alfa is precies je significantieniveau. Bij een Type II-fout verwerp je een onware nulhypothese niet: je mist een echt effect. De kans hierop heet beta. Het spiegelbeeld van beta, dus de kans dat je een echt effect wel oppikt, heet het onderscheidingsvermogen of de power van je onderzoek.

  H0 is in werkelijkheid waar H0 is in werkelijkheid onwaar
Je verwerpt H0 Type I-fout (vals alarm), kans alfa Correcte beslissing (power = 1 min beta)
Je houdt H0 aan Correcte beslissing Type II-fout (gemist effect), kans beta

De twee fouten staan op gespannen voet. Zet je alfa heel streng, bijvoorbeeld op 1 procent, dan daalt je kans op een vals alarm, maar stijgt je kans om een echt effect te missen. De enige manier om beide fouten tegelijk klein te houden, is een grotere steekproef: die verkleint de standaardfout van je schatting en maakt de toets dus gevoeliger. Daarom hoort een poweranalyse vooraf bij elk serieus toetsend onderzoek: je bepaalt dan hoeveel respondenten je nodig hebt om een effect van een bepaalde grootte met voldoende zekerheid te kunnen aantonen. Hoe je dat aantal onderbouwt, lees je in ons artikel over de juiste steekproefgrootte bepalen.

Voorbeeld: een hypothese toetsen in marktonderzoek

Stel, een webshop wil weten of een nieuwe productpagina beter converteert dan de oude. De onderzoeksvraag is helder, dus we vertalen ze naar hypotheses. De nulhypothese: de conversieratio van de nieuwe pagina is gelijk aan die van de oude. De alternatieve hypothese: de conversieratio verschilt. We toetsen tweezijdig, want in principe zou de nieuwe pagina ook slechter kunnen zijn, en we kiezen een significantieniveau van 5 procent.

We leiden het verkeer willekeurig naar een van beide pagina’s, precies zoals in een zuivere A/B-test, en meten per groep 3.000 bezoekers. De oude pagina haalt 120 aankopen, de nieuwe 156. In percentages: 4,0 procent tegen 5,2 procent. Dat ziet er beter uit, maar de vraag is of dit verschil echt is of toeval. Een toets op het verschil tussen twee percentages geeft een p-waarde van ongeveer 0,027. Die ligt onder 0,05, dus we verwerpen de nulhypothese. De conclusie: er is een statistisch significant verschil, de nieuwe pagina converteert beter.

Onderdeel Oude pagina Nieuwe pagina
Bezoekers 3.000 3.000
Aankopen 120 156
Conversie 4,0 procent 5,2 procent
Nulhypothese Conversie oud is gelijk aan conversie nieuw
Uitkomst toets p is ongeveer 0,027, dus kleiner dan 0,05: H0 verworpen

Let op hoe gevoelig die uitkomst is voor de omvang van je test. Had je dezelfde percentages gemeten bij 2.000 bezoekers per groep, dan was de p-waarde op 0,07 uitgekomen en had je H0 moeten aanhouden, met precies hetzelfde verschil in de cijfers. Het aantal respondenten beslist dus mee over je conclusie, en dat is geen detail maar de kern van een poweranalyse.

Twee nuances maken het verhaal compleet. Ten eerste zegt significantie niets over de omvang van het effect: 1,2 procentpunt meer conversie kan voor de ene webshop goud waard zijn en voor de andere verwaarloosbaar. Dat beoordeel je met de effectgrootte en met een betrouwbaarheidsinterval rond het verschil, niet met de p-waarde alleen. Ten tweede toont deze opzet een verschil, geen verklaring waarom. Voor dat waarom combineer je de cijfers idealiter met kwalitatief inzicht, zoals ons artikel over kwalitatief en kwantitatief onderzoek uitlegt.

Vijf valkuilen bij het opstellen en toetsen van hypotheses

Statistiekpakketten en AI-assistenten kunnen vandaag in enkele seconden een hypothese voorstellen en er een toets op loslaten. Dat is handig, maar het verlaagt ook de drempel om verkeerd onderzoek te produceren: de software toetst gewillig ook een hypothese die je achteraf bedacht hebt, en rekent elk verschil braaf door tot een p-waarde. Juist omdat het zo makkelijk is geworden, wordt de rol van de onderzoeker belangrijker, niet kleiner. Wie weet waar het misgaat, haalt betrouwbare conclusies uit dezelfde data. Dit zijn de vijf fouten die we in de praktijk het vaakst zien.

De hypothese achteraf verzinnenJe draait je onderzoek, ziet een opvallend verband en formuleert daar pas een hypothese omheen. Dat heet HARKing en het is een cirkelredenering: je gebruikt dezelfde data om een hypothese te verzinnen en om haar te bevestigen.Zo vermijd je het: leg H0 en H1 schriftelijk vast voor je de eerste kruistabel opent.
De nulhypothese willen bewijzenEen niet significante uitkomst betekent niet dat de nulhypothese waar is. Het betekent dat je te weinig bewijs hebt om haar te verwerpen, vaak omdat de steekproef te klein was.Zo herken je het: er staat dat er geen verschil is, waar er had moeten staan dat er geen verschil is gevonden.
Significant verwarren met belangrijkBij een grote steekproef wordt zelfs een nietig verschil significant. Significantie zegt dat een effect waarschijnlijk echt is, niet dat het groot of relevant is.Zo vermijd je het: rapporteer naast de p-waarde altijd de effectgrootte en vertaal die naar klanten of omzet.
Veel toetsen tegelijk zonder correctieToets je twintig verbanden tegelijk op 5 procent, dan is de kans ongeveer 64 procent dat er minstens één toets puur door toeval significant lijkt. Hoe meer je toetst, hoe meer valse alarmen.Zo vermijd je het: corrigeer voor het aantal toetsen, of behandel een losse vondst als hypothese voor vervolgonderzoek.
Te klein meten en het effect missenZonder poweranalyse vooraf weet je niet of je steekproef groot genoeg is om een effect dat er echt is ook te zien. Een te kleine studie die niets vindt, is vaak gewoon blind geweest.Zo herken je het: de conclusie luidt dat er geen effect is aangetoond, en nergens staat welk effect de studie had kunnen oppikken.

Die laatste valkuil raakt direct aan de kwaliteit van je steekproef: een te kleine of scheve groep respondenten kost je niet alleen precisie maar ook geldigheid, en daar helpt wegen en raken maar tot op zekere hoogte bij.

De vijf valkuilen hebben een gemeenschappelijke noemer: ze gaan niet over rekenen maar over oordelen. Een toets kiezen die past bij je data, de aannames erachter bewaken en een uitkomst vertalen naar een beslissing die hout snijdt, dat is vakwerk. Een overzicht van welke toets bij welke vraag past, vind je in onze gids over de meest gebruikte statistische technieken in marktonderzoek, en de logica achter oorzaak en gevolg staat in ons artikel over correlatie en causaliteit. Werk je met categorische kenmerken, dan is de chi-kwadraattoets vaak de juiste keuze; vergelijk je gemiddelden over meer dan twee groepen, dan kom je bij de variantieanalyse uit.

Van hypothese naar onderbouwde beslissing

Een hypothese opstellen lijkt een formaliteit, maar het is het moment waarop je onderzoek richting krijgt. Een scherpe nulhypothese, een bijpassende alternatieve hypothese en een bewuste keuze tussen eenzijdig en tweezijdig bepalen of je toets de juiste vraag beantwoordt. De statistiek erna is dan nog maar uitvoering. Goede hypotheses vertalen een bedrijfsvraag naar iets dat je met data kan toetsen, en een goede onderzoeker bewaakt dat de conclusie ook echt volgt uit de cijfers.

Bij BABLR zetten we die stap elke dag: van businessvraag naar toetsbare hypothese, naar de juiste methode en een conclusie waar je beslissingen op kan bouwen. Benieuwd wat dat voor jouw vraag betekent? Bekijk onze soorten marktonderzoek of lees eerst hoe marktonderzoek in zijn geheel werkt. Of je nu klanttevredenheid wil meten, je consumenten beter wil begrijpen of een B2B-markt wil doorgronden, een goed opgestelde hypothese is telkens het startpunt. Ook een marktanalyse en heldere datavisualisatie helpen om je bevindingen overtuigend te presenteren.

Veelgestelde vragen

Veelgestelde vragen over de nulhypothese

Een nulhypothese (H0) is de standaarduitspraak dat er geen effect, verschil of samenhang is in je data. In marktonderzoek is dat bijvoorbeeld: de nieuwe verpakking verkoopt niet beter, of de twee doelgroepen verschillen niet in tevredenheid. Je toetst de nulhypothese om te zien of de data genoeg bewijs leveren om haar te verwerpen.

De nulhypothese (H0) stelt dat er geen effect is. De alternatieve hypothese (H1) stelt dat er wel een effect is en is meestal wat je eigenlijk wil aantonen. De twee sluiten elkaar uit: precies een van de twee is waar. Een toets kan alleen de nulhypothese verwerpen, nooit de alternatieve hypothese bewijzen.

Vertaal je onderzoeksvraag naar twee meetbare variabelen, bepaal de richting van het verwachte effect en schrijf dan de uitspraak zonder effect op als H0. Voorbeeld: H0 zegt dat de gemiddelde tevredenheid van klantgroep A en klantgroep B gelijk is, H1 zegt dat ze verschillen. Zorg dat de hypothese toetsbaar is en vooraf vastligt, dus voor je de data bekijkt.

Een Type I-fout is een vals alarm: je verwerpt de nulhypothese terwijl ze eigenlijk waar is, je ziet dus een effect dat er niet is. De kans erop heet alfa en is gelijk aan je significantieniveau, meestal 5 procent. Een Type II-fout is een gemiste kans: je verwerpt een onware nulhypothese niet en mist een echt effect. De kans erop heet beta.

Je verwerpt de nulhypothese als de p-waarde van je toets kleiner is dan het vooraf gekozen significantieniveau, meestal 0,05. De data zijn dan zo onwaarschijnlijk onder de nulhypothese dat je ze verwerpt ten gunste van de alternatieve hypothese. Is de p-waarde groter, dan houd je de nulhypothese aan: dat betekent te weinig bewijs, niet dat ze bewezen is.

Dat hangt af van hoe klein het effect is dat je wil kunnen aantonen, van het gekozen significantieniveau en van het gewenste onderscheidingsvermogen, vaak 80 procent. Kleine effecten vragen grotere steekproeven. Een poweranalyse vooraf berekent het benodigde aantal, zodat je niet te klein meet en een echt effect mist, of nodeloos groot en duur meet.

Davy Tollenaere CEO en lead researcher

Davy Tollenaere is CEO en lead researcher bij BABLR. Hij begeleidt marktonderzoekstrajecten van de eerste onderzoeksvraag tot het strategisch advies, en werkt zowel kwantitatief als kwalitatief voor bedrijven, overheden en organisaties in België.

Vragen over de methodologie van je onderzoek? Stel ze ons