A/B
Data en onderzoek 2 oktober 2026

A/B-testen en
experimentatie
statistieken 2026

Hoeveel A/B-tests leveren echt iets op, hoeveel bezoekers heb je nodig en hoe vaak testen de grootste bedrijven? 47 cijfers uit Harvard Business Review, Microsoft, Booking.com, LinkedIn, Uber, wetenschappelijk onderzoek en testsoftware.

±10%

van de experimenten bij Booking.com levert een positief resultaat op

Bron: Harvard Business Review, 2020

25.000

tests per jaar voert Booking.com uit, volgens Harvard Business Review

Bron: Harvard Business Review, 2020

26,1%

kans op een vals-positieve uitslag als je stopt zodra een test significant lijkt

Bron: Evan Miller, 2010

Een A/B-test laat twee versies van een pagina, advertentie of e-mail tegelijk aan vergelijkbare bezoekers zien en meet welke beter presteert. Experimentatie is het bredere vak: ideeën als hypothese behandelen en pas uitrollen als de data het bevestigen. Grote techbedrijven doen dit op enorme schaal, maar de meeste ideeën blijken bij testen geen verbetering op te leveren.

Op deze pagina staan 47 cijfers over A/B-testen en experimentatie. Elk cijfer komt uit een bron die we zelf hebben geopend en heeft een klikbare bronvermelding. Veel cijfers komen uit de VS of van wereldwijde platforms; dat staat er steeds bij, net als cijfers van softwareleveranciers. Wil je zelf een testprogramma opzetten, kijk dan bij ons growth marketing bureau.

10%

Hoeveel A/B-tests winnen er?

De belangrijkste les uit twintig jaar online experimenten: de meeste ideeën werken niet. Dat geldt ook voor bedrijven met de beste data en de meeste ervaring. Hieronder de slagingspercentages die bedrijven en onderzoekers zelf publiceerden.

Aandeel experimenten met een positief resultaat

OrganisatiePositiefRegioBron
Google en Bing10% tot 20%VSHarvard Business Review, 2017
Microsoft (alle producten)ongeveer een derdeVSHarvard Business Review, 2017
Booking.comongeveer 10%wereldwijd platformHarvard Business Review, 2020
Klanten van Optimizely (127.000 experimenten)12% significant beterwereldwijd, leverancierOptimizely (leverancier), 2026

De bedrijven meten niet allemaal hetzelfde: "positief" kan betekenen dat de primaire metric significant verbeterde, of dat het idee volgens het team effect had.

bijna 10:1

Op elk geslaagd experiment mislukken er volgens Harvard Business Review bijna 10 (wereldwijd).

Bron: Harvard Business Review, 2020

33,4%

Uit een analyse van 21.220 experimenten bij Bing bleek dat de code van 33,4% van de experimenten uiteindelijk naar alle gebruikers werd uitgerold (VS).

Bron: Kevic e.a., ICSE, 2017

0,08%

Volgens leveranciersdata van Analytics-Toolkit (1.001 tests) was de mediane lift over alle A/B-tests slechts 0,08% en de gemiddelde lift 2,08%.

Bron: Analytics-Toolkit (leverancier), 2022

4,89%

In een meta-analyse van 115 gepubliceerde A/B-tests (GoodUI) was de mediane gemeten lift 4,89%.

Bron: Analytics-Toolkit (leverancier), 2018

Wat betekent dit voor jouw bedrijf? Reken niet op een winnaar per test. Wie tien tests draait en er één wint, doet het volgens deze cijfers normaal. De waarde zit in het volume en in wat je leert van de tests die niet winnen.

$100M

Bekende voorbeelden van A/B-tests

Een paar tests zijn beroemd geworden omdat een kleine wijziging veel geld opleverde, of juist kostte. Bij elk voorbeeld staat de bron waarin het bedrijf of een betrokkene het zelf beschreef.

+12%

Een kleine aanpassing aan de advertentiekoppen in Bing verhoogde de omzet in een A/B-test met 12%, op jaarbasis ruim $100 miljoen in alleen de VS, het beste omzetidee in de geschiedenis van Bing.

Bron: Harvard Business Review, 2017

10% tot 25%

Tientallen kleine, via experimenten geteste wijzigingen per maand verhoogden de omzet per zoekopdracht bij Bing met 10% tot 25% per jaar (VS).

Bron: Harvard Business Review, 2017

$10 mln+

Nauwelijks zichtbaar donkerdere linkkleuren in de zoekresultaten van Bing, getest bij 32 miljoen gebruikers, zouden de omzet met meer dan $10 miljoen per jaar verhogen (VS).

Bron: Harvard Business Review, 2017

1% = $10 mln

Bij Bing staat een omzetverbetering van 1% gelijk aan $10 miljoen per jaar in de VS, terwijl veel ideeën de kernmetrics met ongeveer 1% bewegen, aldus Kohavi e.a.

Bron: Kohavi e.a., KDD, 2013

-70%

Toen Amazon het spel Air Patriots per ongeluk ongeveer 10% moeilijker maakte, daalde de retentie na zeven dagen met 70% en de omzet met 30% (VS).

Bron: Harvard Business Review, 2020

+20%

Na een test met vier moeilijkheidsniveaus lanceerde Amazon de makkelijkste variant, waarna gebruikers 20% langer speelden en de omzet met 20% steeg (VS).

Bron: Harvard Business Review, 2020

+40,6%

In de verkiezingscampagne van Obama in 2008 verhoogde de winnende variant van de aanmeldpagina het aanmeldpercentage van 8,26% naar 11,6%, een stijging van 40,6% (VS).

Bron: Dan Siroker, Optimizely-blog, 2010

$60 mln

Volgens Dan Siroker leverden de 2.880.000 extra e-mailadressen uit die test de Obama-campagne naar schatting $60 miljoen extra donaties op (VS).

Bron: Dan Siroker, Optimizely-blog, 2010

+18,6%

In dezelfde Obama-test leverde de knoptekst 'Learn More' 18,6% meer aanmeldingen per bezoeker op dan de standaardtekst 'Sign Up' (VS).

Bron: Wired, 2012

-30,3%

Een video van Obama, waarvan het team vooraf dacht dat die zou winnen, presteerde 30,3% slechter dan zelfs de oorspronkelijke afbeelding (VS).

Bron: Wired, 2012

$75 mln

Volgens Wired kwamen naar schatting 4 miljoen van de 13 miljoen e-mailadressen en zo'n $75 miljoen aan opgehaald geld van de Obama-campagne voort uit A/B-tests (VS).

Bron: Wired, 2012

$200 mln

Het testen van een andere tint blauw voor advertentielinks in Gmail en Google Search leverde Google volgens een Google-directeur $200 miljoen extra omzet per jaar op (wereldwijd).

Bron: The Guardian, 2014

41 tinten

Oud-ontwerper Douglas Bowman schreef in 2009 bij zijn vertrek dat een Google-team 41 tinten blauw testte om te zien welke het best presteerde (VS).

Bron: Douglas Bowman, Stopdesign, 2009

Het Obama-voorbeeld laat zien waarom testen werkt: het team verwachtte dat de video zou winnen, maar die presteerde juist slechter. De bedragen bij Google en Obama zijn schattingen van betrokkenen, geen gecontroleerde jaarcijfers.

25.000

Testsnelheid: hoeveel experimenten draaien bedrijven?

Testsnelheid (test velocity) is het aantal experimenten dat een organisatie per periode afrondt. Bij de grootste platforms lopen honderden tot duizenden tests tegelijk. Voor een gemiddelde Nederlandse website is dat onhaalbaar, maar de cijfers laten zien hoe ver de top is.

duizenden

Het experimentatieplatform van Microsoft draait inmiddels elke maand duizenden online A/B-tests over de meeste grote Microsoft-producten.

Bron: Microsoft Research, 2024

honderden

Vier grote Microsoft-producten draaien elk honderden A/B-tests per dag op miljoenen gebruikers.

Bron: Microsoft Research, 2023

41.000

LinkedIn werkt op een schaal van tot 35 biljoen variant-toewijzingen en 41.000 A/B-tests.

Bron: LinkedIn Engineering, 2020

25.000

Booking.com, opgericht in Nederland, voert volgens Harvard Business Review zo'n 25.000 tests per jaar uit.

Bron: Harvard Business Review, 2020

1.000+

Op het experimentatieplatform van Uber lopen op elk moment gemiddeld meer dan 1.000 experimenten tegelijk.

Bron: Uber Engineering, 2018

honderden

Bij grote platforms worden honderdduizenden gebruikers tegelijk over honderden experimenten verdeeld, zodat één gebruiker in honderden experimenten tegelijk kan zitten.

Bron: Larsen e.a., arXiv, 2023

1 op 50.000

Microsoft vond bij gelijktijdig lopende A/B-tests nauwelijks onderlinge beïnvloeding: in één product 0,002% afwijkende uitkomsten, oftewel 1 op 50.000 testparen.

Bron: Microsoft Research, 2023

Een vaak gehoorde zorg is dat tests die tegelijk lopen elkaar verstoren. Microsoft vond dat in de praktijk nauwelijks: 1 op 50.000 testparen. Meerdere tests tegelijk op verschillende delen van een site is dus meestal geen probleem.

N

Steekproefgrootte en statistiek

Statistische power is de kans dat een test een echt effect ook daadwerkelijk vindt. Hoe kleiner het effect dat je wilt aantonen, hoe meer bezoekers je nodig hebt. Hier lopen de meeste websites tegenaan.

147.456

Een webshop die een omzetverandering van 5% wil aantonen (80% power, 5% significantie) heeft in een rekenvoorbeeld 147.456 gebruikers per variant nodig.

Bron: Larsen e.a., arXiv, 2023

60.342

Volgens dezelfde leveranciersdata is de mediane steekproef van een A/B-test met een gebruikersmetric 60.342 gebruikers (gemiddeld 217.066).

Bron: Analytics-Toolkit (leverancier), 2022

30 dagen

Volgens leveranciersdata van Analytics-Toolkit (1.001 tests) duurt een A/B-test gemiddeld 35,4 dagen en de mediaan is 30 dagen.

Bron: Analytics-Toolkit (leverancier), 2022

70%

Volgens een analyse van 1.001 A/B-tests van Analytics-Toolkit (leveranciersdata) leek ongeveer 70% van de tests te weinig statistische power te hebben.

Bron: Analytics-Toolkit (leverancier), 2022

+22%

Variantiereductie (CUPED) levert bij Microsoft in simulaties een mediane verkeersvermenigvuldiger van 1,66 op, gelijk aan 22% meer statistische power.

Bron: Microsoft Research, 2022

88%

88% van de tests op het Analytics-Toolkit-platform vergeleek slechts één variant met de controle; 10% had twee varianten.

Bron: Analytics-Toolkit (leverancier), 2022

75%

Bij langlopende experimenten op basis van cookies kan meer dan 75% van de gebruikers verloren gaan door cookie-verloop, waardoor de test ongeldig wordt.

Bron: Larsen e.a., arXiv, 2023

3,5x

Volgens Optimizely leveren experimenten met vier varianten 3,5 keer de verwachte impact van een gewone A/B-test met twee versies (wereldwijd, leveranciersdata).

Bron: Optimizely (leverancier), 2026

Heeft je website minder dan enkele tienduizenden bezoekers per variant per maand, dan kun je alleen grote verschillen betrouwbaar meten. Test dan grotere wijzigingen, zoals een andere aanbieding of een nieuwe paginaopbouw, in plaats van een knopkleur. Een conversie-optimalisatie bureau rekent vooraf uit of een test haalbaar is.

P

Valkuilen: peeken, p-hacking en schijneffecten

Peeken betekent tussentijds naar de uitslag kijken en stoppen zodra die er goed uitziet. P-hacking is het breder sturen van een analyse tot er een significante uitkomst uit komt. Beide leveren winnaars op die in werkelijkheid geen effect hebben.

26,1%

Wie een A/B-test stopt zodra die significant lijkt (peeken), krijgt in een rekenvoorbeeld van Evan Miller in 26,1% van de gevallen een vals-positieve uitslag, ruim vijf keer de beoogde 5%.

Bron: Evan Miller, 2010

73%

In een analyse van 2.101 commerciële experimenten (Wharton) stopte ongeveer 73% van de experimenteerders de test precies op het moment dat een positief effect 90% betrouwbaarheid bereikte (p-hacking).

Bron: Berman e.a., SSRN, 2018

75%

Volgens hetzelfde onderzoek had ongeveer 75% van de geteste effecten in werkelijkheid geen effect (een echte nulhypothese).

Bron: Berman e.a., SSRN, 2018

33% naar 40%

Voortijdig stoppen verhoogt het aandeel valse ontdekkingen (false discovery rate) van 33% naar 40% bij experimenten die op 90% betrouwbaarheid werden gestopt.

Bron: Berman e.a., SSRN, 2018

1,95%

De onderzoekers schatten de verwachte kosten van één valse ontdekking op een verlies van 1,95% lift.

Bron: Berman e.a., SSRN, 2018

2.000x

Een veelgeciteerde studie claimde 55% meer klikken door afgeronde knoppen; Ron Kohavi en coauteurs herhaalden de test met meer dan 2.000 keer zoveel gebruikers en vonden een effect dat ongeveer honderd keer kleiner en niet significant was.

Bron: Kohavi e.a., arXiv, 2025

4%

Bij Airbnb leek een test met een prijsfilter na 7 dagen significant met een effect van 4%, maar bij langer doortesten bleek het resultaat neutraal (wereldwijd).

Bron: Airbnb Engineering, 2014

De oplossing is niet ingewikkeld: bepaal vooraf hoeveel bezoekers en dagen een test krijgt, en stop niet eerder. Draai een test bij voorkeur minstens een of twee volledige weken, zodat weekenden en doordeweekse dagen allebei meetellen.

CULTUUR

Experimentatiecultuur en tools

Volwassenheid in experimentatie gaat minder over software en meer over werkwijze: wie mag testen, waar worden uitkomsten bewaard en wordt een mislukte test als leermoment gezien. Onafhankelijke cijfers hierover zijn schaars; de beschikbare cijfers komen van softwareleveranciers.

49%

Volgens de Wingify-webinar Benchmark and Scaling Testing in 2024 zegt 49% van de respondenten dat hun bedrijfscultuur experimenteren en leren van mislukkingen onvoldoende steunt.

Bron: VWO (leverancier), 2024

50%

Volgens dezelfde leveranciersdata heeft 50% van de respondenten geen centrale kennisbank of repository voor experimentresultaten.

Bron: VWO (leverancier), 2024

30 sep 2023

Google Optimize en Optimize 360 zijn sinds 30 september 2023 niet meer beschikbaar; experimenten die toen nog liepen, zijn beëindigd.

Bron: Google Analytics Help, 2023

0,4%

Volgens Optimizely levert elk omzetgericht experiment gemiddeld 0,4% extra digitale omzet op wanneer de uitkomsten worden toegepast en verder uitgebouwd (wereldwijd, leveranciersdata).

Bron: Optimizely (leverancier), 2026

Sinds Google Optimize is gestopt, testen veel Nederlandse bedrijven met betaalde tools of niet meer. Een gedeeld overzicht van alle tests en uitkomsten is vaak de eerste stap naar een vaste testroutine. Daarbij helpt een conversie-optimalisatie bureau dat het testplan en de analyse verzorgt.

Belangrijkste conclusies

1

De meeste tests winnen niet

Bij Google, Bing en Booking.com levert ongeveer 10% tot 20% van de experimenten een positief resultaat op. Bij Optimizely-klanten is dat 12%.

2

Kleine wijzigingen, grote bedragen

Een aanpassing van advertentiekoppen leverde Bing 12% meer omzet op, ruim $100 miljoen per jaar in de VS.

3

De top test op enorme schaal

Booking.com voert zo'n 25.000 tests per jaar uit, LinkedIn kwam uit op 41.000 A/B-tests en bij Uber lopen er altijd meer dan 1.000 tegelijk.

4

Je hebt veel bezoekers nodig

Om 5% omzetverschil aan te tonen zijn in een rekenvoorbeeld 147.456 gebruikers per variant nodig. Ongeveer 70% van de tests op één platform had te weinig power.

5

Niet te vroeg stoppen

Stoppen zodra een test significant lijkt, geeft in 26,1% van de gevallen een valse winnaar. In 2.101 experimenten stopte ongeveer 73% van de teams op dat moment.

6

Cultuur is de bottleneck

Volgens leveranciersdata zegt 49% dat de bedrijfscultuur experimenteren onvoldoende steunt en heeft 50% geen centrale plek voor testresultaten.

Methodologie en bronnen

Elk cijfer op deze pagina komt uit een bron die we op 2 oktober 2026 zelf hebben geopend. Per cijfer hebben we de bron-URL, het jaartal en het letterlijke citaat vastgelegd. Artikelen van Harvard Business Review, Uber en Airbnb die achter een betaalmuur zitten of niet meer online staan, hebben we via het Internet Archive geopend en zo gelinkt.

Niet opgenomen, omdat we geen primaire bron konden openen: de veelgedeelde claim dat "maar 1 op de 8 A/B-tests een significant verschil oplevert" (toegeschreven aan VWO en AppSumo), "Microsoft draait meer dan 20.000 experimenten per jaar", "Booking.com draait meer dan 1.000 tests tegelijk" en cijfers uit betaalde rapporten zoals de CRO-rapporten van Econsultancy en CXL. Een Nederlandse meting van hoeveel bedrijven A/B-testen, vonden we niet.

Let op de herkomst. Optimizely, VWO en Analytics-Toolkit verkopen testsoftware en rapporteren over hun eigen klanten; die cijfers zijn als leveranciersdata gelabeld. De meeste bedrijfsvoorbeelden komen uit de VS of van wereldwijde platforms. Gebruikte bronnen:

Veelgestelde vragen

Hoeveel A/B-tests leveren een winnaar op?

Weinig. Volgens Kohavi en Thomke in Harvard Business Review levert bij Google en Bing ongeveer 10% tot 20% van de experimenten een positief resultaat op, bij Booking.com ongeveer 10%. Optimizely ziet bij 127.000 experimenten van klanten dat 12% een significante verbetering oplevert (leveranciersdata).

Hoeveel bezoekers heb je nodig voor een A/B-test?

Dat hangt af van het effect dat je wilt aantonen. In een rekenvoorbeeld van Larsen e.a. zijn 147.456 gebruikers per variant nodig om een omzetverschil van 5% aan te tonen bij 80% power en 5% significantie. De mediane test op het platform van Analytics-Toolkit had 60.342 gebruikers.

Hoe lang moet een A/B-test lopen?

Op het platform van Analytics-Toolkit duurt een test gemiddeld 35,4 dagen en de mediaan is 30 dagen (leveranciersdata). Belangrijker dan een vast aantal dagen: bepaal de looptijd vooraf. Wie stopt zodra de test significant lijkt, krijgt volgens Evan Miller in 26,1% van de gevallen een vals-positieve uitslag.

Hoeveel tests per jaar doen grote bedrijven?

Booking.com voert volgens Harvard Business Review zo'n 25.000 tests per jaar uit. LinkedIn noemt een schaal van 41.000 A/B-tests en Microsoft draait inmiddels elke maand duizenden A/B-tests over de meeste grote producten.

Wat is de bekendste A/B-test?

Twee voorbeelden worden het vaakst genoemd. Bij Bing verhoogde een kleine aanpassing aan advertentiekoppen de omzet met 12%, ruim $100 miljoen per jaar in de VS. In de Obama-campagne van 2008 verhoogde de winnende aanmeldpagina het aanmeldpercentage met 40,6%, volgens Dan Siroker goed voor naar schatting $60 miljoen aan extra donaties.

Wat is p-hacking bij A/B-testen?

P-hacking is een analyse zo sturen dat er een significante uitkomst uitkomt, bijvoorbeeld door te stoppen zodra de test 90% betrouwbaarheid haalt. In een analyse van 2.101 commerciële experimenten deed ongeveer 73% van de experimenteerders dat. Daardoor steeg het aandeel valse ontdekkingen van 33% naar 40%.

Hulp nodig?

Een testprogramma dat echt iets oplevert? Searchlab zet experimenten op voor websites en campagnes: met een hypothese per test, een vooraf berekende looptijd en een overzicht van alles wat je leert, ook van de tests die niet winnen.

Growth marketing bureau →

Gerelateerde statistieken

Meer cijfers over dit onderwerp

Ruud ten Have

Samengesteld door

Ruud ten Have

Ruud is marketeer met meer dan tien jaar ervaring in online marketing. Bij Searchlab zet hij campagnes en websites op als een reeks tests, zodat elke wijziging meetbaar bijdraagt aan meer omzet.