Leestijd
4 min

Game-based assessments, wetenschappelijk onderbouwd of een gimmick?

Game-based assessments zijn geen gimmick, maar ook geen bewezen vervanging van klassieke cognitieve tests. Een meta-analyse over 44 publicaties vond een samenhang van r = 0,30 met traditionele tests, en r = 0,45 na correctie voor meetfout. Dat is een gemiddeld verband. Of een game werkprestatie voorspelt, is voor de meeste producten nog niet onafhankelijk aangetoond.

Dit artikel is voor CHRO's, HR-directeuren en talent acquisition leads die een game-based assessment overwegen of net een demo hebben gezien. Je leest wat het onderzoek zegt, hoe je de effectgroottes leest, waar het bewijs dun wordt en welk bewijs je vraagt voordat je een game inzet in een selectieproces met juridisch en reputatierisico. De kern is simpel. Validiteit hoort bij een specifieke score voor een specifiek selectiebesluit, niet bij een format. Een game die werkt voor één functie, één scoringsmodel en één doelgroep, zegt weinig over het volgende product in een demo.

Wat een game-based assessment is in selectie

Een game-based assessment (GBA) gebruikt spelmechanieken, zoals opdrachten op tijd, keuzes met beperkte middelen, patroontaken of risicobeslissingen, om gedrag uit te lokken dat wordt gescoord op een vooraf vastgelegd construct. In de wetenschappelijke literatuur zie je ook de term game-related assessment (GRA). Serious games assessment gaat over games die voor een ander doel dan vermaak zijn gebouwd.

Het onderscheid dat telt, is dat tussen een game die eruitziet als een game en een game die iets meet. Een visueel aantrekkelijke opdracht met willekeurige scoring heeft geen psychometrische waarde. Een opdracht die is ontworpen om werkgeheugen, abstract redeneren of leersnelheid zichtbaar te maken, met scoring die op bewijs rust, kan die waarde wel hebben.

Klassieke tests, zoals numerieke of verbale redeneertoetsen op tijd, hebben tientallen jaren validatie achter zich. Games hebben een kortere staat van dienst. Dat verschil in bewijs is een redelijke reden voor scepsis. Het format zelf is dat niet.

Wat de belangrijkste studies en meta-analyses laten zien

De meta-analyse in het Journal of Intelligence

De bruikbaarste losse bron is een meta-analyse in het Journal of Intelligence (open access via PMC) naar de relatie tussen game-related assessments en traditionele metingen van cognitieve capaciteit. Die bundelt 44 publicaties en 52 steekproeven, met 807 effectgroottes en ruim 6.100 volwassen deelnemers.

De gemiddelde geobserveerde correlatie tussen games en traditionele cognitieve tests was r = 0,30. Na correctie voor meetfout kwam die uit op r = 0,45.

Wat betekent dat voor werving? Een correlatie van 0,30 tot 0,45 is een gemiddeld verband. Games en klassieke tests overlappen duidelijk, dus games meten niet niks. Uitwisselbaar zijn ze ook niet. Twee cognitieve tests die hetzelfde meten, zouden veel sterker met elkaar samenhangen. Het resultaat past bij games die een deel van algemene cognitieve capaciteit meten, plus andere dingen zoals motivatie, gewenning aan de interface, risicovoorkeur of taakspecifieke vaardigheid.

De recruitmentstudie in Frontiers in Psychology

Een studie in Frontiers in Psychology (via PMC) naar game-based assessments van cognitieve capaciteit in recruitment kijkt naar validiteit, eerlijkheid en testervaring in een echte wervingscontext. Ze vond een test-hertestbetrouwbaarheid van r = 0,68, een convergente validiteit van r = 0,50 met traditionele cognitieve tests en een Net Promoter Score van 58 voor de testervaring. Voor eerlijkheid gebruikt de studie scoring met machine learning, namelijk ridge regressie met een ingebouwde straf op bias.

Dat zijn degelijke cijfers, en de aandacht voor adverse impact is een goed voorbeeld voor het vak. Er zijn wel twee kanttekeningen. De studie onderzoekt één aanpak uit één ecosysteem, dus je kunt de uitkomst niet doortrekken naar de hele categorie. En het belangrijkste validiteitsbewijs is samenhang met cognitieve tests, niet het voorspellen van werkprestatie.

De meta-analyse in het International Journal of Serious Games

Een derde meta-analyse, in het International Journal of Serious Games, gaat expliciet over de convergente validiteit van game-based assessments. Die afbakening is precies het punt. Convergente validiteit gaat over de vraag of een game samenhangt met andere metingen van hetzelfde construct. Of scores voorspellen wie goed presteert in de functie, is een andere vraag.

Waarom je de studies niet zomaar naast elkaar legt

Elke bron beantwoordt een andere vraag. De constructen verschillen (redeneren, geheugen, aandacht, eigenschappen die tegen persoonlijkheid aan liggen). De scoringsmodellen ook. Een transparante puntenscore gedraagt zich anders dan een samengestelde score uit machine learning. Steekproeven verschillen in leeftijd, opleiding, taal en ervaring met games. Een gemiddelde van r = 0,45 is dus een gemiddelde over heel verschillende games, en losse producten scoren erboven en eronder.

Validiteit is een onderbouwing, geen format

De Standards for Educational and Psychological Testing (AERA, APA en NCME, 2014) zien validiteit als één begrip. Er zijn geen losse soorten validiteit die je kunt afvinken. Meerdere bronnen van bewijs onderbouwen samen of een score past bij het beoogde gebruik. Het gaat om deze vijf.

  1. Testinhoud. Past de opdracht bij het construct en bij wat de functie vraagt?
  2. Responsprocessen. Gebruiken kandidaten de cognitieve of gedragsmatige processen die de ontwerper bedoelde?
  3. Interne structuur. Gedragen items en opdrachten zich zoals de theorie over het construct voorspelt?
  4. Relaties met andere variabelen. Convergent bewijs, discriminant bewijs en samenhang met werkcriteria.
  5. Gevolgen van het testen. Waaronder eerlijkheid, adverse impact en kandidaatervaring.

Hetzelfde kader geldt voor een verbale redeneertoets van veertig jaar oud en voor een nieuwe game. Een nieuw format krijgt geen vrijstelling. Dat is ook het standpunt van SIOP in haar richtlijnen voor het valideren van selectieprocedures. Het bewijs moet de specifieke conclusie in de specifieke context onderbouwen.

Betrouwbaarheid, constructvaliditeit en predictieve validiteit vergeleken

Betrouwbaarheid

Betrouwbaarheid is hoe consistent een score is. In selectie zijn instabiele scores een direct risico. Als een kandidaat op een andere dag anders zou scoren om redenen die niets met capaciteit te maken hebben, dan zijn besluiten op basis van die score deels toeval.

De test-hertestcorrelatie van r = 0,68 uit de recruitmentstudie is acceptabel voor een game, maar ligt onder wat je verwacht van volwassen cognitieve tests voor besluiten met hoge inzet. Daar zijn betrouwbaarheden van 0,80 en hoger gebruikelijk. Voor een screeningsfase met menselijke beoordeling erna kan 0,68 verdedigbaar zijn. Voor een zelfstandige afkapgrens is het mager. Vraag leveranciers welke betrouwbaarheid ze rapporteren (test-hertest, interne consistentie, parallelle versies), over welke periode en in welke steekproef.

Construct- en convergente validiteit

Hier is het bewijs het sterkst. De r = 0,30 geobserveerd en 0,45 gecorrigeerd uit de meta-analyse, en de r = 0,50 uit de recruitmentstudie, laten echte overlap met cognitieve capaciteit zien. Praktisch gezegd deelt een game met r = 0,50 ongeveer een kwart van zijn variantie met een klassieke test (r in het kwadraat is 0,25). De rest is iets anders. Dat kan relevant signaal zijn, ruis of een vaardigheid die er voor de functie niet toe doet. Alleen aanvullend bewijs maakt duidelijk welke van de drie.

Predictieve validiteit is een aparte vraag

Veel bezwaren van inkopers komen voort uit het door elkaar halen van twee claims.

  • Convergente validiteit. De game hangt samen met een cognitieve test.
  • Predictieve of criteriumvaliditeit. De scores voorspellen werkprestatie, opleidingssucces of behoud.

Een gemiddelde convergente correlatie bewijst niet dat een game werkprestatie voorspelt. De gepubliceerde literatuur is veel sterker op het eerste dan op het tweede. Criteriumbewijs voor games in echte functies is schaarser en zit vaak in eigen of door de leverancier betaalde studies.

Er is een indirecte redenering. Als een game cognitieve capaciteit meet, en cognitieve capaciteit voorspelt prestatie (zoals decennia onderzoek naar klassieke tests laat zien), dan erft de game een deel van die voorspellende kracht. Maar die redenering verliest bij elke stap aan kracht. Een game die 0,45 samenhangt met het construct, voorspelt minder dan de klassieke test zelf, tenzij hij ook iets extra's meet dat in het werk telt. Behandel de indirecte redenering als een hypothese die je lokaal toetst, niet als conclusie.

Responsprocessen

Bewijs over responsprocessen gaat over de vraag of kandidaten doen wat de ontwerper aanneemt. Een hoge score kan ook komen door snelle reacties, bekendheid met spelconventies of een aangeleerde truc voor de interface, in plaats van door redeneren. Leveranciers kunnen dit onderbouwen met hardop-denkstudies, analyse van procesdata of door te laten zien dat scores overeind blijven na correctie voor game-ervaring en type apparaat.

Waar games beter en slechter scoren dan klassieke tests

Waar games een voorsprong kunnen hebben

  • Betrokkenheid en afronding. Als minder kandidaten afhaken, raakt je kandidatenpool minder vertekend door uitval. De eigen klantdata van Selection Lab wijst die kant op. Het Main Deck 2026 noemt 27 procent minder uitval (maart 2025). Dat is een uitkomst die de leverancier zelf rapporteert, geen onafhankelijke bevinding, en minder uitval hangt af van de hele flow, niet alleen van de game.
  • Kandidaatervaring. De NPS van 58 uit de recruitmentstudie is hoog voor een testervaring. Tests krijgen zelden hoge cijfers. Welke speltypen kandidaten het meest waarderen, lees je in 3 game-based assessments die kandidaten echt leuk vinden.
  • Breedte van wat je meet. Interactieve opdrachten kunnen processen zichtbaar maken, zoals leren van feedback of je aanpassen aan veranderende regels, die een statische meerkeuzevraag mist.
  • Testangst. Aannemelijk, maar nauwelijks onderbouwd. Behandel claims over minder testangst als iets dat nog data nodig heeft.

Waar games tekortschieten

  • Reacties van sollicitanten. Kandidaten reageren niet overal positief op games. Sommige studies vinden minder gunstige oordelen dan bij traditionele formats, en eerdere game-ervaring kleurt die oordelen. Paul Englert stelt in zijn bespreking van zo'n studie de vraag hardop. Meten deze tools cognitieve capaciteit, of meten ze hoe prettig iemand gamen vindt?
  • Risico op oneerlijkheid. Als game-ervaring, leeftijd of apparaat (touchscreen of muis) de score verschuift los van capaciteit, haalt een game construct-irrelevante variantie en adverse impact binnen.
  • Gat in criteriumbewijs. Zonder validatie tegen werkprestatie is een game hooguit een aannemelijke benadering van cognitieve capaciteit.

Een praktische vuistregel

Games zijn het best te verdedigen als drie voorwaarden kloppen. Het gemeten construct past bij wat de functie vraagt. De leverancier laat betrouwbaarheid en convergent bewijs op een acceptabel niveau zien. En er is criteriumvalidatie voor vergelijkbare functies, eerst van de leverancier en daarna lokaal bevestigd. Ontbreekt er één, gebruik de game dan als één input naast andere en niet als poort.

Zo zet Selection Lab het format in. Games zitten in een flow die per functie wordt samengesteld, naast andere assessmenttypen en gestructureerde interviewrondes, en niet als losse noviteit. Eén instrument draagt zelden in zijn eentje een selectiebesluit, en een combinatie van methoden is in de regel beter te verdedigen dan leunen op één meting.

Beperkingen en open vragen

Generaliseerbaarheid. De steekproeven in gepubliceerd onderzoek bestaan vooral uit volwassenen, vaak studenten of de algemene bevolking, en zijn zelden uitgesplitst naar senioriteit, cultuur of beschermde groep. Of de uitkomsten ook voor andere functies gelden, is grotendeels niet onderzocht.

Criteriumbewijs. Convergent bewijs overheerst. Onafhankelijke, peer-reviewed studies die gamescores koppelen aan beoordelingen van leidinggevenden, productiviteit of behoud zijn schaars.

Transparantie van scoring. Scoring met machine learning kan de voorspelling verbeteren en ruimte geven voor eerlijkheidseisen, zoals de straf op bias uit de recruitmentstudie. Het maakt scores ook lastiger uit te leggen. Bij een audit of bezwaar is ‘het model woog het zo’ geen verweer. Leveranciers moeten audit trails leveren, uitleg per kenmerk waar dat kan, en analyses per subgroep.

Operationele verstoringen. Oefeneffecten, verschillen tussen apparaten en coaching kunnen scores verschuiven. Dat vraagt om monitoring na de invoering, niet alleen in de oorspronkelijke validatie. Hoe je fraude en faken herkent, lees je in game-based assessments versus vragenlijsten.

Onafhankelijkheid van bronnen. Een deel van de studies die het meest relevant zijn voor de praktijk, komt uit commerciële ecosystemen. Dat maakt ze niet ongeldig, maar onafhankelijke replicatie en transparante methoden wegen daardoor zwaarder.

Welk bewijs je eist voordat je een game-based assessment inzet

Een demovideo is geen bewijs. Vraag om een validiteitsdossier dat aansluit op de vijf bronnen van bewijs hierboven.

Checklist voor het validiteitsdossier

  • Construct en inhoud. Een vastgelegde definitie van wat de game meet en een onderbouwing uit functieanalyse waarom dat voor de rol telt.
  • Responsprocessen. Bewijs dat scores de bedoelde processen meten, inclusief analyse van game-ervaring en apparaateffecten.
  • Betrouwbaarheid. Test-hertest en interne consistentie, met steekproef, interval en methode. Leg dat naast wat er voor jouw besluit op het spel staat.
  • Convergente validiteit. Correlaties met gevestigde cognitieve tests, liefst in meer dan één steekproef. Een waarde rond 0,50 is gemiddeld, niet hoog.
  • Criteriumvaliditeit. Samenhang met werkprestatie, opleidingsresultaten of behoud in vergelijkbare functies, plus een plan voor lokale validatie.
  • Eerlijkheid. Verschillen in gemiddelden en selectieratio's per subgroep, naar gender, leeftijd, etniciteit en andere relevante groepen.
  • Kandidaatervaring. Afrondingspercentages, data over reacties van sollicitanten en hoe eerlijk kandidaten het proces vinden.

Adverse impact toetsen

Gebruik de vier-vijfderegel (80 procent) als eerste toets. Ligt de selectieratio van een groep onder 80 procent van die van de groep met de hoogste ratio, dan geldt de procedure onder de Amerikaanse Uniform Guidelines als mogelijk nadelig. In het Verenigd Koninkrijk en de EU gelden andere juridische toetsen, maar de vier-vijfderatio blijft een veelgebruikte vuistregel voor monitoring bij cognitieve tests en andere selectie-instrumenten. Zie het als aanleiding om te onderzoeken en bij te sturen, niet als oordeel. Eis vastgelegde maatregelen en herhaal de analyse op je eigen sollicitantendata, niet alleen op die van de leverancier.

Governance en data

Vraag documentatie op over gegevensbescherming, bewaartermijnen, auditlogs en menselijk toezicht op geautomatiseerde besluiten. Voor Europese werkgevers gaat dat over de AVG en de EU AI Act, waaronder recruitmenttools als hoog risico gelden. Selection Lab geeft aan AVG-conform te werken en aan te sluiten op de EU AI Act, met persoonsgegevens opgeslagen in Frankfurt en lokale taalmodellen die persoonsgegevens uit gesprekken verwijderen. Welke leverancier je ook kiest, vraag de documentatie achter zulke claims op.

Draai eerst een lokale pilot

Pilot met één afgebakende functie voordat je opschaalt. Verzamel gamescores naast je bestaande selectiedata en, na een passende periode, data over prestatie en vroeg verloop. Monitor tussendoor de selectieratio's per subgroep. Klantuitkomsten die Selection Lab rapporteert, zoals 21 procent minder vroeg verloop (januari 2024) en 15 minuten tijdwinst per sollicitant (december 2025), laten zien welke operationele maten het volgen waard zijn. Het zijn wel cijfers van de leverancier zelf, en je pilot hoort je eigen nulmeting op te leveren.

Integratie telt ook mee. Selection Lab noemt een ATS-koppeling en een livegang binnen twee tot tien weken, wat een pilot met een vaste looptijd haalbaar maakt. Spreek bij elke leverancier af dat de pilotdata voor jou beschikbaar blijven voor eigen analyse. Wil je zien hoe dat bij Selection Lab werkt? Vraag een demo aan.

Het verdedigbare standpunt

Het bewijs ondersteunt een gematigde conclusie. Games hangen gemiddeld samen met klassieke cognitieve tests, en minstens één recruitmentstudie rapporteert acceptabele betrouwbaarheid en een sterke kandidaatervaring. Wie dat een gimmick noemt, negeert de data. Wie het gelijkstelt aan een gevalideerde klassieke test, negeert wat ontbreekt. Dat is criteriumbewijs, onafhankelijke replicatie en bewijs over eerlijkheid voor jouw eigen kandidaten.

Gamen is niet het meten. Het validiteitsbewijs is dat wel. Koop eerst het bewijs, en pas daarna het format.

Veelgestelde vragen

Zijn game-based assessments betrouwbaar?

Goed gebouwde games kunnen voldoende betrouwbaar zijn. Een recruitmentstudie in Frontiers in Psychology vond een test-hertestbetrouwbaarheid van r = 0,68. Dat is acceptabel voor een screeningsfase met menselijke beoordeling erna, maar lager dan de 0,80 en hoger die gangbaar is voor klassieke cognitieve tests bij besluiten met hoge inzet.

Voorspelt een game-based assessment werkprestatie?

Dat is voor de meeste games nog niet onafhankelijk aangetoond. Het gepubliceerde bewijs gaat vooral over samenhang met cognitieve tests, r = 0,30 tot 0,45 in een meta-analyse over 44 publicaties. Studies die gamescores koppelen aan werkprestatie zijn schaars en vaak door leveranciers zelf uitgevoerd. Toets het daarom lokaal met een pilot.

Wat is het verschil tussen convergente en predictieve validiteit?

Convergente validiteit zegt of een game samenhangt met andere tests die hetzelfde meten. Predictieve validiteit zegt of de scores voorspellen wie goed presteert, een opleiding haalt of blijft. Een game kan het eerste hebben zonder dat het tweede bewezen is.

Welk bewijs vraag je aan een leverancier van game-based assessments?

Een validiteitsdossier met een definitie van wat de game meet, betrouwbaarheidscijfers met steekproef en methode, correlaties met gevestigde cognitieve tests, samenhang met werkprestatie in vergelijkbare functies, selectieratio's per subgroep en data over kandidaatervaring. Een demovideo is geen bewijs.

Wat is de vier-vijfderegel bij adverse impact?

Een eerste toets op mogelijke benadeling. Ligt de selectieratio van een groep onder 80 procent van die van de groep met de hoogste ratio, dan is dat een signaal om te onderzoeken. De regel komt uit de Amerikaanse Uniform Guidelines. In Europa gelden andere juridische toetsen, maar de ratio is een gangbare vuistregel voor monitoring.

FAQ

Kunnen game-based assessments de diversiteit in het wervingsproces bevorderen?

Ja, game-based assessments kunnen de diversiteit bevorderen door de focus te leggen op vaardigheden en gedrag in plaats van op traditionele criteria zoals cv's, die onbewuste vooroordelen kunnen bevatten. Hierdoor krijgen kandidaten met uiteenlopende achtergronden een gelijke kans om hun potentieel te demonstreren.

Wat is een game-based assessment?

Een game-based assessment is een testmethode die gebruikmaakt van spelmechanismen om de vaardigheden, competenties en persoonlijkheidskenmerken van kandidaten te evalueren. Tijdens het spelen van deze games worden verschillende aspecten, zoals probleemoplossend vermogen, cognitieve capaciteiten en gedrag onder druk, op een interactieve manier beoordeeld.

Wat zijn de voordelen van game-based assessments?

Game-based assessments kunnen een interactieve en boeiende ervaring bieden voor kandidaten, wat voor bepaalde doelgroepen kan bijdragen aan een positiever beeld van het sollicitatieproces. Voor werkgevers kunnen deze assessments diepgaand inzicht geven in zowel cognitieve als gedragsmatige kwaliteiten op een manier die traditionele tests mogelijk niet bieden. Daarnaast kunnen ze de kans op sociaal wenselijk gedrag verminderen, omdat kandidaten in een game-omgeving vaak meer authentiek en spontaan reageren.

Hoe betrouwbaar zijn game-based assessments vergeleken met traditionele tests?

Als ze goed ontworpen zijn, kunnen game-based assessments even betrouwbaar en in sommige gevallen zelfs betrouwbaarder zijn dan traditionele tests, omdat ze een breed scala aan gedragsindicatoren en cognitieve vaardigheden meten in een dynamische setting. Er is echter wel een groot verschil in kwaliteit tussen de verschillende game-based assessments, dus let hier goed op.

Hoe werkt een game-based assessment?

Bij een game-based assessment nemen kandidaten deel aan interactieve spellen die zijn ontworpen om specifieke vaardigheden en gedragingen te meten. Tijdens het spel wordt niet alleen het eindresultaat geanalyseerd, maar ook hoe de kandidaat beslissingen neemt, reageert op uitdagingen en omgaat met verschillende scenario's. Deze observaties geven inzicht in hun denkprocessen en gedragspatronen.

Zijn game-based assessments wetenschappelijk onderbouwd?

Het grote nadeel van game based assessments is dat ze relatief nieuw zijn, dus dat veel game-based assessments nog niet tot nauwelijks onderzocht zijn door onafhankelijke onderzoekers. Veel partijen halen hun eigen onderzoek(en) aan, maar dit is zelden onafhankelijk getoetst. Zonder onafhankelijk onderzoek kun je de betrouwbaarheid van game based assessments niet zeker weten. Wees je hiervan bewust bij het selecteren van het best passende assessment.

Hoe kunnen game-based assessments bijdragen aan een betere kandidaatervaring?

Dit verschilt sterk per doelgroep. Doordat game-based assessments speels en interactief zijn, ervaren bepaalde groepen kandidaten minder stress dan bij traditionele tests. Onderzoek toont aan dat bepaalde doelgroepen (met name kandidaten boven de 35 jaar) juist meer stress ervaren van een game. Ook komt uit onderzoek dat mannen games als positiever ervaren dan vrouwen.

Kun je game-based assessments oefenen?

Hoewel je je kunt vertrouwd maken met het type games dat wordt gebruikt, zijn game-based assessments moeilijk specifiek te oefenen. Ze zijn ontworpen om natuurlijke reacties en authentiek gedrag te meten, waardoor repetitieve oefening minder invloed heeft op de uitkomst dan bij traditionele tests.

Zullen game-based assessments traditionele tests vervangen in de toekomst?

Het is waarschijnlijk dat game-based assessments een grotere rol zullen spelen in toekomstige wervingsprocessen, maar een volledige vervanging van traditionele tests is onzeker. Beide methoden kunnen elkaar aanvullen en worden ingezet afhankelijk van de specifieke eisen van de functie en de voorkeuren van het bedrijf.

Hoe worden de resultaten van een game-based assessment geanalyseerd en geïnterpreteerd?

De resultaten van een game-based assessment worden geanalyseerd op basis van vooraf vastgestelde parameters zoals probleemoplossend vermogen, reactietijd en gedrag onder druk. Geavanceerde algoritmen verzamelen en verwerken automatisch de data om een objectieve en betrouwbare beoordeling van de competenties en vaardigheden van de kandidaat te bieden.

Welke vaardigheden worden gemeten in een game-based assessment?

Game-based assessments meten een breed scala aan vaardigheden. Ze evalueren bijvoorbeeld het probleemoplossend vermogen, het aanpassingsvermogen, de besluitvorming onder druk, samenwerking en emotionele intelligentie van een kandidaat. Afhankelijk van het specifieke ontwerp kunnen ook cognitieve vaardigheden zoals geheugen, aandacht en patroonherkenning worden beoordeeld.

Hoe lang duurt een game-based assessment?

De duur van een game-based assessment varieert, maar meestal duurt het tussen de 15 en 60 minuten. Dit hangt af van de complexiteit van de game en het aantal vaardigheden dat wordt gemeten. Vaak zijn deze assessments korter en interactiever dan traditionele tests, wat kan bijdragen aan een speelse kandidaatervaring.

Zijn game-based assessments geschikt voor alle functies?

Game-based assessments zijn vooral geschikt voor functies waarbij cognitieve flexibiliteit, creativiteit, probleemoplossend vermogen en interpersoonlijke vaardigheden cruciaal zijn. Voor zeer technische of specialistische rollen kunnen aanvullende tests of evaluaties nodig zijn om specifieke kennis en expertise te meten.

Wat is het verschil tussen een game-based assessment en een gamified assessment?

Het verschil tussen een game-based assessment en een gamified assessment ligt in de mate waarin speltechnieken worden geïntegreerd. Bij een gamified assessment worden traditionele tests verrijkt met spelelementen om de betrokkenheid te vergroten, terwijl bij een game-based assessment de game zelf het primaire instrument is voor evaluatie. In een game-based assessment worden kandidaten beoordeeld op basis van hun interactie binnen de game, die is ontworpen om specifieke competenties te meten.

FAQ

Hoe kan ik het retentiepercentage van mijn bedrijf verbeteren?

Het retentiepercentage kan worden verbeterd door te investeren in de ontwikkeling en tevredenheid van medewerkers. Dit omvat het aanbieden van trainingen, carrièrekansen en erkenning voor hun bijdragen. Een open communicatiecultuur en aandacht voor werk-privébalans kunnen eveneens bijdragen aan hogere retentie. Daarnaast kan het bieden van concurrerende arbeidsvoorwaarden en het betrekken van medewerkers bij besluitvorming de loyaliteit versterken.

Wat zijn de voordelen van doorgroeimogelijkheden voor personeelsbehoud?

Doorgroeimogelijkheden kunnen het behoud van personeel bevorderen door medewerkers een gevoel van richting en motivatie te geven. Wanneer zij de kans krijgen om te leren en zich professioneel te ontwikkelen binnen het bedrijf, voelen zij zich gewaardeerd, wat hun loyaliteit vergroot. Dit kan voorkomen dat ze vertrekken om elders betere kansen te zoeken.

Wat zijn de belangrijkste factoren die personeelsretentie beïnvloeden?

Belangrijke factoren die personeelsretentie beïnvloeden zijn onder meer salaris en secundaire arbeidsvoorwaarden, mogelijkheden voor professionele ontwikkeling, werk-privébalans, bedrijfscultuur en de relatie met leidinggevenden. Medewerkers blijven vaak langer wanneer ze zich gewaardeerd, uitgedaagd en ondersteund voelen in hun werkomgeving.

Waarom is personeelsretentie zo belangrijk voor organisaties?

Personeelsretentie is belangrijk omdat het helpt bij het verminderen van kosten voor werving en training van nieuwe medewerkers, en bijdraagt aan het behoud van kennis en ervaring binnen de organisatie. Een hoge retentie zorgt ook voor continuïteit binnen teams, wat kan leiden tot een stabielere bedrijfscultuur, hogere klanttevredenheid en verbeterde bedrijfsresultaten.

Welke wervingsstrategieën helpen bij het verhogen van retentie?

Wervingsstrategieën die de retentie kunnen verhogen, omvatten het identificeren van kandidaten die passen bij de bedrijfscultuur, het gebruik van assessments om soft skills te evalueren en het bieden van transparantie over rolverwachtingen tijdens het sollicitatieproces. Medewerkers die zich verbonden voelen met de organisatie en duidelijkheid hebben over hun functie, zijn geneigd langer te blijven.

Hoe kan een goed onboardingsproces bijdragen aan hogere retentie?

Een effectief onboardingsproces kan bijdragen aan hogere retentie door nieuwe medewerkers te helpen zich snel aan te passen aan hun rol, de bedrijfscultuur en de verwachtingen. Door vanaf het begin ondersteuning en duidelijke informatie te bieden, wordt hun betrokkenheid vergroot en de kans verkleind dat ze vroegtijdig vertrekken vanwege gevoelens van overweldiging of gebrek aan begeleiding.

Wat is de rol van bedrijfscultuur in het behoud van personeel?

De bedrijfscultuur speelt een cruciale rol in het behoud van personeel. Wanneer medewerkers zich gehoord, gewaardeerd en verbonden voelen met de waarden en normen van het bedrijf, is de kans groter dat ze blijven. Een positieve cultuur die samenwerking, respect en persoonlijke groei stimuleert, kan de motivatie en tevredenheid van medewerkers aanzienlijk vergroten.

Hoe kunnen leiderschap en managementstijl de retentie beïnvloeden?

Leiderschap en managementstijl hebben een significante invloed op retentie. Leiders die hun team inspireren, ondersteunen en coachen, kunnen de betrokkenheid en tevredenheid van medewerkers verhogen. Het bieden van autonomie en vertrouwen kan leiden tot hogere loyaliteit, terwijl een inefficiënte of negatieve managementstijl kan bijdragen aan ontevredenheid en verhoogd personeelsverloop.

Wat is het belang van erkenning en beloningen voor personeelsbehoud?

Erkenning en beloningen spelen een belangrijke rol in personeelsbehoud door medewerkers te laten zien dat hun werk wordt gewaardeerd. Dit kan hun motivatie en loyaliteit verhogen. Naast financiële beloningen kunnen ook complimenten, promoties en andere vormen van erkenning bijdragen aan tevredenheid en het behouden van personeel.

Welke rol speelt werk-privébalans in het verhogen van retentie?

Een evenwichtige werk-privébalans speelt een belangrijke rol in het verhogen van retentie. Door stress te verminderen en werktevredenheid te vergroten, blijven medewerkers vaak langer bij het bedrijf. Initiatieven zoals flexibele werktijden, mogelijkheden voor thuiswerken en respect voor persoonlijke tijd kunnen bijdragen aan deze balans.

Wat betekent retentie verhogen binnen een bedrijf?

Retentie verhogen binnen een bedrijf houdt in dat je strategieën implementeert om medewerkers langer aan de organisatie te binden. Dit kan door het verbeteren van werktevredenheid, het aanbieden van doorgroeimogelijkheden en het bevorderen van een positieve en ondersteunende bedrijfscultuur.

Hoe meet ik het succes van mijn retentiestrategie?

Het succes van een retentiestrategie kan worden gemeten door het bijhouden van retentiepercentages en verloopcijfers, en door inzichten te verkrijgen uit exitgesprekken. Daarnaast kunnen enquêtes over medewerkerstevredenheid en feedback uit evaluatiegesprekken waardevolle informatie bieden over de effectiviteit van de toegepaste strategieën.

Wat zijn de kosten van een laag retentiepercentage?

Een laag retentiepercentage kan aanzienlijke kosten met zich meebrengen, zoals verhoogde uitgaven voor werving en training van nieuwe medewerkers. Bovendien kan het verlies van ervaren personeel leiden tot lagere productiviteit, verminderde kennisoverdracht en een negatieve invloed op de bedrijfscultuur.

Hoe kan ik medewerkersbetrokkenheid verhogen?

Om medewerkersbetrokkenheid te verhogen, kun je hen betrekken bij besluitvormingsprocessen, regelmatig om hun feedback vragen en erkenning geven voor hun bijdragen. Het aanbieden van ontwikkelingsmogelijkheden en het onderhouden van transparante communicatie kunnen eveneens bijdragen aan een grotere betrokkenheid.

Hoe kan technologie helpen bij het verbeteren van personeelsretentie?

Technologie kan een hulpmiddel zijn bij het verbeteren van personeelsretentie door het faciliteren van communicatie, feedback en ontwikkeling. Door gebruik te maken van online platforms voor training, erkenning en evaluatie, kunnen bedrijven een meer betrokken en tevreden personeelsbestand creëren.

FAQ

Hoe lang duurt het om de tool te doorlopen?

Minder dan 10 minuten. Je doorloopt 30 vragen en krijgt daarna een overzicht van waar je op moet letten bij je volgende assessmentplatform.

Helpt deze checklist bij het vergelijken van assessmentaanbieders?

Ja. Doordat je scherp krijgt wat voor jouw team echt belangrijk is, wordt het vergelijken van functionaliteit, prijs en sterke punten van aanbieders eenvoudiger en strategischer.

Hoe gebruik ik deze checklist zonder formele RFI?

De checklist is net zo waardevol voor een interne evaluatie, voor het verkennen van nieuwe tools of voor het verbeteren van je huidige selectieproces, ook als je geen RFI of RFQ uitzet.

Waar moet je op letten bij een modern assessmentplatform?

Geef voorrang aan platformen met een gebruiksvriendelijk ontwerp, goede werking op mobiel, sterke analytics, koppelingen met je ATS en inclusieve functionaliteit zoals ondersteuning voor neurodiversiteit.

Welke soorten assessments zijn in 2026 relevant?

De sterkste platformen combineren capaciteitentesten, situational judgement tests, gedragsassessments en voorspellende AI, zodat je een kandidaat completer beoordeelt dan met één los instrument.

Voor wie is een assessmentchecklist bedoeld?

Voor HR-professionals, hiring managers en inkoopteams die oplossingen voor voorselectie beoordelen, en in het bijzonder voor wie AI-gestuurde of compliance-gedreven assessmentplatformen met elkaar vergelijkt.

Hoe helpt deze checklist bij een RFI of RFQ voor assessments?

Met de checklist breng je je eisen scherp in kaart, zodat je met vertrouwen een Request for Information of Request for Quotation voor assessmenttools kunt opstellen of beantwoorden.

Wat is een assessmenttool in werving en selectie?

Een assessmenttool beoordeelt de vaardigheden, het gedrag en de match van kandidaten tijdens het wervingsproces. Daarmee onderbouw je aannamebeslissingen beter en verloopt de voorselectie soepeler.

Game-based assessment packs

← Blog

Game-based assessments, wetenschappelijk onderbouwd of een gimmick?

Game-based assessments zijn geen gimmick en geen vervanging van klassieke tests. Wat onderzoek zegt over betrouwbaarheid en validiteit, en welk bewijs je vraagt.
Joeri Everaers
COO
Leestijd: ca.
4 min

Game-based assessments zijn geen gimmick, maar ook geen bewezen vervanging van klassieke cognitieve tests. Een meta-analyse over 44 publicaties vond een samenhang van r = 0,30 met traditionele tests, en r = 0,45 na correctie voor meetfout. Dat is een gemiddeld verband. Of een game werkprestatie voorspelt, is voor de meeste producten nog niet onafhankelijk aangetoond.

Dit artikel is voor CHRO's, HR-directeuren en talent acquisition leads die een game-based assessment overwegen of net een demo hebben gezien. Je leest wat het onderzoek zegt, hoe je de effectgroottes leest, waar het bewijs dun wordt en welk bewijs je vraagt voordat je een game inzet in een selectieproces met juridisch en reputatierisico. De kern is simpel. Validiteit hoort bij een specifieke score voor een specifiek selectiebesluit, niet bij een format. Een game die werkt voor één functie, één scoringsmodel en één doelgroep, zegt weinig over het volgende product in een demo.

Wat een game-based assessment is in selectie

Een game-based assessment (GBA) gebruikt spelmechanieken, zoals opdrachten op tijd, keuzes met beperkte middelen, patroontaken of risicobeslissingen, om gedrag uit te lokken dat wordt gescoord op een vooraf vastgelegd construct. In de wetenschappelijke literatuur zie je ook de term game-related assessment (GRA). Serious games assessment gaat over games die voor een ander doel dan vermaak zijn gebouwd.

Het onderscheid dat telt, is dat tussen een game die eruitziet als een game en een game die iets meet. Een visueel aantrekkelijke opdracht met willekeurige scoring heeft geen psychometrische waarde. Een opdracht die is ontworpen om werkgeheugen, abstract redeneren of leersnelheid zichtbaar te maken, met scoring die op bewijs rust, kan die waarde wel hebben.

Klassieke tests, zoals numerieke of verbale redeneertoetsen op tijd, hebben tientallen jaren validatie achter zich. Games hebben een kortere staat van dienst. Dat verschil in bewijs is een redelijke reden voor scepsis. Het format zelf is dat niet.

Wat de belangrijkste studies en meta-analyses laten zien

De meta-analyse in het Journal of Intelligence

De bruikbaarste losse bron is een meta-analyse in het Journal of Intelligence (open access via PMC) naar de relatie tussen game-related assessments en traditionele metingen van cognitieve capaciteit. Die bundelt 44 publicaties en 52 steekproeven, met 807 effectgroottes en ruim 6.100 volwassen deelnemers.

De gemiddelde geobserveerde correlatie tussen games en traditionele cognitieve tests was r = 0,30. Na correctie voor meetfout kwam die uit op r = 0,45.

Wat betekent dat voor werving? Een correlatie van 0,30 tot 0,45 is een gemiddeld verband. Games en klassieke tests overlappen duidelijk, dus games meten niet niks. Uitwisselbaar zijn ze ook niet. Twee cognitieve tests die hetzelfde meten, zouden veel sterker met elkaar samenhangen. Het resultaat past bij games die een deel van algemene cognitieve capaciteit meten, plus andere dingen zoals motivatie, gewenning aan de interface, risicovoorkeur of taakspecifieke vaardigheid.

De recruitmentstudie in Frontiers in Psychology

Een studie in Frontiers in Psychology (via PMC) naar game-based assessments van cognitieve capaciteit in recruitment kijkt naar validiteit, eerlijkheid en testervaring in een echte wervingscontext. Ze vond een test-hertestbetrouwbaarheid van r = 0,68, een convergente validiteit van r = 0,50 met traditionele cognitieve tests en een Net Promoter Score van 58 voor de testervaring. Voor eerlijkheid gebruikt de studie scoring met machine learning, namelijk ridge regressie met een ingebouwde straf op bias.

Dat zijn degelijke cijfers, en de aandacht voor adverse impact is een goed voorbeeld voor het vak. Er zijn wel twee kanttekeningen. De studie onderzoekt één aanpak uit één ecosysteem, dus je kunt de uitkomst niet doortrekken naar de hele categorie. En het belangrijkste validiteitsbewijs is samenhang met cognitieve tests, niet het voorspellen van werkprestatie.

De meta-analyse in het International Journal of Serious Games

Een derde meta-analyse, in het International Journal of Serious Games, gaat expliciet over de convergente validiteit van game-based assessments. Die afbakening is precies het punt. Convergente validiteit gaat over de vraag of een game samenhangt met andere metingen van hetzelfde construct. Of scores voorspellen wie goed presteert in de functie, is een andere vraag.

Waarom je de studies niet zomaar naast elkaar legt

Elke bron beantwoordt een andere vraag. De constructen verschillen (redeneren, geheugen, aandacht, eigenschappen die tegen persoonlijkheid aan liggen). De scoringsmodellen ook. Een transparante puntenscore gedraagt zich anders dan een samengestelde score uit machine learning. Steekproeven verschillen in leeftijd, opleiding, taal en ervaring met games. Een gemiddelde van r = 0,45 is dus een gemiddelde over heel verschillende games, en losse producten scoren erboven en eronder.

Validiteit is een onderbouwing, geen format

De Standards for Educational and Psychological Testing (AERA, APA en NCME, 2014) zien validiteit als één begrip. Er zijn geen losse soorten validiteit die je kunt afvinken. Meerdere bronnen van bewijs onderbouwen samen of een score past bij het beoogde gebruik. Het gaat om deze vijf.

  1. Testinhoud. Past de opdracht bij het construct en bij wat de functie vraagt?
  2. Responsprocessen. Gebruiken kandidaten de cognitieve of gedragsmatige processen die de ontwerper bedoelde?
  3. Interne structuur. Gedragen items en opdrachten zich zoals de theorie over het construct voorspelt?
  4. Relaties met andere variabelen. Convergent bewijs, discriminant bewijs en samenhang met werkcriteria.
  5. Gevolgen van het testen. Waaronder eerlijkheid, adverse impact en kandidaatervaring.

Hetzelfde kader geldt voor een verbale redeneertoets van veertig jaar oud en voor een nieuwe game. Een nieuw format krijgt geen vrijstelling. Dat is ook het standpunt van SIOP in haar richtlijnen voor het valideren van selectieprocedures. Het bewijs moet de specifieke conclusie in de specifieke context onderbouwen.

Betrouwbaarheid, constructvaliditeit en predictieve validiteit vergeleken

Betrouwbaarheid

Betrouwbaarheid is hoe consistent een score is. In selectie zijn instabiele scores een direct risico. Als een kandidaat op een andere dag anders zou scoren om redenen die niets met capaciteit te maken hebben, dan zijn besluiten op basis van die score deels toeval.

De test-hertestcorrelatie van r = 0,68 uit de recruitmentstudie is acceptabel voor een game, maar ligt onder wat je verwacht van volwassen cognitieve tests voor besluiten met hoge inzet. Daar zijn betrouwbaarheden van 0,80 en hoger gebruikelijk. Voor een screeningsfase met menselijke beoordeling erna kan 0,68 verdedigbaar zijn. Voor een zelfstandige afkapgrens is het mager. Vraag leveranciers welke betrouwbaarheid ze rapporteren (test-hertest, interne consistentie, parallelle versies), over welke periode en in welke steekproef.

Construct- en convergente validiteit

Hier is het bewijs het sterkst. De r = 0,30 geobserveerd en 0,45 gecorrigeerd uit de meta-analyse, en de r = 0,50 uit de recruitmentstudie, laten echte overlap met cognitieve capaciteit zien. Praktisch gezegd deelt een game met r = 0,50 ongeveer een kwart van zijn variantie met een klassieke test (r in het kwadraat is 0,25). De rest is iets anders. Dat kan relevant signaal zijn, ruis of een vaardigheid die er voor de functie niet toe doet. Alleen aanvullend bewijs maakt duidelijk welke van de drie.

Predictieve validiteit is een aparte vraag

Veel bezwaren van inkopers komen voort uit het door elkaar halen van twee claims.

  • Convergente validiteit. De game hangt samen met een cognitieve test.
  • Predictieve of criteriumvaliditeit. De scores voorspellen werkprestatie, opleidingssucces of behoud.

Een gemiddelde convergente correlatie bewijst niet dat een game werkprestatie voorspelt. De gepubliceerde literatuur is veel sterker op het eerste dan op het tweede. Criteriumbewijs voor games in echte functies is schaarser en zit vaak in eigen of door de leverancier betaalde studies.

Er is een indirecte redenering. Als een game cognitieve capaciteit meet, en cognitieve capaciteit voorspelt prestatie (zoals decennia onderzoek naar klassieke tests laat zien), dan erft de game een deel van die voorspellende kracht. Maar die redenering verliest bij elke stap aan kracht. Een game die 0,45 samenhangt met het construct, voorspelt minder dan de klassieke test zelf, tenzij hij ook iets extra's meet dat in het werk telt. Behandel de indirecte redenering als een hypothese die je lokaal toetst, niet als conclusie.

Responsprocessen

Bewijs over responsprocessen gaat over de vraag of kandidaten doen wat de ontwerper aanneemt. Een hoge score kan ook komen door snelle reacties, bekendheid met spelconventies of een aangeleerde truc voor de interface, in plaats van door redeneren. Leveranciers kunnen dit onderbouwen met hardop-denkstudies, analyse van procesdata of door te laten zien dat scores overeind blijven na correctie voor game-ervaring en type apparaat.

Waar games beter en slechter scoren dan klassieke tests

Waar games een voorsprong kunnen hebben

  • Betrokkenheid en afronding. Als minder kandidaten afhaken, raakt je kandidatenpool minder vertekend door uitval. De eigen klantdata van Selection Lab wijst die kant op. Het Main Deck 2026 noemt 27 procent minder uitval (maart 2025). Dat is een uitkomst die de leverancier zelf rapporteert, geen onafhankelijke bevinding, en minder uitval hangt af van de hele flow, niet alleen van de game.
  • Kandidaatervaring. De NPS van 58 uit de recruitmentstudie is hoog voor een testervaring. Tests krijgen zelden hoge cijfers. Welke speltypen kandidaten het meest waarderen, lees je in 3 game-based assessments die kandidaten echt leuk vinden.
  • Breedte van wat je meet. Interactieve opdrachten kunnen processen zichtbaar maken, zoals leren van feedback of je aanpassen aan veranderende regels, die een statische meerkeuzevraag mist.
  • Testangst. Aannemelijk, maar nauwelijks onderbouwd. Behandel claims over minder testangst als iets dat nog data nodig heeft.

Waar games tekortschieten

  • Reacties van sollicitanten. Kandidaten reageren niet overal positief op games. Sommige studies vinden minder gunstige oordelen dan bij traditionele formats, en eerdere game-ervaring kleurt die oordelen. Paul Englert stelt in zijn bespreking van zo'n studie de vraag hardop. Meten deze tools cognitieve capaciteit, of meten ze hoe prettig iemand gamen vindt?
  • Risico op oneerlijkheid. Als game-ervaring, leeftijd of apparaat (touchscreen of muis) de score verschuift los van capaciteit, haalt een game construct-irrelevante variantie en adverse impact binnen.
  • Gat in criteriumbewijs. Zonder validatie tegen werkprestatie is een game hooguit een aannemelijke benadering van cognitieve capaciteit.

Een praktische vuistregel

Games zijn het best te verdedigen als drie voorwaarden kloppen. Het gemeten construct past bij wat de functie vraagt. De leverancier laat betrouwbaarheid en convergent bewijs op een acceptabel niveau zien. En er is criteriumvalidatie voor vergelijkbare functies, eerst van de leverancier en daarna lokaal bevestigd. Ontbreekt er één, gebruik de game dan als één input naast andere en niet als poort.

Zo zet Selection Lab het format in. Games zitten in een flow die per functie wordt samengesteld, naast andere assessmenttypen en gestructureerde interviewrondes, en niet als losse noviteit. Eén instrument draagt zelden in zijn eentje een selectiebesluit, en een combinatie van methoden is in de regel beter te verdedigen dan leunen op één meting.

Beperkingen en open vragen

Generaliseerbaarheid. De steekproeven in gepubliceerd onderzoek bestaan vooral uit volwassenen, vaak studenten of de algemene bevolking, en zijn zelden uitgesplitst naar senioriteit, cultuur of beschermde groep. Of de uitkomsten ook voor andere functies gelden, is grotendeels niet onderzocht.

Criteriumbewijs. Convergent bewijs overheerst. Onafhankelijke, peer-reviewed studies die gamescores koppelen aan beoordelingen van leidinggevenden, productiviteit of behoud zijn schaars.

Transparantie van scoring. Scoring met machine learning kan de voorspelling verbeteren en ruimte geven voor eerlijkheidseisen, zoals de straf op bias uit de recruitmentstudie. Het maakt scores ook lastiger uit te leggen. Bij een audit of bezwaar is ‘het model woog het zo’ geen verweer. Leveranciers moeten audit trails leveren, uitleg per kenmerk waar dat kan, en analyses per subgroep.

Operationele verstoringen. Oefeneffecten, verschillen tussen apparaten en coaching kunnen scores verschuiven. Dat vraagt om monitoring na de invoering, niet alleen in de oorspronkelijke validatie. Hoe je fraude en faken herkent, lees je in game-based assessments versus vragenlijsten.

Onafhankelijkheid van bronnen. Een deel van de studies die het meest relevant zijn voor de praktijk, komt uit commerciële ecosystemen. Dat maakt ze niet ongeldig, maar onafhankelijke replicatie en transparante methoden wegen daardoor zwaarder.

Welk bewijs je eist voordat je een game-based assessment inzet

Een demovideo is geen bewijs. Vraag om een validiteitsdossier dat aansluit op de vijf bronnen van bewijs hierboven.

Checklist voor het validiteitsdossier

  • Construct en inhoud. Een vastgelegde definitie van wat de game meet en een onderbouwing uit functieanalyse waarom dat voor de rol telt.
  • Responsprocessen. Bewijs dat scores de bedoelde processen meten, inclusief analyse van game-ervaring en apparaateffecten.
  • Betrouwbaarheid. Test-hertest en interne consistentie, met steekproef, interval en methode. Leg dat naast wat er voor jouw besluit op het spel staat.
  • Convergente validiteit. Correlaties met gevestigde cognitieve tests, liefst in meer dan één steekproef. Een waarde rond 0,50 is gemiddeld, niet hoog.
  • Criteriumvaliditeit. Samenhang met werkprestatie, opleidingsresultaten of behoud in vergelijkbare functies, plus een plan voor lokale validatie.
  • Eerlijkheid. Verschillen in gemiddelden en selectieratio's per subgroep, naar gender, leeftijd, etniciteit en andere relevante groepen.
  • Kandidaatervaring. Afrondingspercentages, data over reacties van sollicitanten en hoe eerlijk kandidaten het proces vinden.

Adverse impact toetsen

Gebruik de vier-vijfderegel (80 procent) als eerste toets. Ligt de selectieratio van een groep onder 80 procent van die van de groep met de hoogste ratio, dan geldt de procedure onder de Amerikaanse Uniform Guidelines als mogelijk nadelig. In het Verenigd Koninkrijk en de EU gelden andere juridische toetsen, maar de vier-vijfderatio blijft een veelgebruikte vuistregel voor monitoring bij cognitieve tests en andere selectie-instrumenten. Zie het als aanleiding om te onderzoeken en bij te sturen, niet als oordeel. Eis vastgelegde maatregelen en herhaal de analyse op je eigen sollicitantendata, niet alleen op die van de leverancier.

Governance en data

Vraag documentatie op over gegevensbescherming, bewaartermijnen, auditlogs en menselijk toezicht op geautomatiseerde besluiten. Voor Europese werkgevers gaat dat over de AVG en de EU AI Act, waaronder recruitmenttools als hoog risico gelden. Selection Lab geeft aan AVG-conform te werken en aan te sluiten op de EU AI Act, met persoonsgegevens opgeslagen in Frankfurt en lokale taalmodellen die persoonsgegevens uit gesprekken verwijderen. Welke leverancier je ook kiest, vraag de documentatie achter zulke claims op.

Draai eerst een lokale pilot

Pilot met één afgebakende functie voordat je opschaalt. Verzamel gamescores naast je bestaande selectiedata en, na een passende periode, data over prestatie en vroeg verloop. Monitor tussendoor de selectieratio's per subgroep. Klantuitkomsten die Selection Lab rapporteert, zoals 21 procent minder vroeg verloop (januari 2024) en 15 minuten tijdwinst per sollicitant (december 2025), laten zien welke operationele maten het volgen waard zijn. Het zijn wel cijfers van de leverancier zelf, en je pilot hoort je eigen nulmeting op te leveren.

Integratie telt ook mee. Selection Lab noemt een ATS-koppeling en een livegang binnen twee tot tien weken, wat een pilot met een vaste looptijd haalbaar maakt. Spreek bij elke leverancier af dat de pilotdata voor jou beschikbaar blijven voor eigen analyse. Wil je zien hoe dat bij Selection Lab werkt? Vraag een demo aan.

Het verdedigbare standpunt

Het bewijs ondersteunt een gematigde conclusie. Games hangen gemiddeld samen met klassieke cognitieve tests, en minstens één recruitmentstudie rapporteert acceptabele betrouwbaarheid en een sterke kandidaatervaring. Wie dat een gimmick noemt, negeert de data. Wie het gelijkstelt aan een gevalideerde klassieke test, negeert wat ontbreekt. Dat is criteriumbewijs, onafhankelijke replicatie en bewijs over eerlijkheid voor jouw eigen kandidaten.

Gamen is niet het meten. Het validiteitsbewijs is dat wel. Koop eerst het bewijs, en pas daarna het format.

Veelgestelde vragen

Zijn game-based assessments betrouwbaar?

Goed gebouwde games kunnen voldoende betrouwbaar zijn. Een recruitmentstudie in Frontiers in Psychology vond een test-hertestbetrouwbaarheid van r = 0,68. Dat is acceptabel voor een screeningsfase met menselijke beoordeling erna, maar lager dan de 0,80 en hoger die gangbaar is voor klassieke cognitieve tests bij besluiten met hoge inzet.

Voorspelt een game-based assessment werkprestatie?

Dat is voor de meeste games nog niet onafhankelijk aangetoond. Het gepubliceerde bewijs gaat vooral over samenhang met cognitieve tests, r = 0,30 tot 0,45 in een meta-analyse over 44 publicaties. Studies die gamescores koppelen aan werkprestatie zijn schaars en vaak door leveranciers zelf uitgevoerd. Toets het daarom lokaal met een pilot.

Wat is het verschil tussen convergente en predictieve validiteit?

Convergente validiteit zegt of een game samenhangt met andere tests die hetzelfde meten. Predictieve validiteit zegt of de scores voorspellen wie goed presteert, een opleiding haalt of blijft. Een game kan het eerste hebben zonder dat het tweede bewezen is.

Welk bewijs vraag je aan een leverancier van game-based assessments?

Een validiteitsdossier met een definitie van wat de game meet, betrouwbaarheidscijfers met steekproef en methode, correlaties met gevestigde cognitieve tests, samenhang met werkprestatie in vergelijkbare functies, selectieratio's per subgroep en data over kandidaatervaring. Een demovideo is geen bewijs.

Wat is de vier-vijfderegel bij adverse impact?

Een eerste toets op mogelijke benadeling. Ligt de selectieratio van een groep onder 80 procent van die van de groep met de hoogste ratio, dan is dat een signaal om te onderzoeken. De regel komt uit de Amerikaanse Uniform Guidelines. In Europa gelden andere juridische toetsen, maar de ratio is een gangbare vuistregel voor monitoring.