Skill test tools leveren aantoonbare ROI als ze drie dingen tegelijk aantonen. Voorspellende validiteit voor de rol die je vult, meetbaar effect op doorlooptijd en drop-off, en resultaten bij een klant die op jouw situatie lijkt. Mist een van de drie, dan is de businesscase een aanname en geen berekening.
Dat klinkt als een lage lat. Hij is het niet. Wie de assessmentmarkt langsgaat en per leverancier vraagt om het cijfer plus de steekproef waarop het is berekend, houdt een korte lijst over. Deze pagina laat zien hoe je die lijst zelf maakt, en waar wij daarin staan.
ROI op een skill test is niet hetzelfde als een goed gevoel over kwaliteit. Het is het verschil tussen wat een betere selectiebeslissing oplevert en wat het meten kost. Dat verschil zit in vier posten.
Recruiterstijd. Uren die niet naar cv's scannen en no-shows gaan. Deze post is het makkelijkst te meten en wordt daarom vaak als enige gemeten, wat de businesscase te klein maakt.
Drop-off in de funnel. Kandidaten die afhaken tijdens de sollicitatie. Elke afhaker die je niet verliest, is een sourcing-euro die je niet opnieuw uitgeeft.
Kwaliteit van de aanname. Prestaties in het eerste jaar en de kans dat iemand blijft. Dit is de grootste post en de moeilijkste, omdat je er prestatiedata bij nodig hebt.
Mishires. De aanname die binnen zes maanden weer vertrekt. Eén voorkomen mishire betaalt vaak een jaarlicentie, mits je de werkelijke kosten van die mishire kent en niet gokt.
Wie alleen op recruiterstijd rekent, koopt een tool die tijd bespaart en niets zegt over wie je aanneemt. Dat is efficiëntie, geen ROI. Het onderscheid is niet academisch, want het bepaalt welke tool je moet willen.
De meest recente grote herberekening van selectiemethoden is die van Sackett en collega's uit 2022. Zij corrigeerden een systematische overschatting in de oudere cijfers van Schmidt en Hunter uit 1998. De rangorde die daaruit komt.
| Selectiemethode | Voorspellende validiteit |
|---|---|
| Gestructureerd interview | .42 |
| Kennistest voor de functie | .40 |
| Empirisch gescoorde biodata | .38 |
| Werkopdracht of proefopdracht | .33 |
| Cognitieve capaciteitentest | .31 |
| Interesses, gemeten als fit met de functie | .24 |
Twee dingen vallen op. Het gestructureerd interview staat bovenaan, niet de capaciteitentest. En interesses als fit met de concrete functie doen het ruim twee keer beter dan interesses als algemene categorie, wat in de oudere cijfers op .10 stond.
Wat dat betekent voor je toolkeuze. Een tool die alleen een capaciteitentest verkoopt, koopt je .31 in. Een tool die de test combineert met een gestructureerde interviewleidraad op dezelfde competenties zit hoger, omdat je twee voorspellers stapelt in plaats van één. Dat is het goedkoopste rendement in de hele selectieketen en het wordt het vaakst overgeslagen.
Deze vier gelden ook voor ons. Verderop staat welke van onze eigen cijfers deze test doorstaan en welke niet.
Hieronder staat per leverancier alleen wat op 26 augustus 2026 publiek te vinden was. "Niet gevonden" betekent niet dat het niet bestaat, het betekent dat je het moet opvragen voordat je erop rekent.
| Tool | Wat het meet | Publiek bewijs | Waar de ROI zit |
|---|---|---|---|
| Selection Lab | Cognitie, persoonlijkheid, taal, hard en soft skills, plus screening en planning in één flow | Klantcases met een metriek per klant. Geen validiteitscoëfficiënten per test publiek | Wegvallend handwerk en lagere drop-off bij volume |
| TestGorilla | Brede bibliotheek waar je zelf een testset samenstelt | Fact sheets per test met betrouwbaarheids- en validiteitsinformatie, plus uitleg over eigen validatiestudies. Geen coëfficiënten of steekproeven op de sciencepagina zelf | Snelheid en volume, mits jij de juiste tests kiest |
| Ixly | Nederlandse psychometrische uitgever, capaciteiten en persoonlijkheid | Testhandleidingen online plus COTAN-beoordelingen per test | Rollen waar een misser duur is |
| Aon Assessment, voorheen cut-e | Internationale testbatterijen voor volume en internationale selectie | Geen publiek validiteitsrapport gevonden. Handleidingen lopen via de leverancier | Internationale volumeselectie met één norm |
| Codility en HackerRank | Werkopdrachten voor code en technische taken | Codility verwijst naar een technical manual en zegt expliciet dat het vandaag geen claim doet over outcome tracking. HackerRank publiceert whitepapers per assessmenttype | Binnen techniek, waar de opdracht dicht bij het werk zit |
Eén observatie die de moeite waard is. De enige partij in dit lijstje met een onafhankelijke, publiek narekenbare beoordeling is Ixly, en die beoordeling is niet vlekkeloos. De COTAN beoordeelde de ACT Algemene Intelligentie als goed op theoretische uitgangspunten, testmateriaal en handleiding, als voldoende op betrouwbaarheid en begripsvaliditeit, en als onvoldoende op normen en criteriumvaliditeit. Ixly schreef daar zelf over dat criteriumvaliditeit in het veld erg lastig aan te tonen is en dat weinig Nederlandse intelligentietests daar voldoende halen.
Dat is geen zwakte van Ixly. Dat is hoe streng een echte beoordeling is. Zet het naast een leverancier die "wetenschappelijk gevalideerd" op de homepage zet en niets publiceert, en je ziet meteen wie zich heeft laten nakijken.
Vul je eigen cijfers in. De formule.
Jaarlijkse opbrengst = (voorkomen mishires x kosten per mishire) + (bespaarde recruiteruren x uurtarief) + (extra plaatsingen x marge per plaatsing)
ROI = (jaarlijkse opbrengst min jaarlijkse licentiekosten min implementatiekosten) gedeeld door (jaarlijkse licentiekosten plus implementatiekosten)
De post die de uitkomst bepaalt, is bijna altijd de mishire. Daar zit ook de grootste onzekerheid, want vrijwel niemand kent dat bedrag voor de eigen organisatie. Daarom staat er hieronder geen branchecijfer. Zet je eigen bedrag in de linkerkolom en kijk wat er met de uitkomst gebeurt.
| Wat je invult | Waar je het haalt |
|---|---|
| Aantal aannames per jaar | Je ATS |
| Aantal vertrekkers binnen zes maanden | Je HR-systeem |
| Kosten per mishire | Sourcingkosten plus inwerktijd plus productieverlies plus de uren van de leidinggevende |
| Sollicitanten per jaar | Je ATS |
| Bespaarde minuten per sollicitant | Meet dit zelf in de pilot, neem het niet over uit een demo |
| Uurtarief recruiter | Je eigen loonkosten |
Zonder het bedrag per mishire kun je de ROI van geen enkele tool berekenen. Dat cijfer eerst vaststellen is meer waard dan drie demo's bekijken. Het kost een middag en het maakt elke leveranciersclaim daarna narekenbaar.
Skill test tools die AI gebruiken om kandidaten te beoordelen, vallen onder Annex III van de EU AI Act en gelden daarmee als hoog risico. De Digital Omnibus on AI is op 27 juli 2026 in werking getreden, na publicatie in het Publicatieblad op 24 juli 2026. Daarmee is de deadline voor zelfstandige Annex III-systemen verschoven van 2 augustus 2026 naar 2 december 2027.
Wat wel al geldt sinds 2 augustus 2026 zijn de transparantieverplichtingen uit artikel 50. Kandidaten moeten weten dat ze met een AI-systeem te maken hebben, en synthetische output moet machineleesbaar gemarkeerd zijn, met een overgangstermijn tot 2 december 2026 voor systemen die al op de markt waren.
Voor je businesscase betekent dit twee dingen. Je hebt langer dan gedacht om de documentatie op orde te krijgen, en het is een aankoopcriterium geworden. Een leverancier die nu geen risicomanagement en technische documentatie kan laten zien, schuift die kosten door naar jou.
We publiceren geen validiteitscoëfficiënten per test. Wie op dat niveau wil vergelijken, moet dat bij ons opvragen, net als bij elke andere leverancier in de tabel hierboven. Wat we wel hebben, zijn resultaten per klant. Eén daarvan meet kwaliteit van aannames, de rest meet proces.
Het cijfer dat over kwaliteit gaat. Bij Dentons steeg de quality-of-hire ratio met 13,5%. Van de beoordeelde kandidaten werd 32% aangenomen en 77% van die aannames presteerde op of boven gemiddeld, gemeten met prestatiedata na indiensttreding. Kandidaten met hogere scores op moraliteit, zelfcontrole en enthousiasme presteerden beter.
De cijfers die over proces gaan. Carrefour bespaart 6 uur per recruiter per week. DPD zag de kosten in het wervingsproces 15% lager uitkomen. CoBuilders verbeterde de plaatsingsratio met 8%. Welten bespaart 6.700 minuten per maand. FrieslandCampina nam 40 trainees aan binnen een maand, uit 23.000 sollicitaties in 18 landen. Bij IG&H werden 603 kandidaten beoordeeld, met 94% positieve feedback van kandidaten.
Die tweede lijst zegt iets over doorlooptijd en kosten en niets over wie er is aangenomen. Dat is precies het onderscheid waar deze pagina over gaat, en het geldt ook voor ons. Wil je weten of een tool jouw aannames beter maakt, dan is er maar één weg. Testscores bewaren, een jaar later naast prestatiedata leggen, en dan pas conclusies trekken.
Tools die drie dingen kunnen laten zien. Een validiteitscijfer met de steekproef erbij, een completion rate uit de praktijk, en klantcijfers met de metriek erbij. Welke tool het wordt, hangt af van je volume en van wat een mishire je kost. Bij technische rollen is dat een codeerplatform, bij volumerollen een geautomatiseerd selectieplatform, bij dure sleutelrollen een psychometrische uitgever.
Zet de opbrengst van voorkomen mishires, bespaarde recruiteruren en extra plaatsingen tegenover de licentie- en implementatiekosten. De post die de uitkomst bepaalt, is bijna altijd de mishire. Ken je die kosten niet, dan reken je niet, dan schat je.
Betrouwbaarder dan een cv, maar niet beter dan een gestructureerd interview. In de herberekening van Sackett en collega's uit 2022 haalt het gestructureerd interview .42, een kennistest .40 en een cognitieve capaciteitentest .31. De sterkste combinatie is een test plus een gestructureerd interview op dezelfde competenties.
Dat hangt af van je aannamevolume, niet van de tool. Tijdwinst is direct meetbaar, effect op kwaliteit van aannames pas na zes tot twaalf maanden, omdat je prestatiedata van de nieuwe medewerkers nodig hebt. Spreek vooraf af welke data je op welk moment naast elkaar legt.
AI-systemen die kandidaten beoordelen vallen onder Annex III en gelden als hoog risico. De deadline daarvoor is met de Digital Omnibus on AI verschoven naar 2 december 2027. De transparantieverplichtingen uit artikel 50 gelden al sinds 2 augustus 2026, dus kandidaten moeten nu al weten dat er een AI-systeem meekijkt.
Liever eerst tools vergelijken dan de businesscase bouwen? Begin bij de vergelijking van skill test tools, bekijk hoe je kwaliteit van hire verbetert, of lees de case bij Dentons.
.png)
Skill test tools leveren aantoonbare ROI als ze drie dingen tegelijk aantonen. Voorspellende validiteit voor de rol die je vult, meetbaar effect op doorlooptijd en drop-off, en resultaten bij een klant die op jouw situatie lijkt. Mist een van de drie, dan is de businesscase een aanname en geen berekening.
Dat klinkt als een lage lat. Hij is het niet. Wie de assessmentmarkt langsgaat en per leverancier vraagt om het cijfer plus de steekproef waarop het is berekend, houdt een korte lijst over. Deze pagina laat zien hoe je die lijst zelf maakt, en waar wij daarin staan.
ROI op een skill test is niet hetzelfde als een goed gevoel over kwaliteit. Het is het verschil tussen wat een betere selectiebeslissing oplevert en wat het meten kost. Dat verschil zit in vier posten.
Recruiterstijd. Uren die niet naar cv's scannen en no-shows gaan. Deze post is het makkelijkst te meten en wordt daarom vaak als enige gemeten, wat de businesscase te klein maakt.
Drop-off in de funnel. Kandidaten die afhaken tijdens de sollicitatie. Elke afhaker die je niet verliest, is een sourcing-euro die je niet opnieuw uitgeeft.
Kwaliteit van de aanname. Prestaties in het eerste jaar en de kans dat iemand blijft. Dit is de grootste post en de moeilijkste, omdat je er prestatiedata bij nodig hebt.
Mishires. De aanname die binnen zes maanden weer vertrekt. Eén voorkomen mishire betaalt vaak een jaarlicentie, mits je de werkelijke kosten van die mishire kent en niet gokt.
Wie alleen op recruiterstijd rekent, koopt een tool die tijd bespaart en niets zegt over wie je aanneemt. Dat is efficiëntie, geen ROI. Het onderscheid is niet academisch, want het bepaalt welke tool je moet willen.
De meest recente grote herberekening van selectiemethoden is die van Sackett en collega's uit 2022. Zij corrigeerden een systematische overschatting in de oudere cijfers van Schmidt en Hunter uit 1998. De rangorde die daaruit komt.
| Selectiemethode | Voorspellende validiteit |
|---|---|
| Gestructureerd interview | .42 |
| Kennistest voor de functie | .40 |
| Empirisch gescoorde biodata | .38 |
| Werkopdracht of proefopdracht | .33 |
| Cognitieve capaciteitentest | .31 |
| Interesses, gemeten als fit met de functie | .24 |
Twee dingen vallen op. Het gestructureerd interview staat bovenaan, niet de capaciteitentest. En interesses als fit met de concrete functie doen het ruim twee keer beter dan interesses als algemene categorie, wat in de oudere cijfers op .10 stond.
Wat dat betekent voor je toolkeuze. Een tool die alleen een capaciteitentest verkoopt, koopt je .31 in. Een tool die de test combineert met een gestructureerde interviewleidraad op dezelfde competenties zit hoger, omdat je twee voorspellers stapelt in plaats van één. Dat is het goedkoopste rendement in de hele selectieketen en het wordt het vaakst overgeslagen.
Deze vier gelden ook voor ons. Verderop staat welke van onze eigen cijfers deze test doorstaan en welke niet.
Hieronder staat per leverancier alleen wat op 26 augustus 2026 publiek te vinden was. "Niet gevonden" betekent niet dat het niet bestaat, het betekent dat je het moet opvragen voordat je erop rekent.
| Tool | Wat het meet | Publiek bewijs | Waar de ROI zit |
|---|---|---|---|
| Selection Lab | Cognitie, persoonlijkheid, taal, hard en soft skills, plus screening en planning in één flow | Klantcases met een metriek per klant. Geen validiteitscoëfficiënten per test publiek | Wegvallend handwerk en lagere drop-off bij volume |
| TestGorilla | Brede bibliotheek waar je zelf een testset samenstelt | Fact sheets per test met betrouwbaarheids- en validiteitsinformatie, plus uitleg over eigen validatiestudies. Geen coëfficiënten of steekproeven op de sciencepagina zelf | Snelheid en volume, mits jij de juiste tests kiest |
| Ixly | Nederlandse psychometrische uitgever, capaciteiten en persoonlijkheid | Testhandleidingen online plus COTAN-beoordelingen per test | Rollen waar een misser duur is |
| Aon Assessment, voorheen cut-e | Internationale testbatterijen voor volume en internationale selectie | Geen publiek validiteitsrapport gevonden. Handleidingen lopen via de leverancier | Internationale volumeselectie met één norm |
| Codility en HackerRank | Werkopdrachten voor code en technische taken | Codility verwijst naar een technical manual en zegt expliciet dat het vandaag geen claim doet over outcome tracking. HackerRank publiceert whitepapers per assessmenttype | Binnen techniek, waar de opdracht dicht bij het werk zit |
Eén observatie die de moeite waard is. De enige partij in dit lijstje met een onafhankelijke, publiek narekenbare beoordeling is Ixly, en die beoordeling is niet vlekkeloos. De COTAN beoordeelde de ACT Algemene Intelligentie als goed op theoretische uitgangspunten, testmateriaal en handleiding, als voldoende op betrouwbaarheid en begripsvaliditeit, en als onvoldoende op normen en criteriumvaliditeit. Ixly schreef daar zelf over dat criteriumvaliditeit in het veld erg lastig aan te tonen is en dat weinig Nederlandse intelligentietests daar voldoende halen.
Dat is geen zwakte van Ixly. Dat is hoe streng een echte beoordeling is. Zet het naast een leverancier die "wetenschappelijk gevalideerd" op de homepage zet en niets publiceert, en je ziet meteen wie zich heeft laten nakijken.
Vul je eigen cijfers in. De formule.
Jaarlijkse opbrengst = (voorkomen mishires x kosten per mishire) + (bespaarde recruiteruren x uurtarief) + (extra plaatsingen x marge per plaatsing)
ROI = (jaarlijkse opbrengst min jaarlijkse licentiekosten min implementatiekosten) gedeeld door (jaarlijkse licentiekosten plus implementatiekosten)
De post die de uitkomst bepaalt, is bijna altijd de mishire. Daar zit ook de grootste onzekerheid, want vrijwel niemand kent dat bedrag voor de eigen organisatie. Daarom staat er hieronder geen branchecijfer. Zet je eigen bedrag in de linkerkolom en kijk wat er met de uitkomst gebeurt.
| Wat je invult | Waar je het haalt |
|---|---|
| Aantal aannames per jaar | Je ATS |
| Aantal vertrekkers binnen zes maanden | Je HR-systeem |
| Kosten per mishire | Sourcingkosten plus inwerktijd plus productieverlies plus de uren van de leidinggevende |
| Sollicitanten per jaar | Je ATS |
| Bespaarde minuten per sollicitant | Meet dit zelf in de pilot, neem het niet over uit een demo |
| Uurtarief recruiter | Je eigen loonkosten |
Zonder het bedrag per mishire kun je de ROI van geen enkele tool berekenen. Dat cijfer eerst vaststellen is meer waard dan drie demo's bekijken. Het kost een middag en het maakt elke leveranciersclaim daarna narekenbaar.
Skill test tools die AI gebruiken om kandidaten te beoordelen, vallen onder Annex III van de EU AI Act en gelden daarmee als hoog risico. De Digital Omnibus on AI is op 27 juli 2026 in werking getreden, na publicatie in het Publicatieblad op 24 juli 2026. Daarmee is de deadline voor zelfstandige Annex III-systemen verschoven van 2 augustus 2026 naar 2 december 2027.
Wat wel al geldt sinds 2 augustus 2026 zijn de transparantieverplichtingen uit artikel 50. Kandidaten moeten weten dat ze met een AI-systeem te maken hebben, en synthetische output moet machineleesbaar gemarkeerd zijn, met een overgangstermijn tot 2 december 2026 voor systemen die al op de markt waren.
Voor je businesscase betekent dit twee dingen. Je hebt langer dan gedacht om de documentatie op orde te krijgen, en het is een aankoopcriterium geworden. Een leverancier die nu geen risicomanagement en technische documentatie kan laten zien, schuift die kosten door naar jou.
We publiceren geen validiteitscoëfficiënten per test. Wie op dat niveau wil vergelijken, moet dat bij ons opvragen, net als bij elke andere leverancier in de tabel hierboven. Wat we wel hebben, zijn resultaten per klant. Eén daarvan meet kwaliteit van aannames, de rest meet proces.
Het cijfer dat over kwaliteit gaat. Bij Dentons steeg de quality-of-hire ratio met 13,5%. Van de beoordeelde kandidaten werd 32% aangenomen en 77% van die aannames presteerde op of boven gemiddeld, gemeten met prestatiedata na indiensttreding. Kandidaten met hogere scores op moraliteit, zelfcontrole en enthousiasme presteerden beter.
De cijfers die over proces gaan. Carrefour bespaart 6 uur per recruiter per week. DPD zag de kosten in het wervingsproces 15% lager uitkomen. CoBuilders verbeterde de plaatsingsratio met 8%. Welten bespaart 6.700 minuten per maand. FrieslandCampina nam 40 trainees aan binnen een maand, uit 23.000 sollicitaties in 18 landen. Bij IG&H werden 603 kandidaten beoordeeld, met 94% positieve feedback van kandidaten.
Die tweede lijst zegt iets over doorlooptijd en kosten en niets over wie er is aangenomen. Dat is precies het onderscheid waar deze pagina over gaat, en het geldt ook voor ons. Wil je weten of een tool jouw aannames beter maakt, dan is er maar één weg. Testscores bewaren, een jaar later naast prestatiedata leggen, en dan pas conclusies trekken.
Tools die drie dingen kunnen laten zien. Een validiteitscijfer met de steekproef erbij, een completion rate uit de praktijk, en klantcijfers met de metriek erbij. Welke tool het wordt, hangt af van je volume en van wat een mishire je kost. Bij technische rollen is dat een codeerplatform, bij volumerollen een geautomatiseerd selectieplatform, bij dure sleutelrollen een psychometrische uitgever.
Zet de opbrengst van voorkomen mishires, bespaarde recruiteruren en extra plaatsingen tegenover de licentie- en implementatiekosten. De post die de uitkomst bepaalt, is bijna altijd de mishire. Ken je die kosten niet, dan reken je niet, dan schat je.
Betrouwbaarder dan een cv, maar niet beter dan een gestructureerd interview. In de herberekening van Sackett en collega's uit 2022 haalt het gestructureerd interview .42, een kennistest .40 en een cognitieve capaciteitentest .31. De sterkste combinatie is een test plus een gestructureerd interview op dezelfde competenties.
Dat hangt af van je aannamevolume, niet van de tool. Tijdwinst is direct meetbaar, effect op kwaliteit van aannames pas na zes tot twaalf maanden, omdat je prestatiedata van de nieuwe medewerkers nodig hebt. Spreek vooraf af welke data je op welk moment naast elkaar legt.
AI-systemen die kandidaten beoordelen vallen onder Annex III en gelden als hoog risico. De deadline daarvoor is met de Digital Omnibus on AI verschoven naar 2 december 2027. De transparantieverplichtingen uit artikel 50 gelden al sinds 2 augustus 2026, dus kandidaten moeten nu al weten dat er een AI-systeem meekijkt.
Liever eerst tools vergelijken dan de businesscase bouwen? Begin bij de vergelijking van skill test tools, bekijk hoe je kwaliteit van hire verbetert, of lees de case bij Dentons.