Leestijd

Hoe Selection Lab hallucinaties van LLM's buiten de kandidaatscore houdt

Gebruikt Selection Lab LLM's om kandidaten te scoren?
Nee. Taalmodellen doen bij Selection Lab het gesprek met de kandidaat, de verwerking van cv-tekst en het verwijderen van persoonsgegevens. De matchscore komt uitsluitend uit gevalideerde assessments, gewogen per functieprofiel. Geen enkele LLM-uitkomst komt in die score terecht, zodat een verzonnen eigenschap nooit een selectiebeslissing kan beïnvloeden.

Dit artikel beantwoordt een vraag die elke CHRO, HR-directeur en auditor van HR-technologie aan een leverancier van AI-recruitmentsoftware zou moeten stellen. Gebruik je large language models (LLM's) voor het scoren van kandidaten, en zo ja, hoe voorkom je dat hallucinaties de selectiebeslissing beïnvloeden?

Gebruiken selectietools LLM's om kandidaten te scoren?

Veel recruitmenttools gebruiken inmiddels ergens in hun stack een LLM. De vraag die telt is waar. Een taalmodel dat een intakegesprek voert is iets heel anders dan een taalmodel dat bepaalt op welke plek een kandidaat in de ranglijst komt of of iemand door mag. Wie die twee door elkaar haalt, neemt een groot risico.

In de architectuur van Selection Lab is de scheiding expliciet.

  • LLM's doen het gesprek met de kandidaat in SmartChat, de verwerking van cv-tekst, de aansturing van de workflow en het verwijderen van persoonsgegevens.
  • Gestructureerde ML-modellen en gevalideerde assessments doen de numerieke scoring, de knock-outcriteria en de match per functie.

Een LLM mag in dit systeem een conceptuitleg of een gespreksantwoord geven. Het mag geen getal produceren dat in de samengestelde matchscore terechtkomt. Die grens staat vast, want elke verzonnen of gehallucineerde eigenschap van een kandidaat die in de scoring belandt, is een fout in een beslissing met grote gevolgen voor iemands loopbaan.

Onderzoek laat zien dat het risico echt is. Een scoping review in Frontiers in Artificial Intelligence uit 2026 ("Mapping the use of large language models in hiring decisions") vond weinig empirisch bewijs dat maatregelen tegen hallucinaties in operationele wervingsprocessen werken. Een arXiv-preprint uit juli 2025 (arXiv:2507.02087) vergeleek algemene LLM's met een specifiek matchscoremodel op ongeveer 10.000 echte combinaties van kandidaat en vacature en vond dat ongecontroleerde LLM-scoring risico's oplevert voor nauwkeurigheid en fairness die speciaal gebouwde systemen vermijden.

Hoe de modellen van Selection Lab gelaagd zijn

Selection Lab werkt met drie soorten modellen.

  1. Lokale LLM-laag. Deze laag begrijpt het gesprek in SmartChat, haalt persoonsgegevens uit documenten en verwijdert die. SmartChat antwoordt binnen 10 seconden via WhatsApp of webchat en doet de cv-check, de intakevragen en het inplannen van een afspraak (Selection Lab Main Deck 2026). Persoonsgegevens staan opgeslagen in Frankfurt en worden uit de gesprekscontext gehaald voordat er iets verder wordt verwerkt.

  2. Psychometrische en game-based assessments. Gevalideerde instrumenten die soft skills, cognitieve capaciteiten, situationeel oordeel en culturele fit meten. Ze leveren gestructureerde data op itemniveau, geen vrije tekst.

  3. Matching en samengestelde scoring op basis van ML. Deze service neemt genormaliseerde scores uit de assessments en combineert die tot de matchscore die in de ATS-rapportage staat. Hier komt geen enkele LLM-uitkomst binnen.

Het lokaal verwijderen van persoonsgegevens met een LLM is een praktische beheersmaatregel. Doordat identificerende gegevens uit gesprekslogs verdwijnen voordat die verder worden verwerkt, is er weinig ruimte voor een gehallucineerd persoonsgegeven om in een systeemrecord terecht te komen.

Wat er per stap in en uit gaat

StapInputOutput
Intake / SmartChatWhatsApp- of webchatberichten, geüpload cvGestructureerde antwoorden, geanonimiseerd gesprekslog, ingeplande afspraak
AssessmentHard skills tests, game-based assessments, SJT-antwoordenItemscores, antwoordvectoren
Samengestelde scoringGenormaliseerde scores, wegingen per functieprofielMatchscore, geschiktheidssignaal
Rapportage voor recruitersMatchscore, subscores van assessmentsRapport in het ATS, gestructureerde interviewvragen

De kandidaat ziet zijn resultaten als eerste. Delen met een recruiter vraagt om vernieuwde toestemming (Selection Lab Main Deck 2026). Die toestemmingslaag doet ertoe. Een onjuiste of gehallucineerde eigenschap kan de kandidaat aanvechten voordat die ooit een selectiebeslissing bereikt.

Hoe een matchscore tot stand komt

De scoringspijplijn werkt zo. Uitkomsten van gevalideerde assessments worden genormaliseerd tot scores, gecombineerd volgens functiespecifieke wegingen en als matchscore getoond in het ATS. Interviewvragen komen uit de gestructureerde assessmentresultaten, niet uit vrije tekst van een LLM.

Een concreet voorbeeld. Een functieprofiel voor logistiek geeft gewichten aan cognitieve snelheid, instructies opvolgen en betrouwbaarheid. De game-based en psychometrische assessments van een kandidaat leveren itemscores op precies die dimensies. De scoringsservice vermenigvuldigt die scores met de functiegewichten en produceert een matchscore. De interviewvragen die de recruiter in het ATS ziet, verwijzen naar dimensies waarop de kandidaat laag scoorde in het assessment. Nergens in die keten verzint een LLM iets over de kandidaat.

Alle inputs voor de scoring worden bewaard. Versiebeheer maakt het mogelijk om achteraf te controleren welke scoringslogica op welk moment gold.

Wat recruiters in de praktijk zien

Recruiters die met Selection Lab werken, krijgen geen narratieve AI-samenvattingen. Juist daar is het risico op hallucinaties het grootst. Ze zien wel dit.

  • Een gestructureerde matchscore met zichtbare subdimensies
  • Een geschiktheidsstatus op basis van knock-outcriteria
  • Voorgestelde interviewvragen die direct aan assessmentuitkomsten hangen

AI automatiseert de intake en zet de juiste volgende stap klaar, maar de selectiebeslissing rust op gevalideerde assessments, niet op verzonnen feiten. Vrije tekst van kandidaten wordt geen "feit" dat meetelt in de ranking. Dat is wat het voorkomen van hallucinaties in de praktijk betekent voor een recruiter. Het systeem verzint niets over een kandidaat dat die kandidaat niet zelf heeft laten zien.

Kandidaten hebben er ook baat bij. Doordat SmartChat binnen 10 seconden reageert, krijgen ze tijdens de intake direct antwoord op hun vragen, en ze bekijken hun eigen resultaten voordat er iets wordt gedeeld.

Technische bijlage voor engineers en auditors

Architectuur in het kort

SmartChat (gesprekslaag)
  └─> Lokale LLM-laag voor redactie (verwijdert persoonsgegevens uit de gesprekscontext)
        └─> Assessmentengines (gevalideerd psychometrisch / game-based / hard skills)
              └─> Normalisatie van scores
                    └─> Samengestelde scoring (ML-weging, functieprofiel)
                          └─> ATS-integratie (matchscore, interviewvragen, rapporten)

Maatregelen tegen hallucinaties

Allowlist-architectuur. LLM-uitkomsten zijn beperkt tot vastgelegde actietypen (bericht sturen, afspraak inplannen, veld uitlezen). Numerieke scoring staat niet op die lijst. Elke LLM-uitkomst die een score of geschiktheidssignaal probeert te produceren, wordt weggegooid.

TEVV-aanpak (NIST AI RMF). Het AI Risk Management Framework van NIST (AI RMF 1.0) kent vier kernfuncties, Govern, Map, Measure en Manage. NIST AI 600-1, het profiel voor generatieve AI, benoemt confabulatie expliciet als risico dat gemeten en beheerst moet worden. Selection Lab evalueert modeluitkomsten offline, doet red-teaming gericht op prompt injection en hallucinatiepogingen, en controleert dat geen verzonnen claims in scoringsfeatures terechtkomen.

Runtime-controles. Generatie blijft beperkt tot antwoorden die zijn verankerd in wat de kandidaat zelf heeft aangeleverd. Bij lage zekerheid valt het systeem terug op veilige standaardantwoorden in plaats van te speculeren. Outputfiltering voorkomt dat gehallucineerde persoonsgegevens in een opgeslagen log verschijnen.

Wettelijk kader

Onder de EU AI Act, bijlage III (artikel 6, lid 2), gelden AI-systemen voor werving, personeelsbeheer en toegang tot zelfstandig werk als hoog risico. Tools voor het screenen en rangschikken van kandidaten vallen daaronder. Systemen met hoog risico moeten voor ingebruikname voldoen aan eisen voor documentatie, transparantie, menselijk toezicht en nauwkeurigheid.

De architectuur van Selection Lab is ontworpen om aan die eisen te voldoen. De scoring is gebaseerd op gevalideerde gestructureerde signalen, de scoringslogica is geversioneerd en controleerbaar, kandidaten zien resultaten voordat ze gedeeld worden en recruiters houden de eindbeslissing. Voor organisaties die een AI-inkoopaudit doen, zijn dit de minimale voorwaarden voor verdedigbaar gebruik van AI in selectie.

Voor de AVG geldt dat alle persoonsgegevens in Frankfurt staan en dat de lokale LLM-laag persoonsgegevens uit de gespreksverwerking verwijdert voordat die gedeelde infrastructuur raakt.

Veelgestelde vragen over LLM's en kandidaatscores

Gebruikt Selection Lab AI om kandidaten te scoren?

Niet met een taalmodel. LLM's doen het gesprek in SmartChat, de verwerking van cv-tekst en het verwijderen van persoonsgegevens. De matchscore komt uit gevalideerde psychometrische en game-based assessments, gewogen per functieprofiel. Geen enkele LLM-uitkomst komt in die score terecht.

Wat is een hallucinatie van een LLM in recruitment?

Een taalmodel dat iets over een kandidaat beweert wat de kandidaat nooit heeft aangeleverd of laten zien. Denk aan een verzonnen vaardigheid, een niet-bestaande werkervaring of een eigenschap die uit vrije tekst wordt afgeleid. Komt zo'n bewering in een score terecht, dan beslis je op basis van iets wat niet bestaat.

Hoe voorkomt Selection Lab hallucinaties in de selectiebeslissing?

Met een allowlist-architectuur. LLM-uitkomsten zijn beperkt tot vastgelegde acties zoals een bericht sturen, een afspraak inplannen of een veld uitlezen. Elke poging om een score of geschiktheidssignaal te produceren wordt weggegooid. Generatie blijft verankerd in wat de kandidaat zelf heeft aangeleverd en een lokale laag verwijdert persoonsgegevens voordat er iets verder wordt verwerkt.

Wat ziet een recruiter in het ATS?

Een gestructureerde matchscore met zichtbare subdimensies, een geschiktheidsstatus op basis van knock-outcriteria en voorgestelde interviewvragen die aan specifieke assessmentuitkomsten hangen. Er zijn geen narratieve AI-samenvattingen over de kandidaat, want daar is het risico op hallucinaties het grootst.

Valt AI-screening van kandidaten onder hoog risico in de EU AI Act?

Ja. Bijlage III rekent AI-systemen voor werving, screening en het rangschikken van kandidaten tot hoog risico. Dat brengt eisen mee voor documentatie, transparantie, menselijk toezicht en nauwkeurigheid. De geversioneerde, controleerbare scoringslogica van Selection Lab en het principe dat de kandidaat zijn resultaten als eerste ziet, zijn op die classificatie ontworpen.

FAQ

Kunnen game-based assessments de diversiteit in het wervingsproces bevorderen?

Ja, game-based assessments kunnen de diversiteit bevorderen door de focus te leggen op vaardigheden en gedrag in plaats van op traditionele criteria zoals cv's, die onbewuste vooroordelen kunnen bevatten. Hierdoor krijgen kandidaten met uiteenlopende achtergronden een gelijke kans om hun potentieel te demonstreren.

Wat is een game-based assessment?

Een game-based assessment is een testmethode die gebruikmaakt van spelmechanismen om de vaardigheden, competenties en persoonlijkheidskenmerken van kandidaten te evalueren. Tijdens het spelen van deze games worden verschillende aspecten, zoals probleemoplossend vermogen, cognitieve capaciteiten en gedrag onder druk, op een interactieve manier beoordeeld.

Wat zijn de voordelen van game-based assessments?

Game-based assessments kunnen een interactieve en boeiende ervaring bieden voor kandidaten, wat voor bepaalde doelgroepen kan bijdragen aan een positiever beeld van het sollicitatieproces. Voor werkgevers kunnen deze assessments diepgaand inzicht geven in zowel cognitieve als gedragsmatige kwaliteiten op een manier die traditionele tests mogelijk niet bieden. Daarnaast kunnen ze de kans op sociaal wenselijk gedrag verminderen, omdat kandidaten in een game-omgeving vaak meer authentiek en spontaan reageren.

Hoe betrouwbaar zijn game-based assessments vergeleken met traditionele tests?

Als ze goed ontworpen zijn, kunnen game-based assessments even betrouwbaar en in sommige gevallen zelfs betrouwbaarder zijn dan traditionele tests, omdat ze een breed scala aan gedragsindicatoren en cognitieve vaardigheden meten in een dynamische setting. Er is echter wel een groot verschil in kwaliteit tussen de verschillende game-based assessments, dus let hier goed op.

Hoe werkt een game-based assessment?

Bij een game-based assessment nemen kandidaten deel aan interactieve spellen die zijn ontworpen om specifieke vaardigheden en gedragingen te meten. Tijdens het spel wordt niet alleen het eindresultaat geanalyseerd, maar ook hoe de kandidaat beslissingen neemt, reageert op uitdagingen en omgaat met verschillende scenario's. Deze observaties geven inzicht in hun denkprocessen en gedragspatronen.

Zijn game-based assessments wetenschappelijk onderbouwd?

Het grote nadeel van game based assessments is dat ze relatief nieuw zijn, dus dat veel game-based assessments nog niet tot nauwelijks onderzocht zijn door onafhankelijke onderzoekers. Veel partijen halen hun eigen onderzoek(en) aan, maar dit is zelden onafhankelijk getoetst. Zonder onafhankelijk onderzoek kun je de betrouwbaarheid van game based assessments niet zeker weten. Wees je hiervan bewust bij het selecteren van het best passende assessment.

Hoe kunnen game-based assessments bijdragen aan een betere kandidaatervaring?

Dit verschilt sterk per doelgroep. Doordat game-based assessments speels en interactief zijn, ervaren bepaalde groepen kandidaten minder stress dan bij traditionele tests. Onderzoek toont aan dat bepaalde doelgroepen (met name kandidaten boven de 35 jaar) juist meer stress ervaren van een game. Ook komt uit onderzoek dat mannen games als positiever ervaren dan vrouwen.

Kun je game-based assessments oefenen?

Hoewel je je kunt vertrouwd maken met het type games dat wordt gebruikt, zijn game-based assessments moeilijk specifiek te oefenen. Ze zijn ontworpen om natuurlijke reacties en authentiek gedrag te meten, waardoor repetitieve oefening minder invloed heeft op de uitkomst dan bij traditionele tests.

Zullen game-based assessments traditionele tests vervangen in de toekomst?

Het is waarschijnlijk dat game-based assessments een grotere rol zullen spelen in toekomstige wervingsprocessen, maar een volledige vervanging van traditionele tests is onzeker. Beide methoden kunnen elkaar aanvullen en worden ingezet afhankelijk van de specifieke eisen van de functie en de voorkeuren van het bedrijf.

Hoe worden de resultaten van een game-based assessment geanalyseerd en geïnterpreteerd?

De resultaten van een game-based assessment worden geanalyseerd op basis van vooraf vastgestelde parameters zoals probleemoplossend vermogen, reactietijd en gedrag onder druk. Geavanceerde algoritmen verzamelen en verwerken automatisch de data om een objectieve en betrouwbare beoordeling van de competenties en vaardigheden van de kandidaat te bieden.

Welke vaardigheden worden gemeten in een game-based assessment?

Game-based assessments meten een breed scala aan vaardigheden. Ze evalueren bijvoorbeeld het probleemoplossend vermogen, het aanpassingsvermogen, de besluitvorming onder druk, samenwerking en emotionele intelligentie van een kandidaat. Afhankelijk van het specifieke ontwerp kunnen ook cognitieve vaardigheden zoals geheugen, aandacht en patroonherkenning worden beoordeeld.

Hoe lang duurt een game-based assessment?

De duur van een game-based assessment varieert, maar meestal duurt het tussen de 15 en 60 minuten. Dit hangt af van de complexiteit van de game en het aantal vaardigheden dat wordt gemeten. Vaak zijn deze assessments korter en interactiever dan traditionele tests, wat kan bijdragen aan een speelse kandidaatervaring.

Zijn game-based assessments geschikt voor alle functies?

Game-based assessments zijn vooral geschikt voor functies waarbij cognitieve flexibiliteit, creativiteit, probleemoplossend vermogen en interpersoonlijke vaardigheden cruciaal zijn. Voor zeer technische of specialistische rollen kunnen aanvullende tests of evaluaties nodig zijn om specifieke kennis en expertise te meten.

Wat is het verschil tussen een game-based assessment en een gamified assessment?

Het verschil tussen een game-based assessment en een gamified assessment ligt in de mate waarin speltechnieken worden geïntegreerd. Bij een gamified assessment worden traditionele tests verrijkt met spelelementen om de betrokkenheid te vergroten, terwijl bij een game-based assessment de game zelf het primaire instrument is voor evaluatie. In een game-based assessment worden kandidaten beoordeeld op basis van hun interactie binnen de game, die is ontworpen om specifieke competenties te meten.

FAQ

Hoe kan ik het retentiepercentage van mijn bedrijf verbeteren?

Het retentiepercentage kan worden verbeterd door te investeren in de ontwikkeling en tevredenheid van medewerkers. Dit omvat het aanbieden van trainingen, carrièrekansen en erkenning voor hun bijdragen. Een open communicatiecultuur en aandacht voor werk-privébalans kunnen eveneens bijdragen aan hogere retentie. Daarnaast kan het bieden van concurrerende arbeidsvoorwaarden en het betrekken van medewerkers bij besluitvorming de loyaliteit versterken.

Wat zijn de voordelen van doorgroeimogelijkheden voor personeelsbehoud?

Doorgroeimogelijkheden kunnen het behoud van personeel bevorderen door medewerkers een gevoel van richting en motivatie te geven. Wanneer zij de kans krijgen om te leren en zich professioneel te ontwikkelen binnen het bedrijf, voelen zij zich gewaardeerd, wat hun loyaliteit vergroot. Dit kan voorkomen dat ze vertrekken om elders betere kansen te zoeken.

Wat zijn de belangrijkste factoren die personeelsretentie beïnvloeden?

Belangrijke factoren die personeelsretentie beïnvloeden zijn onder meer salaris en secundaire arbeidsvoorwaarden, mogelijkheden voor professionele ontwikkeling, werk-privébalans, bedrijfscultuur en de relatie met leidinggevenden. Medewerkers blijven vaak langer wanneer ze zich gewaardeerd, uitgedaagd en ondersteund voelen in hun werkomgeving.

Waarom is personeelsretentie zo belangrijk voor organisaties?

Personeelsretentie is belangrijk omdat het helpt bij het verminderen van kosten voor werving en training van nieuwe medewerkers, en bijdraagt aan het behoud van kennis en ervaring binnen de organisatie. Een hoge retentie zorgt ook voor continuïteit binnen teams, wat kan leiden tot een stabielere bedrijfscultuur, hogere klanttevredenheid en verbeterde bedrijfsresultaten.

Welke wervingsstrategieën helpen bij het verhogen van retentie?

Wervingsstrategieën die de retentie kunnen verhogen, omvatten het identificeren van kandidaten die passen bij de bedrijfscultuur, het gebruik van assessments om soft skills te evalueren en het bieden van transparantie over rolverwachtingen tijdens het sollicitatieproces. Medewerkers die zich verbonden voelen met de organisatie en duidelijkheid hebben over hun functie, zijn geneigd langer te blijven.

Hoe kan een goed onboardingsproces bijdragen aan hogere retentie?

Een effectief onboardingsproces kan bijdragen aan hogere retentie door nieuwe medewerkers te helpen zich snel aan te passen aan hun rol, de bedrijfscultuur en de verwachtingen. Door vanaf het begin ondersteuning en duidelijke informatie te bieden, wordt hun betrokkenheid vergroot en de kans verkleind dat ze vroegtijdig vertrekken vanwege gevoelens van overweldiging of gebrek aan begeleiding.

Wat is de rol van bedrijfscultuur in het behoud van personeel?

De bedrijfscultuur speelt een cruciale rol in het behoud van personeel. Wanneer medewerkers zich gehoord, gewaardeerd en verbonden voelen met de waarden en normen van het bedrijf, is de kans groter dat ze blijven. Een positieve cultuur die samenwerking, respect en persoonlijke groei stimuleert, kan de motivatie en tevredenheid van medewerkers aanzienlijk vergroten.

Hoe kunnen leiderschap en managementstijl de retentie beïnvloeden?

Leiderschap en managementstijl hebben een significante invloed op retentie. Leiders die hun team inspireren, ondersteunen en coachen, kunnen de betrokkenheid en tevredenheid van medewerkers verhogen. Het bieden van autonomie en vertrouwen kan leiden tot hogere loyaliteit, terwijl een inefficiënte of negatieve managementstijl kan bijdragen aan ontevredenheid en verhoogd personeelsverloop.

Wat is het belang van erkenning en beloningen voor personeelsbehoud?

Erkenning en beloningen spelen een belangrijke rol in personeelsbehoud door medewerkers te laten zien dat hun werk wordt gewaardeerd. Dit kan hun motivatie en loyaliteit verhogen. Naast financiële beloningen kunnen ook complimenten, promoties en andere vormen van erkenning bijdragen aan tevredenheid en het behouden van personeel.

Welke rol speelt werk-privébalans in het verhogen van retentie?

Een evenwichtige werk-privébalans speelt een belangrijke rol in het verhogen van retentie. Door stress te verminderen en werktevredenheid te vergroten, blijven medewerkers vaak langer bij het bedrijf. Initiatieven zoals flexibele werktijden, mogelijkheden voor thuiswerken en respect voor persoonlijke tijd kunnen bijdragen aan deze balans.

Wat betekent retentie verhogen binnen een bedrijf?

Retentie verhogen binnen een bedrijf houdt in dat je strategieën implementeert om medewerkers langer aan de organisatie te binden. Dit kan door het verbeteren van werktevredenheid, het aanbieden van doorgroeimogelijkheden en het bevorderen van een positieve en ondersteunende bedrijfscultuur.

Hoe meet ik het succes van mijn retentiestrategie?

Het succes van een retentiestrategie kan worden gemeten door het bijhouden van retentiepercentages en verloopcijfers, en door inzichten te verkrijgen uit exitgesprekken. Daarnaast kunnen enquêtes over medewerkerstevredenheid en feedback uit evaluatiegesprekken waardevolle informatie bieden over de effectiviteit van de toegepaste strategieën.

Wat zijn de kosten van een laag retentiepercentage?

Een laag retentiepercentage kan aanzienlijke kosten met zich meebrengen, zoals verhoogde uitgaven voor werving en training van nieuwe medewerkers. Bovendien kan het verlies van ervaren personeel leiden tot lagere productiviteit, verminderde kennisoverdracht en een negatieve invloed op de bedrijfscultuur.

Hoe kan ik medewerkersbetrokkenheid verhogen?

Om medewerkersbetrokkenheid te verhogen, kun je hen betrekken bij besluitvormingsprocessen, regelmatig om hun feedback vragen en erkenning geven voor hun bijdragen. Het aanbieden van ontwikkelingsmogelijkheden en het onderhouden van transparante communicatie kunnen eveneens bijdragen aan een grotere betrokkenheid.

Hoe kan technologie helpen bij het verbeteren van personeelsretentie?

Technologie kan een hulpmiddel zijn bij het verbeteren van personeelsretentie door het faciliteren van communicatie, feedback en ontwikkeling. Door gebruik te maken van online platforms voor training, erkenning en evaluatie, kunnen bedrijven een meer betrokken en tevreden personeelsbestand creëren.

FAQ

Hoe lang duurt het om de tool te doorlopen?

Minder dan 10 minuten. Je doorloopt 30 vragen en krijgt daarna een overzicht van waar je op moet letten bij je volgende assessmentplatform.

Helpt deze checklist bij het vergelijken van assessmentaanbieders?

Ja. Doordat je scherp krijgt wat voor jouw team echt belangrijk is, wordt het vergelijken van functionaliteit, prijs en sterke punten van aanbieders eenvoudiger en strategischer.

Hoe gebruik ik deze checklist zonder formele RFI?

De checklist is net zo waardevol voor een interne evaluatie, voor het verkennen van nieuwe tools of voor het verbeteren van je huidige selectieproces, ook als je geen RFI of RFQ uitzet.

Waar moet je op letten bij een modern assessmentplatform?

Geef voorrang aan platformen met een gebruiksvriendelijk ontwerp, goede werking op mobiel, sterke analytics, koppelingen met je ATS en inclusieve functionaliteit zoals ondersteuning voor neurodiversiteit.

Welke soorten assessments zijn in 2026 relevant?

De sterkste platformen combineren capaciteitentesten, situational judgement tests, gedragsassessments en voorspellende AI, zodat je een kandidaat completer beoordeelt dan met één los instrument.

Voor wie is een assessmentchecklist bedoeld?

Voor HR-professionals, hiring managers en inkoopteams die oplossingen voor voorselectie beoordelen, en in het bijzonder voor wie AI-gestuurde of compliance-gedreven assessmentplatformen met elkaar vergelijkt.

Hoe helpt deze checklist bij een RFI of RFQ voor assessments?

Met de checklist breng je je eisen scherp in kaart, zodat je met vertrouwen een Request for Information of Request for Quotation voor assessmenttools kunt opstellen of beantwoorden.

Wat is een assessmenttool in werving en selectie?

Een assessmenttool beoordeelt de vaardigheden, het gedrag en de match van kandidaten tijdens het wervingsproces. Daarmee onderbouw je aannamebeslissingen beter en verloopt de voorselectie soepeler.

Game-based assessment packs

← Blog

Hoe Selection Lab hallucinaties van LLM's buiten de kandidaatscore houdt

Gebruikt Selection Lab LLM's om kandidaten te scoren? Nee. Zo blijft de matchscore gebaseerd op gevalideerde assessments.
Joeri Everaers
COO
Leestijd: ca.

Gebruikt Selection Lab LLM's om kandidaten te scoren?
Nee. Taalmodellen doen bij Selection Lab het gesprek met de kandidaat, de verwerking van cv-tekst en het verwijderen van persoonsgegevens. De matchscore komt uitsluitend uit gevalideerde assessments, gewogen per functieprofiel. Geen enkele LLM-uitkomst komt in die score terecht, zodat een verzonnen eigenschap nooit een selectiebeslissing kan beïnvloeden.

Dit artikel beantwoordt een vraag die elke CHRO, HR-directeur en auditor van HR-technologie aan een leverancier van AI-recruitmentsoftware zou moeten stellen. Gebruik je large language models (LLM's) voor het scoren van kandidaten, en zo ja, hoe voorkom je dat hallucinaties de selectiebeslissing beïnvloeden?

Gebruiken selectietools LLM's om kandidaten te scoren?

Veel recruitmenttools gebruiken inmiddels ergens in hun stack een LLM. De vraag die telt is waar. Een taalmodel dat een intakegesprek voert is iets heel anders dan een taalmodel dat bepaalt op welke plek een kandidaat in de ranglijst komt of of iemand door mag. Wie die twee door elkaar haalt, neemt een groot risico.

In de architectuur van Selection Lab is de scheiding expliciet.

  • LLM's doen het gesprek met de kandidaat in SmartChat, de verwerking van cv-tekst, de aansturing van de workflow en het verwijderen van persoonsgegevens.
  • Gestructureerde ML-modellen en gevalideerde assessments doen de numerieke scoring, de knock-outcriteria en de match per functie.

Een LLM mag in dit systeem een conceptuitleg of een gespreksantwoord geven. Het mag geen getal produceren dat in de samengestelde matchscore terechtkomt. Die grens staat vast, want elke verzonnen of gehallucineerde eigenschap van een kandidaat die in de scoring belandt, is een fout in een beslissing met grote gevolgen voor iemands loopbaan.

Onderzoek laat zien dat het risico echt is. Een scoping review in Frontiers in Artificial Intelligence uit 2026 ("Mapping the use of large language models in hiring decisions") vond weinig empirisch bewijs dat maatregelen tegen hallucinaties in operationele wervingsprocessen werken. Een arXiv-preprint uit juli 2025 (arXiv:2507.02087) vergeleek algemene LLM's met een specifiek matchscoremodel op ongeveer 10.000 echte combinaties van kandidaat en vacature en vond dat ongecontroleerde LLM-scoring risico's oplevert voor nauwkeurigheid en fairness die speciaal gebouwde systemen vermijden.

Hoe de modellen van Selection Lab gelaagd zijn

Selection Lab werkt met drie soorten modellen.

  1. Lokale LLM-laag. Deze laag begrijpt het gesprek in SmartChat, haalt persoonsgegevens uit documenten en verwijdert die. SmartChat antwoordt binnen 10 seconden via WhatsApp of webchat en doet de cv-check, de intakevragen en het inplannen van een afspraak (Selection Lab Main Deck 2026). Persoonsgegevens staan opgeslagen in Frankfurt en worden uit de gesprekscontext gehaald voordat er iets verder wordt verwerkt.

  2. Psychometrische en game-based assessments. Gevalideerde instrumenten die soft skills, cognitieve capaciteiten, situationeel oordeel en culturele fit meten. Ze leveren gestructureerde data op itemniveau, geen vrije tekst.

  3. Matching en samengestelde scoring op basis van ML. Deze service neemt genormaliseerde scores uit de assessments en combineert die tot de matchscore die in de ATS-rapportage staat. Hier komt geen enkele LLM-uitkomst binnen.

Het lokaal verwijderen van persoonsgegevens met een LLM is een praktische beheersmaatregel. Doordat identificerende gegevens uit gesprekslogs verdwijnen voordat die verder worden verwerkt, is er weinig ruimte voor een gehallucineerd persoonsgegeven om in een systeemrecord terecht te komen.

Wat er per stap in en uit gaat

StapInputOutput
Intake / SmartChatWhatsApp- of webchatberichten, geüpload cvGestructureerde antwoorden, geanonimiseerd gesprekslog, ingeplande afspraak
AssessmentHard skills tests, game-based assessments, SJT-antwoordenItemscores, antwoordvectoren
Samengestelde scoringGenormaliseerde scores, wegingen per functieprofielMatchscore, geschiktheidssignaal
Rapportage voor recruitersMatchscore, subscores van assessmentsRapport in het ATS, gestructureerde interviewvragen

De kandidaat ziet zijn resultaten als eerste. Delen met een recruiter vraagt om vernieuwde toestemming (Selection Lab Main Deck 2026). Die toestemmingslaag doet ertoe. Een onjuiste of gehallucineerde eigenschap kan de kandidaat aanvechten voordat die ooit een selectiebeslissing bereikt.

Hoe een matchscore tot stand komt

De scoringspijplijn werkt zo. Uitkomsten van gevalideerde assessments worden genormaliseerd tot scores, gecombineerd volgens functiespecifieke wegingen en als matchscore getoond in het ATS. Interviewvragen komen uit de gestructureerde assessmentresultaten, niet uit vrije tekst van een LLM.

Een concreet voorbeeld. Een functieprofiel voor logistiek geeft gewichten aan cognitieve snelheid, instructies opvolgen en betrouwbaarheid. De game-based en psychometrische assessments van een kandidaat leveren itemscores op precies die dimensies. De scoringsservice vermenigvuldigt die scores met de functiegewichten en produceert een matchscore. De interviewvragen die de recruiter in het ATS ziet, verwijzen naar dimensies waarop de kandidaat laag scoorde in het assessment. Nergens in die keten verzint een LLM iets over de kandidaat.

Alle inputs voor de scoring worden bewaard. Versiebeheer maakt het mogelijk om achteraf te controleren welke scoringslogica op welk moment gold.

Wat recruiters in de praktijk zien

Recruiters die met Selection Lab werken, krijgen geen narratieve AI-samenvattingen. Juist daar is het risico op hallucinaties het grootst. Ze zien wel dit.

  • Een gestructureerde matchscore met zichtbare subdimensies
  • Een geschiktheidsstatus op basis van knock-outcriteria
  • Voorgestelde interviewvragen die direct aan assessmentuitkomsten hangen

AI automatiseert de intake en zet de juiste volgende stap klaar, maar de selectiebeslissing rust op gevalideerde assessments, niet op verzonnen feiten. Vrije tekst van kandidaten wordt geen "feit" dat meetelt in de ranking. Dat is wat het voorkomen van hallucinaties in de praktijk betekent voor een recruiter. Het systeem verzint niets over een kandidaat dat die kandidaat niet zelf heeft laten zien.

Kandidaten hebben er ook baat bij. Doordat SmartChat binnen 10 seconden reageert, krijgen ze tijdens de intake direct antwoord op hun vragen, en ze bekijken hun eigen resultaten voordat er iets wordt gedeeld.

Technische bijlage voor engineers en auditors

Architectuur in het kort

SmartChat (gesprekslaag)
  └─> Lokale LLM-laag voor redactie (verwijdert persoonsgegevens uit de gesprekscontext)
        └─> Assessmentengines (gevalideerd psychometrisch / game-based / hard skills)
              └─> Normalisatie van scores
                    └─> Samengestelde scoring (ML-weging, functieprofiel)
                          └─> ATS-integratie (matchscore, interviewvragen, rapporten)

Maatregelen tegen hallucinaties

Allowlist-architectuur. LLM-uitkomsten zijn beperkt tot vastgelegde actietypen (bericht sturen, afspraak inplannen, veld uitlezen). Numerieke scoring staat niet op die lijst. Elke LLM-uitkomst die een score of geschiktheidssignaal probeert te produceren, wordt weggegooid.

TEVV-aanpak (NIST AI RMF). Het AI Risk Management Framework van NIST (AI RMF 1.0) kent vier kernfuncties, Govern, Map, Measure en Manage. NIST AI 600-1, het profiel voor generatieve AI, benoemt confabulatie expliciet als risico dat gemeten en beheerst moet worden. Selection Lab evalueert modeluitkomsten offline, doet red-teaming gericht op prompt injection en hallucinatiepogingen, en controleert dat geen verzonnen claims in scoringsfeatures terechtkomen.

Runtime-controles. Generatie blijft beperkt tot antwoorden die zijn verankerd in wat de kandidaat zelf heeft aangeleverd. Bij lage zekerheid valt het systeem terug op veilige standaardantwoorden in plaats van te speculeren. Outputfiltering voorkomt dat gehallucineerde persoonsgegevens in een opgeslagen log verschijnen.

Wettelijk kader

Onder de EU AI Act, bijlage III (artikel 6, lid 2), gelden AI-systemen voor werving, personeelsbeheer en toegang tot zelfstandig werk als hoog risico. Tools voor het screenen en rangschikken van kandidaten vallen daaronder. Systemen met hoog risico moeten voor ingebruikname voldoen aan eisen voor documentatie, transparantie, menselijk toezicht en nauwkeurigheid.

De architectuur van Selection Lab is ontworpen om aan die eisen te voldoen. De scoring is gebaseerd op gevalideerde gestructureerde signalen, de scoringslogica is geversioneerd en controleerbaar, kandidaten zien resultaten voordat ze gedeeld worden en recruiters houden de eindbeslissing. Voor organisaties die een AI-inkoopaudit doen, zijn dit de minimale voorwaarden voor verdedigbaar gebruik van AI in selectie.

Voor de AVG geldt dat alle persoonsgegevens in Frankfurt staan en dat de lokale LLM-laag persoonsgegevens uit de gespreksverwerking verwijdert voordat die gedeelde infrastructuur raakt.

Veelgestelde vragen over LLM's en kandidaatscores

Gebruikt Selection Lab AI om kandidaten te scoren?

Niet met een taalmodel. LLM's doen het gesprek in SmartChat, de verwerking van cv-tekst en het verwijderen van persoonsgegevens. De matchscore komt uit gevalideerde psychometrische en game-based assessments, gewogen per functieprofiel. Geen enkele LLM-uitkomst komt in die score terecht.

Wat is een hallucinatie van een LLM in recruitment?

Een taalmodel dat iets over een kandidaat beweert wat de kandidaat nooit heeft aangeleverd of laten zien. Denk aan een verzonnen vaardigheid, een niet-bestaande werkervaring of een eigenschap die uit vrije tekst wordt afgeleid. Komt zo'n bewering in een score terecht, dan beslis je op basis van iets wat niet bestaat.

Hoe voorkomt Selection Lab hallucinaties in de selectiebeslissing?

Met een allowlist-architectuur. LLM-uitkomsten zijn beperkt tot vastgelegde acties zoals een bericht sturen, een afspraak inplannen of een veld uitlezen. Elke poging om een score of geschiktheidssignaal te produceren wordt weggegooid. Generatie blijft verankerd in wat de kandidaat zelf heeft aangeleverd en een lokale laag verwijdert persoonsgegevens voordat er iets verder wordt verwerkt.

Wat ziet een recruiter in het ATS?

Een gestructureerde matchscore met zichtbare subdimensies, een geschiktheidsstatus op basis van knock-outcriteria en voorgestelde interviewvragen die aan specifieke assessmentuitkomsten hangen. Er zijn geen narratieve AI-samenvattingen over de kandidaat, want daar is het risico op hallucinaties het grootst.

Valt AI-screening van kandidaten onder hoog risico in de EU AI Act?

Ja. Bijlage III rekent AI-systemen voor werving, screening en het rangschikken van kandidaten tot hoog risico. Dat brengt eisen mee voor documentatie, transparantie, menselijk toezicht en nauwkeurigheid. De geversioneerde, controleerbare scoringslogica van Selection Lab en het principe dat de kandidaat zijn resultaten als eerste ziet, zijn op die classificatie ontworpen.