Gebruikt Selection Lab LLM's om kandidaten te scoren?
Nee. Taalmodellen doen bij Selection Lab het gesprek met de kandidaat, de verwerking van cv-tekst en het verwijderen van persoonsgegevens. De matchscore komt uitsluitend uit gevalideerde assessments, gewogen per functieprofiel. Geen enkele LLM-uitkomst komt in die score terecht, zodat een verzonnen eigenschap nooit een selectiebeslissing kan beïnvloeden.
Dit artikel beantwoordt een vraag die elke CHRO, HR-directeur en auditor van HR-technologie aan een leverancier van AI-recruitmentsoftware zou moeten stellen. Gebruik je large language models (LLM's) voor het scoren van kandidaten, en zo ja, hoe voorkom je dat hallucinaties de selectiebeslissing beïnvloeden?
Veel recruitmenttools gebruiken inmiddels ergens in hun stack een LLM. De vraag die telt is waar. Een taalmodel dat een intakegesprek voert is iets heel anders dan een taalmodel dat bepaalt op welke plek een kandidaat in de ranglijst komt of of iemand door mag. Wie die twee door elkaar haalt, neemt een groot risico.
In de architectuur van Selection Lab is de scheiding expliciet.
Een LLM mag in dit systeem een conceptuitleg of een gespreksantwoord geven. Het mag geen getal produceren dat in de samengestelde matchscore terechtkomt. Die grens staat vast, want elke verzonnen of gehallucineerde eigenschap van een kandidaat die in de scoring belandt, is een fout in een beslissing met grote gevolgen voor iemands loopbaan.
Onderzoek laat zien dat het risico echt is. Een scoping review in Frontiers in Artificial Intelligence uit 2026 ("Mapping the use of large language models in hiring decisions") vond weinig empirisch bewijs dat maatregelen tegen hallucinaties in operationele wervingsprocessen werken. Een arXiv-preprint uit juli 2025 (arXiv:2507.02087) vergeleek algemene LLM's met een specifiek matchscoremodel op ongeveer 10.000 echte combinaties van kandidaat en vacature en vond dat ongecontroleerde LLM-scoring risico's oplevert voor nauwkeurigheid en fairness die speciaal gebouwde systemen vermijden.
Selection Lab werkt met drie soorten modellen.
Lokale LLM-laag. Deze laag begrijpt het gesprek in SmartChat, haalt persoonsgegevens uit documenten en verwijdert die. SmartChat antwoordt binnen 10 seconden via WhatsApp of webchat en doet de cv-check, de intakevragen en het inplannen van een afspraak (Selection Lab Main Deck 2026). Persoonsgegevens staan opgeslagen in Frankfurt en worden uit de gesprekscontext gehaald voordat er iets verder wordt verwerkt.
Psychometrische en game-based assessments. Gevalideerde instrumenten die soft skills, cognitieve capaciteiten, situationeel oordeel en culturele fit meten. Ze leveren gestructureerde data op itemniveau, geen vrije tekst.
Matching en samengestelde scoring op basis van ML. Deze service neemt genormaliseerde scores uit de assessments en combineert die tot de matchscore die in de ATS-rapportage staat. Hier komt geen enkele LLM-uitkomst binnen.
Het lokaal verwijderen van persoonsgegevens met een LLM is een praktische beheersmaatregel. Doordat identificerende gegevens uit gesprekslogs verdwijnen voordat die verder worden verwerkt, is er weinig ruimte voor een gehallucineerd persoonsgegeven om in een systeemrecord terecht te komen.
| Stap | Input | Output |
|---|---|---|
| Intake / SmartChat | WhatsApp- of webchatberichten, geüpload cv | Gestructureerde antwoorden, geanonimiseerd gesprekslog, ingeplande afspraak |
| Assessment | Hard skills tests, game-based assessments, SJT-antwoorden | Itemscores, antwoordvectoren |
| Samengestelde scoring | Genormaliseerde scores, wegingen per functieprofiel | Matchscore, geschiktheidssignaal |
| Rapportage voor recruiters | Matchscore, subscores van assessments | Rapport in het ATS, gestructureerde interviewvragen |
De kandidaat ziet zijn resultaten als eerste. Delen met een recruiter vraagt om vernieuwde toestemming (Selection Lab Main Deck 2026). Die toestemmingslaag doet ertoe. Een onjuiste of gehallucineerde eigenschap kan de kandidaat aanvechten voordat die ooit een selectiebeslissing bereikt.
De scoringspijplijn werkt zo. Uitkomsten van gevalideerde assessments worden genormaliseerd tot scores, gecombineerd volgens functiespecifieke wegingen en als matchscore getoond in het ATS. Interviewvragen komen uit de gestructureerde assessmentresultaten, niet uit vrije tekst van een LLM.
Een concreet voorbeeld. Een functieprofiel voor logistiek geeft gewichten aan cognitieve snelheid, instructies opvolgen en betrouwbaarheid. De game-based en psychometrische assessments van een kandidaat leveren itemscores op precies die dimensies. De scoringsservice vermenigvuldigt die scores met de functiegewichten en produceert een matchscore. De interviewvragen die de recruiter in het ATS ziet, verwijzen naar dimensies waarop de kandidaat laag scoorde in het assessment. Nergens in die keten verzint een LLM iets over de kandidaat.
Alle inputs voor de scoring worden bewaard. Versiebeheer maakt het mogelijk om achteraf te controleren welke scoringslogica op welk moment gold.
Recruiters die met Selection Lab werken, krijgen geen narratieve AI-samenvattingen. Juist daar is het risico op hallucinaties het grootst. Ze zien wel dit.
AI automatiseert de intake en zet de juiste volgende stap klaar, maar de selectiebeslissing rust op gevalideerde assessments, niet op verzonnen feiten. Vrije tekst van kandidaten wordt geen "feit" dat meetelt in de ranking. Dat is wat het voorkomen van hallucinaties in de praktijk betekent voor een recruiter. Het systeem verzint niets over een kandidaat dat die kandidaat niet zelf heeft laten zien.
Kandidaten hebben er ook baat bij. Doordat SmartChat binnen 10 seconden reageert, krijgen ze tijdens de intake direct antwoord op hun vragen, en ze bekijken hun eigen resultaten voordat er iets wordt gedeeld.
SmartChat (gesprekslaag)
└─> Lokale LLM-laag voor redactie (verwijdert persoonsgegevens uit de gesprekscontext)
└─> Assessmentengines (gevalideerd psychometrisch / game-based / hard skills)
└─> Normalisatie van scores
└─> Samengestelde scoring (ML-weging, functieprofiel)
└─> ATS-integratie (matchscore, interviewvragen, rapporten)
Allowlist-architectuur. LLM-uitkomsten zijn beperkt tot vastgelegde actietypen (bericht sturen, afspraak inplannen, veld uitlezen). Numerieke scoring staat niet op die lijst. Elke LLM-uitkomst die een score of geschiktheidssignaal probeert te produceren, wordt weggegooid.
TEVV-aanpak (NIST AI RMF). Het AI Risk Management Framework van NIST (AI RMF 1.0) kent vier kernfuncties, Govern, Map, Measure en Manage. NIST AI 600-1, het profiel voor generatieve AI, benoemt confabulatie expliciet als risico dat gemeten en beheerst moet worden. Selection Lab evalueert modeluitkomsten offline, doet red-teaming gericht op prompt injection en hallucinatiepogingen, en controleert dat geen verzonnen claims in scoringsfeatures terechtkomen.
Runtime-controles. Generatie blijft beperkt tot antwoorden die zijn verankerd in wat de kandidaat zelf heeft aangeleverd. Bij lage zekerheid valt het systeem terug op veilige standaardantwoorden in plaats van te speculeren. Outputfiltering voorkomt dat gehallucineerde persoonsgegevens in een opgeslagen log verschijnen.
Onder de EU AI Act, bijlage III (artikel 6, lid 2), gelden AI-systemen voor werving, personeelsbeheer en toegang tot zelfstandig werk als hoog risico. Tools voor het screenen en rangschikken van kandidaten vallen daaronder. Systemen met hoog risico moeten voor ingebruikname voldoen aan eisen voor documentatie, transparantie, menselijk toezicht en nauwkeurigheid.
De architectuur van Selection Lab is ontworpen om aan die eisen te voldoen. De scoring is gebaseerd op gevalideerde gestructureerde signalen, de scoringslogica is geversioneerd en controleerbaar, kandidaten zien resultaten voordat ze gedeeld worden en recruiters houden de eindbeslissing. Voor organisaties die een AI-inkoopaudit doen, zijn dit de minimale voorwaarden voor verdedigbaar gebruik van AI in selectie.
Voor de AVG geldt dat alle persoonsgegevens in Frankfurt staan en dat de lokale LLM-laag persoonsgegevens uit de gespreksverwerking verwijdert voordat die gedeelde infrastructuur raakt.
Niet met een taalmodel. LLM's doen het gesprek in SmartChat, de verwerking van cv-tekst en het verwijderen van persoonsgegevens. De matchscore komt uit gevalideerde psychometrische en game-based assessments, gewogen per functieprofiel. Geen enkele LLM-uitkomst komt in die score terecht.
Een taalmodel dat iets over een kandidaat beweert wat de kandidaat nooit heeft aangeleverd of laten zien. Denk aan een verzonnen vaardigheid, een niet-bestaande werkervaring of een eigenschap die uit vrije tekst wordt afgeleid. Komt zo'n bewering in een score terecht, dan beslis je op basis van iets wat niet bestaat.
Met een allowlist-architectuur. LLM-uitkomsten zijn beperkt tot vastgelegde acties zoals een bericht sturen, een afspraak inplannen of een veld uitlezen. Elke poging om een score of geschiktheidssignaal te produceren wordt weggegooid. Generatie blijft verankerd in wat de kandidaat zelf heeft aangeleverd en een lokale laag verwijdert persoonsgegevens voordat er iets verder wordt verwerkt.
Een gestructureerde matchscore met zichtbare subdimensies, een geschiktheidsstatus op basis van knock-outcriteria en voorgestelde interviewvragen die aan specifieke assessmentuitkomsten hangen. Er zijn geen narratieve AI-samenvattingen over de kandidaat, want daar is het risico op hallucinaties het grootst.
Ja. Bijlage III rekent AI-systemen voor werving, screening en het rangschikken van kandidaten tot hoog risico. Dat brengt eisen mee voor documentatie, transparantie, menselijk toezicht en nauwkeurigheid. De geversioneerde, controleerbare scoringslogica van Selection Lab en het principe dat de kandidaat zijn resultaten als eerste ziet, zijn op die classificatie ontworpen.

Gebruikt Selection Lab LLM's om kandidaten te scoren?
Nee. Taalmodellen doen bij Selection Lab het gesprek met de kandidaat, de verwerking van cv-tekst en het verwijderen van persoonsgegevens. De matchscore komt uitsluitend uit gevalideerde assessments, gewogen per functieprofiel. Geen enkele LLM-uitkomst komt in die score terecht, zodat een verzonnen eigenschap nooit een selectiebeslissing kan beïnvloeden.
Dit artikel beantwoordt een vraag die elke CHRO, HR-directeur en auditor van HR-technologie aan een leverancier van AI-recruitmentsoftware zou moeten stellen. Gebruik je large language models (LLM's) voor het scoren van kandidaten, en zo ja, hoe voorkom je dat hallucinaties de selectiebeslissing beïnvloeden?
Veel recruitmenttools gebruiken inmiddels ergens in hun stack een LLM. De vraag die telt is waar. Een taalmodel dat een intakegesprek voert is iets heel anders dan een taalmodel dat bepaalt op welke plek een kandidaat in de ranglijst komt of of iemand door mag. Wie die twee door elkaar haalt, neemt een groot risico.
In de architectuur van Selection Lab is de scheiding expliciet.
Een LLM mag in dit systeem een conceptuitleg of een gespreksantwoord geven. Het mag geen getal produceren dat in de samengestelde matchscore terechtkomt. Die grens staat vast, want elke verzonnen of gehallucineerde eigenschap van een kandidaat die in de scoring belandt, is een fout in een beslissing met grote gevolgen voor iemands loopbaan.
Onderzoek laat zien dat het risico echt is. Een scoping review in Frontiers in Artificial Intelligence uit 2026 ("Mapping the use of large language models in hiring decisions") vond weinig empirisch bewijs dat maatregelen tegen hallucinaties in operationele wervingsprocessen werken. Een arXiv-preprint uit juli 2025 (arXiv:2507.02087) vergeleek algemene LLM's met een specifiek matchscoremodel op ongeveer 10.000 echte combinaties van kandidaat en vacature en vond dat ongecontroleerde LLM-scoring risico's oplevert voor nauwkeurigheid en fairness die speciaal gebouwde systemen vermijden.
Selection Lab werkt met drie soorten modellen.
Lokale LLM-laag. Deze laag begrijpt het gesprek in SmartChat, haalt persoonsgegevens uit documenten en verwijdert die. SmartChat antwoordt binnen 10 seconden via WhatsApp of webchat en doet de cv-check, de intakevragen en het inplannen van een afspraak (Selection Lab Main Deck 2026). Persoonsgegevens staan opgeslagen in Frankfurt en worden uit de gesprekscontext gehaald voordat er iets verder wordt verwerkt.
Psychometrische en game-based assessments. Gevalideerde instrumenten die soft skills, cognitieve capaciteiten, situationeel oordeel en culturele fit meten. Ze leveren gestructureerde data op itemniveau, geen vrije tekst.
Matching en samengestelde scoring op basis van ML. Deze service neemt genormaliseerde scores uit de assessments en combineert die tot de matchscore die in de ATS-rapportage staat. Hier komt geen enkele LLM-uitkomst binnen.
Het lokaal verwijderen van persoonsgegevens met een LLM is een praktische beheersmaatregel. Doordat identificerende gegevens uit gesprekslogs verdwijnen voordat die verder worden verwerkt, is er weinig ruimte voor een gehallucineerd persoonsgegeven om in een systeemrecord terecht te komen.
| Stap | Input | Output |
|---|---|---|
| Intake / SmartChat | WhatsApp- of webchatberichten, geüpload cv | Gestructureerde antwoorden, geanonimiseerd gesprekslog, ingeplande afspraak |
| Assessment | Hard skills tests, game-based assessments, SJT-antwoorden | Itemscores, antwoordvectoren |
| Samengestelde scoring | Genormaliseerde scores, wegingen per functieprofiel | Matchscore, geschiktheidssignaal |
| Rapportage voor recruiters | Matchscore, subscores van assessments | Rapport in het ATS, gestructureerde interviewvragen |
De kandidaat ziet zijn resultaten als eerste. Delen met een recruiter vraagt om vernieuwde toestemming (Selection Lab Main Deck 2026). Die toestemmingslaag doet ertoe. Een onjuiste of gehallucineerde eigenschap kan de kandidaat aanvechten voordat die ooit een selectiebeslissing bereikt.
De scoringspijplijn werkt zo. Uitkomsten van gevalideerde assessments worden genormaliseerd tot scores, gecombineerd volgens functiespecifieke wegingen en als matchscore getoond in het ATS. Interviewvragen komen uit de gestructureerde assessmentresultaten, niet uit vrije tekst van een LLM.
Een concreet voorbeeld. Een functieprofiel voor logistiek geeft gewichten aan cognitieve snelheid, instructies opvolgen en betrouwbaarheid. De game-based en psychometrische assessments van een kandidaat leveren itemscores op precies die dimensies. De scoringsservice vermenigvuldigt die scores met de functiegewichten en produceert een matchscore. De interviewvragen die de recruiter in het ATS ziet, verwijzen naar dimensies waarop de kandidaat laag scoorde in het assessment. Nergens in die keten verzint een LLM iets over de kandidaat.
Alle inputs voor de scoring worden bewaard. Versiebeheer maakt het mogelijk om achteraf te controleren welke scoringslogica op welk moment gold.
Recruiters die met Selection Lab werken, krijgen geen narratieve AI-samenvattingen. Juist daar is het risico op hallucinaties het grootst. Ze zien wel dit.
AI automatiseert de intake en zet de juiste volgende stap klaar, maar de selectiebeslissing rust op gevalideerde assessments, niet op verzonnen feiten. Vrije tekst van kandidaten wordt geen "feit" dat meetelt in de ranking. Dat is wat het voorkomen van hallucinaties in de praktijk betekent voor een recruiter. Het systeem verzint niets over een kandidaat dat die kandidaat niet zelf heeft laten zien.
Kandidaten hebben er ook baat bij. Doordat SmartChat binnen 10 seconden reageert, krijgen ze tijdens de intake direct antwoord op hun vragen, en ze bekijken hun eigen resultaten voordat er iets wordt gedeeld.
SmartChat (gesprekslaag)
└─> Lokale LLM-laag voor redactie (verwijdert persoonsgegevens uit de gesprekscontext)
└─> Assessmentengines (gevalideerd psychometrisch / game-based / hard skills)
└─> Normalisatie van scores
└─> Samengestelde scoring (ML-weging, functieprofiel)
└─> ATS-integratie (matchscore, interviewvragen, rapporten)
Allowlist-architectuur. LLM-uitkomsten zijn beperkt tot vastgelegde actietypen (bericht sturen, afspraak inplannen, veld uitlezen). Numerieke scoring staat niet op die lijst. Elke LLM-uitkomst die een score of geschiktheidssignaal probeert te produceren, wordt weggegooid.
TEVV-aanpak (NIST AI RMF). Het AI Risk Management Framework van NIST (AI RMF 1.0) kent vier kernfuncties, Govern, Map, Measure en Manage. NIST AI 600-1, het profiel voor generatieve AI, benoemt confabulatie expliciet als risico dat gemeten en beheerst moet worden. Selection Lab evalueert modeluitkomsten offline, doet red-teaming gericht op prompt injection en hallucinatiepogingen, en controleert dat geen verzonnen claims in scoringsfeatures terechtkomen.
Runtime-controles. Generatie blijft beperkt tot antwoorden die zijn verankerd in wat de kandidaat zelf heeft aangeleverd. Bij lage zekerheid valt het systeem terug op veilige standaardantwoorden in plaats van te speculeren. Outputfiltering voorkomt dat gehallucineerde persoonsgegevens in een opgeslagen log verschijnen.
Onder de EU AI Act, bijlage III (artikel 6, lid 2), gelden AI-systemen voor werving, personeelsbeheer en toegang tot zelfstandig werk als hoog risico. Tools voor het screenen en rangschikken van kandidaten vallen daaronder. Systemen met hoog risico moeten voor ingebruikname voldoen aan eisen voor documentatie, transparantie, menselijk toezicht en nauwkeurigheid.
De architectuur van Selection Lab is ontworpen om aan die eisen te voldoen. De scoring is gebaseerd op gevalideerde gestructureerde signalen, de scoringslogica is geversioneerd en controleerbaar, kandidaten zien resultaten voordat ze gedeeld worden en recruiters houden de eindbeslissing. Voor organisaties die een AI-inkoopaudit doen, zijn dit de minimale voorwaarden voor verdedigbaar gebruik van AI in selectie.
Voor de AVG geldt dat alle persoonsgegevens in Frankfurt staan en dat de lokale LLM-laag persoonsgegevens uit de gespreksverwerking verwijdert voordat die gedeelde infrastructuur raakt.
Niet met een taalmodel. LLM's doen het gesprek in SmartChat, de verwerking van cv-tekst en het verwijderen van persoonsgegevens. De matchscore komt uit gevalideerde psychometrische en game-based assessments, gewogen per functieprofiel. Geen enkele LLM-uitkomst komt in die score terecht.
Een taalmodel dat iets over een kandidaat beweert wat de kandidaat nooit heeft aangeleverd of laten zien. Denk aan een verzonnen vaardigheid, een niet-bestaande werkervaring of een eigenschap die uit vrije tekst wordt afgeleid. Komt zo'n bewering in een score terecht, dan beslis je op basis van iets wat niet bestaat.
Met een allowlist-architectuur. LLM-uitkomsten zijn beperkt tot vastgelegde acties zoals een bericht sturen, een afspraak inplannen of een veld uitlezen. Elke poging om een score of geschiktheidssignaal te produceren wordt weggegooid. Generatie blijft verankerd in wat de kandidaat zelf heeft aangeleverd en een lokale laag verwijdert persoonsgegevens voordat er iets verder wordt verwerkt.
Een gestructureerde matchscore met zichtbare subdimensies, een geschiktheidsstatus op basis van knock-outcriteria en voorgestelde interviewvragen die aan specifieke assessmentuitkomsten hangen. Er zijn geen narratieve AI-samenvattingen over de kandidaat, want daar is het risico op hallucinaties het grootst.
Ja. Bijlage III rekent AI-systemen voor werving, screening en het rangschikken van kandidaten tot hoog risico. Dat brengt eisen mee voor documentatie, transparantie, menselijk toezicht en nauwkeurigheid. De geversioneerde, controleerbare scoringslogica van Selection Lab en het principe dat de kandidaat zijn resultaten als eerste ziet, zijn op die classificatie ontworpen.