Ja, kandidaten gebruiken ChatGPT bij assessments, en het beïnvloedt de uitslag vooral bij open schrijfopdrachten en thuisopdrachten. In een blind experiment (PLOS ONE) werden 63 AI-antwoorden in een echt examensysteem ingediend. 94% bleef onopgemerkt en scoorde gemiddeld hoger dan echte studenten. AI-detectors zijn geen betrouwbaar bewijs. Wat wel werkt is een ander assessmentontwerp, gedragsmonitoring en menselijke beoordeling.
Dat onderzoek ging over een universiteit, niet over een sollicitatieprocedure. Toch is het signaal moeilijk te negeren. Assessments die ontworpen zijn voor een wereld zonder taalmodellen meten nu soms iets anders dan ze beloven, en dat raakt de voorspellende waarde van je selectie.
Deze gids is voor TA-leads, recruitmentmanagers en assessmentontwerpers die daar nu iets mee moeten. Je krijgt een overzicht van welke formats kwetsbaar zijn, ontwerpprincipes, een monitoringkader, een draaiboek en een set KPI's om het te volgen.
Wat je nodig hebt. Toegang tot je huidige assessmentconfiguratie, een basisbegrip van je itemtypen en het mandaat (of de afstemming) om minstens één assessmentflow aan te passen.
Doorlooptijd. Reken op 1 tot 2 weken voor beleid en monitoring, en 4 tot 6 weken voor een volledig herontwerp van het assessment.
Niet elk format loopt hetzelfde risico. Drie dingen bepalen hoe kwetsbaar een opdracht is. Wordt hij zonder toezicht gemaakt, hoeveel tekst levert hij op, en leg je naast het antwoord ook iets vast over het proces?
| Format | Kwetsbaarheid | Waarom | Wat je in plaats daarvan doet |
|---|---|---|---|
| Open schrijfopdracht zonder toezicht | Hoog | Statische, onbegrensde tekst; geen zicht op het proces | Tijdslimiet per item; voeg halverwege een sessiespecifieke beperking toe |
| Thuisopdracht | Hoog | Volledig zonder toezicht; een taalmodel kan eindeloos bijschaven | Vraag een toelichting op de gemaakte keuzes; laat een vervolggesprek volgen |
| SJT met open tekstantwoord | Gemiddeld | Onderzoek (ScienceDirect, oktober 2024) laat kleine scoreverschuivingen zien, maar duidelijk andere antwoordpatronen | Stap over op forced-choice of rangschikken |
| Verbaal redeneren / capaciteitentest | Gemiddeld tot hoog | Taalmodellen redeneren veel itemtypen uit, zeker bij ruime tijd | Adaptieve timing; parallelle itempools |
| Codeer- of technische test | Gemiddeld | Deels te controleren via runtime checks, maar prompt-injectie komt veel voor | Werk in een browser-IDE met schermopname; vraag om uitleg van de logica |
| Live gestructureerd interview | Laag | Realtime en interactief; lastig midden in een gesprek uit te besteden | Informeer kandidaten vooraf over je AI-beleid |
Een studie in Wiley Online Library (gepubliceerd op 9 maart 2026, 5.675 respondenten) vond dat minder dan 3% van de sollicitanten zelf aangaf generatieve AI te gebruiken, maar in specifieke assessmentfases liep dat op tot 19%. Zelfrapportage onderschat het werkelijke gebruik. Het verschil per fase vertelt je wel waar je je maatregelen op richt.
De betrouwbaarste maatregel is niet detectie. Het is de opdracht zo bouwen dat uitbesteden structureel moeilijk wordt.
Vraag om procesbewijs, niet alleen om antwoorden. Wie een probleem zelf heeft opgelost, kan zijn redenering uitleggen als je doorvraagt. Een geplakt AI-antwoord meestal niet. Vraag in een SJT voor klantenservice niet alleen "Wat zou je doen?" maar ook welk stukje informatie uit het scenario het zwaarst woog en waarom. Dat dwingt de kandidaat iets te doen met sessiespecifieke inhoud die een taalmodel niet heeft gezien.
Begrens de tijd en laat scenario's vertakken. Kortere tijdvensters per item dan een kandidaat nodig heeft om te kopiëren, plakken en nalezen, halen een groot deel van het voordeel weg bij tekstzware items. Vertakking, waarbij de volgende vraag afhangt van het vorige antwoord, maakt hergebruik van prompts nutteloos. Een AI-antwoord op vraag 2 slaat nergens op als het niet is gebouwd op het echte antwoord van de kandidaat op vraag 1.
Gebruik parallelle itempools. Als elke kandidaat hetzelfde magazijnscenario krijgt, staat dat scenario vroeg of laat online. Bouw minstens drie structureel gelijkwaardige varianten met andere contextdetails. Dat bemoeilijkt het matchen van prompts en verlengt de levensduur van je itembank.
Combineer formats. Een modulair assessment met een forced-choice SJT, een cognitieve game met tijdslimiet en een korte video-opdracht is veel lastiger systematisch te omzeilen dan één open tekstopdracht. Je dekt per sessie ook meer competenties af.
ChatGPT-gebruik bij assessments is een integriteitsvraag, maar welk middel je kiest om het te signaleren bepaalt hoe eerlijk je proces blijft.
AI-tekstdetectors (zoals GPTZero) werken op kansverdelingen in tekstkenmerken, en hun foutmarge is in de praktijk fors. Turnitin geeft in zijn eigen richtlijnen (juli 2024) geen detectiescore bij een AI-kans tussen 1 en 19%, juist om valse positieven te vermijden. Zelfs met een gestelde ambitie van minder dan 1% valse positieven (Turnitin, maart 2023) schatte Jisc (juni 2025) dat die 1% op instellingsschaal neerkomt op ongeveer 4.800 onterechte markeringen per jaar. In een wervingscontext, waar een onterechte vlag een geschikte kandidaat uitsluit, is dat als enig bewijs niet te verdedigen.
Gedragsmonitoring levert een ander soort bewijs. Waarneembare signalen zoals focuswisselingen (tabbladen, andere applicaties), klembordactiviteit, onregelmatig typritme en afwijkende sessietiming zijn gebaseerd op gedrag en door een mens te beoordelen. Ze bewijzen AI-gebruik niet sluitend, maar ze geven een controleerbaar spoor voor een onderbouwd menselijk oordeel.
De proctoringconfiguratie van Selection Lab legt met toestemming van de kandidaat camera, audio en scherm vast en toont integriteitssignalen over of er tijdens de sessie tools zoals ChatGPT zijn gebruikt. Alleen al openlijk melden dat er wordt opgenomen werkt afschrikkend. Kandidaten die weten dat de sessie wordt vastgelegd, proberen minder snel iets uit te besteden.
Over de AVG en de EU AI Act. Toestemming moet expliciet en gespecificeerd zijn (camera, audio en scherm waar nodig als aparte categorieën), bewaartermijnen moeten vastliggen en minimaal zijn, en een negatief besluit dat uitsluitend op een AI-vlag rust is onder de hoogrisicovereisten van de EU AI Act niet toegestaan. Er moet altijd een menselijke beoordelingsstap in zitten. Hoe je dat in de praktijk regelt lees je in onze blog over bezwaar maken tegen een AI-beslissing.
Signalen die beoordeling verdienen, per format
Leg een nulmeting vast voordat je de aangepaste assessments uitrolt, en kijk na 30 en 90 dagen opnieuw.
Integriteitsmonitoring
Validiteit van het assessment
Operationele efficiëntie
Implementatiechecklist
Het onderzoeksbeeld is duidelijk genoeg om op te handelen. Generatieve AI wordt gebruikt bij assessments, het effect op de uitslag hangt af van het format, en tekstdetectors zijn geen afdoende maatregel. Het antwoord is een ander assessmentontwerp plus gedragsmonitoring plus gestructureerde menselijke beoordeling. Die combinatie, ingebouwd in een modulair assessmentplatform met eigen integriteitstooling, maakt van een compliancerisico een beheersbaar en controleerbaar proces.
Ja. In een Wiley-studie onder 5.675 sollicitanten gaf minder dan 3% aan generatieve AI te gebruiken, maar in specifieke assessmentfases liep dat op tot 19%. Zelfrapportage onderschat het echte gebruik. In een blind PLOS ONE-experiment bleef 94% van de AI-antwoorden onopgemerkt en scoorden ze hoger dan echte inzendingen.
Open schrijfopdrachten zonder toezicht en thuisopdrachten lopen het grootste risico, omdat ze onbewaakt zijn en vrije tekst opleveren. Verbale redeneertesten zitten op gemiddeld tot hoog risico als de tijd ruim is. SJT's met tekstantwoord en codeertesten zijn gemiddeld. Een live gestructureerd interview is het lastigst uit te besteden.
Nee. Tekstdetectors werken op kansverdelingen en geven valse positieven in een mate die bij werving telt. Turnitin geeft daarom geen score bij een AI-kans tussen 1 en 19%, en Jisc schatte dat 1% valse positieven op instellingsschaal alsnog ongeveer 4.800 onterechte markeringen per jaar oplevert. Gedragssignalen plus menselijke beoordeling zijn de verdedigbare bewijsstandaard.
Vraag om procesbewijs in plaats van alleen antwoorden, begrens de tijd per item, laat scenario's vertakken zodat de volgende vraag afhangt van het vorige antwoord, gebruik minimaal drie parallelle varianten per scenario en combineer formats, bijvoorbeeld een forced-choice SJT, een cognitieve game met tijdslimiet en een korte video-opdracht in één flow.
Ja, onder voorwaarden. Toestemming moet expliciet en per gegevenstype (camera, audio, scherm) worden gegeven, bewaartermijnen moeten vastliggen en minimaal zijn, en geen enkel negatief besluit mag uitsluitend op een automatische vlag rusten. Een mens beoordeelt elke gemarkeerde sessie voordat er een besluit valt.

Ja, kandidaten gebruiken ChatGPT bij assessments, en het beïnvloedt de uitslag vooral bij open schrijfopdrachten en thuisopdrachten. In een blind experiment (PLOS ONE) werden 63 AI-antwoorden in een echt examensysteem ingediend. 94% bleef onopgemerkt en scoorde gemiddeld hoger dan echte studenten. AI-detectors zijn geen betrouwbaar bewijs. Wat wel werkt is een ander assessmentontwerp, gedragsmonitoring en menselijke beoordeling.
Dat onderzoek ging over een universiteit, niet over een sollicitatieprocedure. Toch is het signaal moeilijk te negeren. Assessments die ontworpen zijn voor een wereld zonder taalmodellen meten nu soms iets anders dan ze beloven, en dat raakt de voorspellende waarde van je selectie.
Deze gids is voor TA-leads, recruitmentmanagers en assessmentontwerpers die daar nu iets mee moeten. Je krijgt een overzicht van welke formats kwetsbaar zijn, ontwerpprincipes, een monitoringkader, een draaiboek en een set KPI's om het te volgen.
Wat je nodig hebt. Toegang tot je huidige assessmentconfiguratie, een basisbegrip van je itemtypen en het mandaat (of de afstemming) om minstens één assessmentflow aan te passen.
Doorlooptijd. Reken op 1 tot 2 weken voor beleid en monitoring, en 4 tot 6 weken voor een volledig herontwerp van het assessment.
Niet elk format loopt hetzelfde risico. Drie dingen bepalen hoe kwetsbaar een opdracht is. Wordt hij zonder toezicht gemaakt, hoeveel tekst levert hij op, en leg je naast het antwoord ook iets vast over het proces?
| Format | Kwetsbaarheid | Waarom | Wat je in plaats daarvan doet |
|---|---|---|---|
| Open schrijfopdracht zonder toezicht | Hoog | Statische, onbegrensde tekst; geen zicht op het proces | Tijdslimiet per item; voeg halverwege een sessiespecifieke beperking toe |
| Thuisopdracht | Hoog | Volledig zonder toezicht; een taalmodel kan eindeloos bijschaven | Vraag een toelichting op de gemaakte keuzes; laat een vervolggesprek volgen |
| SJT met open tekstantwoord | Gemiddeld | Onderzoek (ScienceDirect, oktober 2024) laat kleine scoreverschuivingen zien, maar duidelijk andere antwoordpatronen | Stap over op forced-choice of rangschikken |
| Verbaal redeneren / capaciteitentest | Gemiddeld tot hoog | Taalmodellen redeneren veel itemtypen uit, zeker bij ruime tijd | Adaptieve timing; parallelle itempools |
| Codeer- of technische test | Gemiddeld | Deels te controleren via runtime checks, maar prompt-injectie komt veel voor | Werk in een browser-IDE met schermopname; vraag om uitleg van de logica |
| Live gestructureerd interview | Laag | Realtime en interactief; lastig midden in een gesprek uit te besteden | Informeer kandidaten vooraf over je AI-beleid |
Een studie in Wiley Online Library (gepubliceerd op 9 maart 2026, 5.675 respondenten) vond dat minder dan 3% van de sollicitanten zelf aangaf generatieve AI te gebruiken, maar in specifieke assessmentfases liep dat op tot 19%. Zelfrapportage onderschat het werkelijke gebruik. Het verschil per fase vertelt je wel waar je je maatregelen op richt.
De betrouwbaarste maatregel is niet detectie. Het is de opdracht zo bouwen dat uitbesteden structureel moeilijk wordt.
Vraag om procesbewijs, niet alleen om antwoorden. Wie een probleem zelf heeft opgelost, kan zijn redenering uitleggen als je doorvraagt. Een geplakt AI-antwoord meestal niet. Vraag in een SJT voor klantenservice niet alleen "Wat zou je doen?" maar ook welk stukje informatie uit het scenario het zwaarst woog en waarom. Dat dwingt de kandidaat iets te doen met sessiespecifieke inhoud die een taalmodel niet heeft gezien.
Begrens de tijd en laat scenario's vertakken. Kortere tijdvensters per item dan een kandidaat nodig heeft om te kopiëren, plakken en nalezen, halen een groot deel van het voordeel weg bij tekstzware items. Vertakking, waarbij de volgende vraag afhangt van het vorige antwoord, maakt hergebruik van prompts nutteloos. Een AI-antwoord op vraag 2 slaat nergens op als het niet is gebouwd op het echte antwoord van de kandidaat op vraag 1.
Gebruik parallelle itempools. Als elke kandidaat hetzelfde magazijnscenario krijgt, staat dat scenario vroeg of laat online. Bouw minstens drie structureel gelijkwaardige varianten met andere contextdetails. Dat bemoeilijkt het matchen van prompts en verlengt de levensduur van je itembank.
Combineer formats. Een modulair assessment met een forced-choice SJT, een cognitieve game met tijdslimiet en een korte video-opdracht is veel lastiger systematisch te omzeilen dan één open tekstopdracht. Je dekt per sessie ook meer competenties af.
ChatGPT-gebruik bij assessments is een integriteitsvraag, maar welk middel je kiest om het te signaleren bepaalt hoe eerlijk je proces blijft.
AI-tekstdetectors (zoals GPTZero) werken op kansverdelingen in tekstkenmerken, en hun foutmarge is in de praktijk fors. Turnitin geeft in zijn eigen richtlijnen (juli 2024) geen detectiescore bij een AI-kans tussen 1 en 19%, juist om valse positieven te vermijden. Zelfs met een gestelde ambitie van minder dan 1% valse positieven (Turnitin, maart 2023) schatte Jisc (juni 2025) dat die 1% op instellingsschaal neerkomt op ongeveer 4.800 onterechte markeringen per jaar. In een wervingscontext, waar een onterechte vlag een geschikte kandidaat uitsluit, is dat als enig bewijs niet te verdedigen.
Gedragsmonitoring levert een ander soort bewijs. Waarneembare signalen zoals focuswisselingen (tabbladen, andere applicaties), klembordactiviteit, onregelmatig typritme en afwijkende sessietiming zijn gebaseerd op gedrag en door een mens te beoordelen. Ze bewijzen AI-gebruik niet sluitend, maar ze geven een controleerbaar spoor voor een onderbouwd menselijk oordeel.
De proctoringconfiguratie van Selection Lab legt met toestemming van de kandidaat camera, audio en scherm vast en toont integriteitssignalen over of er tijdens de sessie tools zoals ChatGPT zijn gebruikt. Alleen al openlijk melden dat er wordt opgenomen werkt afschrikkend. Kandidaten die weten dat de sessie wordt vastgelegd, proberen minder snel iets uit te besteden.
Over de AVG en de EU AI Act. Toestemming moet expliciet en gespecificeerd zijn (camera, audio en scherm waar nodig als aparte categorieën), bewaartermijnen moeten vastliggen en minimaal zijn, en een negatief besluit dat uitsluitend op een AI-vlag rust is onder de hoogrisicovereisten van de EU AI Act niet toegestaan. Er moet altijd een menselijke beoordelingsstap in zitten. Hoe je dat in de praktijk regelt lees je in onze blog over bezwaar maken tegen een AI-beslissing.
Signalen die beoordeling verdienen, per format
Leg een nulmeting vast voordat je de aangepaste assessments uitrolt, en kijk na 30 en 90 dagen opnieuw.
Integriteitsmonitoring
Validiteit van het assessment
Operationele efficiëntie
Implementatiechecklist
Het onderzoeksbeeld is duidelijk genoeg om op te handelen. Generatieve AI wordt gebruikt bij assessments, het effect op de uitslag hangt af van het format, en tekstdetectors zijn geen afdoende maatregel. Het antwoord is een ander assessmentontwerp plus gedragsmonitoring plus gestructureerde menselijke beoordeling. Die combinatie, ingebouwd in een modulair assessmentplatform met eigen integriteitstooling, maakt van een compliancerisico een beheersbaar en controleerbaar proces.
Ja. In een Wiley-studie onder 5.675 sollicitanten gaf minder dan 3% aan generatieve AI te gebruiken, maar in specifieke assessmentfases liep dat op tot 19%. Zelfrapportage onderschat het echte gebruik. In een blind PLOS ONE-experiment bleef 94% van de AI-antwoorden onopgemerkt en scoorden ze hoger dan echte inzendingen.
Open schrijfopdrachten zonder toezicht en thuisopdrachten lopen het grootste risico, omdat ze onbewaakt zijn en vrije tekst opleveren. Verbale redeneertesten zitten op gemiddeld tot hoog risico als de tijd ruim is. SJT's met tekstantwoord en codeertesten zijn gemiddeld. Een live gestructureerd interview is het lastigst uit te besteden.
Nee. Tekstdetectors werken op kansverdelingen en geven valse positieven in een mate die bij werving telt. Turnitin geeft daarom geen score bij een AI-kans tussen 1 en 19%, en Jisc schatte dat 1% valse positieven op instellingsschaal alsnog ongeveer 4.800 onterechte markeringen per jaar oplevert. Gedragssignalen plus menselijke beoordeling zijn de verdedigbare bewijsstandaard.
Vraag om procesbewijs in plaats van alleen antwoorden, begrens de tijd per item, laat scenario's vertakken zodat de volgende vraag afhangt van het vorige antwoord, gebruik minimaal drie parallelle varianten per scenario en combineer formats, bijvoorbeeld een forced-choice SJT, een cognitieve game met tijdslimiet en een korte video-opdracht in één flow.
Ja, onder voorwaarden. Toestemming moet expliciet en per gegevenstype (camera, audio, scherm) worden gegeven, bewaartermijnen moeten vastliggen en minimaal zijn, en geen enkel negatief besluit mag uitsluitend op een automatische vlag rusten. Een mens beoordeelt elke gemarkeerde sessie voordat er een besluit valt.