Bijna zeventig procent van de tekst in literatuurhoofdstukken van economiebachelorscripties wordt door AI-detector Pangram aangemerkt als AI-gegenereerd. Dat blijkt uit een steekproef van Folia. Maar hoe problematisch is het dat de AI-detector zo dieprood uitslaat?
‘Natuurlijk, ik help je graag met je literatuuronderzoek!’ Voor studenten die vastlopen bij het schrijven van hun scriptie, is hulp nooit ver weg. Met tools als ChatGPT, Claude, of UvA AI Chat fungeert kunstmatige intelligentie steeds vaker als studiepartner. Chatbots helpen bijvoorbeeld met een opzet, schrijven alinea’s en hoofdstukken of redigeren teksten. Toch blijft het vaak onduidelijk hoe vaak en wanneer studenten AI gebruiken bij het schrijven van hun scripties.
Om hier meer inzicht in te krijgen, onderzocht Folia bij wijze van steekproef de literatuur- en achtergrondhoofdstukken van 50 bachelorscripties van de Faculteit Economie en Bedrijfskunde (FEB) met AI-detectieprogramma Pangram (zie verantwoording). Bachelorscripties van deze faculteit zijn – in tegenstelling tot scripties van veel andere faculteiten, zoals de Faculteit der Geesteswetenschappen (FGw) – openbaar beschikbaar via de scriptiebank van de universiteit. Volgens onderzoek is Pangram goed in staat om in grote hoeveelheden data AI-sporen te herkennen, hoewel het programma op individueel niveau weleens fout kan zitten. Een individuele score vormt dan ook geen sluitend bewijs dat een student AI heeft gebruikt.
In totaal analyseerde Folia 50 bachelorscripties uit 2026 van de Faculteit Economie en Bedrijfskunde (FEB). De scripties zijn afkomstig uit de openbare scriptiebibliotheek van de UvA.
Met AI-detectieprogramma Pangram werd vervolgens gekeken welk aandeel van de tekst door de software als AI-gegenereerd werd aangemerkt. Naar eigen zeggen markeert Pangram slechts 1 op de 10.000 teksten ten onrechte als door AI geschreven. Onafhankelijke onderzoeken zijn kritischer, maar komen maximaal op een foutpositief percentage van enkele procenten.
Binnen iedere scriptie analyseerde Folia de hoofdstukken waarin het literatuuronderzoek is opgenomen. Hiervoor is gekozen vanwege de karakterlimieten van Pangram en omdat literatuuronderzoek in nagenoeg iedere bachelorscriptie voorkomt.
Ter vergelijking werden ook tien bachelorscripties uit 2021 onderzocht, dus van vóór de brede beschikbaarheid van generatieve AI-tools zoals ChatGPT. In geen van deze scripties markeerde Pangram tekst als AI-gegenereerd.
Bij 48 van de 50 scripties markeerde Pangram ten minste een deel van de onderzochte tekst als AI-gegenereerd. Gemiddeld markeerde Pangram 69 procent van de onderzochte tekst als afkomstig van kunstmatige intelligentie. 1 op de 4 teksten werd volledig aangemerkt als gegenereerde content, met een score van 100 procent AI. De resultaten laten in ieder geval zien dat detectiesoftware bij veel scripties een aanzienlijk deel van de tekst als AI-gegenereerd aanmerkt. Maar is dat erg?
Toegestaan
Allereerst, voor de duidelijkheid: het is UvA-studenten onder voorwaarden inmiddels toegestaan om kunstmatige intelligentie te gebruiken bij het schrijven van hun scriptie. De regels daarover verschillen per faculteit en zelfs per opleiding. De FGw staat het gebruik van AI bijvoorbeeld alleen toe als sparringpartner of vertaalhulp: het genereren van lopende teksten wordt in principe gezien als fraude. De FEB staat studenten juist breder toe om AI te gebruiken bij het schrijfproces, ‘mits tijdens het scriptieproces geborgd wordt dat de student de materie op het vereiste niveau beheerst’.
Marc Salomon, decaan van de Amsterdam Business School binnen de economiefaculteit, schrikt dan ook niet van het feit dat de AI-detector bij zoveel scripties rood uitslaat. ‘We leren studenten tijdens het curriculum om verantwoord met AI om te gaan. Daar hoort natuurlijk ook bij dat je op een verantwoorde manier onderzoek doet met AI.’
Transparant
Daarbij dienen studenten, volgens de richtlijnen van de universiteit, wel ‘transparant te zijn over de wijze waarop de student generatieve AI heeft ingezet’. Dat lijkt niet altijd te gebeuren. Sommige studenten beschrijven in hun scriptie het gebruik van bijvoorbeeld ChatGPT weliswaar expliciet en gedetailleerd in een ‘AI statement’. In andere scripties die door Pangram als grotendeels of zelfs volledig AI-gegenereerd worden aangemerkt, staat juist een originaliteitsverklaring waarin de student expliciet verklaart géén generatieve AI te hebben gebruikt.
Ook dat baart Salomon niet direct zorgen: ‘Een detectorscore is geen hard bewijs voor oneigenlijk gebruik. Zo’n detectieprogramma kan ook aanslaan op tekst die studenten zelf hebben geschreven en alleen hebben laten nalopen met een spellingchecker zoals Grammarly. Veel studenten zien spelling- en grammaticacheckers niet als “AI-gebruik”.’
Wenselijk?
Een hoge AI-score hoeft dus niet te betekenen dat een student iets verkeerd heeft gedaan. Maar daarmee is de vraag nog niet beantwoord of het ook wenselijk is dat een AI-tekstgenerator een groot deel van een scriptie – toch de belangrijkste opdracht van je opleiding – voor zijn rekening neemt.
Volgens Rens Bod, hoogleraar computationele en digitale geesteswetenschappen, hangt dat sterk af van het vakgebied: ‘Kijk naar de experimentele wetenschappen, zoals biologie of natuurkunde. Als een student wekenlang in het lab heeft gestaan, alle experimenten zelf heeft uitgevoerd en alle data nauwkeurig heeft gedocumenteerd, is het dan zo verschrikkelijk erg als een AI een handje helpt bij het opschrijven? Bij de geesteswetenschappen is het formuleren van de tekst en het zorgvuldig opbouwen van een argumentatie juist de kern van het vak. Daar ligt dat weer anders.’
Hij ziet ook voordelen van het gebruik van kunstmatige intelligentie bij het schrijfproces: ‘Er zijn bijvoorbeeld veel mensen in de bètawetenschappen die helemaal niet schoon kunnen schrijven. Voor hen kan generatieve AI een oplossing zijn die hen kan helpen in het opschrijven van hun bevindingen op een wat toegankelijkere manier. Het is in die zin bijna een vorm van democratisering van het schrijven.’
Na de universiteit
Bovendien bereidt de universiteit studenten voor op een realiteit waaruit AI bijna niet meer weg te denken is. In de beroepspraktijk maalt vaak niemand erom of een beleidsnota, e-mail of kwartaalrapportage deels met behulp van ChatGPT tot stand is gekomen. Het gaat vooral om het resultaat. Juist daarom is het volgens Bod belangrijk om studenten al tijdens hun studie te leren hoe ze daar verantwoord mee omgaan: ‘Voor studenten is het ook belangrijk dat ze leren hoe ze AI op een verantwoorde manier kunnen gebruiken. Tegelijkertijd denk ik wel dat het nuttig is als studenten hun scriptie aangrijpen om op zijn minst één keer zoveel mogelijk helemaal zelf te doen.’
Binnen de economiefaculteit worden volgens Salomon daarom meerdere maatregelen genomen om te controleren of studenten hun eigen werk en keuzes kunnen verantwoorden. Zo hebben FEB-studenten tijdens hun scriptieproces vier verschillende voortgangsgesprekken waarin de begeleider de eigen kennis en eigen intellectuele bijdrage van de student test. Bovendien moeten studenten de scriptie uiteindelijk mondeling verdedigen.
Faken wordt moeilijk
Bod denkt dat dit soort maatregelen studenten er zeker van kunnen weerhouden om werk massaal uit te besteden aan kunstmatige intelligentie: ‘Op een gegeven moment komt er een punt waarop je zoveel moeite moet doen om je werk te faken met generatieve AI, dat dit de moeite niet meer waard is.’
Volgens hem vallen studenten die dat wél doen bij mondelinge controles bovendien al snel door de mand: ‘Ze zeggen wel eens dat één keer schrijven gelijkstaat aan tien keer lezen. Dus als je een tekst niet zelf hebt geschreven, dan zit het vaak niet zo goed in je kop.’ Tegelijkertijd baalt hij dat de controles nodig zijn: ‘Ik vind het heel jammer dat docenten hierdoor zo nadrukkelijk politieagenten worden. Dat is wel verschrikkelijk.’