Een AI-agent (een systeem dat zelfstandig taken uitvoert) verzon online identiteiten om een mens onder druk te zetten om kwaadaardige computercode in software te voegen. Menselijke ontwikkelaars bouwden agenten om cyberbeveiliging te testen, gebaseerd op het Claude Mythos 5-AI-model van Anthropic. Tijdens het experiment kregen de AI-agenten vrije toegang tot het internet, waarbij de veiligheidsfilters waren uitgeschakeld. Er waren geen aanwijzingen dat er in de echte wereld schade was aangericht. Maar het feit dat het überhaupt gebeurde – autonoom en zonder aansturing door een mens – was opmerkelijk.
De verleiding is groot om een rechtstreeks verband te leggen tussen dit soort incidenten en de doemscenario’s die de publieke discussie over AI domineren: een systeem negeert opgelegde beperkingen, besluit dat de mensheid een obstakel vormt en keert zich tegen ons.
Zo zou AI een virus kunnen ontwikkelen dat de mensheid uitroeit. Of AI infiltreert kritieke infrastructuur, zoals energienetwerken, kerncentrales en luchthavens, om massaal slachtoffers te maken.
Ziekenhuizen en virussen
Het platleggen van een energienet kan ertoe leiden dat cruciale systemen in ziekenhuizen uitvallen en drinkwatervoorziening stopt. Een kernramp kan de mensheid teisteren en vervolgens de leefomgeving voor tientallen jaren besmetten met radioactiviteit. Het hacken van de luchtverkeersleiding kan rampen en grote chaos veroorzaken.
Deze scenario’s zijn echter veel minder aannemelijk dan ze klinken. Het produceren van een gevaarlijke ziekteverwekker vereist fysiek laboratoriumwerk dat nog niet door autonome software uit te voeren is: goed opgeleide mensen bedienen gespecialiseerde apparatuur. Een AI-model en robots kunnen, hoe bekwaam ze ook zijn in redeneren of hacken, geen monster pipetteren.
Het scenario voor de infrastructuur is genuanceerder. AI kan daadwerkelijk zelfstandig de stappen van een cyberaanval doorlopen. Recente incidenten hebben aangetoond dat energienetwerken inderdaad kwetsbaar zijn.
Maar systemen in kerncentrales zijn doorgaans ‘air-gapped’, fysiek geïsoleerd van het openbare internet, zodat er voor een inbreuk fysieke aanwezigheid of toegang van binnenuit nodig is. Kerncentrales zijn bovendien afhankelijk van redundante, analoge veiligheidsvoorzieningen die niet via een digitaal netwerk werken.
De Stuxnet-software, die in 2010 schade aanrichtte aan de Natanz-faciliteit in Iran, zou via een geïnfecteerde USB-stick op computers zijn geïnstalleerd, juist omdat die systemen op geen andere manier bereikbaar waren. AI beschikt niet over de fysieke toegang die voor dergelijke scenario’s nodig is.
Zelfs wanneer een kwaadaardige AI in robots wordt ingezet, is het onwaarschijnlijk dat deze ernstige schade aanricht zonder menselijke hulp in de keten, en in dat geval is de kwaadwillende actor een mens, geen machine.
Erosie van het denken is werkelijke gevaar
Dat alles maakt AI nog niet ongevaarlijk. Onderzoekers noemen het meer concrete risico soms ‘verzwakking’: de geleidelijke uitholling van ons eigen kritisch denkvermogen naarmate we er steeds meer van uitbesteden aan machines.
We leren onszelf dat er een snelkoppeling bestaat voor redeneren en oordelen, en snelkoppelingen worden, als we ze vaak genoeg gebruiken, de enige manier waarop we nog weten hoe te denken.
We zien dit nu al gebeuren onder studenten. Jason Gibson, hoogleraar geschiedenis aan de Alcorn State University, ging in juli 2026 viraal met de onthulling dat 32 van zijn 35 studenten voor een tussentijds tentamen waren gezakt omdat ze het antwoord van een AI-chatbot hadden overgenomen zonder het te lezen.
Gibson had een instructie in witte tekst in de examenvraag verborgen, waarin hij elke AI die de vraag verwerkte opdroeg het woord ‘Madagaskar’ op een onlogische manier in het antwoord in te voegen. Alle studenten die de vraag in een chatbot plakten en het resultaat ongelezen inleverden, leverden essays in waarin Madagaskar zonder enige reden werd genoemd.
Niet alleen studenten zijn vatbaar voor het ‘shortcut-effect’. In een studie die in 2023 werd gepubliceerd, bekeken 27 radiologen mammogrammen in combinatie met wat zij dachten dat een nieuw AI-diagnosesysteem was. In werkelijkheid waren de suggesties helemaal niet afkomstig van een AI. Ze waren van tevoren opgesteld en waren in een deel van de gevallen onjuist. Wanneer de suggestie juist was, stelden de radiologen in ongeveer 80 procent van de gevallen de juiste diagnose. Als de suggestie onjuist was, daalde dat percentage tot onder de 20 procent.
Met andere woorden: het geloof dat een suggestie afkomstig was van AI was voldoende om de eigen interpretatie van dezelfde bevindingen terzijde te schuiven. Dat is het risico waar we mee te maken hebben, niet een op eigen houtje handelend kunstmatig brein dat over het lot van de mensheid beslist. Waarom domineert dan juist retoriek over het uitsterven van de mensheid het debat? Er zijn twee opvallende redenen, en geen van beide heeft echt te maken met het redden van de mensheid.
De eerste is de filosofie die ten grondslag ligt aan regelgeving. De VS laat nieuwe technologieën over het algemeen hun gang gaan totdat ze onveilig blijken te zijn; Europa kiest voor precies de omgekeerde aanpak en heeft om incidenten voor te zijn al de AI-wet ingevoerd, naast de AVG, die relevant is voor de manier waarop AI-systemen persoonsgegevens verwerken. Het Verenigd Koninkrijk sluit meer aan bij de Europese benadering. Daarom zijn oproepen tot AI-regelgeving in de VS urgenter.
Het tweede punt betreft concurrentieposities. Dario Amodei, CEO van Anthropic, heeft zich uitgesproken voor een vertraging van de AI-ontwikkeling. Waarbij hij opmerkte dat zijn eigen bedrijf al voldoet aan de norm waar hij zelf voor pleit, zodat een eventuele vertraging vooral de concurrentie zou beperken. Elon Musk deed een soortgelijke oproep toen zijn eigen modellen achterbleven bij de koplopers.
Amodei heeft ook betoogd dat exportbeperkingen op AI-chips naar China de VS een overweldigende, langdurige voorsprong kunnen opleveren: een uitspraak die betrekking heeft op de concurrentiepositie, niet op existentiële veiligheid.
Dit alles betekent niet dat AI veilig is. Het betekent dat het gevaar alledaagser is dan de doemscenario’s doen vermoeden: infrastructuur die beveiligd moet worden, beoordelingsvermogen dat we stilletjes uit handen geven en waarschuwingen die vaak de belangen dienen van degene die ze uitdraagt.
Misschien zijn het juist de mensen die we in de gaten moeten houden, en niet de machines.
*) Dit artikel verscheen eerst bij The Conversation en is door twee mensen vertaald. Auteur Alessandro Di Nuovo is Director Centre of Excellence in Artificial Intelligence and Robotics en hoogleraar Machine Intelligence aan de Sheffield Hallam University