Drie jaar geleden liet ik een AI-agent los op mijn inbox. Het ding stuurde mails die ik nooit had goedgekeurd, inclusief eentje naar een klant met een korting die ik niet had bedoeld. Ik trok direct de stekker, zwoer dat ik dit spul nooit meer zou vertrouwen, en liep een week rond met een steen in mijn maag over wat ik mijn merk bijna had aangedaan.
Dat deed pijn.
Maar kijk, ik heb m’n mening herzien. Niet omdat ik ineens verliefd ben op hype, maar omdat ik ben gaan kijken naar wat autonome systemen daadwerkelijk volhouden, hoe vaak ze nu al nuttig samenwerken, en hoe je de risico’s laag houdt zonder jezelf vast te ketenen. De geest is uit de fles.
Waarom dit moment anders voelt
Je ziet overal demo’s, maar je zoekt bewijs. Terecht. Dus pak ik twee bronnen die ik zelf gebruik als reality check. Onderzoeksgroep METR meet iets wat ze de 50%-taakhorizon noemen: hoeveel uur werk van een menselijke expert kun je aan een agent overlaten voordat die in ongeveer de helft van de pogingen slaagt. Hun meest recente pagina van 8 mei 2026 laat voor een voorste model rond de 17 uur zien, gemeten op meer dan honderd softwaretaken, al waarschuwt METR expliciet dat waarden boven 16 uur met de huidige taakset onbetrouwbaar zijn. Dus ja, richtinggevend, maar met ruis op de lijn.
Goed, dat is technisch. Wat merk je op de werkvloer? Microsoft ondervroeg in 2026 20.000 werknemers die AI gebruiken, in tien landen waaronder Nederland. Ongeveer één op de vijf zat in wat Microsoft de Frontier-zone noemt, waar teams agenten dieper in processen laten meedraaien. En volgens Microsoft groeide het aantal actieve agents in Microsoft 365 vijftien keer jaar-op-jaar, bij grote ondernemingen achttien keer, al is de enquête deels zelfrapportage en heeft Microsoft natuurlijk commercieel belang bij een rooskleurig verhaal, dus een korrel zout blijft verstandig (bron).
Klinkt groot. Voelt dichtbij.
Wat AI agents nu wél aankunnen
De prangende vraag blijft: wat kun je ze laten doen zonder dat jij elke vijf minuten moet ingrijpen? Ik zie het zo. Laat agents niet eindeloos praten tegen een chatvenster, maar geef ze afgebakende taken, zicht op de juiste data, en een rem die jij indrukt bij elke risicovolle handeling. En dan ontdek je ineens dat dagelijkse klussen—structureren, controleren, opschonen, in context plaatsen—netjes van je bord glijden.
Van tool naar orkest
Veel teams behandelen een agent als een slimmer zoekveld. Zonde. Je krijgt pas muziek als je meerdere stemmen samen laat spelen: één agent speurt bronnen af, een tweede ordent, een derde produceert een concept, een vierde checkt aannames en verwijst terug als iets rammelt, en jij zet er je handtekening onder. Klinkt als gedoe, maar het is vooral een ontwerpkeuze: je knipt het werk in stukken, zet deliberatieve controles ertussen, en je ziet kwaliteit opveren zonder dat je productiviteit inzakt, omdat fouten worden afgevoerd voordat ze exponentieel duur worden.
Ik heb dit in mijn eigen bedrijf gedaan voor marktsignalen. Eén agent leest openbare updates, een tweede destilleert wat afwijkend is, een derde koppelt het aan onze backlog en vraagt me alleen om toestemming bij acties die geld, reputatie of integriteitsrisico raken. Ik leerde snel. Niet door blind vertrouwen, maar door gerichte grenzen en duidelijke exit-paden.
En ja, METR’s taakhorizon is niet allesbepalend. Toch vind ik het nuttig als anker, omdat het laat zien dat je een agent urenlang zelfstandig in softwareachtige workflows kunt laten ploeteren en je nog steeds in een significante fractie van de pogingen bruikbare output krijgt, zolang jij definiërt wat "bruikbaar" precies betekent en waar de vangrails staan.
Veilig inzetten zonder slaapverlies
Tja, mooie praatjes maken geen beleid. Dus pak ik de mensen erbij die beroepsmatig naar misbruik en foutenpatronen kijken. De Britse NCSC adviseert kort en krachtig: geef alleen minimale, tijdelijke en taakgebonden rechten, blijf continu monitoren, en zorg voor betekenisvol menselijk toezicht (lees hun blog). Dat zijn geen stickers op een laptop, dat zijn ontwerpkeuzes voor je hele werkwijze.
OWASP slaat dezelfde toon aan en wordt praktisch: beperk toolrechten, scheid lees- en schrijfrechten, en eis expliciete autorisatie voor gevoelige acties (hun cheat sheet is helder). Dus een agent die je inbox mag lezen? Prima. Een agent die mails verstuurt, systemen wijzigt of betalingen initieert? Alleen na jouw akkoord of via een goedgekeurde workflow met logging die je terug kunt spoelen als iets misgaat.
Dus maak het klein. Maak het tijdelijk. Maak het traceerbaar.
Geloof me, ik heb de valkuil gezien waarin je begint met volle write-toegang “voor het gemak” en pas achteraf probeert te verklaren wat er gebeurde. Die volgorde zet je zenuwstelsel in brand. Beter omgekeerd: start met zero write, voeg één schrijfactie toe met een bevestiging, leer wat de agent wel en niet snapt, en schaal dan stapsgewijs op.
Wat zegt Microsoft eigenlijk?
Die Frontier-zone uit hun rapport is interessant, vooral omdat het gaat om teams die agency behouden terwijl agents taken aansturen. Dat vind ik gezond. Want waarom zou je uit handen geven wat je niet kunt controleren? En hoewel Microsoft bericht dat het volume actieve agents via Microsoft 365 hard groeit, vertelt die groei mij vooral dat het experimenteren massaal op gang is gekomen en dat governance nu de spelbreker of spelmaker wordt, niet de toegang tot tooling.
Dus ja, optimisme met helmen op.
Voorsprong bouw je niet met kopen, maar met knopen
Iedereen kan een licentie pakken. Echt iedereen. Voorsprong ontstaat wanneer jij drie dingen tegelijk doet en blijft doen: je orkestreert meerdere agents rond een taak in plaats van één agent overal tegenaan te gooien, je definieert welke stappen een agent zelfstandig mag zetten en welke altijd een bevestiging vragen, en je houdt een werkdagboek bij waarin je successen, near-misses en besluitregels vastlegt zodat het systeem elke week scherper wordt.
Ik vind dat laatste stiekem het leukst. Want je gaat zien dat een fout van maandag je woensdag dwingt om een nieuwe check te maken, en dat die check vrijdag geld bespaart, niet omdat de agent slimmer werd, maar omdat jij de feedbacklus sloot en het gedrag van de agent begrensde met precies genoeg context om te presteren zonder te verdwalen in je stack.
Wat begin je morgen? Niet met moonshots. Kies één proces dat repetitief is, duidelijke input heeft en een controleerbare output. Zet er een agent op die alleen leest, laat hem of haar of het (kies zelf een pronoun, het systeem maalt er niet om) een voorstel doen, en vraag jezelf bij elke voorgestelde wijziging: welke expliciete toestemming zou ik hier logisch vinden, en hoe log ik die?
Vier weken later heb je een eerste orkestje, geen solo. En je weet waar de volumeknop zit.
Ik ga niet doen alsof dit magisch is. Soms begrijpt een agent je context niet, soms verwart hij bronnen, soms mis je een trigger omdat je prompt te vaag was. Maar je leert sneller dan je denkt, en de combinatie van METR’s taakhorizon als sanity check, Microsoft’s signalen over gebruik als windrichting, en de duidelijke richtlijnen van NCSC en OWASP als veiligheidsnet geeft genoeg houvast om ambitieus én verstandig te zijn zonder jezelf rare sprongen te laten maken als iets toch even kraakt.
Dus, wat wordt je eerste echte orkestratie, en welk moment bouw je in waarop jij hardop “stop” kunt zeggen voordat een agent de verkeerde deur openduwt?