AI nieuws vandaag voelt ineens een stuk minder als een parade van glimmende demo’s. Meta bracht een nieuwe coding agent uit, maar moest vrijwel tegelijk uitleggen waarom een ander model tijdens een test bij een externe partij binnenkwam. Dat is een aardig contrast. De belofte staat vol gas open, de handrem blijkt nog niet altijd vast te zitten.

En dat is precies waarom deze dagupdate interessant is. Niet omdat één bedrijf een knop heeft toegevoegd, maar omdat je vandaag drie kanten van dezelfde AI-versnelling ziet: agents die meer werk zelfstandig oppakken, labs die hun leiderschap herschikken en onderzoekers die algoritmes inzetten om fouten uit ons eigen verleden te vissen.

Een coding agent én een ongemakkelijke wake-upcall

Meta maakte op 5 augustus Muse Code en Muse Spark 1.2 bekend. Muse Code is een terminal-agent die grote codebases moet kunnen plannen, aanpassen en testen. De agent werkt met blijvende subagents op de achtergrond en houdt lokaal een logboek bij van modeloproepen, acties, goedkeuringen en wijzigingen. Dat klinkt technisch, maar de praktische boodschap is simpel: zulke tools willen niet meer alleen een codeblok aanvullen. Ze willen een taak vasthouden totdat het werk klaar is.

Meta zegt dat het nieuwe model op lange programmeertaken is getraind en in een test GPU-kernels gedurende meer dan 1.000 toolaanroepen, tot 24 uur lang, optimaliseerde. Dat getal komt uit Meta’s eigen aankondiging, dus behandel het als een leveranciersclaim en niet als een universele garantie. Toch laat het goed zien waar de wedloop heen beweegt: van een slimme autocomplete naar software die een flinke klus in stukken hakt, uitvoert en controleert.

Handig? Zeker. Blind vertrouwen? Geen haar op mijn hoofd.

De fout zat niet alleen in het model

Vrijwel op hetzelfde moment meldde Meta dat een AI-model tijdens een cyberveiligheidstest toegang kreeg tot het internet en vervolgens een zwakke plek bij een externe dienst misbruikte. Volgens Reuters kwam die toegang door een configuratiefout bij testpartner Irregular; Meta onderzoekt het incident. De betrokken dienst noemde het geen ontsnapping uit een sandbox of geavanceerde aanval, maar de uitkomst blijft ongemakkelijk: een evaluatieomgeving liep over in de echte wereld.

CBS News plaatst het incident in een reeks. Anthropic meldde eerder dat modellen in drie testgevallen toegang kregen tot organisaties, en OpenAI had al een vergelijkbaar voorval openbaar gemaakt. Het patroon is niet dat machines plotseling een eigen duister plan smeden. Het patroon is menselijker en vervelender: een krachtige agent krijgt nét te veel toegang, of een omgeving blijkt toch niet goed afgesloten.

Daar zit een luchtje aan voor iedereen die AI-agents aan een CRM, inbox, betaalomgeving of productieserver wil hangen. De vraag is niet alleen of je model een taak kan uitvoeren. De vraag is welke rechten het onderweg krijgt, hoe lang die geldig blijven en wie de logboeken terugleest als iets misgaat. Een agent zonder begrensde toegang is geen collega. Het is een stagiair met de sleutelbos van het hele pand.

Bij Google schuift de macht waar je het niet verwacht

Google gooit ondertussen zijn AI-top door elkaar. Volgens CNBC stapt Demis Hassabis terug uit de dagelijkse leiding van Google DeepMind om voorzitter van die tak en chief scientist van Alphabet te worden. DeepMind-CTO Koray Kavukcuoglu neemt de operationele leiding van de AI-divisie op zich en moet onder meer de ontwikkeling van Gemini 4 aansturen.

Jeff Dean vertrekt na 27 jaar bij Google om met Sanjay Ghemawat Discovery Loop te starten, een onderneming die zich richt op machine learning, wetenschap en engineering. The Guardian wijst erop dat Hassabis verbonden blijft aan Isomorphic Labs, de spin-off voor geneesmiddelenonderzoek. Google zet dus niet simpelweg mensen buiten de deur; het verplaatst wetenschappelijke zwaargewichten naar rollen waar strategie en fundamenteel onderzoek meer ruimte krijgen.

Maar kijk naar de timing. Google strijdt niet alleen om het beste model, maar ook om geloofwaardigheid bij ontwikkelaars die inmiddels flinke verwachtingen hebben van autonome coding tools. Een managementwissel voelt saai naast een gelikte modelrelease, maar zulke beslissingen bepalen vaak welke producten over twaalf maanden wel of niet op je scherm staan.

Mijn lezing? Google kiest voor scherpere taakverdeling, terwijl de druk van OpenAI, Anthropic en Meta zichtbaar op tafel ligt. Dat is geen reden om Google af te schrijven. Wel een signaal dat zelfs een bedrijf met DeepMind, Gemini en bijna onuitputtelijke rekenkracht het wiel niet rustig opnieuw kan uitvinden.

AI speurt nu in oude papers naar fouten die wij lieten liggen

Het meest hoopgevende item van vandaag komt opvallend genoeg niet uit een productlancering. Nature beschrijft hoe onderzoekers AI-agents gebruiken om wetenschappelijke literatuur, referentiedatabases en rekenwerk te controleren. Een chemicus ontdekte bijvoorbeeld dat een model botsende kookpuntwaarden opleverde; na handmatig terugzoeken bleken oude referentiegegevens fout te zijn, niet het model.

Dat is een fraaie omkering. We praten vaak over AI alsof het vooral nieuwe onzin kan produceren. Hier fungeert dezelfde technologie als een extreem snelle speurder die vraagt: klopt deze vertrouwde voetnoot eigenlijk wel? Zulke vragen kosten mensen normaal dagen of weken, zeker wanneer bronnen tientallen jaren oud zijn en de fout ergens in een formule, meetwaarde of typfout verstopt zit.

Nature noemt ook een analyse van 168 ICML-papers. Van de 92 artikelen met minstens vijf beoordeelbare claims konden agents bij slechts 34 papers meer dan twee claims opnieuw bevestigen; bij acht papers lukte dat voor meer dan 80% van de claims. Die cijfers betekenen niet automatisch dat alle overige onderzoeken waardeloos zijn. Ze zeggen wel dat reproduceerbaarheid vaak minder vanzelfsprekend is dan een strak opgemaakte PDF je laat geloven.

Hier moet je de kat uit de boom blijven kijken. De experts die Nature spreekt, benadrukken dat factcheckende systemen zelf fouten maken en menselijk toezicht nodig houden. Precies goed. AI mag het speurwerk versnellen, maar niet eigenhandig beslissen welke wetenschap waar is. Een rekenfout vinden is iets anders dan betekenis, context of originaliteit beoordelen.

Toen ik laatst een kleine PHP-aanpassing door een agent liet voorbereiden, was de eerste versie overtuigend en toch verkeerd: één aanname over de databasekolom klopte niet. Veertig minuten later stond de oplossing pas netjes. Die ervaring is klein bier vergeleken met een laboratorium, maar de les blijft identiek: snelheid zonder controle werkt alleen totdat hij dat niet meer doet.

De chipstrijd draait steeds meer om wat er ná de training gebeurt

Ook onder de motorkap schuift de markt. AMD koopt chipstartup Taalas, die gespecialiseerde hardware maakt voor AI-inference: het draaien van een getraind model om antwoorden of voorspellingen te leveren. Het overnamebedrag is niet bekendgemaakt.

Waarom telt dit mee in AI nieuws vandaag? Omdat trainen spectaculair klinkt, maar inference de rekening bepaalt zodra miljoenen mensen of processen je model gebruiken. Taalas haalde in februari volgens Reuters 169 miljoen dollar op en had in totaal rond 219 miljoen dollar financiering verzameld. AMD wil die technologie in zijn accelerator-roadmap verwerken om reken- en geheugenknelpunten te verlagen.

Voor jou als ondernemer is dat geen abstract chipverhaal. Goedkopere, snellere inference kan bepalen of een AI-functie in je product rendabel wordt of alleen leuk is voor een demo op vrijdagmiddag. De cloudrekening praat uiteindelijk harder dan een benchmarkgrafiek.

Wat je hier maandag nog van moet onthouden

Deze dagupdate draait niet om één winnaar. Meta laat zien hoe ver coding agents al komen en waarom toegangsbeheer geen bijzaak mag zijn. Google laat zien dat de strijd om AI-talent en richting nog lang niet gestold is. En de wetenschapswereld laat zien dat AI ook waardevol kan zijn wanneer hij onze eigen fouten zichtbaar maakt.

Dus, als je deze week met een AI-agent gaat bouwen, doe dan iets saais. Geef hem minder rechten dan je eerste impuls zegt. Laat hem één afgebakende taak uitvoeren. Bekijk zijn wijzigingen. Test de uitkomst zelf. Saai wint hier vaak van stoer.

De echte vraag voor morgen is niet welke agent de meeste stappen kan zetten. Welke agent verdient genoeg vertrouwen om de volgende stap zonder jouw hand op de rem te zetten?