De eerste keer dat ik mijn eigen stem uit een computer hoorde komen, kreeg ik kippenvel. Niet van bewondering. Van ongemak.

Het klonk als ik. Mijn tempo, mijn aarzelingen, dat rare uithaaltje aan het eind van een zin waarvan ik niet wist dat ik het had.

Dat is ElevenLabs in één ervaring samengevat. Technisch indrukwekkend en tegelijk een beetje eng.

Waarom dit anders klinkt dan alle voorgangers

AI-stemmen bestaan al twintig jaar. Ze klonken alleen altijd als een navigatiesysteem: correct uitgesproken, volledig zielloos, elke zin even vlak.

Het verschil zit in emotie en timing. Een menselijke stem versnelt als iemand enthousiast raakt, valt een halve seconde stil vlak voor een belangrijk punt, laat een zucht horen bij vermoeidheid en hapt hoorbaar naar adem halverwege een lange zin, en precies die onbewuste kleine dingen maken het verschil tussen voorgelezen en verteld.

Dat is waar ElevenLabs het wint. Je kunt aangeven hoe iets moet klinken, en de stem doet het.

En het Nederlands dan?

Beter dan ik had verwacht, en dat is een compliment dat ik niet snel geef bij AI-tools.

De uitspraak klopt in de meeste gevallen, de klemtonen zitten goed en het klinkt niet als iemand die Nederlands heeft geleerd uit een boekje. Bij eigennamen, plaatsnamen en vaktermen gaat het nog regelmatig mis, dus die moet je handmatig corrigeren.

Tja. Elke tool heeft huiswerk nodig.

Waarvoor gebruiken mensen dit?

Het loopt hard. Het bedrijf haalde in mei 2026 een jaarlijkse omzet van 500 miljoen dollar, wat voor een bedrijf in deze niche opzienbarend is.

De grootste toepassingen die ik voorbij zie komen: audioversies van artikelen, ingesproken cursussen en trainingen, nasynchronisatie van video's naar andere talen, en stemmen voor games en apps.

Voor mijn eigen blog heb ik overwogen om alle artikelen van een audioversie te voorzien. Ik heb het uiteindelijk niet gedaan, en daar was een reden voor die niets met kwaliteit te maken had.

De ethische kant, en die is niet klein

Een stem klonen kan met een paar minuten opname. Dat is fantastisch als het je eigen stem is. Het is een probleem als het de stem van je moeder is en iemand haar nabelt om geld te vragen.

Stemfraude is een reëel en groeiend fenomeen. Microsoft kondigde in 2026 nog een programma aan tegen AI-gedreven criminaliteit, waarbij deepfakes en slimme phishing expliciet genoemd worden als doelwit.

ElevenLabs heeft maatregelen: verificatie voordat je een stem mag klonen, en systemen om te detecteren of audio door hun eigen model is gemaakt. Dat is netjes en het is niet waterdicht.

Mijn stelling: als je een stem gebruikt die niet van jou is, heb je toestemming nodig. Punt. Geen juridische discussie over wat mag, gewoon fatsoen.

Wat kost het?

De gratis versie geeft je een beperkt aantal tekens per maand, genoeg om te testen maar niet om iets mee op te leveren. Daarboven lopen abonnementen op van een paar dollar per maand tot bedragen voor bedrijven die er hun productie op draaien.

Je betaalt per aantal tekens, dus reken vooraf uit hoeveel tekst je maandelijks omzet. Een artikel van duizend woorden is ongeveer zesduizend tekens, en dan weet je meteen waar je uitkomt.

Studenten en kleine makers vallen vaak nog binnen de goedkopere lagen. Zodra je serieus gaat produceren, telt het aan.

Wat je nodig hebt voor een goed resultaat

Een schone opname. Dat is negentig procent van het werk.

Neem op in een stille ruimte, met een fatsoenlijke microfoon, zonder galm. Een gekloonde stem erft alles: ruis, echo, en dat brommende geluid van je koelkast. Slecht materiaal erin betekent een slechte stem eruit, en daar helpt geen instelling tegen.

Verder: pas de tekst aan op voorlezen. Geschreven tekst en gesproken tekst zijn twee verschillende dingen. Lange zinnen met bijzinnen lezen prima maar klinken benauwd. Korte zinnen werken.

Ik pas mijn artikelen aan voordat ik ze laat inspreken. Kost tien minuten, scheelt een resultaat waar je je voor schaamt.

De instellingen die uitmaken

Stabiliteit bepaalt hoeveel variatie de stem heeft. Laag betekent expressief maar onvoorspelbaar, hoog betekent consistent maar vlakker. Voor voorgelezen artikelen zit je meestal goed in de bovenste helft.

Voor karakters in een verhaal juist andersom. Daar wil je die onvoorspelbaarheid, want dat maakt het levend.

Speel er een half uur mee voordat je iets definitiefs maakt. De verschillen zijn groter dan de schuifjes doen vermoeden.

Waarom ik het zelf niet gebruik voor mijn blog

Dit is mijn eigen twijfel, geen advies.

Een artikel is van mij omdat ik het heb geschreven. Een ingesproken versie in een gekloonde stem voelt als een kopie van iets wat ik niet heb gedaan, en ik weet niet of ik dat wil.

Puur zakelijk gezien is dat onzin. Meer bereik, meer luisteraars, meer mensen die het opnemen tijdens het autorijden. De cijfers zouden me gelijk geven.

Maar niet alles wat rendeert voelt goed, en ik ben lang genoeg ondernemer om te weten dat dat gevoel meestal ergens over gaat. Voorlopig laat ik het liggen. Vraag me over een jaar opnieuw.

Voor wie is dit dan wel logisch?

Maak je cursussen, audioboeken of trainingen? Dan bespaart dit je opnamedagen en studiokosten, en dat is een direct te berekenen voordeel.

Wil je video's in meerdere talen uitbrengen? Dan is dit de snelste route die er bestaat.

Zoek je een stem voor iets wat de deur uitgaat met jouw naam eronder? Denk dan even door over de vraag of je publiek het erg vindt als ze het merken. Want ze gaan het merken.