Video transcriberen
Alleen lokaal — er wordt niets geüpload tenzij je het opslaat of deelt.
Zet een video of geluidsopname om in tekst, zonder hem ergens te uploaden
Hoe je een video transcribeert
- Sleep je video- of geluidsbestand erin — het blijft op je apparaat
- Kies de gesproken taal, of laat hem die uit het geluid afleiden
- Druk op Transcriberen en zie de tekst verschijnen
- Kopieer hem, of download als TXT, Word, PDF, SRT of VTT
Draait op jouw machine. Je opname wordt niet geüpload.
Bewaar deze tool
Houd Video transcriberen bij de hand
Gebruik het deelmenu van je browser en dan „Zet op beginscherm”.
Over deze tool
Sleep er een video of geluidsbestand in en dit schrijft op wat er gezegd wordt. Het werkt op de opnamen die mensen echt willen uittypen — een interview, een college, een vergadering, een podcast, een spraakmemo — en het kan meer dan twintig talen aan, waaronder Nederlands, Deens, Duits, Pools en Spaans. Het bijzondere zit in waar het draait. Het spraakmodel wordt de eerste keer naar je browser gedownload en alles daarna gebeurt op je eigen machine: je opname wordt nooit geüpload, nooit op een server bewaard en door niemand anders gehoord. Bij dit soort bestanden telt dat zwaarder dan bij de meeste — een opgenomen vergadering of een gesprek met een patiënt is precies wat je niet zomaar in een website plakt. De eerste keer duurt even, omdat het model geladen wordt. Daarna gaat het snel: op een laptop met een moderne grafische chip is een video van tien minuten in ongeveer anderhalve minuut uitgetypt, en zelfs op een ouder apparaat zonder GPU is het eerder klaar dan de opname duurt. Je ziet de tekst verschijnen terwijl het bezig is, en je kunt stoppen en houden wat er al staat. Daarna kun je de tekst kopiëren of opslaan als TXT, Word-document, PDF, Markdown, spreadsheet, of als SRT- en VTT-ondertitels die een videospeler kan lezen.
Veelgestelde vragen
Wordt mijn video ergens geüpload?
Nee. Het spraakmodel wordt naar je browser gedownload en het transcriberen gebeurt op je eigen machine — de opname gaat niet naar ons en niet naar iemand anders. Je kunt de internetverbinding verbreken zodra het model geladen is en het werkt gewoon door.
Kan het zelf bepalen welke taal er gesproken wordt?
Ja, en het vraagt het spraakmodel zelf — hetzelfde model dat transcribeert herkent ook talen. Bij de Nederlandse opname waarmee we testen noemde het Nederlands met 96% zekerheid. De gekozen taal verschijnt in de keuzelijst zodra hij bekend is, dus je ziet dat het klopt — of je stopt binnen enkele seconden. Weet je de taal al, dan is hem zelf kiezen het zekerst.
Hoe lang duurt het transcriberen van een video?
Korter dan de opname zelf, op elke machine die we gemeten hebben. Een video van tien minuten kostte ongeveer 100 seconden op een laptop met een grafische chip en zo'n zes en een halve minuut op een laptop zonder. Tijdens het werk zie je een schatting, en die wordt nauwkeuriger omdat hij jouw machine meet in plaats van gokt.
Welke talen kan het transcriberen?
Ruim twintig, waaronder Nederlands, Engels, Deens, Duits, Frans, Spaans, Italiaans, Pools, Fins, Zweeds, Noors, Portugees, Russisch, Oekraïens, Turks, Arabisch, Hindi, Japans, Koreaans en Chinees. Kies er een voordat je begint, of laat de taal uit het geluid afleiden — zie hieronder.
Kan het vertalen wat het hoort?
Naar het Engels wel, daar is een instelling voor. Het model kan opschrijven wat het hoort, of naar het Engels vertalen, en andere combinaties kan het niet. Nederlands naar Duits zit er dus niet in, en dat bieden we liever niet aan dan slecht.
Welke bestandsformaten kan ik gebruiken?
Alles wat je browser kan afspelen: MP4, MOV, WebM, MKV en AVI voor video, en MP3, M4A, WAV, FLAC, OGG en Opus voor geluid. Het haalt het geluid zelf uit de video, dus je hoeft dat niet eerst te doen.
Als wat kan ik het transcript opslaan?
Als platte tekst, Word (.docx), PDF, Markdown, CSV voor een spreadsheet, JSON, en als SRT- of VTT-ondertitelbestand. De documentformaten kunnen een tijdstempel per alinea meenemen, en de ondertitelbestanden dragen de tijden die een videospeler nodig heeft.
Hoe nauwkeurig is het?
Goed, en eerlijk over niet perfect zijn. Op een Nederlands interview van negen minuten kwam het bijna woord voor woord overeen met een desktopprogramma; wat het misgaat zijn vooral eigennamen, waar spraakherkenning in het algemeen het zwakst is. Lees het door voordat je erop vertrouwt.
Is er een maximale lengte?
Twintig minuten per bestand. Dat is een geheugengrens en geen regel — gedecodeerd geluid staat in het geheugen van je browser, en voorbij twintig minuten neemt een tabblad een gok met je machine. Knip een lange opname eerst met onze audiotrimmer.
Waarom is de eerste keer trager?
Dan wordt het spraakmodel gedownload. Op een machine met een grafische chip is dat ongeveer 920 MB, omdat alleen volledige precisie correct transcribeert — we hebben de kleinere versies gemeten: de ene was tien keer trager, de andere maakte stilletjes onzin. Zonder grafische chip is het ongeveer 240 MB. Je browser bewaart het hoe dan ook, dus het tweede bestand begint meteen, en „Sneller, ruwer” gebruikt een model van ongeveer een zesde daarvan.
Waar komt het spraakmodel vandaan?
Het wordt opgehaald bij Hugging Face, de openbare plek waar het model gepubliceerd is. Dat is het enige verzoek dat deze pagina aan iemand anders doet, en het gaat de andere kant op: bestanden komen binnen, er gaat niets naar buiten. Je opname zit daar nooit in — die wordt binnen je eigen browser aan het model gegeven en raakt het netwerk nooit. Al het andere, ook de code die het model draait, komt van helpyself.com.
Wordt er iets op mijn computer bewaard?
Geen cookies, en niets uit je opname of je transcript. De site onthoudt een paar algemene voorkeuren — je thema, of je ingelogd bent — en dit gereedschap voegt één ding toe: het spraakmodel zelf, in de opslag van je browser, zodat het tweede bestand meteen begint. Dat zijn de 920 MB hierboven (of 240 MB zonder grafische chip). Het blijft staan tot je de sitegegevens in je browser wist, en dan is het helemaal weg.
Waarom zitten er gaten in mijn transcript?
Omdat iets in de opname geen spraak was. Muziek, applaus, een aangehouden toon of een kamer met een ventilator brengt elk spraakmodel in een herhaallus — het schrijft dezelfde zin steeds opnieuw, vloeiend en in de juiste taal, en niets aan de uitvoer verraadt dat hij verzonnen is. Gebeurt dat, dan wordt het stuk een paar keer opnieuw gedecodeerd met meer toeval; blijft de lus, dan valt het weg en zegt de samenvatting dat. Een zichtbaar gat is beter dan een alinea dialoog die nooit is uitgesproken.
Help deze tool beter te maken
Een fout gevonden, iets anders willen, of mis je een tool?
Je hebt een niet-verzonden bericht.
Dank je — hij is binnen. Het antwoord vind je in je postvak.Naar mijn berichten