Video transkribieren
Nur lokal — es wird nichts hochgeladen, außer Sie speichern oder teilen es.
Video oder Audio in Text umwandeln, ohne es irgendwohin hochzuladen
Wie man ein Video transkribiert
- Video- oder Audiodatei ablegen — sie bleibt auf Ihrem Gerät
- Gesprochene Sprache wählen, oder aus dem Ton bestimmen lassen
- Auf Transkribieren drücken und dem Text beim Entstehen zusehen
- Kopieren oder als TXT, Word, PDF, SRT oder VTT herunterladen
Läuft auf Ihrem Gerät. Ihre Aufnahme wird nicht hochgeladen.
Tool speichern
Video transkribieren griffbereit halten
Nutzen Sie das Teilen-Menü Ihres Browsers und dann „Zum Home-Bildschirm“.
Über dieses Tool
Legen Sie ein Video oder eine Audiodatei ab, und dieses Werkzeug schreibt auf, was darin gesprochen wird. Es eignet sich für genau die Aufnahmen, die man wirklich transkribieren muss — ein Interview, eine Vorlesung, eine Besprechung, einen Podcast, eine Sprachnotiz — und beherrscht mehr als zwanzig Sprachen, darunter Deutsch, Dänisch, Niederländisch, Polnisch und Spanisch. Das Ungewöhnliche daran ist, wo es läuft. Das Spracherkennungsmodell wird beim ersten Mal in Ihren Browser geladen, alles Weitere passiert auf Ihrem eigenen Rechner: Ihre Aufnahme wird nie hochgeladen, nie auf einem Server gespeichert und von niemandem sonst gehört. Bei dieser Art von Datei zählt das mehr als sonst — eine aufgezeichnete Besprechung ist genau das, was man nicht einfach auf einer fremden Website einfügt. Der erste Durchlauf lädt das Modell und dauert einen Moment. Danach geht es schnell: Auf einem Notebook mit moderner Grafikeinheit ist ein zehnminütiges Video in etwa anderthalb Minuten transkribiert, und selbst auf einem älteren Gerät ganz ohne Grafikbeschleunigung ist es schneller fertig, als die Aufnahme dauert. Sie sehen den Text entstehen und können jederzeit abbrechen und behalten, was bereits da ist. Am Ende können Sie den Text kopieren oder als TXT, Word-Dokument, PDF, Markdown, Tabelle oder als SRT- und VTT-Untertitel speichern.
Häufige Fragen
Wird mein Video irgendwohin hochgeladen?
Nein. Das Spracherkennungsmodell wird in Ihren Browser geladen, die Transkription läuft auf Ihrem eigenen Rechner — die Aufnahme wird weder an uns noch an sonst jemanden gesendet. Sie können nach dem Laden des Modells die Internetverbindung trennen, es funktioniert trotzdem.
Kann es selbst bestimmen, welche Sprache gesprochen wird?
Ja, und es fragt das Spracherkennungsmodell selbst — dasselbe Modell, das transkribiert, erkennt auch Sprachen. Bei unserer niederländischen Testaufnahme nannte es Niederländisch mit 96 % Sicherheit. Die gewählte Sprache erscheint im Auswahlfeld, sobald sie feststeht — Sie sehen also, dass es stimmt, oder brechen nach Sekunden ab. Wenn Sie die Sprache kennen, ist es am sichersten, sie selbst anzugeben.
Wie lange dauert es, ein Video zu transkribieren?
Auf jedem gemessenen Gerät kürzer als die Aufnahme selbst. Ein zehnminütiges Video brauchte etwa 100 Sekunden auf einem Notebook mit Grafikeinheit und rund sechseinhalb Minuten auf einem ohne. Das Werkzeug zeigt während des Laufs eine Schätzung an, die genauer wird, weil sie Ihr Gerät misst statt zu raten.
Welche Sprachen werden erkannt?
Über zwanzig, darunter Deutsch, Englisch, Dänisch, Niederländisch, Französisch, Spanisch, Italienisch, Polnisch, Finnisch, Schwedisch, Norwegisch, Portugiesisch, Russisch, Ukrainisch, Türkisch, Arabisch, Hindi, Japanisch, Koreanisch und Chinesisch. Wählen Sie die Sprache vor dem Start, oder lassen Sie sie aus dem Ton bestimmen — siehe unten.
Kann es übersetzen, was es hört?
Ins Englische ja, dafür gibt es eine Einstellung. Das Modell kann aufschreiben, was es hört, oder ins Englische übersetzen — andere Sprachpaare beherrscht es nicht. Deutsch nach Französisch ist damit nicht möglich, und wir bieten es lieber gar nicht an als schlecht.
Welche Dateiformate werden akzeptiert?
Alles, was Ihr Browser abspielen kann: MP4, MOV, WebM, MKV und AVI als Video sowie MP3, M4A, WAV, FLAC, OGG und Opus als Audio. Der Ton wird direkt aus dem Video gelesen, Sie müssen ihn nicht vorher extrahieren.
Als was kann ich das Transkript speichern?
Als reinen Text, Word (.docx), PDF, Markdown, CSV für die Tabellenkalkulation, JSON sowie als SRT- oder VTT-Untertitel. Die Dokumentformate können einen Zeitstempel pro Absatz tragen, die Untertiteldateien die Zeiten, die ein Videoplayer braucht.
Wie genau ist es?
Gut, aber nicht fehlerfrei — und das sagen wir lieber. Bei einem neunminütigen niederländischen Interview stimmte es fast Wort für Wort mit einem Desktop-Programm überein; Fehler betreffen meist Eigennamen, worin Spracherkennung generell am schwächsten ist. Lesen Sie das Ergebnis durch, bevor Sie sich darauf verlassen.
Gibt es eine Längenbegrenzung?
Zwanzig Minuten pro Datei. Das ist eine Speichergrenze und keine Regel — dekodierter Ton liegt im Arbeitsspeicher Ihres Browsers, und jenseits von zwanzig Minuten geht ein Tab ein Risiko mit Ihrem Rechner ein. Längere Aufnahmen vorher mit unserem Audio-Trimmer teilen.
Warum ist der erste Durchlauf langsamer?
Dabei wird das Spracherkennungsmodell geladen. Auf einem Rechner mit Grafikeinheit sind das rund 920 MB, weil nur volle Genauigkeit korrekt transkribiert — wir haben die kleineren Varianten gemessen: eine war zehnmal langsamer, die andere lieferte stillschweigend Unsinn. Ohne Grafikeinheit sind es rund 240 MB. Ihr Browser behält es in beiden Fällen, die zweite Datei beginnt also sofort, und „Schneller, gröber“ nutzt ein Modell von etwa einem Sechstel der Größe.
Woher kommt das Spracherkennungsmodell?
Es wird von Hugging Face geladen, dem öffentlichen Verzeichnis, in dem das Modell veröffentlicht ist. Das ist die einzige Anfrage, die diese Seite an Dritte stellt, und sie läuft in die andere Richtung: Dateien kommen herunter, nichts geht hinauf. Ihre Aufnahme ist daran nie beteiligt — sie wird dem Modell im Browser übergeben und berührt das Netz nie. Alles Übrige, auch der Code, der das Modell ausführt, kommt von helpyself.com.
Wird etwas auf meinem Rechner gespeichert?
Keine Cookies, und nichts aus Ihrer Aufnahme oder Ihrem Transkript. Die Seite merkt sich ein paar allgemeine Einstellungen — Ihr Design, ob Sie angemeldet sind — und dieses Werkzeug legt eines dazu: das Spracherkennungsmodell selbst, im Speicher Ihres Browsers, damit die zweite Datei sofort beginnt. Das sind die oben genannten 920 MB (bzw. 240 MB ohne Grafikeinheit). Es bleibt, bis Sie die Websitedaten in Ihrem Browser löschen; dann ist es restlos weg.
Warum hat mein Transkript Lücken?
Weil etwas in der Aufnahme keine Sprache war. Musik, Applaus, ein gehaltener Ton oder ein Raum mit einem Lüfter bringen jedes Sprachmodell in eine Endlosschleife — es schreibt denselben Satz immer wieder, flüssig und in der richtigen Sprache, ohne dass irgendetwas verrät, dass er erfunden ist. Passiert das, wird die Passage mehrfach mit mehr Zufall neu dekodiert; bleibt die Schleife, wird sie ausgelassen und die Zusammenfassung sagt es. Eine sichtbare Lücke ist besser als ein Absatz Dialog, der nie gesprochen wurde.
Helfen Sie, dieses Tool zu verbessern
Einen Fehler gefunden, eine Änderung im Kopf, oder fehlt Ihnen ein Tool?
Sie haben einen ungesendeten Entwurf.
Danke — ist bei uns angekommen. Die Antwort finden Sie in Ihrem Postfach.Zu meinen Nachrichten