Aller au contenu
helpyself

Transcrire une vidéo

Local uniquement — rien n'est envoyé sauf si vous l'enregistrez ou le partagez.

Transformez une vidéo ou un enregistrement en texte, sans rien téléverser

Comment transcrire une vidéo en texte

  1. Déposez votre vidéo ou votre audio — il reste sur votre appareil
  2. Choisissez la langue parlée, ou laissez-la déduire du son
  3. Appuyez sur Transcrire et regardez le texte apparaître
  4. Copiez-le, ou téléchargez-le en TXT, Word, PDF, SRT ou VTT

    Fonctionne sur votre machine. Votre enregistrement n'est pas téléversé.

    Partager un lien

    Enregistre le résultat dans vos fichiers et vous donne une adresse que n'importe qui peut ouvrir. Elle expire d'elle-même.

    Le lien dure
    Enregistrer cet outil

    Gardez Transcrire une vidéo sous la main

    Ajouter aux favoris

    À propos de cet outil

    Déposez une vidéo ou un fichier audio et cet outil écrit ce qui s'y dit. Il convient aux enregistrements qu'on a réellement besoin de transcrire — un entretien, un cours, une réunion, un podcast, un mémo vocal — et gère plus de vingt langues, dont le français, le danois, le néerlandais, l'allemand et le polonais. Ce qui sort de l'ordinaire, c'est l'endroit où il travaille. Le modèle de reconnaissance vocale est téléchargé dans votre navigateur la première fois, et tout le reste se passe sur votre propre machine : votre enregistrement n'est jamais téléversé, jamais conservé sur un serveur, jamais entendu par qui que ce soit d'autre. Pour ce genre de fichier cela compte plus que d'habitude — une réunion enregistrée est précisément ce qu'on ne colle pas dans un site web en espérant. Le premier passage télécharge le modèle et prend un moment. Ensuite c'est rapide : sur un portable doté d'une puce graphique récente, une vidéo de dix minutes est transcrite en une minute et demie environ, et même sur une machine ancienne sans GPU elle se termine avant la fin de l'enregistrement. Vous voyez le texte apparaître au fil de l'eau, et vous pouvez arrêter en conservant ce qui a déjà été trouvé. À la fin, copiez le texte ou enregistrez-le en TXT, document Word, PDF, Markdown, tableur, ou en sous-titres SRT et VTT qu'un lecteur vidéo saura lire.

    Questions fréquentes

    Ma vidéo est-elle envoyée quelque part ?

    Non. Le modèle vocal est téléchargé dans votre navigateur et la transcription se fait sur votre propre machine — l'enregistrement ne nous est pas envoyé, ni à personne d'autre. Vous pouvez couper la connexion une fois le modèle chargé, cela continue de fonctionner.

    Peut-il déterminer seul la langue parlée ?

    Oui, et il le demande au modèle vocal lui-même — le modèle qui transcrit identifie aussi les langues. Sur l'enregistrement néerlandais qui nous sert de test, il a annoncé le néerlandais avec 96 % de confiance. La langue retenue apparaît dans la liste dès qu'elle est connue : vous voyez qu'elle est juste, ou vous arrêtez en quelques secondes. Si vous connaissez la langue, l'indiquer vous-même reste le plus sûr.

    Combien de temps faut-il pour transcrire une vidéo ?

    Moins longtemps que dure l'enregistrement, sur toutes les machines mesurées. Une vidéo de dix minutes a demandé environ 100 secondes sur un portable avec puce graphique et environ six minutes et demie sans. L'outil affiche une estimation pendant le travail, et elle s'affine parce qu'elle mesure votre machine au lieu de supposer.

    Quelles langues peut-il transcrire ?

    Plus de vingt : français, anglais, danois, néerlandais, allemand, espagnol, italien, polonais, finnois, suédois, norvégien, portugais, russe, ukrainien, turc, arabe, hindi, japonais, coréen et chinois, entre autres. Choisissez-en une avant de lancer, ou laissez la langue être déduite du son — voir plus bas.

    Peut-il traduire ce qu'il entend ?

    Vers l'anglais oui, une option est prévue. Le modèle sait écrire ce qu'il entend ou le traduire en anglais, et aucune autre combinaison. Français vers allemand n'est pas à sa portée, et nous préférons ne pas le proposer plutôt que de le proposer mal.

    Quels formats de fichier accepte-t-il ?

    Tout ce que votre navigateur sait lire : MP4, MOV, WebM, MKV et AVI pour la vidéo, MP3, M4A, WAV, FLAC, OGG et Opus pour l'audio. Il extrait lui-même le son de la vidéo, inutile de le séparer au préalable.

    Sous quels formats puis-je enregistrer la transcription ?

    Texte brut, Word (.docx), PDF, Markdown, CSV pour un tableur, JSON, ainsi que des sous-titres SRT ou VTT. Les formats document peuvent porter un horodatage par paragraphe, et les fichiers de sous-titres portent les temps qu'attend un lecteur vidéo.

    Quelle est sa précision ?

    Bonne, et honnête sur le fait de n'être pas parfaite. Sur un entretien néerlandais de neuf minutes, elle rejoignait presque mot pour mot un logiciel de bureau ; ce qu'elle rate, ce sont surtout les noms propres, là où la reconnaissance vocale est généralement la plus faible. Relisez avant de vous y fier.

    Y a-t-il une limite de durée ?

    Vingt minutes par fichier. C'est une limite de mémoire plutôt qu'une règle — l'audio décodé occupe la mémoire de votre navigateur, et au-delà de vingt minutes un onglet joue avec votre machine. Découpez d'abord un long enregistrement avec notre rogneur audio.

    Pourquoi le premier passage est-il plus lent ?

    Il télécharge le modèle vocal. Sur une machine dotée d'une puce graphique cela représente environ 920 Mo, car seule la pleine précision transcrit correctement — nous avons mesuré les versions plus légères : l'une était dix fois plus lente, l'autre produisait discrètement n'importe quoi. Sans puce graphique, c'est environ 240 Mo. Votre navigateur le conserve dans les deux cas, le deuxième fichier démarre donc immédiatement, et « Plus rapide, plus grossière » utilise un modèle d'environ un sixième de la taille.

    D'où vient le modèle vocal ?

    Il est téléchargé depuis Hugging Face, le dépôt public où le modèle est publié. C'est la seule requête que cette page adresse à un tiers, et elle va dans l'autre sens : des fichiers descendent, rien ne remonte. Votre enregistrement n'y figure jamais — il est confié au modèle à l'intérieur de votre navigateur et ne touche pas le réseau. Tout le reste, y compris le code qui fait tourner le modèle, vient de helpyself.com.

    Est-ce que quelque chose est conservé sur mon ordinateur ?

    Aucun cookie, et rien de votre enregistrement ni de votre transcription. Le site retient quelques préférences générales — votre thème, si vous êtes connecté — et cet outil ajoute une seule chose : le modèle vocal lui-même, dans le stockage de votre navigateur, pour que le deuxième fichier démarre immédiatement. Ce sont les 920 Mo mentionnés plus haut (ou 240 Mo sans puce graphique). Il reste jusqu'à ce que vous effaciez les données du site dans votre navigateur, ce qui le supprime entièrement.

    Pourquoi ma transcription comporte-t-elle des trous ?

    Parce qu'une partie de l'enregistrement n'était pas de la parole. La musique, les applaudissements, une note tenue ou une pièce avec un ventilateur enferment n'importe quel modèle vocal dans une boucle — il écrit la même phrase encore et encore, avec aisance et dans la bonne langue, sans que rien n'indique qu'elle est inventée. Le passage est alors redécodé plusieurs fois avec un peu d'aléa ; si la boucle persiste, il est omis et le résumé le signale. Un trou visible vaut mieux qu'un paragraphe de dialogue jamais prononcé.

    Aidez-nous à améliorer cet outil

    Un bug, une envie de changement, ou un outil qui vous manque ?

    /transcribe-video

    ↑↓ pour se déplacer · Entrée pour ouvrir · Échap pour fermer