Saltar al contenido
helpyself

Transcribir vídeo

Solo local: no se sube nada salvo que lo guardes o lo compartas.

Convierte un vídeo o un audio en texto, sin subirlo a ninguna parte

Cómo transcribir un vídeo a texto

  1. Suelta tu vídeo o audio — se queda en tu dispositivo
  2. Elige el idioma hablado, o deja que lo deduzca del audio
  3. Pulsa Transcribir y mira aparecer el texto
  4. Cópialo, o descárgalo como TXT, Word, PDF, SRT o VTT

    Se ejecuta en tu máquina. Tu grabación no se sube.

    Compartir un enlace

    Lo guarda en tus archivos y te da una dirección que cualquiera puede abrir. Deja de funcionar sola.

    El enlace dura
    Guardar esta herramienta

    Ten Transcribir vídeo a mano

    Añadir a marcadores

    Sobre esta herramienta

    Suelta un vídeo o un archivo de audio y esto escribe lo que se dice en él. Sirve para las grabaciones que de verdad hace falta transcribir — una entrevista, una clase, una reunión, un pódcast, una nota de voz — y entiende más de veinte idiomas, entre ellos español, danés, neerlandés, alemán y polaco. Lo poco habitual es dónde se ejecuta. El modelo de voz se descarga a tu navegador la primera vez y todo lo demás ocurre en tu propia máquina: tu grabación no se sube nunca, no se guarda en ningún servidor y no la escucha nadie más. Con este tipo de archivo eso importa más que de costumbre — una reunión grabada o una entrevista con un paciente es justo lo que no se puede pegar en una web cualquiera y confiar. La primera vez tarda un poco porque descarga el modelo. Después va rápido: en un portátil con tarjeta gráfica moderna, un vídeo de diez minutos se transcribe en aproximadamente minuto y medio, y hasta en un equipo antiguo sin GPU termina antes de lo que dura la grabación. Ves aparecer el texto mientras trabaja, y puedes parar y quedarte con lo que lleve hecho. Al terminar puedes copiar el texto o guardarlo como TXT, documento de Word, PDF, Markdown, hoja de cálculo, o como subtítulos SRT y VTT que cualquier reproductor entiende.

    Preguntas frecuentes

    ¿Se sube mi vídeo a algún sitio?

    No. El modelo de voz se descarga a tu navegador y la transcripción ocurre en tu propia máquina — la grabación no se envía ni a nosotros ni a nadie. Puedes desconectarte de internet una vez cargado el modelo y seguirá funcionando.

    ¿Puede deducir qué idioma se habla?

    Sí, y se lo pregunta al propio modelo de voz — el mismo modelo que transcribe también identifica idiomas. Con la grabación neerlandesa que usamos de prueba dijo neerlandés con un 96% de confianza. El idioma elegido aparece en el desplegable en cuanto lo sabe, así que ves que acertó — o paras en segundos si no. Si ya sabes el idioma, indicarlo tú sigue siendo lo más seguro.

    ¿Cuánto tarda en transcribir un vídeo?

    Menos de lo que dura la grabación, en todos los equipos que medimos. Un vídeo de diez minutos tardó unos 100 segundos en un portátil con tarjeta gráfica y unos seis minutos y medio en uno sin ella. La herramienta muestra una estimación mientras trabaja, y se vuelve más precisa porque mide tu máquina en vez de suponer.

    ¿Qué idiomas puede transcribir?

    Más de veinte: español, inglés, danés, neerlandés, alemán, francés, italiano, polaco, finés, sueco, noruego, portugués, ruso, ucraniano, turco, árabe, hindi, japonés, coreano y chino, entre otros. Elige uno antes de empezar, o deja que deduzca el idioma del audio — mira más abajo.

    ¿Puede traducir lo que oye?

    Al inglés sí, hay una opción para ello. El modelo puede escribir lo que oye o traducirlo al inglés, y no admite ninguna otra combinación. Español a alemán no es algo que pueda hacer, así que preferimos no ofrecerlo antes que ofrecerlo mal.

    ¿Qué formatos de archivo acepta?

    Todo lo que tu navegador sepa reproducir: MP4, MOV, WebM, MKV y AVI en vídeo, y MP3, M4A, WAV, FLAC, OGG y Opus en audio. Extrae el sonido del vídeo por su cuenta, así que no hace falta separarlo antes.

    ¿En qué formatos puedo guardar la transcripción?

    Texto plano, Word (.docx), PDF, Markdown, CSV para hoja de cálculo, JSON, y subtítulos SRT o VTT. Los formatos de documento pueden llevar una marca de tiempo por párrafo, y los de subtítulos llevan los tiempos que necesita un reproductor.

    ¿Cómo de precisa es?

    Buena, y sincera sobre no ser perfecta. En una entrevista neerlandesa de nueve minutos coincidió casi palabra por palabra con un programa de escritorio; lo que falla suele ser nombres propios, que es donde el reconocimiento de voz es más débil en general. Léela antes de fiarte de ella.

    ¿Hay un límite de duración?

    Veinte minutos por archivo. Es un límite de memoria más que una norma — el audio decodificado vive en la memoria de tu navegador, y pasados veinte minutos una pestaña se está jugando tu equipo. Corta las grabaciones largas antes con nuestro recortador de audio.

    ¿Por qué la primera vez es más lenta?

    Porque descarga el modelo de voz. En un equipo con tarjeta gráfica son unos 920 MB, porque solo la precisión completa transcribe bien — medimos las versiones más pequeñas: una era diez veces más lenta y la otra producía disparates sin avisar. Sin tarjeta gráfica son unos 240 MB. Tu navegador lo conserva en ambos casos, así que el segundo archivo empieza de inmediato, y «Más rápida, más basta» usa un modelo de en torno a una sexta parte.

    ¿De dónde sale el modelo de voz?

    Se descarga de Hugging Face, el repositorio público donde está publicado el modelo. Es la única petición que esta página hace a un tercero, y va en el otro sentido: los archivos bajan, no sube nada. Tu grabación nunca forma parte de eso — se le entrega al modelo dentro de tu propio navegador y no toca la red. Todo lo demás, incluido el código que ejecuta el modelo, se sirve desde helpyself.com.

    ¿Guarda algo en mi ordenador?

    Ninguna cookie, y nada de tu grabación ni de tu transcripción. El sitio recuerda unas pocas preferencias generales — tu tema, si has iniciado sesión — y esta herramienta añade una cosa: el propio modelo de voz, en el almacenamiento de tu navegador, para que el segundo archivo empiece de inmediato. Son los 920 MB de arriba (o 240 MB sin tarjeta gráfica). Se queda hasta que borres los datos de este sitio en tu navegador, y entonces desaparece por completo.

    ¿Por qué mi transcripción tiene huecos?

    Porque algo de la grabación no era habla. La música, los aplausos, una nota sostenida o una sala con un ventilador meten a cualquier modelo de voz en un bucle — escribe la misma frase una y otra vez, con fluidez y en el idioma correcto, y nada en el resultado indica que sea inventado. Cuando pasa, el tramo se decodifica varias veces más con algo de azar; si sigue en bucle, se omite y el resumen lo dice. Un hueco que se ve es mejor que un párrafo de diálogo que nadie pronunció.

    Ayuda a mejorar esta herramienta

    ¿Has encontrado un fallo, quieres un cambio o te falta alguna herramienta?

    /transcribe-video

    ↑↓ para moverte · Enter para abrir · Esc para cerrar