Vai al contenuto
helpyself

Trascrivere video

Solo in locale — non viene caricato niente a meno che tu non lo salvi o lo condivida.

Trasforma un video o una registrazione in testo, senza caricarlo da nessuna parte

Come trascrivere un video in testo

  1. Trascina il tuo video o audio — resta sul tuo dispositivo
  2. Scegli la lingua parlata, o lascia che la ricavi dall'audio
  3. Premi Trascrivi e guarda comparire il testo
  4. Copialo, o scaricalo in TXT, Word, PDF, SRT o VTT

    Gira sulla tua macchina. La tua registrazione non viene caricata.

    Condividi un link

    Salva il risultato nei tuoi file e ti dà un indirizzo che chiunque può aprire. Smette di funzionare da solo.

    Il link dura
    Salva questo strumento

    Tieni Trascrivere video a portata di mano

    Aggiungi ai preferiti

    Su questo strumento

    Trascina un video o un file audio e questo strumento scrive ciò che vi si dice. Funziona sulle registrazioni che davvero serve trascrivere — un'intervista, una lezione, una riunione, un podcast, un memo vocale — e gestisce più di venti lingue, fra cui italiano, danese, olandese, tedesco, polacco e spagnolo. La parte insolita è dove gira. Il modello vocale viene scaricato nel browser la prima volta e tutto il resto avviene sulla tua macchina: la registrazione non viene mai caricata, mai conservata su un server, mai ascoltata da nessun altro. Con questo tipo di file conta più del solito — una riunione registrata o un colloquio con un paziente è esattamente ciò che non si incolla in un sito sperando bene. La prima volta ci vuole un momento perché scarica il modello. Poi è veloce: su un portatile con una scheda grafica recente un video di dieci minuti viene trascritto in circa un minuto e mezzo, e perfino su una macchina vecchia senza GPU finisce prima di quanto duri la registrazione. Vedi il testo comparire mentre lavora, e puoi fermarti tenendo quello che ha già trovato. Alla fine puoi copiare il testo o salvarlo come TXT, documento Word, PDF, Markdown, foglio di calcolo, oppure come sottotitoli SRT e VTT che un lettore video sa leggere.

    Domande frequenti

    Il mio video viene caricato da qualche parte?

    No. Il modello vocale viene scaricato nel tuo browser e la trascrizione avviene sulla tua macchina — la registrazione non arriva né a noi né a nessun altro. Puoi scollegarti da internet una volta caricato il modello e continuerà a funzionare.

    Riesce a capire da solo quale lingua si parla?

    Sì, e lo chiede al modello vocale stesso — lo stesso modello che trascrive riconosce anche le lingue. Sulla registrazione olandese con cui facciamo le prove ha indicato l'olandese con il 96% di confidenza. La lingua scelta compare nel menù appena è nota, così vedi che è giusta — o ti fermi in pochi secondi. Se la lingua la conosci già, indicarla resta la via più sicura.

    Quanto tempo ci vuole per trascrivere un video?

    Meno di quanto duri la registrazione, su ogni macchina che abbiamo misurato. Un video di dieci minuti ha richiesto circa 100 secondi su un portatile con scheda grafica e circa sei minuti e mezzo su uno senza. Durante il lavoro compare una stima, che diventa più precisa perché misura la tua macchina invece di tirare a indovinare.

    Quali lingue riesce a trascrivere?

    Più di venti: italiano, inglese, danese, olandese, tedesco, francese, spagnolo, polacco, finlandese, svedese, norvegese, portoghese, russo, ucraino, turco, arabo, hindi, giapponese, coreano e cinese, fra le altre. Scegline una prima di iniziare, oppure lascia che la lingua venga ricavata dall'audio — vedi sotto.

    Può tradurre quello che sente?

    In inglese sì, c'è un'apposita opzione. Il modello sa scrivere ciò che sente oppure tradurlo in inglese, e nessun'altra combinazione. Dall'italiano al tedesco non è in grado, e preferiamo non offrirlo piuttosto che offrirlo male.

    Quali formati di file accetta?

    Tutto ciò che il browser sa riprodurre: MP4, MOV, WebM, MKV e AVI per il video, MP3, M4A, WAV, FLAC, OGG e Opus per l'audio. Estrae da sé l'audio dal video, quindi non serve separarlo prima.

    In che formati posso salvare la trascrizione?

    Testo semplice, Word (.docx), PDF, Markdown, CSV per il foglio di calcolo, JSON e sottotitoli SRT o VTT. I formati documento possono portare un marcatore temporale per ogni paragrafo, e i file di sottotitoli portano i tempi che serve a un lettore video.

    Quanto è accurata?

    Buona, e sincera sul non essere perfetta. Su un'intervista olandese di nove minuti ha coinciso quasi parola per parola con un programma da scrivania; ciò che sbaglia sono soprattutto i nomi propri, dove il riconoscimento vocale è in generale più debole. Rileggila prima di fidartene.

    C'è un limite di durata?

    Venti minuti per file. È un limite di memoria più che una regola — l'audio decodificato sta nella memoria del browser, e oltre i venti minuti una scheda rischia grosso con la tua macchina. Taglia prima le registrazioni lunghe con il nostro ritagliatore audio.

    Perché la prima volta è più lenta?

    Perché scarica il modello vocale. Su una macchina con scheda grafica sono circa 920 MB, perché solo la precisione piena trascrive correttamente — abbiamo misurato le versioni più piccole: una era dieci volte più lenta, l'altra produceva in silenzio sciocchezze. Senza scheda grafica sono circa 240 MB. Il browser lo conserva in entrambi i casi, così il secondo file parte subito, e «Più veloce, più grezza» usa un modello grande circa un sesto.

    Da dove arriva il modello vocale?

    Viene scaricato da Hugging Face, l'archivio pubblico su cui il modello è pubblicato. È l'unica richiesta che questa pagina rivolge a terzi, e va nella direzione opposta: i file scendono, non sale nulla. La tua registrazione non ne fa mai parte — viene consegnata al modello dentro il tuo browser e non tocca la rete. Tutto il resto, compreso il codice che esegue il modello, arriva da helpyself.com.

    Viene salvato qualcosa sul mio computer?

    Nessun cookie, e nulla della tua registrazione o della tua trascrizione. Il sito ricorda poche preferenze generali — il tema, se hai effettuato l'accesso — e questo strumento aggiunge una cosa sola: il modello vocale stesso, nella memoria del browser, perché il secondo file parta subito. Sono i 920 MB indicati sopra (o 240 MB senza scheda grafica). Resta finché non cancelli i dati di questo sito dal browser, e allora sparisce del tutto.

    Perché la mia trascrizione ha dei buchi?

    Perché qualcosa nella registrazione non era parlato. Musica, applausi, una nota tenuta o una stanza con un ventilatore mandano qualsiasi modello vocale in un ciclo — scrive la stessa frase all'infinito, scorrevole e nella lingua giusta, senza che nulla riveli che è inventata. Quando accade, il tratto viene decodificato altre volte con più casualità; se il ciclo resta, viene omesso e il riepilogo lo dice. Un buco visibile è meglio di un paragrafo di dialogo mai pronunciato.

    Aiutaci a migliorare questo strumento

    Hai trovato un errore, vuoi una modifica, o ti manca uno strumento?

    /transcribe-video

    ↑↓ per muoverti · Invio per aprire · Esc per chiudere