Come generare una voce con l'IA dal testo: guida pratica
Trasforma un testo scritto in parlato naturale: incolla lo script, scegli una voce, descrivi tono e ritmo in linguaggio semplice ed esporta un file audio.
Di Pipe2.ai · Aggiornato July 24, 2026
Per generare una voce con l’IA a partire da un testo su Pipe2.ai, apri Audio Generator, incolla lo script che vuoi far pronunciare, scegli una voce (oppure lasciala su Auto) e descrivi la resa — tono, accento, ritmo, emozione — nel campo Voice Instructions. Il modello legge il tuo testo in quello stile e restituisce un MP3 che puoi scaricare o sovrapporre a un video. Non serve una sessione di registrazione né un doppiatore da ingaggiare; il testo scritto e una breve nota di stile sono l’intero input.
Verificato rispetto al workflow attivo, luglio 2026: gli input, il numero di voci, la copertura linguistica, il comportamento del controllo di stile e il formato di output descritti di seguito sono stati verificati rispetto all’attuale pipeline Audio Generator. Questa guida non presuppone controlli che il modulo non offre.
Come generare un voice-over in cinque passaggi
- Apri Audio Generator. Parti dalla pipeline Audio Generator. Usa Gemini 2.5 TTS, con 30 voci in 73 lingue.
- Incolla il testo. Inserisci le parole esatte che vuoi far pronunciare. Qui la punteggiatura conta — controlla le pause (vedi sotto).
- Scegli una voce. Lasciala su Auto per far scegliere al modello una voce adatta alla tua nota di stile, oppure fissa una voce con nome (Zephyr, Puck, Kore e altre) quando vuoi lo stesso personaggio in più clip.
- Descrivi la resa. In Voice Instructions scrivi come deve suonare: «accento britannico caldo, ritmo lento con pause drammatiche» oppure «allegra ed energica, incalzante». È una direzione in linguaggio semplice, non cursori numerici.
- Genera e ascolta. L’output è un MP3. Controlla il ritmo e i nomi o numeri più insidiosi, adatta il testo o l’istruzione e rigenera se necessario.
Audio Generator prende un testo, una voce facoltativa e un’istruzione di stile facoltativa, e restituisce un singolo MP3. La durata dell’audio segue la lunghezza del testo — non c’è un controllo di durata separato — quindi è lo script stesso a stabilire quanto dura la clip.
Scrivi un testo che il modello legge bene
Poiché le parole sono lo script, piccole modifiche al testo cambiano il risultato più di qualsiasi altra cosa. Alcune abitudini aiutano:
- Scrivi frasi brevi e chiare. Hanno un ritmo migliore rispetto a quelle lunghe e piene di subordinate e offrono al modello punti naturali dove respirare.
- Usa la punteggiatura per modellare le pause. Il punto è uno stop netto, la virgola una breve pausa e i puntini di sospensione una pausa più lunga. Aggiungi virgole dove vuoi rallentare la resa.
- Scrivi le parole insidiose come si pronunciano se un nome, un acronimo o un numero viene letto in modo errato, poi rigenera.
- Mantieni una sola voce per personaggio. Fissa una voce con nome per un narratore ricorrente, così il suono resta coerente tra le clip; usa Auto quando ti serve semplicemente una buona corrispondenza per un singolo pezzo.
Per lo stile in sé, descrivi insieme accento, emozione e velocità. Per esempio:
Narratore calmo e rassicurante. Un ritmo dolce e disteso con pause chiare tra le frasi. Accento neutro, caldo ma non troppo brillante.
La guida di Google alla generazione vocale con Gemini consiglia questo tipo di direzione in linguaggio naturale piuttosto che tentare di codificare il tono come parametri. Il controllo di stile è espressivo ma non esatto, quindi tratta l’istruzione come una guida e affinala dopo l’ascolto.
Voci, durata e i limiti che vale la pena conoscere
Alcuni comportamenti sono facili da sottovalutare:
- La durata segue il testo. Non c’è un selettore di durata; uno script più lungo produce una clip più lunga. Riduci o amplia le parole per cambiare la durata.
- Gli script molto lunghi vengono suddivisi. La pipeline spezza il testo lungo, genera ogni parte e le ricuce, il che può lasciare una leggera giuntura in un punto di unione. Suddividere uno script lungo in paragrafi naturali aiuta.
- Lo stile è direzionale, non preciso. Le istruzioni orientano tono e ritmo ma non colpiranno un’emozione o un timing esatti a ogni esecuzione; rigenera anziché aspettarti un unico risultato fisso.
- Parla, non canta né sonorizza. Per la musica o una base strumentale usa Music Generator; Audio Generator è solo parlato.
Inserisci il voice-over in un video
Una voce generata è più utile quando è abbinata alle immagini. Il percorso comune è Audio Generator → Video Reel: crea la narrazione, poi aggiungila tramite l’input Narration di Video Reel mentre la musica di sottofondo resta sul suo input, così parlato e musica vengono mixati mantenendo la voce in primo piano. Se vuoi anche una base musicale sotto la narrazione, generane una con Music Generator e allega entrambe.
Per l’intera sequenza di produzione — pianificare le inquadrature, generare le clip, aggiungere narrazione e musica, poi sottotitoli e branding — segui come creare video con l’IA. Per bilanciare una colonna sonora rispetto al parlato, vedi come aggiungere musica a un video, e per generare la musica stessa, vedi come generare musica con l’IA.
Conserva come risorse separate lo script, l’MP3 generato e qualsiasi video finale. In questo modo puoi ridoppiare una battuta o cambiare la resa senza ricostruire il resto del progetto.
Domande frequenti
Come si genera una voce con l'IA a partire da un testo?
Incolla lo script, scegli una voce e descrivi la resa desiderata. Su Pipe2.ai apri Audio Generator, inserisci il testo, scegli una voce o lasciala su Auto e scrivi un'istruzione di stile come «calda, distesa, come un conduttore radiofonico notturno». Il modello legge il testo in quello stile e restituisce un MP3 che puoi scaricare o sovrapporre a un video.
Quante voci e quante lingue sono disponibili?
Audio Generator offre 30 voci distinte e copre 73 lingue tramite Gemini 2.5 TTS. Lascia la voce su Auto per far scegliere al modello quella più adatta alla tua istruzione di stile, oppure fissa una voce con nome quando vuoi lo stesso personaggio in più clip.
Posso controllare tono, accento e ritmo della voce?
Sì, tramite il campo Voice Instructions, in linguaggio semplice anziché con parametri numerici. Descrivi accento, emozione e velocità — per esempio «calma e rassicurante, lenta con pause chiare». Anche la punteggiatura modella la resa: i punti creano stop netti, le virgole brevi pause e i puntini di sospensione una pausa più lunga.
Quanto può durare il parlato generato?
La durata dell'audio segue la lunghezza del testo, non un'impostazione di durata. Gli script lunghi vengono suddivisi automaticamente in blocchi e ricuciti insieme, quindi un testo molto lungo può presentare leggere giunture nei punti di unione. Scrivere frasi brevi e chiare mantiene il ritmo uniforme.
La voce IA può cantare o produrre effetti sonori?
No. Audio Generator è pensato per la sintesi vocale del testo parlato, non per il canto o l'esecuzione musicale, né per gli effetti sonori. Per una musica di sottofondo o una traccia strumentale usa invece Music Generator; per un voice-over più musica in un unico video, componi entrambi in Video Reel.