La trappola della voce credibile e il trucco della timeline
Quando ti mandano una traccia guida generata dall'intelligenza artificiale, il pericolo non è che suoni male: è che suona fin troppo bene. Sembra una voce professionale, sembra credibile e ti porta fuori strada senza che tu te ne accorga. Come si smonta il ritmo del manichino, come si cerca il senso del testo al banco di lavoro e perché alla fine conviene ribaltare l'ordine dei take.
Arriva la sessione, apri la traccia video su REAPER e dentro c'è la voce guida generata da un modello sintetico.
Il cliente è uno che il mestiere lo conosce e mi scrive subito: «Paolo, la guida serve solo per farti vedere dove cadono le scene. Se per recitare ti serve più spazio prenditelo pure, non stare attaccato al secondo. Sappiamo che deve suonare diversa: se serve, riallargo i tagli del video dopo».
È un ottimo presupposto per lavorare bene, ma c'è un tranello. E non è il tranello che si immagina chi non fa questo lavoro.
---
Il problema è che sembra brava
Se la traccia guida fosse una voce metallica anni Ottanta, di quelle che sillabano come un citofono rotto, non ci cascheresti mai. La spegneresti dopo due secondi per non farti distrarre.
Il guaio dei modelli attuali è l'opposto: suonano bene. Hanno una pasta credibile, una dizione pulita, una cadenza che sembra professionale. Hanno l'aspetto di un lavoro finito. E proprio perché sembra credibile, l'istinto ti porta a fidarti.
Ti metti la cuffia, ascolti l'attacco, guardi il video e senza accorgertene cominci a ricalcare le sue pause. Pensi: «Beh, qui sale, qui scende, il respiro ci sta, stiamo dentro i tempi».
Solo che quella voce non sta capendo una sola sillaba di quello che legge.
---
Chi sta parlando?
Il testo di questo video racconta un'invenzione. C'è una persona che descrive un meccanismo, un'intuizione tecnica: una cosa inaspettata, eppure perfettamente logica, semplice, quasi bella per quanto è lineare.
La voce sintetica legge il paragrafo con una bella intonazione istituzionale, ma mette gli accenti a caso rispetto al pensiero. Scandisce la parola chiave con lo stesso peso della congiunzione. Non perché sia "cattiva", ma perché un modello di linguaggio calcola le probabilità statistiche delle parole, non sa cosa si prova quando un'idea improvvisamente funziona e tutti i pezzi vanno a posto.
Nei primi due take mi ritrovo a fare l'errore classico: vado dietro alla guida. Registro, riascolto e sento che qualcosa non torna. È a tempo, è pulita, è professionale, ma è vuota. È la fotocopia di un manichino ben vestito.
---
Smontare la frase al banco
A quel punto faccio quello che fa un falegname quando vede una venatura storta nel legno: fermo la macchina, muto la traccia guida e mi rileggo le righe sul leggio con calma.
Non sto facendo l'artista ispirato e non c'è nessuna magia: è pura analisi di bottega.
Mi chiedo dove sta il perno della frase. L'inventore non deve recitare l'entusiasmo da televendita; deve avere la tranquillità di chi ha capito una cosa prima degli altri. Quindi la prima parte deve appoggiarsi, la seconda deve chiarire, il finale deve chiudere senza enfasi, quasi con naturalezza.
Faccio una terza prova. Allargo un tempo di mezzo secondo. Lascio un'esitazione minuscola prima del termine tecnico, come se stessi visualizzando il pezzo che si incastra. Registro. Riascolto.
Adesso c'è il senso. Il tempo è leggermente diverso da quello della guida — come aveva previsto il cliente — ma il discorso adesso sta in piedi da solo.
---
Il trucco di bottega: ribaltare la timeline
A fine sessione, dentro REAPER ho tre registrazioni per ogni blocco: 1. Take 1: quello registrato per primo, ancora troppo influenzato dalla cadenza della guida. 2. Take 2: una via di mezzo, tecnicamente corretta ma non del tutto centrata. 3. Take 3: l'ultimo, quello dove ho capito il testo e l'intenzione funziona.
Se prendo i file e li esporto così come sono, il cliente riceverà: Take 1, Take 2, Take 3.
È una cattiva abitudine. Il cliente non è lì con me a fare l'analisi del testo: sta lavorando, ha fretta, deve montare l'audio e mandare avanti il progetto. Se apre la traccia e la prima cosa che sente è il Take 1, sentirà una versione che assomiglia fin troppo alla guida che aveva già. Rischia di pensare che quello sia il massimo che si poteva tirare fuori, o di scegliere la prima per sbrigarsi.
Allora si fa una cosa semplicissima: si rivoluziona la timeline.
Prendo l'ultimo take — quello più ragionato e riuscito — e lo sposto all'inizio. Diventa la prima proposta. I primi due take scalano a fare da riserva: se per caso il montatore ha un taglio video blindato al millesimo e non può allungare l'inquadratura, ha subito dopo le versioni più strette senza dovermi chiedere un rifacimento.
Ma intanto la prima cosa che ascolta è quella giusta.
---
Questione di mestiere, non di battaglie
Non c'è nessuna guerra contro l'intelligenza artificiale da vincere. Le guide sintetiche sono comodissime e continueremo a riceverne sempre di più.
L'unica cosa che cambia per noi è la concentrazione: prima le guide le faceva un assistente di studio che magari leggeva male ma parlava da essere umano; oggi le fa un software che parla benissimo ma non ha idea di cosa sta dicendo.
Il nostro lavoro resta quello di sempre: capire cosa c'è scritto, togliere quello che non serve e mettere il risultato sul banco in modo che chi deve usarlo lo trovi pronto.
---
Guarda il video
Nel video registrato direttamente in studio mostro il confronto con la traccia guida sintetica, la ricerca del sottotesto e il ribaltamento dei take sulla timeline prima della consegna.

Apri il video sul sito originale

