Intelligenza Artificiale

Google lancia un assistente AI con volto animato per le aziende

Gemini 3.8 Live con Live Avatar combina voce, video generato in tempo reale e accesso agli strumenti aziendali, ma la vera sfida è dimostrarne l'utilità concreta

Gemini Live Avatar: l'AI di Google parla con un volto animato

Il 24 settembre 2026 Google ha presentato Gemini 3.8 Live con Live Avatar: un assistente conversazionale basato sull'intelligenza artificiale che risponde non solo a voce, ma anche con un volto animato sincronizzato in tempo reale. Le labbra seguono le parole generate, le espressioni cambiano durante il dialogo e il ritmo della conversazione cerca di replicare quello di una videochiamata vera. Non si tratta di un video preregistrato, ma di un'animazione generata mentre l'interazione è in corso.

La funzione è disponibile nell'ambiente enterprise di Google, cioè riservata alle organizzazioni e agli sviluppatori aziendali, anche tramite API. Google ha attivato server negli Stati Uniti e nell'Unione europea. Al momento, questa novità non riguarda l'app Gemini per i consumatori comuni.

Cosa cambia rispetto a prima

Gemini Live già sapeva sostenere conversazioni vocali e usare immagini, la fotocamera o la condivisione dello schermo come contesto. La novità di Live Avatar riguarda soprattutto la risposta: oltre a parlare, l'assistente si presenta come un personaggio visibile, con movimenti sincronizzati alla voce. Google dichiara che il sistema può passare tra 97 lingue nel corso della stessa conversazione, adattando sia il parlato sia la sincronizzazione del volto. È una capacità promettente per servizi internazionali, ma la qualità andrà verificata lingua per lingua e nei dialoghi reali.

Un caso d'uso concreto aiuta a capire la logica del prodotto. Immaginiamo un cliente che voglia segnalare un danno alla propria auto a una compagnia assicurativa: può descriverlo a voce e mostrarlo alla fotocamera. L'agente virtuale raccoglie i dettagli, interroga i sistemi dell'azienda in parallelo e continua a parlare mentre attende una risposta. In una dimostrazione, Google mostra proprio questo flusso applicato a una pratica assicurativa. Le chiamate ai sistemi aziendali avvengono in sottofondo, riducendo le pause percepibili dall'utente.

Capire un'immagine, interrogare un database e rispondere a voce hanno valore anche senza avatar

Dove il volto aiuta davvero e dove no

La presenza di un volto animato non è sempre un vantaggio. Una guida interattiva su un sito, un chiosco informativo o una procedura da seguire passo passo sullo schermo possono trarre beneficio da un interlocutore visibile, se questo aiuta l'utente a orientarsi. Per comunicare lo stato di una spedizione o rispondere a una domanda semplice, la stessa presenza potrebbe aggiungere poco rispetto a una risposta vocale rapida. Il precedente di Google Duplex — il sistema che qualche anno fa conduceva conversazioni telefoniche per prenotare tavoli o appuntamenti — ricorda che naturalezza conversazionale e capacità di completare un compito sono qualità collegate ma distinte. All'epoca, Google sottolineava già l'importanza di informare l'interlocutore che stava parlando con un sistema automatizzato.

La ricerca accademica invita a misurare l'effetto del volto piuttosto che darlo per scontato. In uno studio su chiamate automatizzate, Yuqian Xu e colleghi hanno rilevato che caratteristiche più umane della voce aumentavano del 10,1% la probabilità che l'interlocutore manifestasse intenzione di accettare un ordine. Ma quel risultato riguarda la sola componente vocale, non il video. In un altro studio sperimentale, Owen Carter e colleghi non hanno trovato un miglioramento della fiducia legato al solo aspetto da avatar: risultavano più efficaci i segnali vocali che comunicavano informazioni concrete sull'affidabilità del sistema. La domanda rimane aperta: che cosa comunica un volto che la voce, da sola, non riesce a comunicare?

Il mercato non aspetta

Google non è il primo a proporre conversazioni video generate in tempo reale. Tavus aveva già lanciato conversazioni video in tempo reale con repliche digitali, mentre altri fornitori permettono di aggiungere una componente visiva a un agente vocale già esistente. Il vantaggio che Google offre alle imprese è l'integrazione diretta con le capacità conversazionali e gli strumenti del proprio ecosistema. Chi ha già un assistente vocale funzionante dovrà valutare se conviene adottare un sistema più integrato oppure mantenere separata la parte video. Per decidere, servono confronti nello stesso percorso utente: richieste risolte, tempo impiegato, soddisfazione, interventi degli operatori e costo complessivo della sessione.

Sul fronte economico, Google pubblica prezzi di riferimento per Gemini 3.8 Live di 0,005 dollari al minuto per l'audio in ingresso e 0,018 dollari al minuto per quello in uscita. Ma queste tariffe non descrivono il costo reale di un servizio con video, connessioni ai sistemi aziendali e capacità riservata. C'è anche un limite tecnico rilevante: con l'avatar attivo, il modello supporta pochi minuti di interazione continuativa e può occasionalmente rallentare o interrompersi per scadenza della sessione. Per un'accoglienza breve può bastare; un'assistenza complessa richiede di progettare in anticipo come riprendere il filo del dialogo e quando passare a un operatore umano.

Un avatar personalizzato con il volto di una persona reale richiede verifiche e attenzione ai diritti sull'immagine

Personalizzazione e trasparenza

Le aziende possono scegliere tra avatar predefiniti oppure crearne uno partendo da un'immagine di riferimento, ma quest'ultima opzione è riservata a clienti selezionati e soggetta a verifiche dichiarate da Google. Un volto riconoscibile può rafforzare l'identità di un servizio, ma richiede attenzione ai diritti sull'immagine e al consenso della persona eventualmente rappresentata. Google afferma di incorporare SynthID nell'audio e nel video generati: si tratta di una marcatura impercettibile pensata per rendere rilevabile l'origine artificiale del contenuto, ma non è un avviso che l'utente vede o sente automaticamente durante la conversazione.

In Italia e nel resto dell'Unione europea, questa distinzione ha conseguenze concrete. Gli obblighi di trasparenza dell'AI Act applicabili dal 2 agosto 2026 distinguono la marcatura rilevabile dalle macchine dall'informazione rivolta a chi interagisce direttamente con il sistema. Le indicazioni della Commissione europea prevedono, nei casi soggetti all'obbligo, una comunicazione chiara fin dall'inizio dell'interazione. La presenza di SynthID, da sola, non stabilisce come un'implementazione specifica informi il cliente. Per un'azienda italiana che inserisca l'avatar sul proprio sito, il punto da verificare è ciò che il visitatore comprende prima ancora di cominciare a parlare.

Il rischio di sembrare più sicuro del necessario

Un volto che reagisce in modo fluido può rendere più piacevole una procedura. Può anche indurre l'utente a interpretare una risposta incerta come più affidabile di quanto sia. Nei primi impieghi aziendali sarà importante osservare dove l'avatar aiuta davvero a procedere, e dove invece occorre rendere più evidente un limite della sessione, un dubbio irrisolto o la possibilità concreta di parlare con una persona.