Gander di Tencent: una nuova architettura per le conversazioni naturali con l'intelligenza artificiale

Il team Hunyuan Speech di Tencent, in collaborazione con ricercatori di diverse università, ha presentato Gander, un modello di intelligenza artificiale innovativo progettato per mantenere conversazioni naturali e fluide mentre gestisce contemporaneamente compiti complessi in background. Secondo il rapporto tecnico pubblicato dai ricercatori, Gander è in grado di elaborare contemporaneamente discorso, immagini e testo, rappresentando un significativo avanzamento nella progettazione di sistemi conversazionali basati su intelligenza artificiale.

Quello che distingue Gander dagli attuali assistenti vocali è la sua capacità di simulare il comportamento umano nelle conversazioni naturali. Gli assistenti vocali odierni, come sottolineano i ricercatori, funzionano principalmente secondo un modello di turni: uno parla mentre l'altro ascolta, e poi i ruoli si invertono. Tuttavia, nelle conversazioni umane reali, le persone si interrompono a vicenda, forniscono feedback rapidi e possono ascoltare mentre parlano simultaneamente. Gander è stato progettato specificamente per replicare questo tipo di interazione naturale, elaborando continuamente video, discorso e testo anche mentre produce risposta vocale.

L'architettura innovativa: cervelletto e cervello

La soluzione tecnologica proposta da Gander affronta un problema fondamentale nello sviluppo dei modelli di intelligenza artificiale conversazionale: il conflitto tra la necessità di risposte rapide, tipiche della conversazione naturale, e il tempo necessario per compiere ragionamenti complessi, come la ricerca in file o la scrittura di codice. Un singolo modello deve bilanciare la velocità con la capacità di ragionamento, e questo compromesso compromette spesso l'esperienza complessiva dell'utente.

Per risolvere questo problema, Gander implementa un'architettura affascinante mutuata dalla struttura anatomica umana, dividendo il lavoro tra due componenti principali: il "cervelletto" e il "cervello".

  • Il cervelletto: gestisce le conversazioni in tempo reale, decidendo quando ascoltare, quando parlare e quando rispondere agli interruttori dell'utente. Questo componente deve operare con latenza minima per garantire interazioni naturali e fluide.
  • Il cervello: affronta il ragionamento e i compiti complessi in background, come il debug di codice, la ricerca di informazioni o l'analisi approfondita di dati. Questo componente ha più tempo per pensare e pianificare, senza compromettere l'esperienza conversazionale.

Un aspetto particolarmente innovativo di questa architettura è che il "cervello" è intercambiabile. Può essere sostituito con sistemi di agenti come Codex o Claude Code senza dover riallenare il modello di conversazione. Nei test, il team di Tencent ha utilizzato un modello non specificato dalla famiglia GPT-5.6 di OpenAI per questo ruolo. Con il miglioramento del modello sottostante, l'intero sistema beneficia automaticamente di questi avanzamenti, rappresentando un approccio scalabile e future-proof.

Come funziona il meccanismo di interruzione

Gander suddivide le conversazioni in segmenti di un secondo, permettendo al cervelletto di prendere decisioni in tempo reale su quando ascoltare, parlare o arrestarsi se l'utente lo interrompe. Un aspetto tecnico significativo è che il sistema prende queste decisioni senza un modulo separato dedicato al rilevamento dell'inizio e della fine della voce, utilizzando invece approssimativamente gli ultimi due minuti di conversazione come memoria contestuale.

Questo approccio minimalista riduce la latenza e semplifica l'architettura complessiva, permettendo al sistema di rispondere più rapidamente agli input dell'utente. La capacità di gestire gli interruttori naturali è fondamentale per un'esperienza conversazionale convincente, poiché una vera conversazione umana è piena di momenti in cui una persona parla sopra l'altra, pone domande rapidamente o fornisce correzioni al volo.

Performance nei test e nei benchmark

Poiché non esisteva ancora un test dedicato specificatamente per modelli come Gander, i ricercatori si sono rivolti a benchmark consolidati per valutare le prestazioni del sistema. Il rapporto indica che Gander ha ottenuto i migliori risultati di timing su Full-Duplex-Bench v3, un benchmark che testa gli assistenti vocali in diversi scenari di attività.

I risultati di Gander nel test Full-Duplex-Bench v3:

  • Inizia a parlare al momento giusto in tutti i 100 scenari di test
  • Interrompe gli utenti solo nell'8% dei casi
  • Supera significativamente i concorrenti testati: GPT-Realtime interrompe gli utenti nel 13,5% dei casi, e il competitor più debole lo fa nel quasi 48% dei casi
  • Utilizza un modello relativamente piccolo per competere con sistemi commerciali di alto livello come GPT-Realtime, Gemini Live e Grok

Questi risultati dimostrano che Gander eccelle nel mantenere un timing conversazionale naturale, un aspetto cruciale per un'esperienza utente convincente. Tuttavia, i risultati mostrano anche un compromesso importante: mentre Gander riduce gli interruttori indesiderati, la sua accuratezza nei compiti è leggermente inferiore rispetto al competitor più debole testato.

Il compromesso tra timing e accuratezza

I ricercatori attribuiscono in parte il calo nell'accuratezza dei compiti al fatto che il test valuta l'intero sistema, il che significa che gli errori di riconoscimento vocale e gli errori di output vengono conteggiati nel risultato finale. Quando al cervello viene fornito direttamente testo, senza passare attraverso il riconoscimento vocale, le prestazioni migliorano significativamente, dimostrando che il nucleo del sistema è più capace di quanto i numeri complessivi suggeriscano.

Un'area di debolezza particolare riguarda la comprensione di video e audio. Gander ha avuto prestazioni peggiori rispetto al suo modello di base in uno dei test, una situazione che i ricercatori attribuiscono all'allenamento del sistema, che favorisce una conversazione fluida rispetto alla percezione precisa. Ciò è particolarmente evidente in compiti come il conteggio degli oggetti in un'immagine o la loro localizzazione spaziale. Questo suggerisce che il focus sull'ottimizzazione per la conversazione naturale ha comportato un compromesso nelle capacità percettive pure, un trade-off che potrebbe essere affrontato con metodologie di allenamento più sofisticate in futuro.

Dati di allenamento e dataset

Gander è stato allenato su circa 2,7 milioni di esempi, un dataset significativo ma non straordinariamente grande rispetto ad alcuni modelli contemporanei. All'interno di questo dataset, alcuni esempi sono specificamente progettati per insegnare al sistema quando rimanere silenzioso, come quando c'è rumore di fondo significativo o quando nessuno in un gruppo di conversazione si sta rivolgendo direttamente al modello. Questo tipo di allenamento specifico è essenziale per creare un'esperienza conversazionale naturale e non intrusiva.

Piano per il rilascio open source

Il team di Tencent ha annunciato ambiziosi piani per democratizzare l'accesso a Gander. I ricercatori intendono pubblicare i pesi del modello e i dati di allenamento una volta completato "il processo di rilascio open source". Già oggi, un repository GitHub per il codice esiste ed è disponibile pubblicamente, con demo disponibili sulla pagina del progetto. Questo approccio aperto è coerente con la filosofia della ricerca moderna in intelligenza artificiale, dove la comunità scientifica beneficia della trasparenza e della collaborazione.

Il contesto più ampio: la strategia di Tencent per gli agenti IA

Gander non rappresenta un progetto isolato per Tencent, ma fa parte di una strategia più ampia volta a posizionare l'azienda come leader nello sviluppo di sistemi di agenti IA intelligenti e pratici. Nel luglio 2026, Tencent ha rilasciato Hy3, un modello linguistico open che avrebbe ridotto significativamente il divario con i rivali, specialmente nei compiti di agente. Hy3 è già in uso all'interno di prodotti Tencent come WorkBuddy, Yuanbao e WeChat, dimostrando come l'azienda integri le sue ricerche in prodotti reali a livello consumer.

Inoltre, Tencent sta negoziando per acquisire la più grande partecipazione nella startup di agenti Manus dopo che Pechino ha bloccato l'acquisizione da parte di Meta. L'azienda vede questo accordo come una naturale estensione dei suoi piani, incluso l'integrazione di un agente embedded in WeChat, la sua piattaforma di messaggistica dominante con miliardi di utenti.

Tendenze industriali: orchestrazione del lavoro tra modelli

Gander rappresenta una tendenza più ampia nell'industria dell'IA dove le aziende stanno sperimentando con l'orchestrazione del lavoro attraverso molteplici modelli specializzati, piuttosto che tentare di costruire un singolo modello che eccella in tutte le aree. Questa strategia di "divisione del lavoro" sta diventando sempre più popolare:

  • GPT-Live di OpenAI: separa la conversazione dal ragionamento, delegando ricerche web e compiti di agente a un modello in background mentre la chat continua naturalmente in primo piano
  • Fugu di Sakana AI: un modello linguistico separato che chiama altri modelli da un pool espandibile in base alle necessità specifiche
  • Agenti proattivi di OpenAI: sistemi in fase di test che creano compiti di follow-up e contattano gli utenti senza essere richiesti, rappresentando un ulteriore livello di autonomia

Sfide pratiche nel gestire interruzioni e latenza

Nonostante i progressi, rimangono sfide significative nel gestire interruzioni naturali e ridurre i ritardi nei sistemi conversazionali con agenti IA. Un'analisi di Anthropic ha scoperto che gli utenti esperti interrompono Claude Code in circa il 9% dei passaggi di lavoro, rispetto a circa il 5% per i principianti. Questo suggerisce che l'adattamento ai diversi stili di interazione utente è un problema che i sistemi attuali non risolvono completamente.

I team che costruiscono agenti conversazionali vocali e chat riferiscono frequentemente di problemi di latenza, secondo un'indagine di settore. La latenza è particolarmente critica in questi sistemi perché gli utenti hanno aspettative molto elevate sulla velocità di risposta: un ritardo anche minimo di pochi centesimi di secondo può far sembrare l'interazione innaturale e frustrante. Gander affronta questo problema con il suo design di "cerebelletto" dedicato, ma il problema rimane una sfida aperta per l'industria nel suo complesso.

Lo stato della ricerca e le domande aperte

I ricercatori di Tencent sono espliciti nel sottolineare che il lavoro su Gander è ancora nelle fasi iniziali. Una domanda fondamentale rimane irrisolta: come scalare Gander verso modelli più grandi senza perdere i vantaggi di timing che caratterizzano il sistema attuale? Scalare da un modello "relativamente piccolo" a uno competitivo con i modelli frontier contemporanei potrebbe richiedere innovazioni architetturali significative.

Inoltre, non esiste ancora un modo standard per valutare sistemi come Gander. La comunità di ricerca IA manca di benchmark consolidati e universalmente riconosciuti per i sistemi conversazionali con capacità di agente in background. Ciò rende difficile confrontare obiettivamente i progressi tra diverse organizzazioni e creare aspettative comuni per le prestazioni del sistema.

Implicazioni per il futuro dei sistemi conversazionali

Gander rappresenta un passo importante verso assistenti IA che possono interagire con gli utenti in modo che rispecchia più fedelmente le conversazioni umane naturali. La capacità di mantenere una conversazione fluida mentre si risolvono simultaneamente problemi complessi in background potrebbe trasformare il modo in cui gli utenti interagiscono con i sistemi IA quotidianamente. Invece di una serie di scambi sequenziali e imbarazzanti con un modello IA, gli utenti potrebbero avere esperienze conversazionali genuinamente collaborative.

Tuttavia, come dimostrano i risultati dei test, ci sono ancora compromessi significativi da risolvere. Mantenere il timing naturale mentre si preserva l'accuratezza dei compiti, specialmente per compiti che richiedono percezione visiva e uditiva precisa, rimane una sfida non completamente risolta. Man mano che il campo avanza, probabilmente vedremo ulteriori iterazioni su questo tipo di architetture divise, con miglioramenti continui in tutti gli aspetti delle prestazioni.

Conclusione

Gander di Tencent rappresenta un contributo significativo alla ricerca su sistemi conversazionali intelligenti, dimostrando che è possibile progettare architetture che mantengono conversazioni naturali e fluide mentre risolvono simultaneamente compiti complessi in background. Attraverso l'uso innovativo di una metafora anatomica (cervelletto e cervello), il sistema divide elegantemente il problema della latenza dalla complessità del ragionamento. I piani di Tencent per il rilascio open source, combinati con la sua strategia più ampia di integrazione di questi sistemi nei suoi prodotti di massa come WeChat, suggeriscono che questa ricerca avrà implicazioni significative per milioni di utenti. Mentre rimangono sfide da affrontare, in particolare nella scalabilità e nella percezione audio-visiva, Gander offre una visione promett