Junyang Lin, che ha guidato il progetto linguistico Qwen di Alibaba, ha annunciato la sua decisione di lasciare la posizione il 3 marzo 2026. Ora si presenta come ricercatore indipendente. Nel suo intervento intitolato “Qwen: Towards a Generalist Model / Agent”, Lin ha presentato un percorso approfondito della famiglia Qwen, che include diverse versioni come QwQ-32B, Qwen2.5-Max, Qwen3, Qwen2.5-VL e Qwen2.5-Omni. Ogni versione ha mostrato benchmarking rispetto ai concorrenti, con basi nominate come DeepSeek-R1, Grok 3 Beta, Gemini 2.5 Pro e OpenAI.

La Struttura Architetturale di Qwen3

Nel suo discorso, Lin spiega gli aspetti architetturali chiave del modello Qwen3, che copre modelli di dimensioni diverse e diverse architetture. Per esempio, i modelli densi hanno una configurazione di embedding collega e di contesto limitato, mentre i modelli più grandi usano un contesto più ampio e un numero maggiore di esperti. I modelli MoE attivano 8 esperti di 128 in totale.

Ecco una riproduzione delle tabelle architetturali:

    • Qwen3-0.6B: 28 layers, 16/8 heads, 32K context
    • Qwen3-1.7B: 28 layers, 16/8 heads, 32K context
    • Qwen3-4B: 36 layers, 32/8 heads, 32K context
    • Qwen3-8B: 36 layers, 32/8 heads, 128K context
    • Qwen3-14B: 40 layers, 40/8 heads, 128K context
    • Qwen3-32B: 64 layers, 64/8 heads, 128K context
    • Qwen3-30B-A3B: 48 layers, 32/4 heads, 128K context
    • Qwen3-235B-A22B: 94 layers, 64/4 heads, 128K context

Il Pensiero Misto e le Difficoltà nell’Unificare

Lin descrive in modo chiaro il concetto di pensiero misto. Tuttavia, illustra le complessità nel cercare di unire due modi di ragionare, che lui identifica come “mode di istruzione” – breve, diretto e veloce. Questo tipo di modello è incentivato da una risposta diretta. Il “thinking mode”, invece, richiede una maggiore elaborazione su problemi complessi e quindi si incentiva sull’uso di molteplici tokens.

Per unire i due modelli, Qwen3 ha adottato una pipeline di post-addestramento a quattro stadi, che include un cold start con lungo ragionamento, il reforzamento logico e il passo finale per unire i due modelli. Lin sottolinea però che la fusione non è facile. La pipeline si basa soprattutto su un problema di dati, non tanto su un problema di modello in sé.

Il Passaggio da Pensiero a Azione

Lin distingue due ere nella storia dell’intelligenza artificiale: da una parte un periodo centrato sui modelli di ragionamento, con modelli come o1 e DeepSeek-R1, in cui la ricompensa derivava da risposte verificabili in settori tecnici come la matematica, il coding e la logica. Dall’altra parte, oggi emerge il pensiero agente, ovvero l’abilità di formulare piani, scegliere quando attivare strumenti, utilizzare i dati dell’ambiente e revisionare le decisioni in base alla risposta che riceve.

Il pensiero agente richiede di rispondere a sfide che il ragionamento puro ha tradizionalmente evitato:

    • Decidere quando interrompere la riflessione e agire
    • Scegliere gli strumenti da attivare e quando farlo
    • Incorporare osservazioni parziali o rumorose dall’ambiente esterno
    • Rivedere i piani in seguito a fallimenti
    • Restare coerenti in contesti complessi e con molteplici interazioni

Gli Esempi di Utilizzo

Il cambio di focus ridefinisce il modo in cui vengono costruiti diversi agenti:

    • Codifica: Mentre un modello di ragionamento emette una singola correzione, un agente autonomo esegue test multipli, esamina la risposta reale e modifica fino a quando l’intera suite passa.
    • Ricerca avanzata: Il ragionamento produce una lunga risposta basata su memoria, mentre un agente divide la domanda in sottodomande, utilizza fonti e richiama citazioni concreto.
    • Gestione multi-agente: Lin sottolinea il ruolo crescente delle "harness engineering", in cui un gestore costruisce piani e assegna compiti a vari agenti specializzati.

Un Aspetto Concettuale: Il Commutatore di Pensiero

Lin mostra che il supporto per il pensiero ibrido non è solo concettuale, ma anche concretamente implementabile. Esiste un flag denominato enable_thinking che permette di attivare il ragionamento in modo mirato durante l’interazione con il modello. Per esempio:

enable_thinking=True

Tale impostazione è il comportamento predefinito, e include il ragionamento nel blocco <thinking>. Qwen3 permette anche di attivarlo dinamicamente aggiungendo /think o /nothink nei messaggi.

Le Sfide Tecnologiche nella Formazione Agente

Uno dei punti chiave del discorso riguarda il lato ingegneristico. La formazione RL (Reinforcement Learning) basata su ragionamento è una questione di generazione di dati e verifiche. Nel caso degli agenti, invece, l’interazione con strumenti, browser, sandbox e terminali richiede una separazione pulita tra addestramento e inferenza. Senza questa distinzione, la scalabilità delle esecuzioni cade, e la capacità calcola si riduce.

Inoltre, Lin evidenzia che il focus deve spostarsi da una diversità dei dati (come nel SFT Supervised Fine-Tuning) a una qualità dell'ambiente, che include stabilità, realismo, copertura e resistenza agli exploit. Riconosce che il hacking delle ricompense è la sfida più difficile, poiché l'accesso agli strumenti amplifica i canali di exploit di ottimizzazione spuri.

Conclusioni

Lin conclude riconoscendo che il modello ibrido non è il futuro. La prossima fase chiave si chiama “agenti”, dove le capacità di reazione attiva al mondo esterno diventano centrali. Questi agenti non seguono solo i dati, ma formulano piani, interagiscono, e adattano le azioni in base alle risposte ricevute. Lin auspica una ridefinizione completa di metodi di training e infrastrutture per abbracciare questa complessità in modo robusto.

Read original article →
← Back to news