Tencent ha lanciato Hy3, un modello Misto di Esperti (MoE) aperto con 295 miliardi di parametri e un contesto enorme da 256mila token. Il modello, sviluppato dal team Hy, attiva solo 21 miliardi di parametri per token, il che consente di mantenere il consumo di risorse hardware a livelli bassi. L'implementazione segue la licenza Apache License 2.0 e si adatta a compiti come ragionamento, workflow agente e attività contestuali estese.
Che cos'è Hy3?
Hy3 utilizza un'architettura MoE (Misto di Esperti), con 192 esperti e routing top-8. Per ogni token, vengono richiamati soltanto 8 esperti, il che riduce notevolmente la computazione necessaria. Inoltre, il modello integra uno strato chiamato Multi-Token Prediction (MTP), che prevede diversi token contemporaneamente accelerando la fase di decoding. Questo meccanismo è abilitato attraverso la decodifica speculativa, supportata da framework come vLLM e SGLang.
Ecco i principali dettagli tecnici:
- Rete: Misto di Esperti (MoE)
- Totali parametri: 295B
- Parametri attivati: 21B
- Parametri dello strato MTP: 3.8B
- Strati (escluso MTP): 80
- Strati MTP: 1
- Teste di attenzione: 64 (GQA, 8 teste KV, dimensione testa 128)
- Dimensioni nascoste: 4096
- Dimensione intermedia: 13312
- Lunghezza contesto: 256K
- Dimensione vocabolario: 120832
- Esperti totali: 192 esperti, top-8 attivati
- Precisioni supportate: BF16
E' stato rilasciato un checkpoint separato chiamato Hy3-FP8, che supporta la precisione FP8 con un footprint di memoria più basso, ideale per una distribuzione economicamente vantaggiosa.
Risultati sui benchmark e prestazioni
La squadra di ricerca ha pubblicato una serie di risultati su benchmark per attività di codice, agentiche e STEM. Sulle metriche di codifica, Hy3 raggiunge 78.0 punti su SWE-Bench Verified, 57.9 su SWE-Bench Pro e 75.8 su SWE-Bench Multilingual. Sui test di benchmark di attività terminali e software, i risultati sono rispettivamente 71.7 (per Terminal-Bench 2.1) e 28.0 (per DeepSWE).
Nei settori del ragionamento e STEM, i risultati di Hy3 sono impressionanti. Sui benchmark USAMO e IMO, il modello segna rispettivamente 72.0 e 90.0. HLE (con strumenti) punta a 53.2. Gli esperti hanno condotto un test cieco con 270 partecipanti, raccogliendo 312 confronti validi su workflow reali. In questo test, Hy3 ottiene un punteggio massimo di 2.67 su 4, superando il GLM-5.1 a 2.51. Il vantaggio è evidente particolarmente su frontend, CI/CD e gestione dati.
Affidabilità e comportamenti in produzione
La squadra di ricerca ha dedicato molta attenzione all'affidabilità del modello in produzione e ha mirato a risolvere tre modelli di fallimento interni:
Chiamate a strumenti e formattazione dell'output
Sono state riparate problematiche di stabilità di base che causavano malfunzionamenti negli agenti. I chiamaggi a strumenti non validi che attivavano cicli infiniti sono diminuiti notevolmente. Hy3 mostra una buona generalizzazione attraverso diversi scaffoldings di agenti. Sui benchmark di SWE-Bench Verified, la variazione di accuratezza tra CodeBuddy, Cline e KiloCode si mantiene entro il 4%.
Conoscenza del mondo e anti-hallucinazioni
L'obiettivo principale consiste nel fornire risposte solo quando basate su dati verificati, segnalando quando i dati non sono sufficienti. Internamente, il modello ha ridotto il tasso di hallucinazioni dal 12.5% al 5.4%. Il tasso di errori di senso comune è passato dal 25.4% al 12.7%.
Tracciamento dell'intento multi-turn
Gli addestramenti congiunti SFT (Supervised Fine-Tuning) e RL (Reinforcement Learning) hanno ridotto da 17.4% a 7.9% il tasso di errori interni. I punteggi su benchmark MRCR (Multiple Round Contextual Retrieval) sono migliorati da 42.9% a 75.1%.
Come richiamare Hy3
Hy3 espone un’API compatibile con OpenAI. Si può distribuire il modello con piattaforme come vLLM o SGLang, successivamente chiamando l'endpoint. Un flag chiamato reasoning_effort controlla quanto il modello riflette. Un esempio di utilizzo in Python è il seguente:
Copy Code
Utilizzare nothink per risposte dirette, e high per task di tipo matematico o multistep complessi. La squadra di ricerca di Tencent consiglia di impostare i parametri temperature=0.9 e topp=1.0. Hy3 è anche accessibile gratuitamente tramite OpenRouter, seguendo il percorso tencent/hy3:free, con un prezzo di 0$ a token. La versione gratuita avrà una scadenza il 21 luglio 2026.
Applicazioni e settori di utilizzo
Hy3 è ottimizzato per attività con contesti lunghi e agenti autonomi. Un esempio concreto include:
- Agenti di codifica: Inserire il codice completo di un repository nel limite contestuale di 256K token. Richiedere a Hy3 di correggere un test fallito utilizzando reasoning_effort="high". Le chiamate stabili a strumenti lo supportano durante l'editing su diversi file.
- Elaborazione di documenti: Trasmettere un lungo contratto o una relazione finanziaria come contesti. La formazione di anti-hallucinazioni rid