Meituan ha recentemente annunciato la disponibilità di LongCat-2.0, il suo nuovo modello linguistico open Mixture-of-Experts (MoE). Con 1.6 trilioni di parametri totali e circa 48 miliardi di parametri attivi per token, il modello si focalizza sull’agentic coding: la comprensione del codice, la sua generazione e l’esecuzione all’interno dei flussi di lavoro agentici.
Che cosa è LongCat-2.0
LongCat-2.0 è il modello open della prossima generazione di Meituan, seguendo LongCat-Flash, un modello con 560 miliardi di parametri lanciato nel 2025. L’architettura è stata progettata con uno scopo specifico: un coding agenticco affidabile ed efficiente.
Il pretraining ha coperto più di 35 trilioni di token in milioni di ore di acceleratori, senza roll-back o perdite irreparabili durante l’intero processo. Questo è un risultato notevole quando si utilizza hardware non Nvidia, dove gli strumenti sono meno maturi.
Aridituri: Come un Modello da 1.6T Sia Economico da Eseguire
La sua architettura combina quattro idee per ridurre il costo della scalabilità.
- Zero-computation experts: Non tutti i token richiedono un calcolo pesante. I token semplici, come la punteggiatura, vengono indirizzati a un esperto a zero calcolo e non modificati. Solo i token complessi coinvolgono un maggiore utilizzo degli esperti.
- LongCat Sparse Attention (LSA): L’attenzione standard cresce quadraticamente con la lunghezza del contesto. LSA seleziona solo i token più rilevanti, riducendo l’escalation a una crescita quasi lineare.
- N-gram Embedding: Il modulo aggiunto ha 135 miliardi di parametri e cattura relazioni dense tra i token locali, riducendo inoltre l’I/O della memoria durante la decodifica in batch.
- Post-training (MOPD): Un processo dedicato fonde tre gruppi di esperti diversi che coprono le capacità di agente, ragionamento e interazione.
Per l’esecuzione, Meituan utilizza uno schema di parallelismo 6D e un’architettura prefill-decode separata. Vengono impiegati anche "super kernel" e prefetching del peso L2-cache per nascondere latenza.
Dettagli Tecnici
LSA integra tre tecniche indipendenti a livello: Indexing Streaming-aware, Indexing Cross-Layer e Indexing gerarchico. La combinazione mantiene un'ampia finestra di contesto da 1 milione di token senza limiti di memoria.
Preferenze di Utilizzo
- Contesto da 1 milione di token: Il modello ha una finestra nativa di contesto con 1 milione di token.
- Tecnologia LSA: Riduce drasticamente i costi di contesto lungo.
- Hardware domestico: Entrenamento e servizio completi senza hardware Nvidia.
Benchmark
Meituan posiziona LongCat-2.0 come strumento specifico per il coding agenticco. Di seguito alcuni benchmark generati da Meituan stesso.
- SWE-bench Pro: 59.5 su compiti di ingegneria software reale.
- Terminal-Bench 2.1: 70.8 su esecuzione e recupero da errori in shell.
- SWE-bench Multilingual: 77.3 su task cross-lingua su repository.
Meituan riferisce che LongCat-2.0 abbia superato GPT-5.5 (58.6) e abbia una prestazione comparabile al modello Gemini 3.1 Pro di Google. LongCat-2.0 mostra però una performance inferiore su benchmark generali come FORTE e BrowseComp. La conferma indipendente degli scaldi non è disponibile.
Confronto con LongCat-Flash
Il passaggio dalla versione precedente è notevole. Ecco una tabella basata sulle specifiche pubblicate di ciascun modello.
- Parametri totali: 1.6T vs 560B (LongCat-Flash).
- Parametri attivi per token: 48B (da 33B a 56B) vs 27B (da 18.6B a 31.3B).
- Contesto: 1Milione di token (LongCat-2.0) vs 128K token (LongCat-Flash).
- Attenzione a lungo contesto: LSA (LongCat-2.0) vs Attenzione Latente Multi-testa (LongCat-Flash).
- Hardware riportati: Superpods asic domestici (LongCat-2.0) vs H800 GPU (LongCat-Flash).
- Output massimo: 128K token, LongCat-Flash non specificato.
- License: MIT per entrambi.
- Lanciato: 30 Giugno 2026, Settembre 2025 per LongCat-Flash.
- Pesi: Presto da LongCat-2.0, Open per LongCat-Flash.
Casi d'Uso Con Esempi
LongCat-2.0 è addestrato su lavoro agenticco specifico e non su conversazioni casuali.
- Ragionamento su interi repository: Inserisci un intero codicebase di medio dimensione nel contesto da 1 milione di token e chiedi al modello di tracciare un bug attraverso molteplici file.
- Task multi-step nel terminale: Lavora il modello all'interno ciclo di un agente con accesso al shell. Può eseguire comandi, leggere errori e riprodurre finché un task si concluda correttamente.
- Edizioni di livello repository: Chiedi di apportare modifiche che coinvolgano diversi moduli e test.
- Conversione tra linguaggi: Usa SWE-bench Multilingual per repository poliglotti. Il modello può portare logica da un linguaggio all’altro mantenendo il comportamento.
Come Accedervi
LongCat-2.0 è accessibile tramite la piattaforma API LongCat. Espongono punti finali compatibili con OpenAI e Anthropic. Il modello è su OpenRouter e in strumenti come Claude Code, OpenClaw, OpenCode, Codex. L’auto hosting locale non è disponibile finché i pesi non saranno rilasciati.
L’endpoint compatibile con OpenAI utilizza l’ID modello LongCat-2.0. Sotto è mostrata una richiesta API.
Ecco un frammento per chiamare l’endpoint.
pip install openai
from openai import OpenAI
client = OpenAI(
apikey="YOURLONG