Meituan ha recentemente annunciato la disponibilità di LongCat-2.0, il suo nuovo modello linguistico open Mixture-of-Experts (MoE). Con 1.6 trilioni di parametri totali e circa 48 miliardi di parametri attivi per token, il modello si focalizza sull’agentic coding: la comprensione del codice, la sua generazione e l’esecuzione all’interno dei flussi di lavoro agentici.

Che cosa è LongCat-2.0

LongCat-2.0 è il modello open della prossima generazione di Meituan, seguendo LongCat-Flash, un modello con 560 miliardi di parametri lanciato nel 2025. L’architettura è stata progettata con uno scopo specifico: un coding agenticco affidabile ed efficiente.

Il pretraining ha coperto più di 35 trilioni di token in milioni di ore di acceleratori, senza roll-back o perdite irreparabili durante l’intero processo. Questo è un risultato notevole quando si utilizza hardware non Nvidia, dove gli strumenti sono meno maturi.

Aridituri: Come un Modello da 1.6T Sia Economico da Eseguire

La sua architettura combina quattro idee per ridurre il costo della scalabilità.

    • Zero-computation experts: Non tutti i token richiedono un calcolo pesante. I token semplici, come la punteggiatura, vengono indirizzati a un esperto a zero calcolo e non modificati. Solo i token complessi coinvolgono un maggiore utilizzo degli esperti.
    • LongCat Sparse Attention (LSA): L’attenzione standard cresce quadraticamente con la lunghezza del contesto. LSA seleziona solo i token più rilevanti, riducendo l’escalation a una crescita quasi lineare.
    • N-gram Embedding: Il modulo aggiunto ha 135 miliardi di parametri e cattura relazioni dense tra i token locali, riducendo inoltre l’I/O della memoria durante la decodifica in batch.
    • Post-training (MOPD): Un processo dedicato fonde tre gruppi di esperti diversi che coprono le capacità di agente, ragionamento e interazione.

Per l’esecuzione, Meituan utilizza uno schema di parallelismo 6D e un’architettura prefill-decode separata. Vengono impiegati anche "super kernel" e prefetching del peso L2-cache per nascondere latenza.

Dettagli Tecnici

LSA integra tre tecniche indipendenti a livello: Indexing Streaming-aware, Indexing Cross-Layer e Indexing gerarchico. La combinazione mantiene un'ampia finestra di contesto da 1 milione di token senza limiti di memoria.

Preferenze di Utilizzo

    • Contesto da 1 milione di token: Il modello ha una finestra nativa di contesto con 1 milione di token.
    • Tecnologia LSA: Riduce drasticamente i costi di contesto lungo.
    • Hardware domestico: Entrenamento e servizio completi senza hardware Nvidia.

Benchmark

Meituan posiziona LongCat-2.0 come strumento specifico per il coding agenticco. Di seguito alcuni benchmark generati da Meituan stesso.

    • SWE-bench Pro: 59.5 su compiti di ingegneria software reale.
    • Terminal-Bench 2.1: 70.8 su esecuzione e recupero da errori in shell.
    • SWE-bench Multilingual: 77.3 su task cross-lingua su repository.

Meituan riferisce che LongCat-2.0 abbia superato GPT-5.5 (58.6) e abbia una prestazione comparabile al modello Gemini 3.1 Pro di Google. LongCat-2.0 mostra però una performance inferiore su benchmark generali come FORTE e BrowseComp. La conferma indipendente degli scaldi non è disponibile.

Confronto con LongCat-Flash

Il passaggio dalla versione precedente è notevole. Ecco una tabella basata sulle specifiche pubblicate di ciascun modello.

    • Parametri totali: 1.6T vs 560B (LongCat-Flash).
    • Parametri attivi per token: 48B (da 33B a 56B) vs 27B (da 18.6B a 31.3B).
    • Contesto: 1Milione di token (LongCat-2.0) vs 128K token (LongCat-Flash).
    • Attenzione a lungo contesto: LSA (LongCat-2.0) vs Attenzione Latente Multi-testa (LongCat-Flash).
    • Hardware riportati: Superpods asic domestici (LongCat-2.0) vs H800 GPU (LongCat-Flash).
    • Output massimo: 128K token, LongCat-Flash non specificato.
    • License: MIT per entrambi.
    • Lanciato: 30 Giugno 2026, Settembre 2025 per LongCat-Flash.
    • Pesi: Presto da LongCat-2.0, Open per LongCat-Flash.

Casi d'Uso Con Esempi

LongCat-2.0 è addestrato su lavoro agenticco specifico e non su conversazioni casuali.

    • Ragionamento su interi repository: Inserisci un intero codicebase di medio dimensione nel contesto da 1 milione di token e chiedi al modello di tracciare un bug attraverso molteplici file.
    • Task multi-step nel terminale: Lavora il modello all'interno ciclo di un agente con accesso al shell. Può eseguire comandi, leggere errori e riprodurre finché un task si concluda correttamente.
    • Edizioni di livello repository: Chiedi di apportare modifiche che coinvolgano diversi moduli e test.
    • Conversione tra linguaggi: Usa SWE-bench Multilingual per repository poliglotti. Il modello può portare logica da un linguaggio all’altro mantenendo il comportamento.

Come Accedervi

LongCat-2.0 è accessibile tramite la piattaforma API LongCat. Espongono punti finali compatibili con OpenAI e Anthropic. Il modello è su OpenRouter e in strumenti come Claude Code, OpenClaw, OpenCode, Codex. L’auto hosting locale non è disponibile finché i pesi non saranno rilasciati.

L’endpoint compatibile con OpenAI utilizza l’ID modello LongCat-2.0. Sotto è mostrata una richiesta API.

Ecco un frammento per chiamare l’endpoint.

pip install openai

from openai import OpenAI

client = OpenAI(

apikey="YOURLONG