Cos’è Prime Inference

Prime Inference è il livello di serving dello stack di addestramento open di Prime Intellect. Dopo aver fornito strumenti post‑training come prime‑rl, verifier e sandbox, Prime ha chiuso il ciclo consentendo ai modelli distribuiti di generare tracce di produzione che possono essere ri‑utilizzate per il training. L’azienda dichiara che l’endpoint GLM‑5.3 è tra i più veloci su OpenRouter, con un tasso di errore quasi nullo nelle chiamate di tool e un uptime del 100% dall’avvio.

Modalità di utilizzo

Prime Inference offre due modalità distinte:

    • Serverless endpoints: ideali per carichi di lavoro con domanda variabile.
    • Reserved capacity: riservata per workload sostenuti, garantendo prevedibilità delle prestazioni.

Entrambe le modalità sono compatibili con le SDK di OpenAI puntando a https://api.pinference.ai/api/v1 (documentazione disponibile).

Affidabilità e infrastruttura

Il servizio garantisce uptime continuo grazie a un failover automatico tra più data center, che ridirige il traffico verso deployment sani. L’hardware attuale è basato su GPU NVIDIA Blackwell, con la futura aggiunta di Vera Rubin prevista a breve.

Fatturazione

Prime Inference utilizza una fatturazione unificata con tracciamento dell’uso a livello di team. I prezzi per modello non sono ancora completamente pubblicati nella documentazione, ma sono disponibili indicazioni preliminari per il modello GLM‑5.3.

Architettura della stack di serving

La stack combina diverse componenti open source:

    • NVIDIA Dynamo
    • vLLM
    • Mooncake
    • FlashInfer

È stata costruita con Inferact e NVIDIA, e le correzioni sono state contribute upstream.

Carico di lavoro target: agentico

Prime Inference è ottimizzata per carichi di lavoro agentici, in cui un turno tipico di agente aggiunge circa 6 000 token a un prompt di 140 000 token. Prime ha testato questo mix con SemiAnalysis AgentX e arrivi a freddo iniettati.

Prefill e decode disaggregati

Prefill e decode vengono eseguiti su gruppi GPU separati. Dynamo gestisce il routing, mentre vLLM esegue il modello su ciascun gruppo. I decoder recuperano le KV calcolate tramite NIXL, riducendo del quasi 40 % la latenza inter‑token al p90 nei test interni.

Routing consapevole della cache

Dynamo utilizza un router KV‑aware che valuta la sovrapposizione dei prefissi in cache rispetto al lavoro in coda. Le sessioni rimangono sul medesimo decoder tra i turni, mentre Mooncake aggiunge un secondo livello KV nella DRAM dell’host.

Prestazioni di GLM‑5.3 su GPU GB200 NVL72

L’obiettivo di interattività era di 100 token al secondo per utente. Con un rapporto prefill/decode 1:4, la configurazione ha servito 66 sessioni per gruppo di prefill, mantenendo 101 token/s per utente e 100 token di output per GPU.

Alcuni dati chiave:

    • Topologia prefill DEP8: circa 5 × più capacità di cache di prefisso rispetto a TEP8 sullo stesso hardware.
    • Riduzione del budget di prefill da 8 K a 4 K token per GPU: la coda mediana è scesa da 550 ms a 110 ms, e il tempo medio al primo token è diminuito del 20 %.
    • Compressione KV NVFP4: ogni riga di cache MLA è passata da 576 a 352 byte, aumentando i token in cache per decoder da 1,09 M a 1,63 M.
    • Kernel sparsity‑MLA nativo: 12,0 µs a 15 token di query, rispetto a 17,7 µs in modalità staged e 13,7 µs in FP8.
    • Layout KV BLHNC: i descrittori di trasferimento sono diminuiti da 19 559 a circa 1 940, riducendo il tempo medio di trasferimento da 146 ms a 78 ms.

Chiamate di tool affidabili

Gli agenti possono fallire quando le chiamate di tool contengono nomi errati o argomenti rotti. Il team di Prime Intellect ha introdotto un structural‑tag builder in Dynamo per il formato tool di GLM, e vLLM utilizza xgrammar per mascherare token che violano lo schema. Sono stati corretti bug di parsing, incluso il caso in cui “<” veniva decodificato come “<” all’interno del codice.

Prime Inference vs concorrenti

Di seguito una sintesi delle principali funzionalità confrontate con i competitor più vicini:

    • Serverless GLM‑5.3: disponibile su Prime Inference, Together AI, Fireworks AI e Baseten.
    • Prezzo GLM‑5.3 (input/output per 1 M token): non ancora pubblicato da Prime; $1,40/$4,40 per gli altri fornitori (fonte: ComputePrices, 2 ottobre 2026).
    • Capacità riservata: Prime offre riservata con roadmap per deploy dedicati con 1‑click; gli altri forniscono capacità dedicata on‑demand.
    • API compatibile OpenAI: presente su tutti i servizi.
    • Batch inference: previsto nella roadmap di Prime; già disponibile su Together AI.
    • Stack di serving divulgato: Prime utilizza Dynamo, vLLM, Mooncake e FlashInfer (open source); gli altri adottano stack proprietari o misti.

Considerazioni finali

Prime Inference è ora operativo con endpoint serverless e capacità riservata per modelli open‑source di frontiera. GLM‑5.3 gira su GPU GB200 NVL72 grazie a Dynamo, vLLM, Mooncake e FlashInfer, raggi