Microsoft ha annunciato durante il Microsoft Build 2026 i modelli Hugging Face su Foundry Managed Compute, una raccolta di modelli open-weight disponibili direttamente nella piattaforma Microsoft Foundry. Questi modelli, selezionati e aggiornati settimanalmente da Hugging Face, sono pronti per essere distribuiti in un click su Foundry, con runtime costruiti e analizzati da Microsoft.

Ipesi di ogni modello sono pre-caricati su Azure, mentre i runtime vengono verificati e ottimizzati da Microsoft. Ogni modello che fa parte della raccolta include la stessa sicurezza, governance, osservabilità e fatturazione che si applicano a tutti gli altri modelli disponibili su Foundry.

Microsoft Foundry

Microsoft Foundry è una piattaforma per sviluppare e gestire applicazioni agentiche basate sull'intelligenza artificiale. La piattaforma si distingue per la vasta selezione di modelli disponibili, con scelte provenienti da Microsoft, OpenAI, Anthropic, Meta, Mistral, DeepSeek, Hugging Face, e altri, coprendo modelli di frontiera, open-source e personalizzati. Tutti questi modelli sono accessibili tramite un singolo endpoint e uno stesso insieme di SDK in Python, C#, JavaScript e Java.

Il Servizio degli Agenti di Foundry

Sul livello dei modelli si basa il Servizio degli Agenti di Foundry: orchestrazione multi-agente con memoria integrata, ground knowledge tramite Foundry IQ, e un catalogo di strumenti connessi tramite protocolli agentic. Gli agenti possono operare con dati aziendali.

Una volta che gli agenti stanno operando, Foundry fornisce tracciatura end-to-end, monitoraggio in tempo reale, valutazioni continue e un'ottimizzatore di prompt che migliora il comportamento degli agenti basandosi sui dati delle valutazioni. Questi cicli di osservabilità e qualità fanno parte integrante della piattaforma.

Foundry Managed Compute

Microsoft Foundry introduce una terza opzione di distribuzione tramite Foundry Managed Compute, un servizio per il calcolo gestito in GPU. Oltre al pay per token e al provisioned throughput, gli utenti hanno ora accesso a una soluzione completamente gestita per modelli open-source e personalizzati.

Gli utenti possono implementare modelli basati su specifiche operative fondamentali — numero di parametri, lunghezza del contesto e obiettivo di ottimizzazione tra latenza e throughput — lasciando a Foundry la gestione della topologia GPU, che può coinvolgere singoli acceleratori o diversi, in base alle esigenze del modello.

Gestione operativa e configurazione

Microsoft si occupa della gestione completa del ciclo di vita dei modelli: gli aggiornamenti in contenitori, le configurazioni runtime e le correzioni di sicurezza avvengono automaticamente, senza richiedere il ridistribuzione del modello. Esempi di runtime supportati includono vLLM, SGLang, TensorRT-LLM, NIM, TEI, e llama.cpp.

Con questa gestione automatizzata, la costanza si riflette anche nei processi di sviluppo: l'interfaccia di pagamento a token, i throughputs programmabili e il Managed Compute condividono le stesse caratteristiche:

    • I modelli open-source interagiscono con gli agenti di Foundry esattamente come i modelli di frontiera.
    • La stessa logica di codifica e workflow si applica a tutti i modelli.
    • I limiti di utilizzo vengono stabiliti in base alle famiglie di acceleratori supportate, consentendo un passaggio fluido verso nuove generazioni di hardware.

Hugging Face

Hugging Face è considerato da molti come la piazza pubblica dell'intelligenza artificiale aperta, con 15 milioni di sviluppatori, 400.000 organizzazioni e oltre 3 milioni di modelli open-source pubblicati. I nuovi sviluppi vengono aggiunti settimanalmente — da coding agente a segmentazione video, e comprensione vocale — rendendo Hugging Face la GitHub per i modelli open.

Gli sviluppatori di Hugging Face pubblicano pesi, producono modelli, confrontano valutazioni ed eseguono sperimentazioni, rendendo Hugging Face la piattaforma ideale per la comunità open.

Vantaggi dei modelli open

I modelli open hanno raggiunto i risultati dei modelli proprietari su numerose benchmarks e aprono porte che i modelli proprietari non sono in grado di raggiungere. Il problema però è sempre stato il livello operativo: rilevamento modelli, revisione dei permessi, sicurezza, selezione del runtime, dimensionamento GPU, costruzione delle immagini, correzioni CVE, e l'implementazione di modelli dietro endpoint aziendali.

Hugging Face da solo non è una piattaforma operativa aziendale. Hugging Face Models su Foundry è il supporto operativo gestito da Microsoft per risolvere i problemi.

La raccolta di modelli Hugging Face

La raccolta Hugging Face porta una selezione curata di modelli direttamente nel catalogo Foundry:

    • Da un punto vista operativo, i modelli open-weight della raccolta Hugging Face si presentano esattamente come gli altri modelli del catalogo.
    • A ogni modello vengono applicati pipeline multi-stage di pubblicazione prima del suo rilascio ufficiale.

Hugging Face e Microsoft collaborano per offrire i modelli più richiesti per contesti aziendali, sfruttando un processo di selezione organizzato:

    • I pesi del modello sono pre-caricati in Azure.
    • I runtime sono gestiti e conservati in un Registro Microsoft.
    • L'autonomia di rete esterna al Hugging Face Hub significa che è possible distribuire modelli in rete privata.

Inferenza e runtime

Modelli Hugging Face su Foundry si avvalgono di una serie di runtime di community open-source, selezionati e ottimizzati per Foundry Managed Compute. Questi runtime sono associati a determinate architetture modello, e aggiornamenti e patch vengono distribuiti automaticamente:

    • vLLM: engine di servizio ad alto throughput per modelli di linguaggio. Poiché Hugging Face è una diretta contributor, tutti i modelli Transformers possono funzionare su vLLM senza ulteriore configurazione.
    • SGLang: server multimodale e linguaggi con supporto strutturale per output JSON e generazioni grammaticali. Hugging Face e SGLang hanno integrato Transformers in SGLang per supportare la distribuzione senza ulteriore azione.
    • Text Embeddings Inference (TEI): runtime per embedding, ricerche semantiche e classificazione di sequenze.
    • llama.cpp: per esecuzione su CPU e GPU small per modelli quantizzati con GGUF.
    • TensorRT-LLM e NIM: utilizzati su hardware NVIDIA per modelli che richiedono ottimizzazione di latenza o throughput.
    • hf-serve: server Hugging Face per modelli diversi da LLM ed embedding, gestendo visone, audio, segmentazione e pipeline complessi con un livello coerente.

Distribuzione in cinque passaggi

La distribuzione inizia partendo dal catalogo di modelli di Microsoft Foundry:

    • Selezionare un modello.
    • Scegliere un modello di distribuzione.
    • Eseguire la condivisione del modello.
  • Impostare il runtime specific