Introduzione a Ollama nel 2026
Centosettantaduemila e cinquecentosettantadue sono le stelle che il repository GitHub di ollama/ollama ha collezionato dal giugno 2023 a oggi, con sedicimila fork attivi e un ritmo di rilascio settimanale che ha trasformato un piccolo runtime scritto in Go nel “Docker dei modelli linguistici”. Ollama è una piattaforma open source, distribuita con licenza MIT, che permette di scaricare, eseguire e interrogare modelli LLM direttamente sul proprio computer, senza pagare API esterne, senza condividere prompt o documenti con server di terze parti e, una volta scaricato il modello, senza nemmeno una connessione internet attiva.
Che cosa fa concretamente Ollama
Ollama è un runtime, ovvero un programma che gira sul tuo computer e fa girare a sua volta i modelli LLM open source. La sua filosofia copia quella di Docker: invece di lottare con dipendenze Python, librerie CUDA, file di pesi in formato GGUF da caricare a mano e prompt template diversi per ogni famiglia di modello, basta un singolo comando del tipo ollama run llama3.1 e in pochi secondi sei dentro una chat interattiva sul tuo terminale, con un modello da otto miliardi di parametri che risponde in italiano, in inglese, in codice Python o in JSON strutturato.
Tre funzioni chiave sotto il cofano
- Rilevamento automatico dell’hardware: Ollama individua GPU NVIDIA con CUDA, schede AMD con ROCm, chip Apple Silicon con backend Metal/MLX o semplicemente CPU x86/ARM e configura il backend di inferenza più adatto senza chiedere nulla all’utente.
- Gestione locale della libreria dei modelli: scarica i pesi da un registry pubblico simile a Docker Hub, li monta in VRAM quando servono e li scarica quando passi a un altro modello, ottimizzando l’utilizzo della memoria.
- Esposizione di un demone HTTP: ascolta di default sulla porta 11434 e parla il dialetto della Chat Completions API di OpenAI, perciò qualunque libreria già scritta per OpenAI (LangChain, LlamaIndex, Vercel AI SDK) funziona puntando a Ollama con un solo cambiamento di URL.
Licenza, monetizzazione e modello di business
Il progetto è scritto in Go, distribuito sotto licenza MIT e mantenuto da un team commerciale (Ollama Inc.). L’azienda offre un piano Pro a 20 dollari al mese e un piano Max a 100 dollari al mese per l’accesso a modelli ospitati su infrastruttura propria, ma il binario locale rimane gratuito per uso personale e commerciale, senza chiavi, senza telemetria attiva per default e senza limiti di token al di fuori di quelli imposti dall’hardware.
Perché eseguire LLM in locale ha senso nel 2026
La domanda più frequente, soprattutto da chi è abituato a ChatGPT Plus o a Claude Pro, è perché complicarsi la vita quando il cloud offre modelli più grandi e veloci. La risposta non è ideologica, è economica e operativa, e poggia su quattro pilastri concreti.
1. Privacy
Se un modello gira sulla tua macchina e non attivi funzioni di telemetria opzionali, nessun byte dei tuoi prompt, delle tue risposte o dei documenti che carichi esce dal perimetro locale. Per chi lavora con dati sanitari, segreti aziendali, contratti riservati o codice proprietario, questo è spesso un vincolo contrattuale o normativo. Il GDPR, l’AI Act europeo e le policy interne riconoscono l’inferenza on‑device come una delle poche soluzioni che azzera, per costruzione, il problema del trasferimento dati verso fornitori cloud extra UE.
2. Costo
Un’API a pagamento come quella di OpenAI o Anthropic ha un prezzo per milione di token che, su carichi seri, esplode rapidamente. Un modello come Llama 3.1 8B o Qwen 3 14B, scaricato una volta sola sul tuo computer, può rispondere a milioni di query a costo marginale zero, escluse le bollette elettriche. La stessa economia vale se colleghi un agente personale; la nostra recensione di Hermes Agent mostra come farlo girare in locale a costo di inferenza azzerato.
3. Disponibilità
Le API cloud cadono, vengono rate‑limitate, cambiano modello da un giorno all’altro o introducono filtri di sicurezza che bloccano richieste legittime. Un modello locale non scompare, non cambia versione senza il tuo consenso, non ti rate‑limita finché hai RAM disponibile e funziona anche in aereo o in rifugio di montagna senza segnale.
4. Personalizzazione
Con Ollama puoi creare un “Modelfile”, un file di testo simile a un Dockerfile, in cui definisci system prompt persistenti, parametri di temperatura, top‑k e top‑p, e puoi caricare adapter LoRA o pesi fine‑tuned ottenuti con strumenti come LLaMA Factory. Niente di tutto questo è possibile con un’API chiusa.
Requisiti hardware reali (non quelli del marketing)
Online si trovano due narrazioni opposte e ugualmente sbagliate: “ti basta un laptop normale” e “serve una RTX 4090 da duemila euro”. La verità sta in mezzo e dipende dalla dimensione del modello che vuoi far girare.
Modelli da 1 a 4 miliardi di parametri
- RAM: 8 GB
- CPU: generazione degli ultimi cinque anni
- Esempi di hardware: Mac M1 entry‑level, mini PC Intel N100, laptop Windows con i5 di decima generazione