Introduzione
Il 25 settembre AWS Strands Labs ha pubblicato Strands Decider 2B, il primo modello decisionale open source della categoria “System One”. A differenza dei grandi modelli linguistici (LLM) che generano testo libero, un modello decisionale si limita a selezionare tra opzioni predefinite o a fornire una valutazione numerica, mantenendo sempre una misura di fiducia calibrata.
Cos’è Strands Decider 2B
Strands Decider 2B è un modello con 1,9 miliardi di parametri che legge uno stato (ad esempio il contesto di una conversazione) e una domanda tipizzata, restituendo una risposta di tipo choice, yes/no o score. Non genera testo libero e non è adatto a compiti di codifica, chat o sintesi, ma eccelle in decisioni rapide e ben calibrate.
Come funziona
Il modello supporta tre tipologie di domande:
- choice: scegli una delle N opzioni fornite.
- noul: restituisce una probabilità fra 0 e 1 per una risposta sì/no.
- score: assegna un livello su una scala ordinata.
Ogni risposta è accompagnata da una confidenza che il team di Strands dichiara calibrata: su compiti non visti, le previsioni con confidenza ≥ 0,9 sono corrette circa il 95 % delle volte.
Architettura: un LLM con la “bocca” rimossa
Strands parte da Qwen3.5‑2B‑Base e rimuove la testa di modellazione del linguaggio. Al suo posto aggiunge una head di puntatore di circa 1 milione di parametri che confronta lo stato nascosto nella posizione <answer> con lo stato dell’ultimo token di ciascuna opzione. Un singolo forward pass fornisce la risposta, eliminando la necessità di un ciclo di decodifica.
Il “torso” del modello utilizza un LoRA a rango‑16, la testa opera in fp32 e i set di etichette provengono direttamente dalla richiesta, quindi non c’è un limite rigido al numero di opzioni. Il checkpoint rilasciato è la versione v19.
Prestazioni e benchmark
Strands Decider 2B è stato valutato su JevBench, un benchmark pubblico per modelli della classe Jev. I risultati v19 includono:
- Accuratezza pubblica JevBench v1: 0,723 (167 su 231 task).
- Brier score: 0,342.
- Errore di calibrazione previsto (ECE): 0,052.
- Accuratezza per livello di difficoltà: facile 1,000; standard 0,875; difficile 0,505.
- Latenza mediana su RTX 3090: 115 ms (p95 299 ms).
- Latenza su Apple M3 Pro: 153 ms medio a caldo per meno di 300 token.
Nel ranking della board v1.4.2 (25 settembre) il modello v19 si piazza 3° su 33 nella classe 2 B, e 1° su 30 escludendo i modelli appena sopra i 2 B. Una nota di avvertimento: la versione più recente di Mapika, decider‑2b v11, ottiene 175 su 231 punti, superando Strands di otto task.
Confronto con altri modelli decisionali
La tabella seguente riassume le principali differenze tra Strands Decider 2B e le alternative più note:
- Strands Decider 2B (v19) – sviluppatore: Strands Agents (AWS) – licenza: Apache‑2.0 – modello base: Qwen3.5‑2B‑Base + LoRA + head di puntatore – dimensione: 1,9 B – auto‑hosting: sì – ricetta di training completa: sì.
- Jev 1.13.0 – sviluppatore: TypeSafe AI – licenza: API chiusa – modello base: non divulgato – dimensione: non divulgata – auto‑hosting: no.
- decider‑2b (Mapika) – sviluppatore: Mapika – licenza: codice e pesi aperti – modello base: Qwen3.5‑2B‑Base + readout addestrato – dimensione: 1,9 B – auto‑hosting: sì.
- Decision 2B (FlyMy.AI) – sviluppatore: FlyMy.AI – licenza: codice e pesi aperti – modello base: MiniCPM5‑2B + LoRA + head di puntatore – dimensione: 2,5 B dense – auto‑hosting: sì.
Le metriche di latenza variano: Strands segna 115 ms mediana su RTX 3090, mentre FlyMy.AI riporta un intervallo 70‑500 ms su hardware vendor, rendendo le comparazioni non direttamente equivalenti.
Casi d’uso e esempio di guardrail
Il team di Strands ha già testato il modello in scenari come:
- Routing di modelli.
- Selezione di tool.
- Controllo di argomenti (argument checking).
- Triage di richieste.
- Guardrail per agenti ibridi.
- Valutazioni (evals) e agenti ibridi.
Un esempio concreto è disponibile nel repository: un agente Strands che vuole accedere a un tool meteo. Prima della chiamata, un intervento beforetoolcall pone due domande sì/no: “Gli argomenti sono coerenti con quanto ha detto l’utente?” e “È opportuno chiamare il tool adesso?”. Se l’agente ha indovinato la città, il modello richiede conferma all’utente invece di procedere automaticamente.
Da riga di comando, il modello può instradare una richiesta del tipo “Aiuto! I miei pagamenti falliscono da tre giorni!” verso i canali billing, ← Volver a las noticias