Introduzione
Fireworks AI ha annunciato il rilascio di Ember-1, un modello specializzato costruito da Fireworks Research mediante post‑training del modello open‑weight Kimi K3 di Moonshot AI. Ember-1 è progettato per produrre tracce di ragionamento più corte senza sacrificare la precisione nei compiti assegnati, offrendo così una soluzione più economica rispetto all’uso tradizionale di Kimi K3.
Il problema: i modelli di ragionamento consumano troppi token
Il team di Fireworks ha osservato che modelli di ragionamento avanzati, come Kimi K3, tendono a dedicare più del 90 % dei token generati a operazioni interne di ragionamento. Questo sovraccarico si amplifica nei flussi di lavoro agentici a più turni, dove il contesto cresce in modo quasi quadratico con il numero di interazioni. I token di ragionamento dei turni precedenti vengono rilette e fatturate nuovamente ad ogni chiamata successiva, aumentando drasticamente i costi.
I clienti hanno richiesto le capacità di codifica di K3 a un prezzo più contenuto. Ridurre il livello di “effort” di ragionamento durante l’inferenza ha comportato una perdita inaccettabile di qualità, spingendo il team a cercare una soluzione più efficace: addestrare il modello a ragionare in modo più efficiente.
Come Fireworks Research ha costruito Ember-1
Non tutto il ragionamento di K3 è superfluo: parte di esso rappresenta una riflessione utile, come la revisione di un’assunzione o la risposta a un feedback. Ember-1 conserva questi comportamenti utili, eliminando al contempo i loop ridondanti e le parti di ragionamento non produttive.
Il set di dati di addestramento comprende esercizi di matematica, programmazione, istruzioni, conversazione, ricerca, uso di strumenti e ingegneria del software. Sono inclusi sia problemi isolati sia interazioni multi‑step estese. Il feedback di task e di ambiente guida la pianificazione on‑policy e l’apprendimento. Il team ha condotto più di 50 esperimenti di training e oltre 200 valutazioni, sviluppando nuovi algoritmi di addestramento non ancora pubblicati. Tutto il training è stato eseguito su Fireworks Serverless Training, utilizzando solo dati proprietari e nessun dato dei clienti.
Risultati dei benchmark
Fireworks ha confrontato Ember-1 con Kimi K3 a tre livelli di effort di ragionamento (Low, High, Max). Il costo è stato calcolato sulla base dei prezzi pubblici dell’API Kimi K3. Di seguito la tabella riassuntiva dei risultati pubblicati da Fireworks.
| Benchmark | N | K3 Low | K3 High | K3 Max | Ember‑1 | Diff. vs K3 Max (costo) |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 89 | 76.4 % | 77.6 % | 80.9 % | 82.0 % | -51.9 % / -23.1 USD |
| SWE‑bench Verified | 500 | 80.4 % | 86.0 % | 93.2 % | 92.2 % | -15.5 % / -68.1 USD |
| SWE‑Interact | 75 | 6.7 % | 13.3 % | 21.3 % | 20.0 % | -32.5 % / -60.8 USD |
| DeepSWE 1.1 | 113 | 55.8 % | 62.8 % | 66.4 % | 75.2 % | -23.7 % / -126.9 USD |
| τ‑2 Bench Airline | 50 | 64 % | 64 % | 64 % | 66 % | -5.9 % / -0.3 USD |
Ember-1 supera K3 Max su Terminal Bench 2.1 e DeepSWE 1.1, mentre è leggermente indietro su SWE‑bench Verified e SWE‑Interact. In totale, su sette benchmark e due clienti con traffico di produzione, Fireworks afferma che il ragionamento di K3 è stato accorciato dal 35 % al 50 % senza perdita di accuratezza.
Test A/B in produzione
Fireworks ha condotto test A/B live con due clienti su carichi di lavoro di codifica. Entrambi i clienti hanno registrato una riduzione di circa il 35 % dei token per task mantenendo una qualità comparabile. Nei risultati pubblicati, i token di output sono scesi da 49,3 K a 29,9 K per task; i token di ragionamento sono diminuiti del 71,3 % e i token totali del 39 %. Il punteggio di task è rimasto sostanzialmente invariato (0,753 per Ember‑1 contro 0,751 per K3). Il numero medio di passaggi è passato da 23,8 a 21,4. Un cliente ha già adottato Ember‑1 in produzione.
Costi e pricing
Il prezzo per token di Ember‑1 è identico a quello di Kimi K3 su Fireworks: 3,00 USD per token di input, 0,30 USD per input cache e 15,00 USD per token di output per 1 milione di token. Il risparmio deriva esclusivamente dalla generazione di meno token. Sulla base dei dati A/B, il costo di output per task scende da circa 0,74 USD a 0,45 USD, evidenziando un notevole vantaggio economico.
Key takeaways
- Ember‑1 è Kimi K3 post‑trained per ragionare con meno token, non una semplice riduzione di effort.
- Fireworks riporta circa il 40 % di token in meno mantenendo l’accuratezza.
- Nel test A/B di produzione, l’output è passato da 49,3 K a 29,9