Introduzione

Fireworks AI ha annunciato il rilascio di Ember-1, un modello specializzato costruito da Fireworks Research mediante post‑training del modello open‑weight Kimi K3 di Moonshot AI. Ember-1 è progettato per produrre tracce di ragionamento più corte senza sacrificare la precisione nei compiti assegnati, offrendo così una soluzione più economica rispetto all’uso tradizionale di Kimi K3.

Il problema: i modelli di ragionamento consumano troppi token

Il team di Fireworks ha osservato che modelli di ragionamento avanzati, come Kimi K3, tendono a dedicare più del 90 % dei token generati a operazioni interne di ragionamento. Questo sovraccarico si amplifica nei flussi di lavoro agentici a più turni, dove il contesto cresce in modo quasi quadratico con il numero di interazioni. I token di ragionamento dei turni precedenti vengono rilette e fatturate nuovamente ad ogni chiamata successiva, aumentando drasticamente i costi.

I clienti hanno richiesto le capacità di codifica di K3 a un prezzo più contenuto. Ridurre il livello di “effort” di ragionamento durante l’inferenza ha comportato una perdita inaccettabile di qualità, spingendo il team a cercare una soluzione più efficace: addestrare il modello a ragionare in modo più efficiente.

Come Fireworks Research ha costruito Ember-1

Non tutto il ragionamento di K3 è superfluo: parte di esso rappresenta una riflessione utile, come la revisione di un’assunzione o la risposta a un feedback. Ember-1 conserva questi comportamenti utili, eliminando al contempo i loop ridondanti e le parti di ragionamento non produttive.

Il set di dati di addestramento comprende esercizi di matematica, programmazione, istruzioni, conversazione, ricerca, uso di strumenti e ingegneria del software. Sono inclusi sia problemi isolati sia interazioni multi‑step estese. Il feedback di task e di ambiente guida la pianificazione on‑policy e l’apprendimento. Il team ha condotto più di 50 esperimenti di training e oltre 200 valutazioni, sviluppando nuovi algoritmi di addestramento non ancora pubblicati. Tutto il training è stato eseguito su Fireworks Serverless Training, utilizzando solo dati proprietari e nessun dato dei clienti.

Risultati dei benchmark

Fireworks ha confrontato Ember-1 con Kimi K3 a tre livelli di effort di ragionamento (Low, High, Max). Il costo è stato calcolato sulla base dei prezzi pubblici dell’API Kimi K3. Di seguito la tabella riassuntiva dei risultati pubblicati da Fireworks.

BenchmarkNK3 LowK3 HighK3 MaxEmber‑1Diff. vs K3 Max (costo)
Terminal Bench 2.18976.4 %77.6 %80.9 %82.0 %-51.9 % / -23.1 USD
SWE‑bench Verified50080.4 %86.0 %93.2 %92.2 %-15.5 % / -68.1 USD
SWE‑Interact756.7 %13.3 %21.3 %20.0 %-32.5 % / -60.8 USD
DeepSWE 1.111355.8 %62.8 %66.4 %75.2 %-23.7 % / -126.9 USD
τ‑2 Bench Airline5064 %64 %64 %66 %-5.9 % / -0.3 USD

Ember-1 supera K3 Max su Terminal Bench 2.1 e DeepSWE 1.1, mentre è leggermente indietro su SWE‑bench Verified e SWE‑Interact. In totale, su sette benchmark e due clienti con traffico di produzione, Fireworks afferma che il ragionamento di K3 è stato accorciato dal 35 % al 50 % senza perdita di accuratezza.

Test A/B in produzione

Fireworks ha condotto test A/B live con due clienti su carichi di lavoro di codifica. Entrambi i clienti hanno registrato una riduzione di circa il 35 % dei token per task mantenendo una qualità comparabile. Nei risultati pubblicati, i token di output sono scesi da 49,3 K a 29,9 K per task; i token di ragionamento sono diminuiti del 71,3 % e i token totali del 39 %. Il punteggio di task è rimasto sostanzialmente invariato (0,753 per Ember‑1 contro 0,751 per K3). Il numero medio di passaggi è passato da 23,8 a 21,4. Un cliente ha già adottato Ember‑1 in produzione.

Costi e pricing

Il prezzo per token di Ember‑1 è identico a quello di Kimi K3 su Fireworks: 3,00 USD per token di input, 0,30 USD per input cache e 15,00 USD per token di output per 1 milione di token. Il risparmio deriva esclusivamente dalla generazione di meno token. Sulla base dei dati A/B, il costo di output per task scende da circa 0,74 USD a 0,45 USD, evidenziando un notevole vantaggio economico.

Key takeaways

    • Ember‑1 è Kimi K3 post‑trained per ragionare con meno token, non una semplice riduzione di effort.
    • Fireworks riporta circa il 40 % di token in meno mantenendo l’accuratezza.
  • Nel test A/B di produzione, l’output è passato da 49,3 K a 29,9