Introduzione a FLUX 3 Action
Black Forest Labs (BFL), il laboratorio dietro i famosi modelli immagine FLUX, ha annunciato il rilascio di FLUX 3 Action, un World Action Model (WAM) da 7 miliardi di parametri progettato per il controllo robotico. Il modello elabora simultaneamente i frame della telecamera, lo stato del robot e un’istruzione testuale, per poi generare sia i futuri frame video sia la sequenza di azioni da eseguire. Su RoboLab‑120 ottiene il primo posto con un tasso di successo del 42,92 %.
Deployabilità e licenza
FLUX 3 Action è pronto per la distribuzione, a patto di soddisfare requisiti di memoria: la politica DROID richiede circa 32 GB di GPU in BF16 su una scheda H200, mentre su schede da 24 GB è possibile utilizzare la quantizzazione FP8 e lo scaricamento dell’encoder testuale. Il modello è rilasciato sotto la FLUX Kommunity License, che consente solo usi non commerciali.
Il trade‑off mirato da FLUX 3 Action
Le politiche robotiche open‑source tradizionali costringono a scegliere tra accuratezza e velocità. I WAM come NVIDIA Cosmos 3 Nano raggiungono il 36,8 % su RoboLab‑120 ma sono lenti a causa della previsione video, mentre i VLA come π0.5 sono rapidi ma ottengono solo il 28,0 %. Su una B200, BFL ha misurato che Cosmos 3 Nano (FP8) richiede circa 4,7 volte più tempo di calcolo rispetto a π0.5 (BF16) per ogni secondo di movimento robotico. FLUX 3 Action mantiene la predizione congiunta di video e azioni, riducendo il divario di velocità grazie a un backbone più piccolo e a tecniche di distillazione.
Architettura e fase di pre‑training
Il modello deriva dal backbone multimodale FLUX 3. Durante il pre‑training sono stati utilizzati dati immagine, video e audio, con i video a rappresentare oltre il 95 % dei token di addestramento. Testo, video e stato robotico vengono codificati in token; i token futuri del backbone sono decodificati in frame video, mentre i token azione sono trasformati in comandi robotici.
Il mid‑training ha mescolato dati (36,95 % di campioni) con video allineati all’azione (63,05 %). Il dataset di azione comprende registrazioni di giochi, video egocentrici di mani umane, gripper portatili e teleoperazione su 14 tipologie di robot. La maggior parte dei dati robotici utilizza uno spazio di azione a 50 dimensioni, chiamato EE50. Senza pre‑training, l’addestramento solo DROID otteneva meno dell’1 % su RoboLab; con il pre‑training il risultato sale all’11,6 %.
Risultati sul benchmark RoboLab‑120
RoboLab‑120 comprende 120 compiti da tavolo in Isaac Sim, con 10 prove per ciascuna configurazione di un braccio Franka in stile DROID. I risultati più rilevanti sono:
- FLUX 3 Action (WAM, 7 B): 42,92 %
- Cosmos 3‑Nano‑Policy (WAM, 16 B): 36,8 %
- π0.5 (VLA, 3,3 B): 28,0 %
- DreamZero (WAM, 14 B): 25,7 %
- GR00T N1.6 (VLA, 3 B): 7,2 %
FLUX 3 Action supera Cosmos 3‑Nano di 6,1 punti percentuali con il 56 % in meno di parametri. La media multi‑seed per il checkpoint FP8 distillato con guidance è 42,24 % ± 0,36.
Risultati su hardware reale
Positronic Robotics ha condotto una valutazione cieca su un braccio Franka con 10 compiti DROID e 3 tentativi per ciascuno. FLUX 3 Action ha completato 28 su 30 tentativi (93,3 %), mentre Cosmos 3‑Nano ha segnato 27/30, DreamZero 20/30 e π0.5 solo 13/30.
Tre checkpoint e quattro punti di velocità
BFL distribuisce la politica DROID in tre ricette, disponibili sia in BF16 sia in FP8:
- Base: 4 passaggi di campionamento con guidance divisa (video CFG 4, azione CFG 1).
- Guidance‑distilled: elimina il secondo passaggio di guidance, è da 1,8x a 2x più veloce e migliora il tasso di successo di 0,6‑1,08 pp.
- Step‑distilled: un solo passaggio di campionamento, 3,15x‑4x più veloce, con una diminuzione del successo di 3,51‑4,32 pp.
Contro Cosmos 3‑Nano in FP8, i checkpoint base e guidance‑distilled risultano da 1,52x a 3,95x più rapidi su GPU consumer, workstation e datacenter. Ogni chiamata produce 32 azioni a 15 Hz, corrispondenti a 2,13 secondi di movimento; π0.5 genera solo 1 secondo per chiamata. In FP8, lo step‑distilled supera π0.5 di 1,34x‑2,28x su workstation e datacenter, ma resta più lento su RTX 5090.
Policy veloce combinata con un reasoner
BFL ha sperimentato un controllo ibrido accoppiando FLUX 3 Action con GPT‑6 Astra, seguendo il setup di Su et al. (2026). Il reasoner può eseguire, modificare o sostituire le azioni previste dalla policy. Con sforzo di ragionamento ridotto, l’ibrido risolve il 90 % degli