Che cosa è MORPHEUS?
MORPHEUS è basato sull'ipotesi "Big World" (Javed & Sutton, 2024), che afferma che la complessità del mondo supera ogni capacità rappresentativa dell'agente. Questo rende l'ambiente non-stazionario anche quando le dinamiche sono fisse. MORPHEUS richiede tre proprietà fondamentali per forzare l'apprendimento continuo: persistenza, non-stazionarietà e complessità operativa.
La persistenza implica che le decisioni passate si accumulano per influenzare il futuro. La non-stazionarietà dice che qualsiasi politica fissa diventerà presto subottimale. La complessità operativa significa che non esiste una politica ottimale fissa.
Un ambiente MORPHEUS è un plugin TypeScript autonomo. Esporta Descriptors Operativi (OD), uno scheduler di simulazione, dati iniziali e documentazione. Un Descriptor Operativo definisce il piano passo-passo per una capacità. Gli agenti interagiscono attraverso un’API e ogni richiesta avvia l'esecuzione di un OD.
Come Funziona la Piattaforma
Due motori creano la non-stazionarietà. Il primo è un motore di iniezione di fallimenti che introduce interruzioni tipizzate tra i passi dei Descriptors. Include undici tipi di fallimenti, tra cui missingdata, dependencyfailure e ratelimit. Funziona a quattro intensità predeterminate: leggera (5%), realistica (8%), moderata (15%) e aggressiva (30%).
Il secondo è un controller di cambio di configurazione asincrono che modifica i tassi di fallimento e la richiesta di lavoro a orari fissi. Funziona in modo indipendente dal ciclo di allenamento, quindi i cambiamenti non coincidono mai con gli aggiorni gradienti. Questo impedisce all’agente di usare la periodicità dei gradienti come un orologio.
Il motore premio raccoglie segnali naturali: eventi di fallimento, bilancio finanziario e throughput delle risorse. Un premio composto combina questi segnali. I pesi predefiniti sono wf = 0.5 e wl = wp = 0.25.
Copia Codice:
Funzione di Premio Composto — MORPHEUS, Appendice C (pesi predefiniti).
def clip(x, lo, hi): return max(lo, min(hi, x))
def compositereward(tickets, actualcost, plannedcost, units, capacity, wf=0.5, wl=0.25, wp=0.25):
rf = -(somma di t["severity"] per t in tickets) # segnale di evento fallimentare
rl = clip(1 - actualcost / plannedcost, -1, 1) # registro finanziario
rp = clip(units / capacity, 0, 1) # throughput delle risorse
return wf rf + wl rl + wp * r_p
Con le assunzioni estreme (nessun fallimento, costo minimo, throughput completi), il valore massimo per ogni configurazione è 0,50.
Inizializzazione dell’Agente
Data la grande dimensione dello spazio d'azione, un approccio AI da zero è irrealizzabile. MORPHEUS usa quindi un percorso a due fasi. Un modello avanguardia (Gemini 3.1 pro) raccoglie traiettorie con il framework ReAct. Queste traiettorie vengono utilizzate per un fine-tuning supervisionato (SFT) su Qwen3-14B.
Pertanto, ogni esecuzione RL parte da questo checkpoint shared SFT. Questo isola il comportamento d’apprendimento continuo da abilità operative di base. Tutti i benchmark usano PPO come ottimizzatore principale per l’addestramento online.
Protocollo di Valutazione a Sei Metriche
Data la natura non-stazionaria, una singola metrica non basta. La squadra propone sei metriche: premio per configurazione, velocità di adattamento, dimenticanza, tempo di recupero, stabilità e scarto di prestazione.
La velocità di adattamento è la metrica principale. Misura i passi necessari per raggiungere la metà del massimo teorico. Due diagnostici supplementari tracciano il vantaggio relativo di adattamento (RAA) e la plasticità in base al grado di rango effettivo.
Risultati Baseline
Usando questo protocollo, sono state testate quattro famiglie algoritmiche. Due compiti sono definiti: Task 1 — Allocazione risorse dinamica con drift strutturato; Task 2 — Schedulazione con ritardi di effetto.
- Task 1 Process-Outbound: EWC guida in premio e LCM adatta più velocemente.
- Task 2: HER guida in premio mentre LCM perde vantaggio con ricompense ritardate.
PPO e HER si adattano solo finché non si è nella prima configurazione e falliscono nel farlo in seguito.
Casi d’Uso con Esempi
Praticamente, MORPHEUS si adatta a ruoli professionali. Per gli ingegneri AI, testa se un agente riconosce cambi di regime senza etichettatura. Per esempio, la richiesta può passare da bassi a "bursty" e la politica deve adattarsi senza segni esterni.
Per i ricercatori dati, mette alla prova l'assegnazione di credito ritardata. Per esempio, la consegna OTIF (On-Time In-Full) è osservabile solo giorni dopo la scelta di spedizione. Gli sviluppatori di software possono modificare i segnali di premio o attivare/desattivare osservabilità senza mutare le dinamiche, grazie al formato TypeScript.
Punti Forti e Punti Deboli
Punti forti:
- Mondi persistenti senza reset, simili a sistemi enterprise live.
- Cambi di regime parametrizzabili e riproducibili per un confronto pulito tra algoritmi.
- Premi da verificatori operativi nativi, non richiedono annotazioni esterne.
- Valutazioni open-source disponibili su Skyfall-Research/morpheus-evals.
Punti deboli:
- Solo due su cinque ambienti sono valutabili finora.
- L’upper bound assumerà zero fallimenti, quindi sarà ottimistico.
- I cambiamenti sono esterni, non derivanti da decisioni compounding.
- I pesi del premio sono variabili di ricerca, non obiettivi verificati dell’industria.
Conclusioni Principali
MORPHEUS simula ambienti enterprise persistenti senza reset, diversamente dai benchmark episodici in RL.
Fornisce cinque ambienti. Due vengono valutati in questo documento: process-outbound e process-inbound.
Una valut