NeuralNetworks è una disciplina in rapida crescita, ma quando si parla di neuroimmagini cliniche, i modelli generali finiscono per sottoperformare. Questo perché dati di MRI (risonanza magnetica) e TC (tomografia computerizzata) contengono informazioni identificabili e sono di difficile accesso. Il motivo? Questi dati non sono ampiamente disponibili in Internet, in quanto spesso vietati o sottoposti a restrizioni di privacy. A risolvere questo limite arriva NeuroVFM: un modello fondamentale, addestrato su grandi quantità di dati di routine clinica senza curare i documenti o i rapporti medici.

Che cos'è NeuroVFM?

NeuroVFM è un modello visivo per neuroimmagini sviluppato e addestrato su 5,24 milioni di volumi di scansioni MRI e TC provenienti da 566.915 studi del dataset UM-NeuroImages. Queste immagini coprono oltre due decenni di dati clinicamente generati da Michigan Medicine. Il modello rappresenta una soluzione innovativa poiché si basa su un approccio chiamato “health system learning”, che implica l’utilizzo di dati non curati generati durante la normale attività clinica.

Questo approccio evita il collo di bottiglia derivante dall’analisi manuale o da rapporti specifici, e non richiede curazioni basate sulle malattie, tipiche di classificatori ristretti. Inoltre, NeuroVFM si basa su un’architettura chiamata Vol-JEPA, estensione di metodi precedenti adatti alle immagini volumetriche mediche. L’applicazione di Vol-JEPA riflette una tendenza piuttosto rilevante nel settore: il progresso di metodi di apprendimento come JEPA si espande in ambito sanitario, migliorando capacità di analisi e diagnostica.

Funzionamento di Vol-JEPA

Vol-JEPA è un algoritmo di intelligenza artificiale completamente autodidatta che si basa esclusivamente su visione, rendendo la necessità di etichette o testi ridondante. Il modello non ricostruisce pixel, ma predice rappresentazioni in uno spazio latente appreso. A differenza delle tecniche tradizionali di ricostruzione, non utilizza un decodificatore di voxel.

I passaggi chiave di questo processo includono:

    • Ciascun volume 3D è tokenizzato in patch non sovrapposte di 4×16×16 voxel.
    • Il volume viene diviso in un contesto visibile minore e in una porzione mascherata maggiore.
    • Un encoder studente elabora le informazioni relative al contesto.
    • Un predictore combina informazioni del contesto con posizionamenti spaziali, per predire lo spazio latente.
    • Un encoder insegnante genera rappresentazioni ground-truth, ottenendo un modello ottimizzato che minimizza la divergenza tra lo studente e l’insegnante.

Un aspetto innovativo è l’uso di maschere pre-definite incentrate sulla regione del cranio, per evitare scorciatoie con l’ambiente. Gli studi hanno utilizzato percentuali di contesto del 25% per le MRI e del 20% per le TC, con ulteriore drop-out del 20% in patch. Questa struttura garantisce che l’encoder concentri la sua attenzione su anatomia condivisa, e non su elementi di fondo.

Prestazioni e risultati

Per valutare le capacità del modello, i ricercatori hanno congelato ogni encoder e utilizzato test comparativi per analizzare le capacità diagnostiche. Il punto principale del confronto è stato l’Area Under the Receiver Operating Characteristic Curve (AUROC) macro-mediato su 156 compiti diagnostici, che abbracciano più di 70 diagnosi diverse per MRI e TC.

NeuroVFM ha raggiunto un AUROC complessivo di 92.68 per la TC e 92.49 per la MRI, superando in modo consistente ogni competitor nel confronto:

Modello Dati di training OBIETTIVO Margini AUROC rispetto a NeuroVFM
NeuroVFM UM-NeuroImages (Health System) Vol-JEPA (Spazio Latente)
HLIP UM-NeuroImages Supervisione di rapporto con testo −0.98
PRIMA UM-NeuroImages (MRI) Supervisione con testo −3.87
NeuroMAE UM-NeuroImages Ricostruzione voxel (MAE) −1.55
DINOv3 1.7B immagini naturali 2D, supervisione autonoma −2.24
BiomedCLIP 15M immagini con testo Visione con testo (2D) −2.88

Come utilizzare il modello?

Oltre ai compiti diagnostici, NeuroVFM supporta una serie di applicazioni downstream, come la generazione di rapporti medici, l’attribuzione della priorità (trierage), e la prenotazione mirata, utilizzando un sistema di token congelato.

    • Generazione di rapporti: Il modello congelato NeuroVFM viene integrato con Qwen3-14B in stile LLaVA-1.5 per produrre riepiloghi strutturati.
    • Trierage automatico: Il sistema produce livelli di urgenza: non significativi, routine o urgente.
    • Predizioni ancorate: Un meccanismo di attenzione traccia le aree correlate ai ritrovamenti, senza richiesta di annotazione.
    • Trasferimento cross-modale: Modelli addestrati su TC funzionano con MRI, mantenendo un AUROC inferiore di <5 punti.

Prestazioni comparative

Il sistema NeuroVFM-LLaVA ha superato modelli di punta in specifiche metriche:

    • Accuratazza di trierage con 3 livelli: migliore rispetto a GPT-5 e a Claude.
    • Accuratazza bilanciata: risultati del 92.6% per NeuroVFM, 71.2% per GPT-5.
    • Tasso di miss: 13.5% contro un 50.3% con GPT-5.
    • Costi di inferenza: risparmi di oltre 24 volte rispetto a GPT-5.

Studio prospettico

Un test pratic