Una nuova frontiera per l’estrazione di dati dal testo
Datalab ha lanciato Lift, un modello progettato per estrarre in modo mirato informazioni da documenti complessi come PDF o immagini. L’approccio innovativo di Lift si basa su un unico passaggio: dato un PDF o un'immagine, più uno schema JSON predefinito, Lift esegue l’estrazione e restituisce direttamente JSON strutturato. A differenza del tradizionale processo in due fasi (conversione in Markdown e successiva estrazione), Lift opera in un solo passo.
Secondo il team di Datalab, Lift si distingue per la capacità di supportare l’estrazione JSON vincolata dallo schema e di restitire JSON che si adatta esattamente ai requisiti dell’applicazione. Questo modello si fonda su un’architettura di 9 miliardi di parametri, in grado di gestire PDF e immagini in alta qualità.
Schema-first vs. Parser-focused
Per comprendere completamente il posizionamento di Lift, è essenziale distinguere tra due categorie principali di strumenti:
- Parsers sono strumenti che convertono documenti in rappresentazioni intermedie fedeli, come Markdown, HTML, JSON, alberi di layout o tabelle. Strumenti come Docling, MinerU, Marker o PyMuPDF rientrano in questa classe.
- Extractors mirano direttamente alle informazioni richieste, in base a uno schema prestabilito. Lift, NuExtract3, LlamaExtract, Reducto Extract e l'API Datalab sono esempi di questa categoria.
Più specificamente, Lift non è né un motore OCR né un convertitore PDF-HTML: è un motore puramente orientato all’estrazione schema-directed. Questo è importante, poiché i sistemi reali continuano a seguire il modello parser-then-extractor, ma Lift promette di semplificare il tutto in un unico passaggio visivo.
Il posizionamento di Lift nel mercato
Lift si colloca a cavallo di molteplici categorie:
- Modelli di estrazione multimodalità con pesi aperti, come NuExtract3
- Frontier LLM (Large Language Models) con modalità di output strutturato
- Piattaforme di intelligenza artificiale dei documenti in nuvola come Azure Document AI, Google Document AI o AWS Textract
- Strumenti commerciali come Reducto, Extend o LlamaExtract
- Parser open-source come Docling, MinerU, Marker o Unstructured
- Biblioteche di generazione strutturata come XGrammar, Outlines o BAML
NuExtract3: il principale avversario open-weight
NuExtract3, prodotto da NuMind, è spesso considerato il diretto concorrente di Lift. Si presenta come un modello di 4 miliardi di parametri, con un’architettura unificata per la comprensione visiva e la conversione in Markdown. È rilasciato con licenza Apache-2.0 su Hugging Face e supporta la conversione di documenti come scansioni, ricevute, moduli e contratti.
In una comparazione pratica, Lift mostra migliore accuratezza (90.2%) rispetto a NuExtract3 (81.5%). Ma NuExtract3 è più piccolo, licenziato in maniera più permissiva e offre anche funzionalità secondarie come la conversione Markdown. L’utile compromesso dipenderà quindi dai criteri prioritariali dell’applicazione, che possono spaziare tra controllo di licenze, velocità di estrazione e capacità di deployment locale.
Confronto con i modelli di LLM multimodali
Un’alternativa comune a Lift è inviare i documenti a modelli LLM come Gemini Flash 3.5 e richiedere output strutturato. Nelle benchmark di Datalab, quest’ultimo supera leggermente Lift in accuratezza dei campi (e accuratezza documentale), ma ne ha un tempo di risposta medio di 28.1 secondi rispetto ai 9.5 di Lift.
Nonostante questo vantaggio, i modelli LLM di frontiera mantengono un certo fascino, specialmente in contesti dove la gestione del carico non è massiccia e le velocità di setup sono più rilevanti rispetto alla scalabilità locale. L’aspetto decisivo di Lift sta nel controllo dei dati, nella residenza locale e nei costi di grandi volumi.
Confronto con le piattaforme cloud
Le piattaforme come Azure Document Intelligence, AWS Textract e Google Document AI non sono solo modelli, ma piattaforme piene di servizi. Oltre all’estrazione, offrono citazioni, controlli di governance, tracciatura, e integrabilità diretta con gli ecosistemi cloud.
Gli utenti che desiderano una soluzione scalabile con supporto di controllo aziendale, governance e citazioni integrate potranno valutare Azure, AWS o Google Document AI. Ma in termini puri di velocità e di strutturazione, Lift presenta un’accuratezza superiore. Anche Datalab offre la propria API, completa di verifica per campo, punteggi di fiducia e citazioni, per chi vuole passare da modelli open-weight a servizi gestiti.
Confronto con i sistemi commerciali
I sistemi come Reducto Extract, LlamaExtract e Extend rappresentano una fascia diversa, non solo per dimensioni ma per funzionamento. Questi non offrono solo modelli di estrazione, ma intere piattaforme con funzioni come tracciabilità, flussi di revisione umana, gestione dello schema, punteggi di fiducia, e conformità.
Lift, invece, è consapevolmente ridotto nel suo scope: è un modello per estrazione schema-oriented. Quando i requisiti principali dell’applicazione non includono tracciabilità, revisione umana, citazioni o governance avanzata, il modello open di Lift offre un compromesso migliore tra velocità, precisione e capacità di deployment locale.
Confronto con Marker
Marker, anch’esso sviluppato da Datalab, svolge un ruolo affatto diverso rispetto a Lift. Mentre Lift mira all’estrazione a partire da un schema prestabilito, Marker funge da parser generalizzato: converte PDF, immagini, DOCX e PPTX in Markdown, JSON o HTML. Marker riconosce tabelle, formule matematiche, testi inline e box di confidenza.
La differenza principale è che Marker non punta a estrarre dati specifici, ma a fornire la struttura fedele del documento, come layout, testo e tavole. Lift va oltre questa fedeltà in una fase intermedia, puntando direttamente a campi JSON, rendendolo più adatto a casi d’uso produttivi in cui l’informazione desiderata è conosciuta in anticipo.
Conclusioni
Lift non cerca di competere con tutti. Si posiziona in una nicchia precisa: estrazione schema-directed ad alta velocità e bassi costi. Il confronto diretto si svolge in primo luogo con modelli open-weight come NuExtract3, ma anche con piattaforme commerciali e multimodali.
Il vantaggio chiave di Lift non è solo la sua velocità o la sua accuratezza, ma la sua natura modulare e portabile. Per applicazioni che richiedono l’elaborazione di grandi volumi con un minimo di overhead API, Lift si distingue. Per contesti in cui governance, citazioni e conformità