Introduzione a PP-OCRv6

PP-OCRv6 è il modello più recente della famiglia OCR universale PaddleOCR. È stato disegnato per affrontare i compiti di rilevamento testuale e riconoscimento OCR per documenti, schermate, immagini multilingue, testi industriali e testi di scena in ambienti reali.

Il modello offre tre livelli di complessità: tiny, small, medium, con un numero variabile di parametri che va da 1,5M a 34,5M. Il medium e il small supportano fino a 50 lingue, inclusi cinese semplificato, cinese tradizionale, inglese, giapponese e 46 lingue a partire dello script latino. PP-OCRv6 permette di valutare rapidamente l'efficacia del modello grazie al suo demo online: PP-OCRv6 Online Demo.

Prestazioni e Benchmarking

Sui benchmark OCR multi-scena PaddleOCR interni, PP-OCRv6medium ottiene il 86,2% di H-mean per la rilevazione ed il 83,2% per l’accuratezza in riconoscimento. Si tratta di un miglioramento del +4,6 punti percentuali per la rilevazione e del +5,1 per il riconoscimento rispetto alla versione precedente, PP-OCRv5server.

PP-OCRv6 è pensato per soddisfare un bisogno pratico: la generazione di risultati testuali strutturati, fedeli e precisi, anche con modelli leggeri. Offre una flessibile opzioni di distribuzione, grazie al supporto di piattaforme come PaddlePaddle, Transformers, o ONNX Runtime.

Architettura e Innovazione

PP-OCRv6 introduce miglioramenti sia nel design architetturale che nella formazione del modello. Lo scopo principale è rafforzare l’accuratezza dell’OCR mantenendo le dimensioni dei modelli adatti a diversi ambienti di distribuzione. Il modello utilizza PPLCNetV4 come backone unificato sia per rilevamento che riconoscimento.

Dettagli Tecnici

Moduli di Rilevamento

La parte di rilevamento testuale è il primo passo del flusso OCR. L’accuratezza in questa fase influenza la qualità del crop trasmesso al riconoscitore. Crop poveri spesso portano a una riconoscimento testuale meno efficace. PP-OCRv6 ha aggiornato il modulo di rilevamento con RepLKFPN, una feature pyramid network leggera a kernel estesa, pensata per il rilevamento testuale a multi-scala, mantenendo l’efficienza dell’inferenza.

Moduli di Riconoscimento

Per il riconoscimento testuale, PP-OCRv6 utilizza EncoderWithLightSVTR, che combina modellazione locale del contesto con un'attenzione globale al fine di migliorare l’accuratezza nel riconoscimento di testi difficili. Questi miglioramenti sono particolarmente rilevanti per i testi multilingue, schermi, caratteri industriali, caratteri speciali, testi densi o aree immagini rumorose.

Supporto Linguistico Esteso

I modelli di tipo small e medium supportano fino a 50 lingue. Questo riduce la necessità di utilizzare modelli separati per comuni scenari OCR multilingue.

Output Strutturato e Flessibilità

I risultati OCR possono essere salvati come immagini visualizzabili e output JSON strutturato. L’output strutturato può essere successivamente utilizzato da sistemi downstream come parsing documentale, esecuzione di query, estrazione dati, integrazione in workflow RAG, analytics oppure in agenti.

Utilizzo con Diverse Technologie

PP-OCRv6 può essere utilizzato con diversi backend di inferenza tramite PaddleOCR 3.7, che offre un'interfaccia unificata di inferenza-engine. Per gli utenti di Hugging Face, è ora possibile utilizzare alcuni modelli OCR e di parsing documentale con un backend Transformers. Questo può essere abilitato facilmente con configurazioni specifiche.

Sul Hugging Face Space, PP-OCRv6 è disponibile in diverse versioni, tra cui safetensors, modelli Paddle inference e modelli ONNX. Questo consente una maggiore flessibilità e compatibilità con i vari framework di inferenza. I modelli ONNX sono disponibili per chi preferisce utilizzare ONNX Runtime.

Modelli, Avvio e Integrazione

PP-OCRv6 aggiunge alla collezione PaddleOCR una famiglia di modelli OCR multilingue leggeri per rilevamento e riconoscimento in ambiente reale. La release include tre livelli di modelli, supporto massimo per 50 lingue e migliorie significative in rilevamento e riconoscimento rispetto a PP-OCRv5_server.

Oltre ai modelli, PP-OCRv6 fornisce diversi accessi: il blog Transformers Backend Blog: PaddleOCR con Transformers Backend, il sito ufficiale di PaddleOCR (https://www.paddleocr.com), il demo online, e le risorse nella Collection. Utenti possono scegliere backend di inferenza più adatto ai loro workflow specifici.

Per chi cerca modelli OCR nativi a basso carico di lavoro e con supporto Transformers, PP-OCRv6 rappresenta una scelta eccellente. Per chi invece è attento alle risorse computazionali, si possono esplorare varianti ancora più leggere per scoprire se ne esistano con carico inferiore.