Datalab Marker 2: throughput molto più alto di MinerU e confronto con Docling e LiteParse

Cosa è accaduto

Datalab ha rilasciato Marker 2, una riscrittura completa del suo pipeline open source per la conversione di documenti che, sul benchmark pubblico olmOCR-bench, ottiene in modalità "balanced" un punteggio complessivo del 76.0% e 83.5% sui PDF nativi, sostenendo 2.9 pagine al secondo su una GPU B200. I risultati citati provengono dalle esecuzioni di Datalab rese riproducibili nel repository del progetto.

Perché è importante

I numeri combinano accuratezza e throughput, due dimensioni spesso in contrasto nelle pipeline di estrazione documentale. Marker 2 presenta tre percorsi di conversione (balanced, fast e --disable_ocr) e cambiamenti strutturali — tra cui Surya OCR 2, un modello di layout da ~20M di parametri e un pdftext ricostruito — che mirano a offrire qualità elevata su GPU e modalità più economiche o CPU-only per deployment diversi.

Possibili impatti

I dati mostrano distinzioni operative rilevanti per team e operatori: rispetto a MinerU, Marker balanced riporta un punteggio leggermente superiore (76.0 vs 72.7) ma soprattutto un throughput molto più alto (2.9 vs 0.54 pg/s sulla stessa macchina), una differenza che può ridurre significativamente i costi infrastrutturali in flussi ad alto volume. La modalità fast aumenta ulteriormente il throughput a 7.4 pg/s a costo di precisione (66.6% overall), mentre --disable_ocr offre un profilo CPU-only a 23.7 pg/s con una perdita di accuratezza sulle categorie sensibili come le equazioni.

La comparazione con Docling e LiteParse evidenzia trade-off distinti: Docling è più orientato alla governance e al supporto di formati eterogenei (MIT license) ma ottiene punteggi e throughput inferiori nel benchmark riportato; LiteParse sacrifica struttura per velocità estrema (1721 pg/s con OCR disabilitato) e perde accuratezza su documenti non lineari.

Dal punto di vista operativo emergono anche implicazioni di compatibilità e aggiornamento: Marker 2 richiede Python 3.10+, ha spostato il packaging e ha rimosso il convertitore di structured-extraction, orientando alcuni casi d'uso verso l'API ospitata o workflow con LLM.

Una possibile lettura

I risultati rafforzano una tendenza pratica: la scelta dello strumento dipende fortemente da mix documentale, vincoli di latenza/throughput, budget e licensing. Per documenti nativi in grandi volumi con accesso GPU, Marker balanced sembra offrire un rapporto qualità/velocità favorevole; per ambienti air-gapped o CPU-only la modalità fast --disable_ocr rappresenta un compromesso interessante. Per contenuti complessi come archivi scansionati o pagine con matematica intensiva, rimangono superiori i tier VLM full-page citati da Datalab.

È opportuno sottolineare che tutte le cifre qui riportate provengono dalle esecuzioni di Datalab e sono rese riproducibili tramite l'harness pubblicato. Team e organizzazioni dovrebbero eseguire i test sul proprio corpus per verificare la corrispondenza con i propri carichi reali prima di decidere un'adozione in produzione.

Fonte: MarkTechPost