Datalab har udgivet Marker 2, som ifølge kilden er en fuld omskrivning af deres open source‑dokumentkonverteringspipeline. Evalueringen, der fremhæves, er kørt på Allen AI’s olmOCR‑bench, og her rapporterer Datalab en samlet score på 76,0 procent i balanced mode og en sustained gennemløbshastighed på cirka 2,9 sider i sekundet på en enkelt B200 GPU. Ifølge samme kilde ligger MinerU’s pipeline backend på 72,7 procent og 0,54 sider i sekundet, mens Docling måles til 50,3 procent og 2,1 sider i sekundet. Tallene er angivet som Datalabs egne runs på det samme benchmark.
Spørgsmålet er, hvordan sådanne benchmarktal kan omsættes i drift. Her kan score og throughput give et fingerpeg om prioriteringer i batchindlæsning og kvalitet, men resultaterne bør valideres på repræsentative korpora og målhardware, da sustained hastighed afhænger af dokumentmix og systemets I/O.
Hvad Marker 2 bygger på
Ifølge kilden er Marker 2 genopbygget omkring tre komponenter: Surya OCR 2, en hurtig layoutmodel med cirka 20 millioner parametre og en genbygget pdftext, der oplyses at være 3× hurtigere end den tidligere. Pipelinevalgene retter sig mod kendte flaskehalse i dokumentkonvertering som OCR, layoutforståelse og udtræk fra indlejrede tekstlag.
Marker 2 eksponerer tre konverteringsveje: balanced, hvor Surya VLM håndterer layout og re‑OCR’er hele sider ved dårlige tekstlag; fast, der læner sig op ad en letvægtslayoutdetektor plus pdftext med begrænset VLM‑brug; samt –disable_ocr, der kun udtrækker det indlejrede tekstlag uden VLM‑kald. Ifølge kilden er tilstandenhedsvalg device‑aware som standard (balanced på GPU og fast på CPU/MPS) og kan overstyres med en –mode‑flag.

Benchmarkets scope og score
Ifølge kilden bygger resultaterne på olmOCR‑bench fra Allen AI. Benchmarket beskrives som en samling PDF‑dokumenter med en officiel checker og kategorier, der breder sig over bl.a. matematik, tabeller og læserækkefølge. Den samlede score er et makrogennemsnit over kategorierne. Det er en stramt defineret test, men stadig én bestemt sammensætning af dokumenter.
På de rapporterede kørseler angiver Datalab: balanced til 76,0 procent samlet og 83,5 procent på born‑digital PDF’er, med cirka 2,9 sider i sekundet. fast til 66,6 procent. –disable_ocr til 43,6 procent og omkring 23,7 sider i sekundet. Ifølge kilden er forskellen mellem tilstandene netop afvejningen mellem kvalitet og hastighed.

Tallene og de direkte sammenligninger
De tal, kilden gengiver fra Datalab, placerer Marker 2 balanced foran MinerU’s pipeline backend på samlet score (76,0 mod 72,7) med en markant forskel i throughput (cirka 2,9 mod 0,54 sider i sekundet). Docling er rapporteret lavere på score (50,3 procent) med 2,1 sider i sekundet i throughput på samme benchmark. Ifølge kilden ligger born‑digital kvalitet for Marker 2 balanced på 83,5 procent. Liteparse nævnes i sammenligningen uden konkrete tal i materialet.
Datalab angiver også, at balanced mode kan holde cirka 2,9 sider i sekundet i sustained multi‑stream, mens single‑stream på samme hardware ligger omkring 0,3 sider i sekundet. Det peger på forskel mellem batchgennemløb og enkeltstrømshastighed. Som altid afhænger transfer til produktion af dokumentmix og hardwareprofil.
Fra score til drift
Som grov fornemmelse: beregner man direkte på de rapporterede cirka 2,9 sider i sekundet, er 10.000 sider i størrelsesordenen knap en time, hvis sustained holder. 100.000 sider kan i princippet være under et døgn. Det er kun pejlemærker; den faktiske tid vil afhænge af dokumenttyper, I/O‑forhold og parallelisering på målmiljøet. Kilden oplyser ikke detaljer for CPU‑kerner, RAM, NVMe/I/O eller netværk, som også påvirker throughput.
Den konkrete betydning i produktion bør valideres ved at måle sustained throughput og eventuel single‑stream hastighed på eget korpus og på samme type hardware, som forventes anvendt i drift.

Arkitektur og skaleringslogik
Ifølge kilden kommer throughputtet især fra en arkitektonisk ændring, hvor mange tynde CPU‑workers deles om en enkelt Surya inference‑server. Forældreprocessen budgetterer VLM‑samtidighed på tværs af workers, så gennemløbet skalerer med serverkapaciteten snarere end per‑proces VRAM. Det forklarer forskellen mellem single‑stream og sustained multi‑stream på samme maskine.
Tilknyttet det valg er også fuld CPU‑understøttelse i de lette tilstande: fast og –disable_ocr kræver ifølge kilden ingen GPU eller inference‑server, og layoutmodellen på cirka 20M parametre kan læse kolonner, tabeller og overskrifter på CPU.
Valg af tilstand og praktiske konsekvenser
Balanced bruger VLM aktivt til layout og re‑OCR og leverer de højeste rapporterede scorer. fast mindsker VLM‑forbrug og læner sig mere op ad layoutdetektor og pdftext. –disable_ocr springer OCR over og udtrækker kun tekstlag. Ifølge kilden er det netop afvejningen mellem hastighed og kvalitet på ol mOCR‑bench, man ser i de tre tal: 76,0, 66,6 og 43,6 procent — med tydeligt højere hastighed i den OCR‑frie bane.
Overført til planlægning kan man bruge born‑digital vs. scannet som en grov skillelinje for test, fordi kilden oplyser særskilt born‑digital score for balanced. Derfra kan man sammenligne balanced, fast og –disable_ocr på et repræsentativt udsnit af egne filer og måle både score og gennemløb.
Sammenligning mod Miner
U, Docling og Liteparse

Ifølge kilden rapporterer Datalab, at MinerU’s pipeline backend scorer 72,7 procent på samme benchmark med 0,54 sider i sekundet, mens Docling ligger på 50,3 procent ved 2,1 sider i sekundet. Marker 2 balanced rapporteres til 76,0 procent samlet og cirka 2,9 sider i sekundet. Liteparse omtales uden konkrete tal i materialet. Rangordningen kan variere på andre dokumentmix; derfor er lokal validering relevant.
Single‑stream vs. sustained giver desuden forskellig oplevelse afhængigt af brugsmønster, og kilden angiver cirka 0,3 sider i sekundet for single‑stream i balanced på samme hardware. Det bør med i vurderingen af interaktive arbejdsgange kontra batch.

Input og output
Ifølge kilden understøtter Marker konvertering af PDF, billeder, PPTX, DOCX, XLSX, HTML og EPUB, og kan levere markdown, JSON, HTML eller chunks som output. Det giver plads til at teste downstream‑kompatibilitet med eksisterende pipelines, uden at man tilføjer nye antagelser.
Hvis outputformatet skifter i en kæde, kan der være behov for mindre omskrivninger i nedstrømsled — det er ikke specificeret i materialet, så det bør valideres i en afgrænset PoC.
En kort PoC‑tjekliste
- Mål sustained gennemløb og single‑stream hastighed på eget korpus og målhardware; dokumentér forskelle mod de rapporterede tal.
- Sammenlign balanced, fast og –disable_ocr på born‑digital og scannede undergrupper; notér fejltyper (f.eks. tabeller og læserækkefølge) ud over samlet score.
- Valider CPU‑only‑kørsler for fast og –disable_ocr, hvis GPU ikke er tilgængelig i drift.
- Bekræft, at de ønskede outputformater (markdown, JSON, HTML eller chunks) passer i den eksisterende pipeline.
Begrænsninger og manglende metadata
Kilden angiver ikke hardwaredetaljer ud over “en B200 GPU”. Antal CPU‑kerner, RAM, NVMe/I/O og netværk kan påvirke throughput markant, så man bør undgå at forvente identiske resultater på tværs af instanser uden lokal måling.
Når backlog og tidslinjer estimeres ud fra sider pr. sekund, bør man tilføje et interval og genmåle på repræsentative dokumenter. Det reducerer risikoen for at låse planer til tal, der varierer med data og infrastruktur.
Migration og breaking changes
Ifølge kilden kræver Marker 2 Python 3.10+ og skifter packaging fra Poetry til uv med hatchling som build backend. pip install marker‑pdf forbliver uændret. Den strukturerede udtrækker (structured‑extraction converter og tilhørende extractors) er fjernet i Marker 2.
Hvis eksisterende job er afhængige af de fjernede komponenter, indikerer kilden, at man må omlægge til andre workflows. Det er en praktisk ændring, der bør ind i CI‑ og deploy‑planer ved opgradering.
Kontekst fra feltet
VentureBeat Research rapporterer, at mange virksomheder har udrullet AI‑agenter før de nødvendige kontroller og nu eftermonterer styring. Det er ikke specifikt for Marker, men det understøtter, at lokale evalueringer og dokumentation af performance og omkostninger er relevante, før man skalerer en konverteringspipeline.
Fodnoter og kildeforhold
Alle score‑ og throughputtal i artiklen er gengivet fra kilden, som tilskriver dem Datalabs egne kørseler på olmOCR‑bench. Uafhængig reproduktion på eget dokumentmix og hardware anbefales, før man planlægger produktion. Manglende hardwaremetadata i materialet kan skabe afvigelser, som kun kan afklares ved lokal måling.