Hvorfor det kan være relevant i praksis
MarkTechPost beskriver, at mange visuelle dokument‑retrievere i produktion er genbrug af generative vision‑language‑modeller, som ender med at bære rundt på en separat visuel gren og en kausal decoder, der ikke bruges til generering. Det giver parameter‑ og compute‑overhead for opgaver, der kun har brug for repræsentationer. Ifølge MarkTechPost går NeoMME direkte efter retrieval‑repræsentationer og fjerner de to komponenter.
Det er et klart arkitekturvalg: én encoder, to modaliteter. Hvis pointen holder bredt, kan det forenkle stakke, hvor man i dag kører retrievere afledt af generative modeller. Hvordan det præcist slår ud i omkostninger og latenstid uden for kildens målinger, er dog ikke dokumenteret her og kræver egne tests.

Hvad NeoMME er ifølge kilden
MarkTechPost skriver, at H Company har frigivet NeoMME som en familie af bidirektionelle encodere i to størrelser omkring 260M og 800M parametre, med nøjagtige tal 262.937.906 og 793.715.032. En enkelt Transformer behandler både flersproglige teksttokens og rå 32×32 RGB‑patches gennem de samme lag, og stakken er trænet fra random init. Kilden anfører, at alle checkpoints er under Apache 2.0 med dag‑nul support i Hugging Face Transformers.
Inddataflowet beskrives sådan: tekst går ind via en ALBERT‑inspireret faktoriseret embedding, et 256‑dim opslag der projekteres op til modelbredden. Billeder deles i ikke‑overlappende 32×32 patches og projekteres af et 2‑lags MLP. Der er ingen patch‑merging og ingen sideordnet SigLIP2‑tower. Begge modeller understøtter et kontekstvindue på 16.384 tokens, som ifølge MarkTechPost rækker til to standard 3.840×2.160 4K‑billeder efter patching.

Træningsmetode og tokenizer
Ifølge MarkTechPost bruges diskret masked diffusion som denoiser over tekst under pretraining, valgfrit betinget af synlige billedpatches. Kilden beskriver desuden en whitespace‑uafhængig BPE‑tokenizer med et ordforråd på 131.072, trænet fra bunden. På tværs af 14 målsprog i FLORES‑200 devtest rapporterer kilden, at tokenizeren emitterer 44,4 procent færre tokens end ModernBERT. Der indgår ikke en per‑sprog opgørelse i den citerede tekst.
De arkitektoniske valg, som kilden fremhæver, omfatter grouped‑query attention, query‑key‑normalisering, gated attention, 2D‑rotary positionsembedding og squared‑ReLU i MLP‑blokkene. De fleste lag bruger symmetrisk sliding‑window attention, mens hvert sjette lag og det sidste lag har global opmærksomhed.
Benchmarks og rapporterede tal
MarkTechPost rapporterer, at retrieval‑finetunen NeoMME‑Retriever når 0,523 i nDCG@10 på ViDoRe v3 ved 260M parametre. Artiklen angiver ikke i den citerede tekst de fulde evalueringsdetaljer såsom sekvenslængde, batchstørrelse, seed, split, retriever‑hovedkonfiguration eller eventuel efterbehandling. Tallet gengives derfor her som et rapporteret resultat fra kilden.
Kilden angiver også driftstal for 260M‑modellen: 51,3 indekserede sider i sekundet på én NVIDIA L40S samt 78,3 millisekunder for at encodere en query på en CPU‑only host. Den citerede tekst specificerer ikke CPU‑model, trådning, batchstørrelse eller hvorvidt forbehandling (patch‑ekstraktion, tokenisering) indgår; målingens præcise opstilling fremgår ikke.

Hvad man kan udlede uden at overstrække kilden
På baggrund af kildens beskrivelse står to forhold klart. For det første er NeoMME designet som en single‑tower encoder, der eksplicit fravælger et separat vision‑tower og en kausal decoder. For det andet peger de rapporterede tal på, at en målrettet encoder kan levere konkurrencedygtige retrieval‑resultater og høj throughput på moderne hardware. Hvor meget af gevinsten der kommer fra arkitektur, træning eller tokenisering, kan ikke fastslås her uden yderligere dokumentation.
Det fremgår af MarkTechPost, at checkpoints er Apache 2.0‑licenseret og har dag‑nul support i Hugging Face Transformers. Det gør verifikation og forsøg lettere, forudsat at læseren tilgår de nævnte udgivelser og kører evalueringsopsætninger, der matcher kildens. Der er linket til et arXiv‑preprint i artiklen, men detaljer som eval‑scripts, seeds og fulde måleparametre bør konsulteres direkte i de officielle artefakter.

Implementeringsimplikationer, som kilden underbygger
MarkTechPost karakteriserer de udbredte hand‑me‑down‑retrievere som en kilde til unødig parameter‑ og compute‑overhead. Hvis en single‑tower encoder kan opretholde kvalitet på opgaven, antyder det færre komponenter i inference‑stakken og potentielt lavere latenstid i encode‑trinnet. Det er en rimelig teknisk forventning ud fra kildens præmis, men konkrete besparelser eller TCO‑effektiviseringer kræver målbare sammenligninger i egne miljøer.
At modellen kan behandle både tekst og billeder i samme lag og har 16.384 tokens kontekst, peger mod en praktisk evne til side‑for‑side læsning i visuel dokumentretrieval uden et særskilt vision‑tower. Hvad der er den optimale batchstørrelse eller sekvenslængde, og hvor grænsen går for VRAM på tværs af GPU‑profiler, er ikke specificeret i kilden og må afklares i lokal test.
Begrænsninger i den tilgængelige dokumentation
Nogle nøgletal gengivet af MarkTechPost kan være følsomme over for evalueringsopsætningen. Det gælder især ViDoRe‑målinger og throughput/latens, som typisk afhænger af batch, inputopløsning, præ‑/post‑processing og hardware‑profil. Hvor kilden ikke oplyser disse detaljer, bør tallene forstås som rapporterede og ikke uafhængigt reproducerede her.
Denne gennemgang bygger på MarkTechPost som primær kilde og et linket arXiv‑preprint. Uden direkte henvisning til evalueringsscripts, seeds og fulde opsætninger er det ikke muligt at verificere de rapporterede målinger i denne tekst. Læsere med interesse i at bruge NeoMME bør derfor konsultere de officielle checkpoints og dokumentation og selv reproducere centrale benchmarks med identiske parametre.

Hovedpunkter fra kilden
– NeoMME er en familie af single‑tower multimodale encodere på ca. 260M og 800M parametre, som fravælger separat vision‑tower og kausal decoder, ifølge MarkTechPost.
– Én Transformer behandler både teksttokens og 32×32 RGB‑patches; træning fra random init, jf. kilden.
– Tokenizer: whitespace‑uafhængig BPE, 131.072 entries; kilden rapporterer 44,4 procent færre tokens end ModernBERT på 14 FLORES‑200‑sprog.
– Kontekstvindue 16.384 tokens; kilden angiver, at det rækker til to 4K‑billeder efter patching.
– NeoMME‑Retriever (260M) rapporteres at nå 0,523 nDCG@10 på ViDoRe v3.
– Driftstal fra kilden for 260M‑modellen: 51,3 sider/sek. på én NVIDIA L40S og 78,3 ms pr. query på CPU‑host.
– Checkpoints under Apache 2.0 og dag‑nul support i Hugging Face Transformers, ifølge kilden.
Hvad der bevidst ikke konkluderes her
Der drages ikke konklusioner om ViDoRe‑v1/v2‑resultater, BEIR‑sammenligninger, ablationspecifikke gevinster eller lager/komprimeringstal, da sådanne detaljer ikke fremgår af de verificerede henvisninger i denne gennemgang. Ligeledes fremsættes der ikke påstande om konkrete omkostningsbesparelser i produktion uden dokumenterede cost‑modeller eller genspilbare målinger.