En teknisk rapport på 14 sider, forfattet af ni forskere hos Sina Weibo, beskriver sprogmodellen VibeThinker-3B som en model med cirka 3 milliarder parametre. Ifølge rapporten og VentureBeats dækning scorer modellen 94,3 på AIME 2026, og med en test-time metode kaldet Claim-Level Reliability Assessment angives scoren at stige til 97,1. Begge tal og metodenavnet fremgår af de to kilder.
VentureBeat sætter præstationen i relation til større modeller og fremhæver, at de publicerede tal har udløst en hurtig og delvist skeptisk debat om, hvad benchmark-scorer siger om reel modelkapacitet. Artiklen i VentureBeat er samtidig kilden til flere af de sammenlignende tal og reaktionsmålinger, som er refereret i denne gennemgang.
Det der kan dokumenteres nu
ArXiv-rapporten er offentligt tilgængelig under titlen “VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models” og angiver modelstørrelsen til omkring 3 milliarder parametre. Rapporten oplyser, at VibeThinker-3B opnår 94,3 på AIME 2026, som VentureBeat beskriver som American Invitational Mathematics Examination. Ifølge både rapporten og VentureBeat oplyser forfatterne, at en test-time teknik, Claim-Level Reliability Assessment, hæver AIME-scoren til 97,1.
VentureBeat anfører, at de rapporterede AIME-resultater placerer VibeThinker-3B i nærheden af DeepSeek V3.2, som mediet omtaler som en 671 milliarder-parameters model, og foran Googles Gemini 3 Pro, for hvilken mediet angiver en AIME-score på 91,7. Disse sammenligninger er fra VentureBeats artikel og fremgår ikke som egne udsagn i arXiv-PDF’en.


Hvad kilderne siger om test-time metoden
På kildeniveau kan der derfor henvises til, at metoden er nævnt og tilskrives effekt på AIME 2026, men uden yderligere detaljer om hyperparametre, prøveantal eller aggregeringsstrategi i de dokumenter, der er linket til her.
Reaktioner og tidlige datapunkter ifølge VentureBeat
VentureBeat refererer, at papiret inden for få timer fik 62 upvotes på Hugging Face’s daily papers, at model-repositoriet fik 130 likes, og at GitHub-repositoriet nåede 685 stjerner. Mediet gengiver også tydelig skepsis i reaktionerne på sociale medier og citerer som eksempel et opslag på X med cirka 161.000 visninger, der stiller spørgsmål ved, om resultaterne er et gennembrud eller et tegn på problemer ved benchmarkene. Disse tal og eksempler stammer fra VentureBeats artikel.
Samlet viser VentureBeats gennemgang, at opmærksomheden kom hurtigt, og at debatten fra start kredsede om dokumentation, sporbarhed og reproducerbarhed i lyset af de høje AIME-scorer for en relativt lille model.
Rammen for diskussionen om benchmarks
VentureBeat placerer VibeThinker-3B i en længerevarende debat om benchmarks og målemetoder. Når en model med opgivet størrelse omkring 3 milliarder parametre sættes op imod markant større systemer på et populært reasoning-benchmark, rejser det — ifølge mediet — spørgsmål om, hvad AIME-scorer faktisk fanger, og hvor robust målingen er på tværs af opsætninger og metoder ved testtid.
Det perspektiv, VentureBeat lægger frem, er, at historien ikke kun handler om ét sæt imponerende tal, men også om den metodebevidsthed, som efterspørges, når usædvanlige resultater præsenteres: tydelig dokumentation, reproducerbarhed og klare protokoller for at gøre sammenligninger retvisende.


Kildeattribution og afgrænsninger
Følgende udsagn kan spores direkte til arXiv-PDF’en og/eller VentureBeat: at ni forskere ved Sina Weibo har lagt en 14-siders rapport på arXiv; at modellen beskrives som cirka 3 milliarder parametre; at AIME 2026-scoren oplyses som 94,3 og 97,1 med Claim-Level Reliability Assessment; at VentureBeat sammenligner med DeepSeek V3.2 (oplyst som 671 milliarder parametre i artiklen) og Gemini 3 Pro (oplyst AIME 91,7 i artiklen); samt at VentureBeat dokumenterer hurtig opmærksomhed og markant skepsis med de nævnte tal for upvotes, likes, stjerner og visninger.

Hvad der kan udledes ud fra kilderne
På nuværende grundlag kan man referere, at de rapporterede scorer og metodenavnet fremgår af en offentligt tilgængelig arXiv-rapport og er gengivet og kontekstualiseret af VentureBeat. Man kan også referere, at VentureBeat sætter tallene i relation til større systemer, og at mediet dokumenterer både interesse og skepsis i de tidlige reaktioner. Ud over disse kildesikrede punkter indeholder materialet her ikke dokumenterede detaljer om procedurer, scripts eller vægtfiler.
Det efterlader to verificerbare spor i kilderne: 1) rapporterede AIME-scorer for en lille model med et angivet test-time greb, og 2) en dokumenteret, tidlig debat om benchmarkenes udsagnskraft, sådan som VentureBeat beskriver den. Yderligere tekniske konklusioner eller praktiske generaliseringer ligger uden for, hvad der kan underbygges med de foreliggende kilder.
Foreløbig status med kildemarkering
ArXiv-rapporten “VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models” fastslår modelstørrelsen (~3B) og oplyser AIME 2026-scorerne 94,3 og 97,1 med Claim-Level Reliability Assessment. VentureBeat gengiver tallene, sammenholder dem med DeepSeek V3.2 og Gemini 3 Pro og dokumenterer de specifikke tal for community-reaktioner nævnt ovenfor. På det foreliggende grundlag kan disse punkter refereres direkte til de to kilder.
Videre afklaringer om metodebeskrivelser, frigivelse af artefakter eller uafhængige replikationer fremgår ikke af materialet her og kan derfor ikke tilføjes eller udledes i denne gennemgang. Den offentlige arXiv-rapport og VentureBeats artikel udgør dermed kilderammen for den foreløbige status.