Snilld

Ny Microsoft-model rammer 95,95% på CyberGym — og kører kun i MDASH

Microsoft lancerer MAI-Cyber-1-Flash som en cybersikkerhedsmodel, der kører inde i MDASH og ikke som selvstændigt endpoint. MarkTechPost rapporterer 95,95% på CyberGym ved samkørsel med GPT-5.4, mens VentureBeat omtaler cirka 96%. Scoren er, ifølge kilderne, endnu ikke uafhængigt reproduceret. VentureBeat gengiver desuden Microsofts påstand om omtrent halverede omkostninger, men uden offentligt pris-breakdown.

28. juli 2026 Peter Munkholm

Microsoft har udgivet MAI‑Cyber‑1‑Flash som en specialiseret model til cyberforsvar. Modellen udbydes ikke som et selvstændigt endpoint, men kører som del af MDASH, Microsofts multi‑model agentiske scanning‑harness (MarkTechPost; VentureBeat). MarkTechPost rapporterer en CyberGym‑score på 95,95%, når MAI‑Cyber‑1‑Flash anvendes sammen med GPT‑5.4, mens VentureBeat omtaler tallet som cirka 96% (MarkTechPost; VentureBeat). Kilderne angiver ikke uafhængig tredjeparts‑reproduktion af scoren.

CyberGym beskrives som en offentlig benchmarksuite med 1.507 reproduktionsopgaver fra 188 OSS‑Fuzz‑projekter, og Microsofts målinger er lavet på standard Level 1‑opsætningen, hvor både sårbar kildekode og en overordnet beskrivelse indgår (MarkTechPost). Det giver et fælles sammenligningsgrundlag, men uden eksternt reproducerede kørsler er tallene stadig producentnære.

Model og arkitektur

Ifølge MarkTechPost er MAI‑Cyber‑1‑Flash en transformer med self‑attention og sparsomme Mixture‑of‑Experts‑lag. Den beskrives med 137 milliarder samlede parametre, 5 milliarder aktive ved inferens, 256k kontekstlængde og tekst‑ind/ud (MarkTechPost). Kilden angiver, at modellen er en cybersikkerheds‑finetune af MAI‑Code‑1‑Flash og afledt af MAI‑Thinking‑1‑linjen (MarkTechPost).

Placeringen i MDASH er en central del af historien. Begge kilder fremhæver, at modellen ikke leveres som et enkelt API‑endpoint, men indgår i Microsofts agentiske ramme, hvor flere modeller samarbejder og rutes i et styret forløb (MarkTechPost; VentureBeat). MarkTechPost beskriver, at MDASH organiserer arbejdet i fem faser, men uden at offentliggøre en fuld teknisk specifikation i den artikel, der refereres.

Makro af plombering på en lille udstyrsdør med svage grønne reflekser i kølig aftenbelysning.

Benchmarkresultater

MarkTechPost rapporterer, at MDASH med MAI‑Cyber‑1‑Flash og GPT‑5.4 scorer 95,95% på CyberGym Level 1 (MarkTechPost). VentureBeat refererer samme niveau som cirka 96% (VentureBeat). Kilderne angiver ikke en uafhængig, tredjeparts‑verificeret kørsel af denne score. Det er væsentligt for læsere, der vil sammenholde tal på tværs af leverandører.

Banner

MarkTechPost sætter også resultatet i historisk kontekst: Da Microsoft første gang beskrev MDASH i maj 2026, opnåede harnesset 88,45% på CyberGym med generelt tilgængelige modeller, hvilket på det tidspunkt var topplaceringen på den offentlige leaderboard og cirka fem point foran næste entry på 83,1% (MarkTechPost). Ifølge forskerholdet løftede udskiftning af 80% af modellerne i MDASH scoren fra 88,4% til 95,95% (MarkTechPost).

Anvendelsesfokus og afgrænsninger

MarkTechPost beskriver fokus som defensivt: trænet til patching, reproduktion og forklaring, ikke til exploit‑generering (MarkTechPost). Inputs og outputs er tekst, hvilket følger direkte af modelbeskrivelsen i samme kilde (MarkTechPost). Disse afgrænsninger er en del af den profilerede anvendelse på CyberGym, hvor opgaverne handler om at gengive og forklare sårbarheder i kodebaser.

CyberGym‑opsætningen i de rapporterede målinger er Level 1, som ifølge MarkTechPost inkluderer sårbar kildekode og en høj‑niveau beskrivelse. Det tydeliggør, at benchmarken tester reproduktion under forhold, hvor væsentlig kontekst stilles til rådighed, i modsætning til ren black‑box‑detektion (MarkTechPost).

MDASH som leveringsmodel

Både MarkTechPost og VentureBeat fremhæver, at MAI‑Cyber‑1‑Flash kører inden i MDASH frem for at være et separat produkt (MarkTechPost; VentureBeat). MarkTechPost beskriver MDASH som et system, der koordinerer specialiserede agenter på tværs af fem faser. Den præcise interne fordeling af opgaver mellem modeller er ikke oplyst i de refererede artikler.

Set i lyset af kilderne er den væsentlige pointe for læsere, der vurderer implementering: adgangen går gennem MDASH‑harnessen, ikke via et åbent, enkeltstående model‑endpoint. Det følger direkte af de to artikler og har betydning for, hvordan man kan sammenligne med modeller, der udbydes som selvstændige API‑services.

En rød-sølv afspærring spænder over en tom korridor, med svage cyan/grønne reflekser i kølig aftenlysning.

Omkostninger og prisfortælling

VentureBeat gengiver Microsofts påstand om, at den nye opsætning omtrent halverer omkostningerne i forhold til Microsofts nuværende produktionsnære konfiguration (VentureBeat). Der gives dog ikke et offentligt pris‑ eller forbrugs‑breakdown, og MarkTechPost leverer heller ikke en talopdeling, som muliggør uafhængig validering (MarkTechPost; VentureBeat).

Banner

I mangel af offentlig prisdetalje må påstanden om omkostningsreduktion forstås som Microsofts egen vurdering, gengivet i presse‑dækningen, ikke som et eksternt verificeret resultat. Det er den dokumenterede status i de tilgængelige kilder.

Klarlagte og uklare punkter i kilderne

Kilderne underbygger, at modellen er lanceret, at den kører inde i MDASH, og at den opnår 95,95%/~96% på CyberGym Level 1 ved samkørsel med GPT‑5.4 (MarkTechPost; VentureBeat). De underbygger også de tekniske hovedtal for modellen (137B samlede parametre, 5B aktive, 256k kontekst, tekst‑I/O) samt afledningen fra MAI‑Code‑1‑Flash/MAI‑Thinking‑1 (MarkTechPost).

Kilderne dokumenterer ikke en offentlig, tredjeparts‑reproduceret CyberGym‑kørsel ved 95,95%, leverer ikke et prisopdelt cost‑breakdown og fremlægger ikke et offentligt modelkort med træningsafgrænsninger. Det er eksplicit fravær af information i de artikler, der refereres her (MarkTechPost; VentureBeat).

Spørgsmål før indkøb eller evaluering

På basis af det, der fremgår af MarkTechPost og VentureBeat, er der tre åbenlyse afklaringspunkter: dokumentation for benchmarkreproducerbarhed, modelkort med tydelige træningsafgrænsninger samt gennemsigtighed i omkostningsmodellen. Begge kilder henviser til resultater og påstande, men uden at stille de nævnte artefakter offentligt til rådighed i deres dækning (MarkTechPost; VentureBeat).

Det gør det relevant at efterspørge rå outputs eller metodebilag for CyberGym‑kørslerne, officielle modelkort og et mere detaljeret prisbillede fra Microsofts side, hvis formålet er at sammenholde ydeevne og pris med andre tilbud under sammenlignelige forhold. Det er ikke tilgængeligt i de anvendte kilder.

Glasdør ved indgang i skumring med diskret inspektionsholder, våde fliser og kølige cyan/grønne reflekser.

Historisk kontekst

MarkTechPost’s gennemgang placerer forbedringen i MDASH fra 88,45% til 95,95% sammen med udskiftning af 80% af de anvendte delmodeller (MarkTechPost). Samme kilde beskriver CyberGym som 1.507 reproduktionsopgaver fra 188 OSS‑Fuzz‑projekter og Microsofts evaluering på Level 1 (MarkTechPost). Det er de mest konkrete, dokumenterede datapunkter om fremgangen.

VentureBeat gentager hovedlinjerne om en mindre, specialiseret model, der sammen med MDASH‑orkestrering søger at opnå høj score og lavere omkostninger, og refererer Microsoft for cost‑påstanden. Artiklen gengiver også den omtrentlige 96%‑score (VentureBeat).

Bundlinjen

MAI‑Cyber‑1‑Flash er lanceret som en cybersikkerhedsmodel med dokumenterede specifikationer og leveres gennem MDASH, ikke som selvstændigt endpoint (MarkTechPost; VentureBeat). MarkTechPost rapporterer 95,95% på CyberGym ved samkørsel med GPT‑5.4, som VentureBeat afrunder til cirka 96%, men uden uafhængig reproduktion i de anvendte kilder. VentureBeat gengiver Microsofts vurdering af omtrent halverede omkostninger, dog uden offentligt pris‑breakdown. For læsere betyder det, at de centrale præstations‑ og prisudsagn i øjeblikket må læses som leverandørnære resultater, solidt refereret, men ikke eksternt verificeret i de kilder, der er brugt her.

Kilder

    Gør brugeroplevelsen bedre.
    Hvilket firma arbejder du for?