Åbne, tunge sprogmodeller nærmer sig de lukkede topmodeller på kapabilitet, mens sikkerhedsforanstaltninger halter. Det er hovedbudskabet i SaferAIs eksterne evaluering af Zhipu AIs GLM-5.2, hvor rapporten finder frontier-niveau på cyber og biologi og svage eller omgåelige safeguards sammenlignet med, hvad lukkede modeller ofte ledsages af (SaferAI; TechCrunch). SaferAI angiver samtidig, at testen er udført via den offentlige API med begrænset kontrol over temperatur og promptopsætning, hvilket giver metode- og reproducerbarhedsforbehold (SaferAI).
Cursor Research har parallelt frigivet MoK, en deterministisk Mixture-of-Experts trænings-megakernel under Apache-2.0, som ifølge Cursor-teamet giver op til 2,37 gange højere throughput end stærkeste offentlige baseline. Det er rapporteret af Cursor/MarkTechPost og er på nuværende tidspunkt selvrapporteret uden uafhængig offentlig replikation på NVL72-opsætninger i de citerede kilder (MarkTechPost).
Hvad SaferAI faktisk fandt
SaferAIs GLM-5.2 Risk Evaluation placerer modellen på frontier-niveau i cyber og biologi og vurderer, at åbne vægt-modeller nærmer sig lukkede frontier-modeller, men ofte udgives uden tilsvarende sikkerhedsevalueringer og med svagere eller omgåelige safeguards (SaferAI). Rapporten beskriver test mod de fire systemiske risikoområder i EU’s General-Purpose AI Code of Practice: Loss of Control, Cyber Offense, CBRN og Harmful Manipulation (SaferAI).
GLM-5.2 angives at være udgivet 16. juni 2026, og SaferAI understreger, at evalueringen er foretaget via den offentlige API uden fuld kontrol over temperatur og promptopsætning, hvilket bør indgå i fortolkningen af kapabilitetsniveauet (SaferAI).


Sikkerhedsgabet ifølge rapporten
På tværs af de fire risikoområder finder SaferAI høj kapabilitet kombineret med svagere eller let omgåelige beskyttelser i GLM-5.2, sammenholdt med hvad lukkede modeller typisk ledsages af. Det kan øge risikoen for, at skadelig cybervejledning, biologisk misbrugskendskab eller manipulerende indhold i praksis kan frembringes, når vægtene er åbne og kan tilpasses (SaferAI).
TechCrunchs dækning fremhæver samme hovedlinje: GLM-5.2 nærmer sig frontier-kapabilitet, mens kritiske sikkerhedsmitigeringer mangler, og hastigheden i kapabilitetsudviklingen kan overhale governance og safeguards (TechCrunch).
MoK presser træningseffektivitet op for dem med NVL72
Cursor Researchs MoK samler MoE-kommunikations- og beregningstrin i én deterministisk megakernel og er open source under Apache-2.0. Cursor-teamet rapporterer op til 2,37 gange højere throughput end den stærkeste offentlige baseline og oplyser, at MoK allerede driver Composer-træning på titusindvis af GPU’er. Tallene er Cursor-/MarkTechPost-rapporterede, og uafhængig validering på faktiske NVL72-opsætninger er ikke dokumenteret i de citerede kilder (MarkTechPost).
Hardwarekravene er høje: NVIDIA Blackwell SM100 eller SM103 GPU’er, hvilket i praksis betyder GB200 NVL72 eller GB300 NVL72 racks, samt Python 3.12+, PyTorch 2.10+ og CUDA Toolkit 13.0+. Inter-GPU buffers bygger på PyTorch symmetric memory. MarkTechPost bemærker, at det begrænser realistiske adoptører til organisationer, der ejer eller lejer NVL72-kapacitet. Mindre enkelt-nodesætups med 8 GPU’er falder udenfor (MarkTechPost).
Implikationer med kildeangivelse
At åbne modeller nærmer sig frontier-kapabilitet, mens safeguards halter, er rapporteret af SaferAI og TechCrunch (SaferAI; TechCrunch). At MoK kan løfte throughput for store MoE-træninger, men kun for miljøer med NVL72-klasse Blackwell-infrastruktur, fremgår af MarkTechPosts dækning af Cursors udgivelse (MarkTechPost). Samlet peger kilderne på, at adgang til kraftige, åbent tilgængelige kapabiliteter kan brede sig, mens træningstiden for aktører med passende hardware kan falde—med de nævnte metode- og valideringsforbehold.
Hvor hurtigt og bredt det sker, afhænger af om modeludgivelser ledsages af stærke sikkerhedsværn, og om de rapporterede MoK-gevinster bekræftes uafhængigt på NVL72-opsætninger. Kilderne dokumenterer kapabilitetstendenser og hardwarekrav; de dokumenterer ikke udbredt, verificeret produktion i almindelige virksomhedsopsætninger.


Praktiske skridt og ansvar
Snillds manualbrief fortolker SaferAIs rapport som en bekræftelse af, at åbne, store modeller hurtigt kan nå frontier-kapabilitet, og at udrulning uden bevidst sikkerhedsarkitektur og governance kan medføre drifts- og omdømmerisici. Briefet anbefaler bl.a. sikkerhedsaudit af modeller, adgangskontrol, input/output-filtrering, kontinuerlig monitorering og staged menneske-i-loop workflows før fuld produktion (Snilld manual brief).

Anbefalingerne bør ses i lyset af rapportens metodeforbehold og MoKs hardwarekrav, som er dokumenteret i de nævnte kilder. Det er samtidig væsentligt, at SaferAIs vurderinger er eksterne og baseret på den offentlige API, og at MoKs hastighedstal er selvrapporterede.
Uafklarede punkter
SaferAI-rapporten indeholder ikke et udviklersvar fra Zhipu AI på konklusionerne, og der er ikke fundet en offentlig respons i de medfølgende kilder. Reproducerbarhed af GLM-5.2-resultaterne ville ifølge SaferAI styrkes af fulde prompt-logs og præcise temperaturindstillinger (SaferAI).
På MoK-siden angiver Cursor/MarkTechPost op til 2,37x throughput versus stærkeste offentlige baseline og brug på titusindvis af GPU’er. Uafhængig validering på NVL72-racks er ikke dokumenteret i de kilder, der er tilgængelige her (MarkTechPost).
Hvad betyder det for beslutningstagere
De centrale, kildebårne pointer er tre: 1) GLM-5.2 nærmer sig frontier-kapabilitet på cyber og biologi, mens safeguards er svage ifølge SaferAI (SaferAI); 2) åbne vægt-modeller frigives ofte uden samme sikkerhedsvurderinger som lukkede modeller (SaferAI); 3) MoK lover højere træningsthroughput for meget store MoE-setup, men kræver Blackwell/NVL72-infrastruktur, hvilket afgrænser, hvem der kan drage fordel af det nu (MarkTechPost).
Snillds manualbrief anbefaler at begynde med konkrete kontrolpunkter før produktion: model- og prompt-audit med fokus på de fire systemiske risikoområder, klar adgangsstyring, I/O-filtre, løbende monitorering og menneske-i-loop i risikofyldte workflows (Snilld manual brief). Anbefalingerne knytter an til de risikoområder SaferAI evaluerer samt de dokumenterede metode- og hardwareforbehold i de citerede kilder.