Snilld

GLM-5.2 i det fri: 1 million tokens og åbne weights

Z.ai frigiver GLM-5.2 som åbne weights under MIT-licens: 753 mia. parametre, 1M-token kontekst og påstande om en sjettedel af omkostningen. Det kan flytte noget for lang-horizon kodning, agent-arbejde og on‑prem drift. Men flere nøgletal mangler uafhængig verifikation, og de praktiske krav er ikke små.

17. juni 2026 Peter Munkholm

De centrale fakta i den her historie stammer fra VentureBeat og Z.ai selv: 753 mia. parametre, 1 million tokens i kontekst, nye teknikker som IndexShare og en opdateret MTP, samt påstanden om cirka en sjettedel af omkostningen på visse benchmarks. Z.ai oplyser, at GLM-5.2 er frigivet som åbne weights under MIT-licens og tilgængelig på Hugging Face og via Z.ais API. Uafhængig reproduktion af resultaterne er endnu ikke offentliggjort.

Nyheden rammer et konkret spørgsmål: Holder lang kontekst kvaliteten, når hele kodebaser, kontrakter og agent-logs samles i én prompt? Og hvor flytter omkostningen hen, hvis man vælger åbne weights og mulig on-prem drift fremfor lukkede APIer?

Hvorfor 1 million tokens betyder noget

1 million tokens gør det muligt at lægge hele repositories, store kontrakter eller flerugers agent-historik i én sammenhæng. En udvikler kan bede om ændringer med fuldt overblik uden at splitte materialet op. Det kan reducere prompt-orkestrering og risikoen for at miste kontekst mellem trin, hvis kvaliteten faktisk holder.

Lang horisont rækker også ud over kodning. MIT beskriver for eksempel, hvordan langtidshukommelse i robotik kan binde sprog, rum og tid bedre sammen. Det er ikke dokumentation for GLM-5.2, men et fingerpeg om, hvorfor lange kontekster er relevante for opgaver, der løber over timer, dage, uger.

Tæt makro af fyldt strømfordeler med kraftige stik i et lille teknikrum, køligt lys og cyan‑grønne reflekser

IndexShare og MTP kort fortalt

VentureBeat beskriver to tekniske greb. IndexShare genbruger den samme indexer på tværs af hver fjerde sparse-attention-lag. Ved 1 million tokens reducerer det per-token FLOPs med cirka 2,9x. Målet er mindre spild ved meget lange sekvenser.

Derudover en opdateret MTP-komponent til spekulativ dekodning, som ifølge VentureBeat kan øge andelen af accepterede tokens med op til omkring 20 procent. Ideen er hurtigere gennemløb uden at gå ned i kvalitet, når betingelserne er på plads.

Hvad der loves på performance

VentureBeat refererer benchmarks, hvor GLM-5.2 slår GPT-5.5 på flere long-horizon kodningsopgaver, bl.a. SWE-bench Pro, FrontierSWE og værktøjsbrug i MCP-Atlas. Andre steder halter den, eksempelvis på visse terminal-benchmarks. Samme artikel kobler resultaterne til en påstand om cirka 1/6 af omkostningen.

Banner

Før konklusioner: den slags tabeller kræver uafhængig gentagelse med åben konfiguration. Hardware, temperatur, prompt-form og post-processing kan rykke måltallene mærkbart. I drift tæller stabilitet over tid mere end et par ekstra point i én kørsel.

Hvad det kan ændre i praksis

Åbne weights under MIT gør, at modellen kan hentes, auditeres og køres lokalt. Det åbner for on-prem og hybriddrift, hvor data bliver inden for egen kontrol. For teams med stramme datalokationskrav kan det være springet fra pilot til produktion. Længere kontekster kan også ændre arbejdsgange: hele modultræer i én prompt, længere review-sløjfer, færre manuelle kontekstskift.

Finjustering på egne data er mulig, men kræver disciplin. Kuratering, evalueringsrammer og versionsstyring skal være på plads, ellers bliver en stor model mest en stor udgift.

Palleløfter med flightcase i lille varemodtagelse, vådt gulv og to teknikere i færd med at få kassen over tærsklen

Infrastrukturens pris og formfaktor

GLM-5.2 er massiv. 753 mia. parametre kræver multi-GPU eller specialiserede acceleratorer, god netværkstopologi og en serveringsstak, der kan streame tokens stabilt. Der er ikke offentliggjort en fuld operationel opskrift fra Z.ai med anbefalet hardwareklasse, batch-størrelser, memory-footprint for 1M-kontekst, eller eksempel-latency med IndexShare og MTP.

Latency bliver central. Lange prompter tager tid at indlæse og for-tolke. IndexShare og MTP kan reducere belastning, men I/O og hukommelse forsvinder ikke. Et langt kontekstvindue er kun en fordel, hvis gennemløb og svarhastighed passer til brugernes arbejdsrytme.

Økonomien bag 1/6-påstanden

VentureBeat nævner enterprise-abonnementer fra 12,60 dollar pr. måned. Det siger intet om compute, storage, netværk, monitorering og beredskab. Kører man lokalt, flytter udgiften til maskinparken. Kører man via API, betaler man i tokens og tillæg for features. Begge veje kræver et TCO-regnestykke, ikke bare en prisliste.

En enkel TCO-skitse, som kan tilpasses eget miljø:

  • Forbrug: GPU-timer pr. 1M-token kørsel x pris pr. GPU-time
  • Hastighed: gennemløb med og uden MTP, cache-hit antagelser
  • Kvalitet: retry-rate, fejlrate, manuelle efterrettelser
  • Drift: lagerplads til weights og artefakter, netværk, overvågning
  • People-tid: MLOps, finjustering, sikkerhed og support

Lille regneeksempel, kun som metode: Antag 0,7 GPU-time pr. 1M-token session på jeres hardware til 4,5 dollar pr. time = 3,15 dollar i compute. Læg 0,50 dollar til lager/net/overvågning og 1,20 dollar i efterarbejde (fx 12 minutter manuelt review til 6 dollar/halv time). Estimeret TCO: 4,85 dollar pr. session. Skift tallene ud med jeres egne målinger, og test med og uden MTP.

Sikkerhed og governance

Åbne weights giver transparens og ansvar. Når weights kan downloades, kan fejltilstande både auditeres og udnyttes. Lang kontekst øger risikoen for prompt-injektion og dataeksfiltration, hvis agent-logs og følsomme dokumenter samles i samme prompt. Der bør være stram adgangskontrol til weights, isolerede miljøer, audit-logging og inferencerestriktioner pr. projekt.

Governance skal være operativ: definer eval-suiter for lange kontekster, red-teaming scenarier og rutiner for patching og kontrollerede modelopgraderinger. Åbne modeller ændrer attack surface i forhold til lukkede APIer og kræver tilsvarende styring.

Banner
—

Benchmarks og tillid

VentureBeat omtaler bl.a. SWE-bench Pro, FrontierSWE, MCP-Atlas samt længerevarende workloads som PostTrainBench og SWE-Marathon. GLM-5.2 beskrives som stærk på flere af dem, men ikke alle. Spørgsmålet er validering: Hvem har kørt testen uafhængigt med offentliggjort konfiguration og scripts?

Før indkøb bør der laves reproduktioner på egen hardware eller via en neutral tredjepart. Fastlås timeout, tool-calling regler, temperatur, top-p og håndtering af mislykkede forsøg. Benchmarks, der belønner agentkæder, kan favorisere bestemte arkitekturer; det skal fremgå af protokollen.

Ukendte ting og krav til udbyderen

Der er tre åbne felter, som bør afklares før større satsning:

  • Hardware og konfiguration: anbefalede GPU/accelerator-klasser, minimum VRAM pr. replica ved 1M tokens, typiske batch-størrelser og I/O-mønstre
  • Ydelse i praksis: eksempel-latency for indlæsning og generation med og uden MTP, samt stabilitet over lange sessioner
  • Omkostninger: en gennemskuelig cost-breakdown, der binder 1/6-påstanden til specifik hardware og batch-praksis

Efterspørg konkrete artefakter: link til Hugging Face-modelkort, checksums for weights og noter om tokenizer-varianter. Hvis artefakterne ikke er tilgængelige eller mangelfulde, bør det noteres i jeres risikovurdering og POC-plan.

Licens og leverandørstrategi

MIT-licensen er usædvanlig liberal for weights i den størrelsesorden. På Hugging Face kan der ligge modelkort og ansvarlige-brugsnoter, som bør læses grundigt. Verificér, at de publicerede weight-filer matcher udgivelsen, og dokumentér checksums.

Strategisk reducerer åbne weights lock-in. Man kan bygge on-prem, i eget VPC eller vælge en hybrid. Det giver forhandlingsrum over for lukkede udbydere og mulighed for at splitte workloads efter styrker: lang kontekst og agent-arbejde ét sted, specifikke reasoning-opgaver et andet.

Tekniske begrænsninger og trade-offs

IndexShare lover lavere FLOPs ved lange sekvenser. Hvad betyder genbrug af indexer for præcision, når sekvenslængde og input-typer varierer kraftigt? Det mangler dokumentation. Test med blandet input og mål variation i nøjagtighed på tværs af positionsintervaller i konteksten.

MTP kan øge tempo, men spekulativ dekodning kan også øge varians, hvis acceptlogikken er for løs. I lange kæder kan små fejl vokse. Latency kan svinge mere end i kort-kontekst scenarier. Stabil brugeroplevelse skal måles, ikke antages.

Et konkret pilotdesign

Her er et kompakt oplæg, der kan køres på to uger:

  • Use case: monorepo-refactor på et kendt projekt med 200k+ linjer. Input er hele repoet som kontekst, inkl. arkitekturdocs og tests. Output er en PR med ændringer og genererede tests.
  • Setup: sammenlign GLM-5.2 mod en kendt reference under identiske prompts og værktøjer. Lås temperatur 0,2, top-p 0,9, timeout 120 sek., n-runs 10 per model.
  • Metrics: end-to-end latency, token-gennemløb, PR-acceptgrad uden rettelser, antal retries, hallucinationer pr. 10k tokens, tid brugt på manuel efterrettelse.
  • Acceptkriterier: mindst samme PR-acceptgrad som reference, 20 procent lavere efterrettelsestid og latency-varians under 15 procent mellem kørsler.

Bundlinjen

GLM-5.2 samler tre sjældne ting i én udgivelse: 753 mia. parametre, 1M-kontekst og åbne weights under MIT-licens. Hvis bare dele af de lovede resultater holder i virkelig drift, får beslutningstagere et reelt alternativ til lukkede APIer på lang-horizon opgaver. Arkitekturen og økonomien skal dog bekræftes i praksis.

Næste skridt er jordnære: bed om åbne konfigurationer for benchmarks, en klar hardwarevejledning, reproducerbare scripts, kør en fokuseret pilot og regn på TCO med egne målinger. Først derefter giver det mening at skrue op.

Kilder og læsning

VentureBeat er brugt som primær kilde til specifikationer, performancepåstande, IndexShare og MTP samt prisangivelsen. Z.ais blog indikerer øjeblikkelig release og MIT-licens. For perspektiv på langtidshukommelse i praksis henvises til MITs artikel om sprogforankret hukommelse i robotik. Tjek Hugging Face for modelkort, checksums og eventuelle brugsnoter ved publicering.

Kilder

    Gør brugeroplevelsen bedre.
    Hvilket firma arbejder du for?