Snilld

Granite 4.2 fra IBM gør reasoning og agentadfærd til standard — hvad det betyder for drift og compliance

IBM har frigivet Granite 4.2 den 25. august 2026 – en ny generation af åbne, decoder-only reasoning-modeller i 3B, 8B og 30B under Apache 2.0. Både MarkTechPost og Unite.ai bekræfter frigivelsesdato, størrelser og licens, samt at modellerne kan skifte mellem tænkende og ikke-tænkende tilstande, og at de to største er trænet med agentisk RL i sandbox-miljøer.

26. august 2026 Peter Munkholm

Kort lede: Hvad skete der, og hvorfor det betyder noget

IBM udgav Granite 4.2 den 25. august 2026 som en familie af åbne sprogmodeller i tre størrelser – 3B, 8B og 30B – alle under Apache 2.0. Det fremgår samstemmende af MarkTechPost og Unite.ai, som også beskriver skiftbar tænketilstand og fokus på eksplicit ræsonnement. Det kan lyde tørt, men konsekvensen er alt andet end det: Apache-licensen fjerner praktiske licensbarrierer for kommerciel brug, og reasoning som førsteprioritet gør modellerne lettere at auditere i drift.

Granite 4.2 følger trenden mod åbne enterprise-modeller med stærk kæde-af-tanke. Den særlige detalje her er, at de to store modeller har lært at agere i miljøer – kode, terminal og web – før frigivelse. Det gør dem mere anvendelige til drift og automationsopgaver, ikke kun Q&A. Det rykker i praksis.

Nærbillede af en slidte adgangsbrik på en nøglering med cyan maling i rillerne, uden tekst, med en let indtrængende lilla skygge.

Hvad er nyt teknisk

Kernen er en tæt, decoder-only transformer. Ingen MoE. Ifølge MarkTechPost bruger arkitekturen Grouped Query Attention med 8 KV-heads, RoPE-positionering, SwiGLU i MLP-laget, RMSNorm med epsilon 1e-5, untied embeddings og bfloat16. Et forbehold: MarkTechPost nævner RoPE θ som 10.000.000 i brødteksten, mens andre udlæg ofte opererer med lavere størrelsesordener; uddraget virker delvist trunkeret. Den konkrete θ-værdi bør krydstjekkes mod IBMs officielle note.

Hvordan blev de trænet

MarkTechPost beskriver pre-training fra bunden på omkring 15 billioner tokens. Efter pre-training følger en flertrins RL-kæde. Unite.ai bekræfter, at 8B- og 30B-modellerne gennemgår agentisk RL i miljøer for software engineering, terminal og web-søgning.

MarkTechPost skitserer rækkefølgen: først RLVR, derefter skill boosters, så SWE, Terminal, Search og til sidst RLHF – hver som separat, asynkron GRPO-kørsel, warm-startet fra forrige checkpoint, med leave-one-out baseline og afkortet importance sampling for at styre off-policy drift. Det forklarer også, hvorfor 3B-udgaven – uden agentisk blok – ligger bagud i kapabilitet.

Lang-kontekst-træningen beskrives som en fase op til 512K tokens, selv om standard sekvenslængde i tabellen er 128K. Det passer med at lære modellen at håndtere meget lange dokumenter, men holde default nede af hensyn til serving-omkostninger.

Reasoning som produktfunktion

På benchmarks gengiver MarkTechPost IBMs egne tal: på AIME2, GPQA, MMLU-Pro og RULER 128K ligger 30B generelt stærkest, og 8B tæt på flere steder. Det er IBMs egne målinger viderebragt af sekundærkilder; uafhængig verifikation mangler, så tag dem som indikatorer.

Banner
En tekniker (ansigt ude af frame) fastgør en kort, farvekodet kabelrem omkring en fysisk isolationsstang ved kant af et testområde; baggrunden er et garage-lignende rum med lilla skygger.

Licens og deploybarhed

Apache 2.0 fjerner friktion for kommerciel brug, finetuning og on-prem deployment – relevant for regulerede brancher. Man skifter fra API-afgifter til interne omkostninger i GPU-timer, el og drift, hvilket ofte er lettere at budgettere.

Hvem passer hver model til

MarkTechPost giver en praktisk ramme: 3B til solo-udviklere og startups på laptop via Ollama eller LM Studio, især med GGUF-kvantisering ned til Q4_K_M. 8B til teams på én moderne GPU (24–48 GB-klassen). 30B til virksomheder med A100/H100-kapacitet eller FP8/NVFP4-serving via vLLM.

Tradeoffs: 3B er hurtig og billig, men snubler på lange reasoning-kæder. 8B er den pragmatiske mellemvej til interne assistenter og RAG. 30B giver mere robuste svar og bedre agentisk adfærd, men koster på hosting. Vælg ud fra workload: simple scripts og terminal-automatisering vs. tung beslutningsstøtte med lang kontekst.

Agentisk adfærd: muligheder og risici

Agentisk RL betyder, at modellen har øvet sig i at handle: redigere kode, køre terminal, søge på nettet – i sandkasser. Det åbner for softwareagenter, DevOps-automatisering og dybere research-agenter. I praksis kan en model fx åbne et repo, rette en konfigurationsfejl, køre tests og poste loggen – forudsat de rigtige rettigheder.

Risiciene følger med: autorisation skal være stram, sandkasser skal være reelle, og ændringer mod produktion bør have en verificeringssluse. Kilderne beskriver træningen i miljøer, men ikke de operative sikkerhedsbarrierer ved anvendelse. Det hul må implementatører selv lukke.

En tekniker (ansigt ude af frame) fastgør en kort, farvekodet kabelrem omkring en fysisk isolationsstang ved kant af et testområde; baggrunden er et garage-lignende rum med lilla skygger.

Chain-of-thought og governance

Kæde-af-tanke kan være guld for audit og forklarbarhed: man ser, hvorfor modellen svarede, som den gjorde. Men det rejser spørgsmål om logging, persondata og regulatorisk accept. Kilderne giver ingen governance-detaljer, så ansvaret lander hos dem, der bygger løsningen.

Pragmatiske principper: log COT på højrisko-queries; hav tænkning slået fra som default og lad brugeren tænde den; maskér/truncér persondata i COT-logs; adskil adgang til COT fra selve svar; og fastsæt en retention-politik, der balancerer ansvarlighed og nytte.

Lang kontekst i praksis

Granite 4.2 står med 128K sekvenslængde i tabellen og en træningsfase helt op til 512K. Det muliggør lange dokumenter uden voldsom fragmentering, men pris og latenstid skalerer med længden. For de fleste workloads vil 64K–128K være sweet spot, mens 512K hører til batchprocesser eller særlige due-diligence-scenarier.

For at udnytte lang kontekst kræver det disciplin i prompt-struktur: fornuftig chunking, indeksering og RAG, ellers brændes GPU-timer af på støj. Mål nyttige token-andeler: hvor meget af konteksten citeres eller refereres i COT og svar.

Speech-modeller og kontaktcenterbrug

Sideløbende frigives to Granite Speech 5.0 Turbo CTC-modeller på 470M hver. MarkTechPost beskriver dem som målrettet transskription og kontaktcentre. CTC egner sig til realtids- og near-realtidsbrug, hvor stabilitet og lav latenstid vægter højt.

Banner

I praksis skal de ind i en pipeline med VAD, domænetilpasning og post-processing af tal, forkortelser og navne. I kontaktcentre kommer derudover speaker diarization, sentiment og routing. ASR er fundamentet, men helhedskæden afgør oplevet kvalitet. Integration med Granite 4.2 som back-end til assistenter giver mening – men test på rigtige opkald, før udrulning i bredden.

Implementeringscheckliste for teknikere

En kort, praktisk rute:

  • Vælg modelstørrelse efter workload. Start småt, mål kvalitet, og skalér kun ved dokumenteret gevinst.
  • Hardware og serving: 3B på laptop via Ollama/LM Studio med GGUF; 8B på én moderne GPU; 30B på A100/H100 eller FP8/NVFP4 via vLLM.
  • Evaluer reasoning: A/B med tænkning til/fra og low-effort vs. fuld kæde. Mål kvalitet, tid og tokenforbrug.
  • Agentisk drift: byg en sandbox i lag – netværk, filsystem, rettigheder – og kræv change-approval før produktion.
  • Governance for COT: definer hvornår der logges, hvem der må se det, og hvor længe det gemmes; maskér fra dag ét.
  • Dataudsyn: hold RAG-indeks adskilt fra produktionsdata. Brug minimumsrettigheder på værktøjskald.
  • Observability: log værktøjskald, fejlretur, tokenforbrug og latency pr. trin.

Drift og omkostninger

Med Apache 2.0 flytter regnestykket fra API-afgift til intern kapacitet. 3B kan køre på edge og skære omkostninger i simple flows. 8B dækker de fleste interne assistenter uden cluster. 30B kræver planlægning – men kan stadig blive billigere over 12–24 måneder, hvis gennemløb og kvalitet er høje. Det afhænger af batchstørrelser, vLLM-effektivitet og hvor meget kvantisering, man accepterer.

MarkTechPost nævner spekulativ dekodning som et lag for hurtigere serving. Prøv det – men mål på egne workloads. Gevinsten varierer.

Små tekniske fodnoter

MarkTechPost fremhæver, at 31,6 procent af de superviserede data var agentiske og 68,4 procent ikke-agentiske, med software engineering som 69 procent af den agentiske andel. Der nævnes også brug af OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex og Goose som harnesses, kvalitetssikret af bl.a. GPT-OSS-120B og Gemma 4. SHA-256-deduplicering over værktøjs- og beskedfelter er ligeledes nævnt.

Træning på NeMo-RL og NeMo-Gym over en NVIDIA GB200 NVL72-klynge hos CoreWeave er også beskrevet. Det viser skala – selv om uafhængige verifikationer af outputkvalitet naturligt nok er sparsomme lige efter frigivelsen.

Hvad kilderne ikke svarer

Der mangler direkte link til IBMs officielle release notes eller tekniske whitepaper. Flere arkitektur-tal – fx RoPE θ og enkelte tabelværdier – virker delvist trunkerede i MarkTechPost-uddraget og bør verificeres. Kilderne beskriver heller ikke håndtering af chain-of-thought i logging, persondata og sikkerhed, og der er ingen uafhængige tests af agentisk-RL-sikkerhed i sandbox-miljøer.

Perspektiv for danske virksomheder

Det vigtige er ikke kun, at modellerne er åbne, men at reasoning og agentik er bygget ind fra start – under Apache 2.0. Det sænker barrieren for at teste og driftsætte systemer, der både kan forklare sig og handle. For nogle bliver 8B arbejdshesten; for andre vil 30B give færre fejl og bedre sporbarhed i komplekse processer. 3B er stærk som edge-hjælper og til hurtige prototyper.

Disciplin er dog nødvendig: test, observability, rettigheder og en klar COT-politik. Uden det forsvinder gevinsterne hurtigt. Med det på plads kan Granite 4.2 blive en stabil byggeklods i porteføljen.

Kilder og næste skridt

De centrale oplysninger kommer fra MarkTechPosts gennemgang af Granite 4.2 og Unite.ai’s note om frigivelsen. Begge bekræfter dato, størrelser og Apache 2.0-licens samt agentisk RL for 8B og 30B. Enkelte arkitekturparametre – især RoPE θ og præcise sekvens- og tabelværdier – bør verificeres direkte i IBMs officielle release note eller tekniske whitepaper, som ikke var linket i de sekundære artikler. Det er næste skridt, før man låser langsigtede arkitekturvalg.

Konklusionen er nøgtern: Granite 4.2 gør det lettere at bygge AI-systemer, der både tænker højt og kan handle, uden licenssnørkler. Den reelle forskel ses først, når modellen kører i egen pipeline, og resultaterne måles.

Kilder

    Gør brugeroplevelsen bedre.
    Hvilket firma arbejder du for?