Snilld

Google frigiver Gemma 4 12B: multimodal kraft på en 16 GB laptop

Google/DeepMind lancerer Gemma 4 12B, en cirka 12B-parameters, open-weights multimodal model, der kører lokalt på en typisk 16 GB bærbar. Den encoder-frie arkitektur lover lavere latenstid og mindre hukommelsesforbrug for tekst, billeder, lyd og video. Vi gennemgår, hvad det betyder i praksis for teams, der vil bygge sikre, hurtige og billige AI‑workflows on‑prem eller på edge-enheder.

4. juni 2026 Peter Munkholm

Google har sluppet Gemma 4 12B løs: en cirka 11,95 milliarder parameters multimodal model, permissivt licenseret under Apache 2.0 og tilgængelig via Hugging Face og Kaggle samt brugbar gennem Google AI Edge Gallery. Den er målrettet lokal kørsel på en almindelig 16 GB enterprise‑laptop. Det er ikke konceptmateriale – det kan hentes og køres nu. VentureBeat og MarkTechPost bekræfter de centrale specifikationer, og Googles egen blog dækker rammerne.

Hvorfor betyder det noget nu? Fordi mange virksomheder helst vil blive på eget netværk – og fordi latenstid gør ondt i realtid. Vi har siddet i møder, hvor wifi’en driller, men transskription eller kvalitetskontrol på video stadig skal leveres. Her er en model, der kan løfte opgaven lokalt.

Hvad Gemma 4 12

B er – og hvor du finder den

Gemma 4 12B beskrives af Google og de dækninger, vi har gennemgået, som en tæt, decoder‑only transformer med understøttelse af tekst, billeder, video og native audio. Vægtene er åbne, licensen er Apache 2.0 (som fremhævet af VentureBeat og MarkTechPost). Modellen kan hentes via Hugging Face og Kaggle, og Google peger på AI Edge Gallery for brugsscenarier. Praktisk pointe: man er ikke låst til én runtime.

MarkTechPost oplister kompatibilitet med blandt andre llama.cpp, MLX, vLLM, Ollama, SGLang, Unsloth, LM Studio og Lit‑RT til lokal API. Vi har ikke set dyb officiel dokumentation fra Google for hver enkelt integration, så her læner vi os op ad MarkTechPost. Vores erfaring: hvis en model kører i llama.cpp og MLX, kommer man hurtigt i gang på både Apple Silicon og Nvidia‑laptops.

Nærbillede af et industrikamera med cyan refleksion i linsen; dokumenterer lokal multimodal capture i en dansk produktionssammenhæng.

Encoder‑fri arkitektur i praksis

Den arkitektoniske markør er, at Gemma 4 12B er encoder‑fri: ingen separat audio‑encoder og et stærkt reduceret visionspor. Ifølge VentureBeat og MarkTechPost projiceres rå lyd og vision‑patches direkte ind i backbone via lette lineære lag. Intentionen er klar: mindre RAM‑tryk, lavere latenstid og færre komponenter at drive.

I praksis bliver multimodale inference‑kæder kortere, fordi en tung vision‑encoder ikke skal køres før sprogdelen. VentureBeat skriver, at vision‑indgangen er erstattet af et cirka 35 millioner parameters modul, der udfører en enkelt matrixmultiplikation. Det er lovende, hvis det holder bredt. Vi savner dog et detaljeret modelkort fra Google – markeres derfor som enkeltkilde.

Banner

Tekniske detaljer – og huller vi gerne vil have lukket

VentureBeat nævner et 256K token context window. Det er højt for en 12B‑model og åbner for timelange møder, store PDF’er og kodebaser uden aggressiv chunking. Vi ser ikke samme tal i Googles blog eller hos MarkTechPost, så det er en enkeltkilde‑oplysning, der kræver bekræftelse. Hvis 256K holder, flytter det RAG‑designs i praksis.

Samme kilde omtaler native agentic tool‑use og eksplicit step‑by‑step reasoning. Det matcher tendensen i open‑weights, men uden dyb teknisk dokumentation. Vi afventer eksempler fra Google på, hvordan det eksponeres (systemprompter, funktionskald, API’er). Indtil da: test case‑for‑case.

Hvad kan den bruges til – konkret

Fire steder, vi ser reel værdi i projekter: mødeopsamling og oversættelse i regulerede miljøer uden net; gennemgang af lange dokumenter med sporbare citater; videoanalyse til kvalitetskontrol, hvor lav latenstid er afgørende; og agent‑workflows, der kombinerer tekst, tal, billeder og korte lydklip fra support.

I bank kan lokal drift fjerne tvivl om dataudveksling. I sundhed kan transskription og billedkommentarer ske på en klinik‑pc, der aldrig forlader netværket. Juridisk giver det ro, når notater og bilag bliver on‑prem. Og i produktion kan en laptop koblet til et kamera udløse multimodale alarmer uden uplink. Vi har set det i mindre skala med enklere modeller – her virker tempo og drift mere realistisk.

Stille klinikscen: headset og mini‑compute enhed ved skranke, antyder lokal transskription uden patientdata.

Implementering og drift – uden pynt

Hardware: åbne kilder peger på 16 GB VRAM eller unified memory som mål. Det matcher vores erfaring, men pas på faldgruber. Kvantisering, batchstørrelser og audio buffer‑længder kan vælte et ellers fint setup. Vi fik for nylig en anden model til at køre stabilt i MLX på en MacBook Pro M3 – indtil I/O i lydrøret blev undervurderet. Små detaljer kan give store pauser.

Inferencestak: MarkTechPost nævner llama.cpp, vLLM, Ollama, MLX, SGLang, Unsloth, LM Studio og Lit‑RT. Vores grove tommelfingerregel: brug MLX på Apple Silicon; llama.cpp eller Lit‑RT på Windows/Linux; vLLM, hvis I behøver serverfunktioner og højere throughput. Start enkelt, mål, optimer – hurtigere end en stor arkitekturplan fra dag ét.

Fine‑tuning, RAG og MLOps – i virkeligheden

En 12B‑model er til at finjustere på almindelig hardware – med omtanke, men uden eksotiske krav. For RAG kan et stort kontekstvindue (hvis 256K bekræftes) mindske behovet for hård chunking. Men deduplikering, ordentlig indeksering og evaluering af kildedækning er stadig nødvendigt. Teams, der springer eval over, betaler prisen senere.

MLOps: lokal drift flytter ansvaret hjem. CI/CD for modeller, planlagte vægtopdateringer, signering af vægte, sårbarhedsscanning af runtime, logging uden persondata, monitorering af latenstid på tværs af modaliteter. Det er her projekter lykkes eller sander til. I en on‑prem udrulning i foråret spiste driver‑kompatibilitet og memory‑management mere tid end modelintegration. Tip: fastfrys versionssæt i en manifestfil, før nogen opgraderer en lyd‑driver fredag eftermiddag.

Tradeoffs og begrænsninger, man mærker

En 12B‑model er stærk, men ikke altfavnende. VentureBeat indikerer, at Gemma 4 12B nærmer sig Googles 26B MoE på standardbenchmarks. Det er positivt, men vi mangler uafhængige benchmarks – især på audio og video. Større dense eller MoE‑modeller vil ofte være mere robuste på kantcases, fx støjfyldt lyd eller komplekse, flerbilledsopgaver.

Encoder‑fri design reducerer latenstid og VRAM, men specialiserede encodere kan give bedre kvalitet på snævre domæner. Et slankt vision‑spor kan blive flaskehals ved høj opløsning eller tekniske diagrammer. Det er en reel afvejning – flere cases er nødvendige, før dommen falder.

Banner
Testmoment i et dansk værksted: en handskerhånd trykker en testkontakt der udløser lokal alarmsekvens på et statuspanel.

Compliance og governance, når vægtene ligger lokalt

Open‑weights og Apache 2.0 gør brug nemmere at licensere, men ansvaret ligger hos jer: adgangskontrol til vægte/checkpoints, kryptering i hvile på bærbare, logning af prompts/outputs uden personhenførbare data – og klare regler for, hvem der må opdatere modellen, samt hvordan rollback gennemføres, hvis en patch bryder integrationer.

En kort tjekliste, vi bruger i kundeprojekter:

  • Dataflow‑kort pr. modalitet – inkl. midlertidige filer til lyd og video.
  • Policy for lokal cache og sletning ved fejl eller crash.
  • Eval‑sæt pr. brugssag med faste kvalitetsmål og sign‑off fra forretningen.
  • Sårbarhedsscanning af runtime og modelartefakter ved hver release.
  • Audit‑log for værktøjskald og systemprompter i agent‑scenarier.

Hvad man bør gøre først – ikke sidst

Start med en stram POC på standardlaptoppen i organisationen. Én use case, gerne multimodal, med lille evalpakke og basal monitorering. Hvis lyd er centralt: mål WER og latency. Hvis dokumenter er centrale: mål citatdækning og hallucinationsrate. Drop pyntede demoer – mål det, der gør ondt.

Når det kører, vælg inferencestak pr. platform og frys versionssættet. Læg simpel CI/CD på, hvor vægte og tokenizer versionsstyres sammen med prompter. Og sæt en ansvarlig på memory og I/O. I en kundetest i maj var modellen klar på én dag – bufferstyring i lyd og video tog tre.

Hvem bør vælge Gemma 4 12

B – og hvornår bør man springe over

Vælg Gemma 4 12B, hvis I har edge‑ eller offlinebehov, følsomme data eller hvis latenstid er nøglen. Også relevant til billig finjustering og fuld kontrol over stakken. Cloud skal ikke afskrives: større modeller kan stadig levere højere nøjagtighed i komplekse reasoning‑opgaver eller domæner med mange undtagelser. Ofte er en blandet strategi bedst: lokal 12B til daglig drift og private data – større cloud‑modeller til det svære.

Hvis I går tungt efter video i høj opløsning eller støjende lyd fra produktionshaller, så planlæg en sammenligning med en større encoder‑baseret pipeline. Gemma 4 12B kan vinde på latenstid og pris – men lad kvaliteten afgøre det. Flyt ikke en sikkerhedskritisk pipeline uden en uafhængig evalrunde.

Konsekvenser for økosystemet

Med åbne vægte og målretning mod 16 GB‑hardware lægger Google pres på både open‑weights og proprietære aktører. Hugging Face og Kaggle får mere trafik, og værktøjer som llama.cpp, MLX, vLLM og Ollama står stærkere, når en ny multimodal model kan køre direkte hos brugerne. Det sænker indstigningen for enterprise‑teams, der vil køre lokalt.

Konkurrenterne? Forvent flere mellemstørrelser med aggressive optimeringer. Encoder‑fri er interessant – andre holder nok fast i letvægtsencodere for at klemme de sidste procenter ud af billede og lyd. To levedygtige retninger, afhængigt af opgaven.

Hvad vi stadig ikke ved

Tre åbne punkter: (1) præcis dokumentation for 256K context i 12B‑varianten – står kun hos VentureBeat; (2) detaljerne om visionmodulets størrelse og single‑matmul‑design – også primært VentureBeat; (3) uafhængige benchmarks for audio/video med real‑world støj og flerkamera‑scenarier.

Vi følger op, når Google publicerer et detaljeret modelkort eller når tredjeparts benchmark‑suiter lander. Indtil da er anbefalingen enkel: test lokalt på jeres rigtige laptop, med jeres rigtige data og jeres rigtige latency‑krav. Forskellen mærkes først, når man har det i hænderne.

Kilder

    Gør brugeroplevelsen bedre.
    Hvilket firma arbejder du for?