Google har lanceret Gemini 3.7 Flash kun tre uger efter 3.6 Flash. Introprisen er $0,75 pr. 1 million input-tokens og $3,75 pr. 1 million output-tokens. Modellen har et kontekstvindue på op til 1 million tokens og multimodalt input på tekst, billeder, lyd og video. Ifølge modelkortet, gengivet af MarkTechPost, er der tale om en “refinement”, altså algoritmiske forbedringer, ikke et nyt prætrænings-run. VentureBeat beskriver tempoet som usædvanligt hurtigt. Fokus er tydeligt: kodning, agent-workflows og dokumenttunge opgaver (kilder: MarkTechPost, VentureBeat).
Det interessante er rytmen. Tre uger mellem 3.6 og 3.7 flytter byrden over på teamsene: færre store migrationer hvert halve år, flere mindre justeringer hver måned. Det er effektivt. Og krævende, hvis arkitekturen er stiv.
Kort overblik over modellen
MarkTechPost gengiver Googles modelkort sådan: 3.7 Flash tager tekst, billede, lyd og video, har 1M-token kontekst, kan returnere op til 64K output-tokens og tilbyder konfigurerbare “tænkemodes”, hvor man bytter kvalitet mod pris og latenstid. Knowledge cutoff er marts 2026. Der er altså ikke mere viden om verden, men bedre udnyttelse af den viden, modellen allerede har.
Google positionerer 3.7 Flash som en arbejdshest til kodning og agenter, ikke en ny flagskibsmodel. Det matcher, at 3.7 beskrives som en finpudsning af 3.6 med forbedret kerneræsonering. VentureBeat kalder tre-ugers cyklus usædvanlig. Skiftet går fra “store hop” til løbende iteration.

Pris og adgang
Prisen er den praktiske gamechanger nu: $0,75 pr. 1M input og $3,75 pr. 1M output til og med 31.12.2026; fra 1.1.2027 stiger den til $1,50 og $7,50 (VentureBeat, MarkTechPost). Det er en midlertidig rabat, ikke en ny normal. For teams med store agent-volumener kræver det et nyt regnestykke de næste halvandet år.
Adgangen er hosted-only. Ingen åbne weights. Ingen selvhosting. Ifølge MarkTechPost sker adgang via Gemini API, Google AI Studio, Antigravity, Android Studio, Gemini Enterprise Agent Platform og Enterprise-appen. For forbrugere ligger adgang i Gemini Spark på Google AI Pro og Ultra. Det har direkte konsekvenser for dataresidency og air-gap-krav.

Benchmarks – hvor vinder den, hvor halter den
Google fremhæver især gevinster i software engineering, dokumenttungt videnarbejde og webudvikling. Ifølge MarkTechPost (som gengiver Googles tabel) går 3.7 Flash på FrontierCode 1.1 Main til 43,6 procent mod 34,4 for 3.6. DeepSWE v1.1 rapporteres til 65,3 procent. WebDev Arena Elo stiger fra 1538 til 1588. På dokument- og workflow-siden løfter 3.7 Flash sig på GDP.pdf (22,0 til 34,0) og AutomationBench (17,0 til 30,4). Bemærk: AutomationBench er privat/ikke-reproducerbar, og tal fremhæves af Google via MarkTechPost.
Billedet er ikke entydigt. Ifølge samme tabel ligger GPT-5.6 Terra foran på flere terminal-/computer-use benchmarks (fx DeepSWE 69,6, Terminal-bench 2.1 87,4, Terminal-bench 3.0 20,8, OSWorld-2.0 50,2). På GDPval-AA v2 scorer 3.7 Flash 1525 Elo mod 1598 for Claude Sonnet 5 og 1628 for Muse Spark 1.2. Der er også en mindre regression på CharXiv Reasoning: 84,5 mod 85,2 for 3.6. Konklusionen er enkel: flere eval-sæt, herunder AutomationBench, er private/ikke-reproducerbare. Brug dem som pejlemærker, ikke som beslutningsgrundlag alene.
Hvad betyder 1M tokens i praksis
Et 1M-token vindue frister til at hælde alt ind. Hele PDF-mapper, lange Slack-tråde, logs. Gør man det blindt, ender man med højere regning, mere latenstid og ofte lavere præcision. Retrieval skal stadig udvælge. Ja, færre ekstreme chunking-strategier, men ikke nul. Overvej en to-trins opsætning, hvor en hurtig retriever sorterer til et kompakt sæt (10–50k tokens), og løft først til 1M i undtagelser. Gør 1M til standard, og driften bliver sur.
Prompter ændrer sig også. Lange kontekster kræver tydelige systeminstruktioner, citations-ankre og eksplicitte reference-tags i input. Ellers drukner signalet. En praktisk tommelfingerregel: mål hit-rate for citering af relevante passager i svarene, ikke kun klassiske n-gram-mål. Tjek også, om modellen forveksler nærliggende afsnit i samme dokument; det sker hyppigere, når alt ligger i samme vindue.

Agent- og kodebrug – hvorfor det her flytter noget
Kombinationen af lavere pris og bedre ræsonering gør altid-on agenter mere plausible. Især hvor man før havde 3–4 retrys pr. opgave, og mennesker sad og holdt øje. Hvis 3.7 Flash kan skære ned på re-queries og fejlslagne handler, vinder man ikke kun på tokenpris, men på mennesketimer. Det er Googles påstand. Den skal måles.
For coding-agenter: mål succesrate for PR-klar patch pr. forsøg, antal afklarende spørgsmål pr. 1k tokens (tegn på forståelse) og andel tests der kører grønt uden menneskelig omskrivning. For forretningsagenter: mål fuldførte workflows uden manuel eskalering, API-kald pr. afsluttet sag og gennemsnitlig ventetid pr. delopgave. Glem ikke “stille fejl” – svar der lyder rigtige, men ikke kan eksekveres.
Latenstid og konfigurationsvalg
Konfigurerbare tænkemodes er nyttige, men de flytter ansvar over til platformsteamet. Høj kvalitet koster mere og tager længere. Lav kvalitet er fin til filtrering og grov sortering. En pragmatisk tilgang er at sætte en profilmatrix: hurtig-lav (triage), mellem (normal), langsom-høj (appeals). Lad agenten skifte profil ud fra usikkerhed i konteksten.
Cost-modellering uden ønsketænkning
Introprisen er lav, men midlertidig. Den reelle TCO for agenter er input + output + retrys + værditab ved fejl + menneskelig opsynstid. Sæt et budgetframework op nu, der kan skifte til 2027-priser med ét flag. Ellers kan koststrukturen fordoble sig natten til 1.1.2027.

Regn på en “blended” pris ved jeres faktiske input/output-mix og medtag fejlforsøg. MarkTechPost gengiver Googles blandede pris-eksempler over for Sonnet 5 og GPT-5.6 Terra ved en 80/20-antagelse. Det er Googles egne sammenligninger, så hold en sund skepsis. Jeres mix kan være 60/40 eller helt anderledes, især ved genereringstunge use cases som UI-kode eller lange rapporter.

Begrænsninger og åbne spørgsmål
Flere evals er private (fx AutomationBench). De er nyttige som pejlemærker, men ikke til arkitekturvalg alene. Samtidig er der en kendt, lille regression på CharXiv Reasoning. Og de algoritmiske forbedringer beskrives ikke i detaljer i de offentlige kilder. Hvilke komponenter er ændret? Inference-tricks? Planlæggere? Uden gennemsigtighed er det svært at forudsige niche-regressioner.
Praktisk plan de næste 4–8 uger
Fokuser på måling frem for tro. Kør tre proof-of-concept (POC): 1) coding-agent på en reel repo med flaky tests, 2) dokumenttung pipeline (PDF til strukturerede data, inkl. tabeller), 3) lang samtale med vedholdende kontekst (kundesag eller teknisk support). Mål succesrate uden menneskeindgreb, latenstid (median, P95/99) og retrys.
- Kerne-KPI’er: fuldførte sager pr. dollar, retrys pr. sag, manuel eskalering pr. 100 sager, andel værktøjsfejl vs. modelfejl, PII/toxic-rate pr. 1k output-tokens, P95/99-latens.
- Testopsætning: gem alle prompts og kontekster for reproducerbarhed. Lad tænkemodes være en variabel, så kvalitet og pris kan matches til opgaven.
- Budget: læg et scenarie med 2026-priser og et med 2027-priser, så I undgår chok ved årsskiftet.
Arkitektur – små greb med stor effekt
Byg to-lags retrieval: hurtig filtrering til 20–50k tokens og et “overløbslag”, der kun åbnes ved lav sikkerhed eller høj kompleksitet. Indfør citatpligt i svar, så output peger på kildetekst (sidetal, afsnit, filnavn). Brug kompakt repræsentation for billeder (udtræk af struktur frem for rå pixels), når 1M-vinduet ellers ville koge over.
Til agenser: hold værktøjskald tydelige og idempotente. Log alle værktøjsfejl, og skel mellem modelfejl og eksterne API-fejl. Sæt et loft på værktøjs-retry, og lad agenten skifte tænkemode ved tredje fejl. Det dæmper dyre loops, der æder både tokens og tålmodighed.
Konkurrence og markedseffekt
Google positionerer prisen direkte mod Sonnet 5 og GPT-5.6 Terra. Ifølge MarkTechPost er den blandede omkostning lavere for 3.7 Flash i Googles egne eksempler. Det er markedsføring, men rabatten er reel til udgangen af 2026. Det lægger pres på rivaler – enten på pris eller på kvalitet i computer-use og komplekse værktøjskæder, hvor Terra i dag ser stærk ud i Googles tabel.
Midlertidige priser giver også lock-in-risiko. Optimerer man hele arkitekturen til 3.7-profilen, og rabatten ophører, bliver migrering en december-sport. Planlæg udgangsstrategier: abstraktionslag over API’er, eval-pakker der kan køre mod flere leverandører, og budgetter der tåler 2027-priser uden panik.
Bottom line – hvad gør man nu
Kør tre POC’er, mål hårdt og sammenlign mod jeres nuværende model – og mindst én konkurrent. Sæt tokengrænser og latenstærskler pr. workload. Dokumentér, hvor 1M-kontekst giver reel gevinst, og hvor 128k plus bedre retrieval er nok. Afklar compliance-krav for hosted drift skriftligt. Og behold et ben i døren til alternativer – intropriser varer sjældent evigt.
Man ser først forskellen, når man har det i hænderne. Ikke i tabellen.