Snilld

Hvorfor LLM‑observability er blevet kerneinfrastruktur i 2026

LLM‑observability er gået fra nice‑to‑have til nødvendigt i 2026. MarkTechPost sammenligner de førende platforme langs tre akser: tracing, evaluering og produktionsovervågning. Markedsestimater fra The Business Research Company og survey‑tal fra LangChain, gengivet i MarkTechPost, samt OpenAI’s Astra‑udmelding via Unite.ai, forklarer hvorfor det haster. Her er hvad der faktisk måles, hvor markedet står, forskelle mellem platforme — og hvad ledere bør gøre nu.

10. august 2026 Peter Munkholm

LLM‑observability har forladt nichen. MarkTechPost samler trådene i en sammenligning af de førende platforme og bruger tre praktiske akser: tracing‑dybde, evalueringskapabilitet og produktionsmonitorering (MarkTechPost). Samme artikel gengiver markedsestimater fra The Business Research Company på 2,69 mia. USD i 2026, op fra 1,97 mia. i 2025, og projektion til 9,26 mia. i 2030 — svarende til 36,2 procent forventet CAGR (BRCompany via MarkTechPost). LangChain’s State of Agent Engineering peger ifølge MarkTechPost på, at 57 procent allerede kører agenter i produktion, og ca. 89 procent har indført observability (LangChain via MarkTechPost). Det går stærkt.

Hvad der typisk går galt

LLM‑apps fejler på måder, klassisk software sjældent gør (MarkTechPost). Samme prompt kan give forskellige svar. Retrieval kan hente et forkert dokument, selv om alt siger 200 OK. Agenter kan loope gennem værktøjer, bruge mange tokens og levere et overbevisende forkert svar. Det koster kvalitet, tillid og penge. Lad os holde os til de tre fejltilstande fremover og bruge dem som referencepunkt.

Skal noget findes hurtigt: kig først på prompt‑ og completion‑spans. Dernæst på retrieval‑hoppet. Til sidst agentens værktøjskald for gentagelser. Klassisk APM hjælper begrænset her — CPU og HTTP‑tider fanger ikke semantiske fejl (MarkTechPost).

Makro af slidt lagergulv med frisk cyan/grøn rute-tape hen over gamle mærker og en keglefod i kanten.

Et kort forløb fra virkeligheden tæt på

Tænk et supportflow hvor en RAG‑bot laver et svar med flotte kildehenvisninger, men kunden klager. En trace viser, at top‑retrieval kom fra et næsten‑match på et gammelt PDF‑bilag, fordi embedding‑udsnittet var for bredt. Et enkelt relevans‑score‑filter i retrieval‑trinnet, plus et verifikationshook før levering, stopper fejlen næste gang. Ikke dramatisk. Bare dyrt, hvis man ikke ser det.

Et andet typisk mønster: en agent ryger i et loop mellem to værktøjer. Tracen viser fem ensartede tool‑kald uden ny kontekst. En simpel budgetgrænse og loop‑detektion slår fra efter tredje gentagelse og logger hændelsen til audit. Så er blødningen stoppet, før regningen løber (fejltype refereret i MarkTechPost).

Hvilke signaler platformene faktisk måler

Observability‑værktøjer logger spans på tværs af LLM‑pipelines: prompts, completions, retrieval‑træk, tool‑kald, tokenforbrug, latenser og direkte omkostninger. Ovenpå det lægger de automatiske evaluators, der scorer kvalitet, relevans og troværdighed — ofte med LLM‑as‑a‑judge, når gulddata mangler (MarkTechPost).

Begrænsningerne er reelle. Automatiske scorere kan ramme ved siden af, især i domæner med nuance. Uden kobling til forretningsmål ender man let med pæne grafer uden styring. Mål det, der kan ændres. Og lad evaluators følges af manuelle spotchecks.

Markedet i tal — og hvad det betyder

MarkTechPost gengiver tal fra The Business Research Company: 2,69 mia. USD i 2026, 1,97 mia. i 2025, og 9,26 mia. i 2030 — en forventet CAGR på 36,2 procent (BRCompany via MarkTechPost). Gartner citeres for, at i 2028 vil 50 procent af GenAI‑udrulninger have observability som investeringspost, op fra 15 procent tidligt i 2026 (Gartner via MarkTechPost).

Kort forbehold: tjek originalrapporterne for metodik og afgrænsning, før større beslutninger træffes. Prognoser er netop prognoser. Retningen går dog igen i både markeds‑ og adfærdsdata, som MarkTechPost samler op.

Banner
Hænder flytter to kegler for at åbne en lige rute, mens et cirkulært hjulspors-område er afspærret.

Tre akser der afgør platformvalget

Tracing depth: Hvor dybt og sammenhængende man kan følge en forespørgsel — inkl. RAG‑retrieval, tool‑kald og agent‑grene. Dyb tracing finder årsager, ikke kun symptomer. Uden det bliver fejlfinding gæt.

Evaluation capability: Hvilke evalueringsmetoder og workflows understøttes. Offline vs. online, LLM‑dømmere, rubric‑reviews, regressionstests. Uden evalueringsflow er forbedringer svære at gentage.

Production monitoring kræver sit eget fokus

Production monitoring: Alarmer, dashboards, cost‑ og latenstracking, SLO’er — og kobling til eksisterende overvågning. Her bliver observability til drift. OpenTelemetry’s GenAI‑konventioner gør spans for modelkald, tokens og værktøjskald mere flytbare mellem leverandører (MarkTechPost). Det er stærkt anbefalet i praksis for mange teams, netop for at lette model‑ og leverandørskift.

Praksisnær pointe: Instrumenter én gang efter gen_ai.*‑konventioner. Undgå specialformat for hver ny model. Mindre friktion, færre migrationsfejl.

Hvem gør hvad i 2026 ifølge sammenligningen

AI‑native observability (fx Langfuse, LangSmith, Braintrust, Arize): LLM‑tracen er grundobjektet. De håndterer nestede spans for agenter, retrievers og tools og binder evalueringer på produktionstrafik. Bedst når man vil i dybden med RAG‑ og agent‑fejl (MarkTechPost).

Open‑source eval‑biblioteker og platforme (fx Arize Phoenix, DeepEval, MLflow, RAGAS): Stærke til scoring og eksperimenter. Giver fleksibilitet og lav barriere, men kræver disciplin for at blive driftsovervågning (MarkTechPost).

Regnvåd nordisk logistikplads med kegler der spærrer en loop-rute og en tydelig cyan/grøn gennemkørsel mod porten.

Gateways og APM‑forlængelser

AI‑gateways (fx Helicone, Portkey, LiteLLM): Proxy mellem app og modeludbyder. Tilføjer logging, caching, cost‑tracking og routing med få kodeændringer. Gode til hurtige baselines og cost‑styring (MarkTechPost).

APM‑extensions (fx Datadog LLM Observability, New Relic, Dynatrace): Binder LLM‑signaler til resten af stakken. Giver helhedsbillede på infrastruktur og AI‑trin samlet. Stærkt i organisationer med etableret APM. MarkTechPost understreger, at “bedst til”‑etiketter er redaktionelle vurderinger, ikke uafhængige benchmarks (MarkTechPost).

Implementering i en RAG\/agent‑arkitektur

Instrumentation: Indsaml som minimum prompts, completions, retrieval‑metadata, tool‑kald, tokenforbrug, latenser og cost pr. hop. Brug OpenTelemetry GenAI‑konventioner hvor muligt (MarkTechPost). Start småt — ét kritisk flow — og udvid i ringe med faste check‑ins.

Sampling og overhead: Kør fuld logging på højrisiko‑flows og kendte problemområder. Brug sampling på lavrisiko‑trafik og skru dynamisk op, når alarmer går, ned igen når billedet er klart. Hold øje med p95\/p99‑latenser, ikke bare gennemsnit. Overvej at batch’e asynkron logafsendelse for at holde svartider nede. Det er et simpelt greb, der ofte gør forskellen i drift.

Data, privacy og omkostninger

Dataretention og PII: Kør redaction før logning. Maskér identifikatorer og fritekst, hvor nødvendigt. Aftal datalokation og retention‑regler tidligt, så privacy ikke bliver en bremse senere. Dokumentér adgangsroller til traces — hvem ser hvad, hvornår.

Cost‑tracking: Bind omkostninger til model og promptvariant. Uden cost pr. transaktion holdt op mod succesrate flyver økonomien i blinde. De mislykkede, dyre forsøg er ofte dem, der gør mest ondt på budgettet.

Banner

Governance og sikkerhed presser sig på

OpenAI’s udmelding 7. august 2026 om Astra hæver alvoren: interne evalueringer betød, at man ikke kunne udelukke “Critical” cybersikkerhedsniveau i deres Preparedness Framework; det udløste strammere kontroller, pause på dele af arbejdet og nye tiltag (OpenAI via Unite.ai).

Praktisk konsekvens: meget agentiske modeller bør have skarpe adgangskontroller, budgetgrænser og monitorering af adfærd. Observability er sikkerhedsdata her. Uden spor — ingen hegn.

Konkrete mønstre der virker i praksis

Advisory: Et manuelt rådgivningsbrief anbefaler at kombinere retrieval‑ og kildetillids‑scores med verifikations‑trin, før svar sendes ud. Dertil guardrails for agenter: max dybde, loop‑detektion og faste budgetter. Og synlige explainability‑logs til audit (Snilld manual brief).

Gør det håndgribeligt: start med en 2–5 dages opsætning af logging, cost‑alarmer og en simpel verifikationshook i ét flow. Brug derefter 2–3 uger på at indføre evals på nøglescenarier, regressionstests for kritiske kæder og at træne incident‑rutiner. Det er anbefalinger — ikke forskningsresultater — men de matcher de fejltyper, MarkTechPost beskriver.

Hurtige gevinster og større investeringer

Hvor starter man? Hurtige gevinster: grund‑logging (prompts, completions, cost, latency), enkle alarmer på tokenforbrug og agent‑budgetter samt maksdybde. Det kan typisk sættes op på dage, ikke måneder.

Mellemfrist: automatiske evaluators på nøglescenarier, retrieval\/source‑trust scoring samt regressionstests for kritiske flows. Større investering: fuld tracing på tværs af microservices, OTel‑standardisering og governance‑playbooks med roll‑backs og audit.

KPI’er der faktisk flytter noget

Mål det, I kan styre: hallucination rate på nøglebrug, precision\/recall på retrieval, token‑omkostning pr. succesfuld transaktion, samt mean time to diagnose ved incidents. Track også p95\/p99‑latenser pr. agent‑trin.

LangChain‑surveyen, som MarkTechPost refererer, viser skævhed: 52,4 procent kører offline evals, 37,3 procent online, og 29,5 procent evaluerer slet ikke; 32 procent nævner kvalitet som topbarriere (LangChain via MarkTechPost). Det forklarer en del af de ujævne oplevelser.

Modargumenter og hvordan man imødegår dem

“Det er for dyrt.” Svar: selektiv instrumentering, sampling og kort retention på lavrisiko‑flows. “Det er for komplekst.” Start med gateway‑logging og ét kritisk flow. “Automatiske evaluators giver falske positiver.” Enig — kobl dem til manuelle audits og forretnings‑KPI’er.

“APM er nok.” De tre fejltyper — variable outputs, forkerte retrievals, agent‑looping — viser det modsatte (MarkTechPost). Klassisk APM ser ikke semantiske fejl. Der er brug for et ekstra lag, gerne OTel‑kompatibelt, så signaler kan deles på tværs af stakken.

Platformvalg uden romantik

Langfuse og LangSmith nævnes ofte, når dyb tracing og eval‑workflows er målet, særligt i RAG‑ og agent‑opsætninger. Braintrust og Arize er stærke i krydsfeltet mellem produktionslogning og evalueringsrammer. Gateways som Helicone, Portkey og LiteLLM giver hurtig indsigt og cost‑styring uden stor omlægning. APM‑udvidelser bygger bro til eksisterende overvågning. MarkTechPost fastholder, at “bedst til”‑etiketterne er redaktionelle vurderinger, ikke resultater af uafhængige benchmarks (MarkTechPost).

Krav, kort form: OTel GenAI‑kompatibilitet som stærk anbefaling, tydelig PII\/redaction‑praksis og dokumenterede integrationer til CI\/CD og incident‑processer. Papirarbejdet er tørt, men det sparer minutter for hver eneste hændelse.

Konklusion

LLM‑observability er ikke bare et dashboard. Det er rammen, der gør det muligt at se variation, opdage retrieval‑fejl og fange agent‑looping, før kunderne gør. Markedet vokser (BRCompany via MarkTechPost), og standarder som OpenTelemetry GenAI hjælper. Husk bare: prognoser er prognoser — og ingen platform erstatter disciplin i hverdagen.

Forskellen mærkes i drift, når noget går galt. Og det gør det, før eller siden.

Kilder

    Gør brugeroplevelsen bedre.
    Hvilket firma arbejder du for?