DeepSeek har frigivet DeepSeek Harness v0.1 som developer preview og publiceret kildekoden under MIT-licens. For teams der bygger agenter betyder det, at orkestreringen bliver noget, man konfigurerer og kan skifte ud — ikke hardkode. Formel-tænkningen er skåret ind til benet: Agent = model + harness. Og i Harness er alt et plugin.
Hvad er en harness
En harness er laget mellem modellen og den verden, den arbejder i: værktøjer, filer, sandboxes, sessioner og kontrolsløjfen, der holder agenten på sporet. Uden det lag ender man hurtigt med et chatvindue. Med det får man en arbejdende proces med hukommelse, værktøjsbrug og sporbarhed.
Tænk på det som styreskinner i et produktionssystem. Modellen er motoren. Harnessen er skinnerne, signalerne og værktøjskassen langs ruten. Her bor retries, cache, tool-registrering, godkendelsesflows og logning. Ofte er det her, forskellen opstår mellem en glansfuld demo og en løsning, der faktisk gennemfører arbejdet.

DeepSeeks tilgang: alt er plugin
DeepSeek vælger den konsekvente version af modularitet. Ifølge dokumentationen står det helt fremme i README: alt er et plugin. Modeller, tools, skills, sessioner, sandboxes, storage, loops, scheduling og selve UI’et ligger bag Cordis-plugin-grænser og kan vælges, byttes eller udvides via konfiguration uden at ændre Harness-koden. Det er et kit, ikke en låst assistent.
Under motorhjelmen ligger Cordis-kernen. Cordis håndterer montering og afmontering af plugins samt afhængigheder og placerer kapabiliteter i plugins frem for i en privilegeret kerne. Tørt, ja — men med praktisk effekt: Når egenskaber ligger i plugins, kan man skifte leverandørstak, sandkasse eller logs uden at bryde resten. I teorien i hvert fald.
Fire runtime-tilstande og sporbarhed
Harness leverer fire kørselstilstande med forskelligt ambitionsniveau. Standard er den fulde coding-agent med filredigering, shell, søgning, planlægning, subagenter og workflows. Code-tilstand eksponerer værktøjerne via et Code Mode SDK, så modellen kan samle flere skridt i én TypeScript-procedure. Minimal holder sig til to værktøjer, en persistent bash og en enkel editor, og bruges til at benchmarke modeller i et bart miljø. Creator lægger ovenpå med inspektion i runtime, eksperimenter i memory og hjælp til at bygge presets.
Alle kørseler skrives til en append-only session-log: systemprompter, ræsonnement, tool-kald og resultater, planlægning af subagenter og hver eneste kontekstindsprøjtning. Det rækker længere end mange andre rammeværker, der primært logger tool-kald. Trajectory-visningen gør det muligt at inspicere kildespor, genoptage, forgrene, søge og afspille samme hændelsesstrøm — værdifuldt for audit og reproducerbarhed.

Installering og udgivelsesstatus
Projektet udgives som dsh. Den grafiske grænseflade kan startes lokalt, og der medfølger en Python SDK under navnet deepseek-harness-sdk med støtte til nyere Linux og macOS på arm64. Koden ligger offentligt, og MIT-licensen fremgår i kildetræet. Versionen er en developer preview — infrastruktur til udviklere, ikke en produktsat færdigagent.
Deploybar? Ja, men med omtanke. For enterprise-piloter, der vil selv-hoste og have fuld logning, kan Harness give et forspring. Regulerede virksomheder får ro ved lokal kørsel og åben kilde — i hvert fald på papiret. Stabilitetsgarantier og langtidssupport er ikke lovet i v0.1 og bør ikke forventes.

Hvorfor orkestrering slår rene modeltal
Den seneste runde af tests fra Composio er klar i spyttet. DeepSeeks V4 Flash har ligget i top på flere leaderboard-lister efter sin udrulning. Alligevel gennemførte modellen kun 53,8 procent af en bunke virkelighedsnære agentopgaver med mange trin: 129 beståede ud af 240 kørsler på tværs af 30 sammensatte workflows og otte forskellige harnesses.
Composio kørte testene med live-værktøjer som Gmail, GitHub, Slack og Google Sheets. Kun seks af de 30 workflows blev gennemført af alle testede harnesses. Pointen er ikke, at modellen er dårlig. Pointen er, at orkestrering, værktøjsopsætning, caching, retries og leverandørstak ændrer udfaldet markant. Samme model, forskellige resultater. Et konfigurerbart harness kan flytte noget — hvis man bruger det rigtigt.
Praktisk betydning for implementering
For udviklingsteams betyder Harness, at man hurtigere kan samle en stack og prøve ting af. Skift mellem modeludbydere i en indstilling. Tilføj en sandbox uden at røre kernen. Brug Minimal-mode til at måle modeladfærd uden støj. Det sparer tid i prototyper og tidlige integrationer.
Driftsmæssigt vokser opgaverne. Plugin-governance bliver et selvstændigt spor: Hvilke plugins er godkendt, hvem vedligeholder dem, og hvordan patches sårbarheder? Observability skal fra modelmetrikker udvides til hele agentløb med eventstrømme, man kan re-spille. Retention for session-logs skal afklares — der kan ligge følsomme detaljer i kontekstindsprøjtninger og tool-responser.
Sikkerhed og sandboxing
Sandbox-laget er både løfte og risiko. Et stærkt sandbox-design gør det muligt at lade agenter eksekvere kode, kalde shell og læse filer — med kontrolleret risiko. Men dokumentation om isoleringens tekniske håndhævelse i Cordis-laget fremstår begrænset i de åbne kilder lige nu. Detaljer om f.eks. syscall-filtrering, ressourcebegrænsninger og procesadskillelse bør på skrift, før man nærmer sig produktion.
Derudover spiller nøglehåndtering og provider-routing ind. Opsætning af flere modeludbydere kræver en klar politik for, hvor nøgler ligger, rotationsplaner og hvilke endpoints der godkendes. Harness tilbyder model-routing som plugin, og nøgler opbevares som skrivebeskyttede legitimationsoplysninger med referencer i indstillingerne. Den operationelle kontrol skal dog forankres i organisationens eksisterende secrets-management.

Licens og afhængigheder
MIT-licensen giver bred frihed til modificering, distribution og kommerciel brug. Det åbner for lokale piloter uden forhandlinger. Men der er en joker: Plugins kan trække afhængigheder ind med andre — potentielt strammere — licenser. Samspillet mellem MIT i kernen og tredjepartslicenser i plugins skal gennemgås i hvert projekt. Lav en BOM over både plugins og deres indirekte afhængigheder og kør et licenstjek.
Et andet punkt er datahåndtering i logs. Append-only er rigtigt for audit, men GDPR og branchekrav kan kræve selektiv sletning eller maskering. Afklar om eventstrømme kan pseudonymiseres ved indtag, eller om der findes selektive redaktionsmuligheder uden at bryde reproducerbarheden. Det er ikke fuldt beskrevet i det offentlige materiale.

Ydelse og omkostning
Der mangler uafhængige benchmarks af Harness-overhead: Hvor meget latency tilføjer eventstrøm, sandbox-kald og plugin-routing? Hvor mange ressourcer bruger web-UI og loglagre under længere kørsler? Det er praktiske spørgsmål, der afgør, om en prototype kan skaleres. Indtil performance-tal foreligger, bør man måle lokalt med kritiske scenarier og holde øje med haler i svartider under fejl og retries.
Priserne for modellerne spiller ind. VentureBeat rapporterer, at DeepSeek hæver priser på V4 Flash og Pro. Hvis selve inferensen bliver dyrere, bliver det endnu vigtigere at trimme orkestreringen: færre unødige værktøjskald, klogere caching, stram fejlpolitik. Orkestrering er cost control.
Hvad er bekræftet og hvad mangler
Bekræftet via MarkTechPosts dækning og det offentlige repo: frigivelsen af v0.1 som developer preview, MIT-licens, dsh som projektnavn og plugin-arkitekturen bag Cordis. Oplysninger om runtime-tilstande, Trajectory-log og model-routing er også beskrevet i materialet. VentureBeat dokumenterer samtidig Composios testresultater og prisændringen for V4-modellerne.
Mangler: direkte citater fra DeepSeek om roadmap, sikkerhedsgarantier og hardening-plan for produktion; detaljer om Cordis’ isolering, herunder sandbox-mekanismer; et klart versions-tag i GitHub, der korresponderer entydigt til v0.1-release-notes med stabilitetsniveau og kendte begrænsninger; samt uafhængige målinger af latency og ressourceforbrug mod andre rammer.
Hvad bør teams gøre nu
Start smalt. Vælg Minimal- eller Code-tilstand for at etablere målelige baseline-tests på 2–3 kritiske workflows. Log alt, og brug replay til at sammenligne ændringer i plugins, caching og retries. Målet er ikke en pæn demo, men en robust gennemførelsesrate over flere løb — med kendt omkostningsprofil og samme resultat ved genkørsel.
Etabler samtidig plugin-governance: politik for kilder, versionsstyring, sikkerhedsreviews og en udgivelseskanal til prod. Opsæt scanning for licenser i både direkte og transitive afhængigheder. Og lav en aftalt plan for at arkivere, maskere eller slette session-logs i henhold til regelkrav — uden at ødelægge audit-sporet.
Markedsblik og konkurrence
Det her lander i et felt, hvor flere rammeværk kæmper om at være laget, alle andre bygger oven på. Composios resultater understreger, at ingen harness har monopol på at få modeller til at lykkes. Forskelle i værktøjsintegration, fallback, agent-loop og cache spiller større rolle, end mange vil indrømme. DeepSeeks greb er at gøre alt udskifteligt. Det gør slaget både teknisk og operationelt.
Hvis prisstigninger på V4 Flash og Pro bider sig fast, kan modelvalget skifte pr. use case. Billigere modeller kan vinde i simple flows, hvor god orkestrering gør resten. Dyrere modeller kan reserveres til sværere passager. Fokus flyttes fra enkeltstående benchmarks til porteføljestyring af modeller — med Harness som fælles lag. Praktisk, ikke romantisk.
Konklusion
DeepSeek Harness v0.1 skubber agentudvikling i en retning, hvor orkestreringslaget er konfigurerbart, sporbarheden er dyb, og teams kan bytte nøglekomponenter uden at rive alt ned. Det er lovende for prototyper, evalueringer og lokale piloter. Men det er stadig en developer preview: sikker sandboxing, plugin-governance, ydeevnemålinger og licenstjek skal på plads, før noget lukkes ind i produktion.
Tre næste skridt: 1) Verificer licenser og afhængigheder for de plugins, der indgår, og lav en BOM. 2) Kør en isoleret pilot med fuld logging og replay, og mål gennemførelsesrate, fejlmønstre og omkostning pr. workflow. 3) Evaluer orkestreringens effekt — ikke kun modelaccuracy på syntetiske benchmarks.
Appendiks: mulige spørgsmål til DeepSeek
- Hvordan håndhæves sandbox-isolering teknisk i Cordis (procesadskillelse, syscall-filtrering, ressourcebegrænsninger)?
- Hvad er stabilitetsløftet på plugin-API’er i v0.1, og hvornår fryses interfaces frem mod v1.0?
- Findes der en formel hardening-guide til produktion, inkl. netværkspolitikker, secrets-management og log-retention?
- Hvad er plan og tidshorisont for uafhængige performance-målinger og reference-workloads?
- Hvordan understøtter Harness selektiv redaktion eller masking af eventstrømme uden at bryde reproducerbarhed?
- Kan DeepSeek dokumentere en kompatibilitetsmatrix for populære plugins med licensoversigt og kendte sårbarheder?
- Er der planlagt first-party enterprise-funktioner som godkendelsesflows, change review af konfiguration og multi-tenant isolation?