Nyheden kort
NVIDIA offentliggjorde 10. september 2026 et blogindlæg, der beskriver, hvordan Skild AIs S1‑robotfoundationmodel er bygget og trænet på NVIDIA‑infrastruktur. Bloggen fremhæver tre ting: S1 er designet til at lære tidligere usete, langstrakte opgaver fra en enkelt videodemonstration; den eksekverer via in‑context learning uden at opdatere vægte bagefter; og samarbejdet har omfattet hele kæden fra syntetisk data til simulation og fysisk deployment. Derudover skriver NVIDIA, at Skild nåede en årlig run‑rate på 100 millioner dollar ti måneder efter første kommercielle deployment. Unite.ai refererer samme oplysninger og peger eksplicit tilbage til NVIDIA som kilden.
Det er en stor påstand: én video, derefter handling—uden eftertræning. Men hele fortællingen bygger på NVIDIAs egne beskrivelser, suppleret af en omtale hos Unite.ai. Uafhængige tal for økonomien eller værktøjs‑benchmarks indgår ikke i materialet her, så læs det som en teknologisk status og en partnerhistorie, ikke som en fagfællebedømt konklusion.

Hvad NVIDIA præcist siger
I NVIDIAs blog står, at S1 “er designet til at lære tidligere usete, long‑horizon opgaver fra en enkelt videodemonstration”. Modellen “bruger video som input for at forstå og eksekvere opgaven uden at opdatere vægte eller gennemgå opgavespecifik eftertræning — en teknik kaldet in‑context learning.” Det nævnes også, at Skild byggede S1 og udførte den underliggende forskning på NVIDIAs AI‑infrastruktur som led i et samarbejde om syntetisk data, træning, simulation og fysisk deployment. NVIDIA fremhæver Isaac Lab og Cosmos som teknologier, der hjælper med at skabe skalerbare, diverse erfaringer på tværs af scenarier og robotkroppe.
Unite.ai gengiver de samme hovedbudskaber: datoen, at S1 er bygget på NVIDIA‑infrastruktur, og at ARR‑tallet på 100 millioner dollar nås ti måneder efter første kommercielle udrulning. Unite.ai optræder her som sekundær kilde og peger direkte på NVIDIAs blog. Der er ingen tydelige uoverensstemmelser, men Unite.ai tilfører heller ikke selvstændig verificering.
Hvorfor det teknisk set er interessant
In‑context learning i robotik handler om at bruge demonstrationsdata — her video — som et kontekstuelt prompt, der former modeladfærden i inference, mens vægtene forbliver frosset. I modsætning til klassisk imitation‑læring undgår man finetuning på den specifikke opgave. Når det lykkes, kan man forkorte vejen fra opgave til kørsel, fordi cyklussen med ny træning, validering og re‑deployment ikke gentages for hver variant.
Det er samtidig svært i praksis. Video er tungt: lange sekvenser, mange objekter, skift i lys og baggrundsstøj kræver stærke perceptionstakke og langtidshukommelse under skarpe latencykrav. Dertil kommer sim‑to‑real‑kløften: store dele af erfaringsrummet må ofte opbygges syntetisk i simulatorer. Her bliver værktøjer som Isaac Lab og datasystemer som Cosmos relevante — som bindeled mellem genereret variation og robust adfærd på gulvet.

Fra demo til drift
Hvis S1 gør, hvad NVIDIA beskriver, ændrer det arbejdet for udvikling, drift og sikkerhed. Træning vil fortsat kræve GPU‑klynger og datastrømme, men den tunge opgavespecifikke finetuning kan i princippet vige for demonstrationsopsætning og prompt‑design i video. Kompleksiteten flytter i stedet ind i pipeline‑styringen: kuratering af demonstrationsvideoer, syntetisk augmentation for kanttilfælde, evalueringsprotokoller og stram adfærdsmonitorering i produktion.
På inferenceniveau er spørgsmålet, hvor beregningen kører. Kører man lokalt på en edge‑workstation ved cellen, eller centralt på et datacenter med lav latenstid til robotten? Lokalt giver robusthed ved netværksglitch og lav latency, men kræver drift på GPU‑hardware tæt på robotten. Centralt kan give bedre udnyttelse og styring, men øger netværksafhængighed og stiller krav til determinisme i responsen. NVIDIA angiver ikke konkrete krav for S1 her — hverken modelstørrelse, latenstid eller hardwareprofil under inference er offentliggjort.

Hvad værktøjskassen fra NVIDIA kan dække
Isaac Lab er NVIDIAs økosystem for robotikudvikling i simulation: fysik, scener, sensorik og domain randomization. Målet er at generere varierende erfaring, som kan dække de hjørner, den virkelige verden kaster af sig. Cosmos nævnes som en del af værktøjerne til at skabe skalerbar og divers erfaring; i konteksten peger det mod syntetisk datagenerering og scenariovariation. Samlet kan de udgøre kedlen, hvor man brygger opgavens “erfaringssuppe”, før robotten møder den fysiske varelinje.
For driftsfolk er broen til produktion afgørende. Sensor‑kalibrering, tidsstempling, koordinatsystemer og sikkerhedsindhegning (geofencing, kraftgrænser, nødstopslogik) skal stadig på plads. In‑context ændrer ikke sikkerhedsreglerne, men lægger et nyt lag på dokumentationskrav: hvilken video promptede adfærden, hvilken versionsstatus havde modellen, og hvilke rollback‑triggere gælder, hvis adfærden afviger under kørsel.
Økonomi og troværdighed
NVIDIA skriver, at Skild nåede en ARR på 100 millioner dollar i løbet af ti måneder fra første kommercielle deployment. Unite.ai gentager tallet og kildehenviser til NVIDIA. I de tilgængelige kilder her findes ingen separat, direkte udmelding fra Skild (pressemeddelelse, regnskab eller ledelsesopslag), der verificerer ARR‑tallet eller præciserer, hvornår “første kommercielle deployment” fandt sted. Vurderingen må derfor markeres som en NVIDIA‑oplysning, ikke et uafhængigt bekræftet regnskabstal.
Hvad kilderne ikke svarer på
Flere centrale detaljer er fraværende. Der er ingen specifikation af S1’s modelstørrelse, arkitektur eller latenstid, og der gives ingen retningslinjer for, hvilken GPU‑klasse der er nødvendig for realtidsinference i typiske celleopsætninger. Forholdet mellem simuleret erfaring og fysisk indsamlet erfaring beskrives som “både og”, men uden tal for fordeling, kvalitetssikring eller transferstrategier.
Der er heller ikke uafhængige benchmarks af “long‑horizon” generel opgaveløsning efter én video. Uden en fælles testbank — og uden at kende prompts og sikkerhedsgitre — er det svært at vurdere, om S1 klarer sig bedre end andre robotfoundationmodeller i felten. Endelig mangler der en datapolitik: hvem ejer syntetisk data, hvordan deles artefakter på tværs af kunder, og hvordan håndteres IP, hvis en promptvideo kommer fra en kundes produktlinje med fortrolige detaljer.

Hvad det kræver i praksis
Virksomheder, der vil arbejde demonstrationsbaseret, får et andet arbejde i kulissen. Start med pipeline: etabler et demonstrationsformat for video (synsvinkel, opløsning, metadata), lav en kurateringsproces, og definér klare acceptkriterier. Byg en simulationssløjfe, hvor de svære varianter genereres systematisk — lys, occlusion, layoutskift — så modellen “ser” dem i konteksten. Afslut med produktionstest og skarp monitorering: sporingslogs, adfærdsdetektorer og sikkerheds‑watchdogs, der kan stoppe eller degradere opgaven ved afvigelser.

Infrastrukturen er ikke gratis. Træningssiden kræver fortsat GPU‑klynger, datastyring og MLOps‑disciplin. Inference kan måske flyttes til edge‑GPU’er, men uden modeldata kan budgettet ikke fastlægges. Selv hvis modellen ikke eftertrænes pr. opgave, betaler man “data‑skatten” i form af demonstrationsproduktion, syntetisk scenariedækning og evalueringskørsler. Mindre finetuning, mere opsætning og overvågning.
Roller, sikkerhed og governance
Drifts‑ og supportteams skal indføre nye rutiner. Versionering af prompts (videoer) bliver lige så vigtigt som versionering af model og kode. Sikkerhedsmæssigt bør prompt‑ændringer behandles som softwareændringer: formel godkendelse, HAZOP‑lignende gennemgang, test i sandkasse og dokumenteret rollout. Og der skal kunne rulles hurtigt tilbage, hvis robotten ændrer adfærd i en ikke‑godkendt retning.
Governance‑spørgsmålene rykker tættere på gulvet. Hvem ejer en demonstrationsvideo optaget på en kundes linje? Må den genbruges som syntetisk frø for andre kunder? Og hvordan sikrer man, at en video fra et lager i Shenzhen ikke kompromitterer en CE‑godkendt adfærd i Skanderborg, fordi layouts ligner, men nødstopsafstande ikke gør. Det lyder pedantisk; i praksis er det forskellen på en glat audit og en lang nat med røde lamper.
Leverandører under pres
Automationshuse og systemintegratorer kan læse NVIDIAs fortælling som både mulighed og pres. Mulighed, fordi en demonstrationsdrevet model kan afkorte tid til første værdi. Pres, fordi kunder vil forvente hurtigere omlægninger, færre timer i PLC‑kode og mere “det kører bare” i uforudsete varianter. Det kræver kompetenceløft: prompt‑engineering for video, sim‑scenariodesign, datalogning og opsætningsværktøjer, der ikke altid findes i den klassiske værktøjskasse.
For købere betyder det et andet kravkatalog til udbud: adgang til sim‑miljø og logik for domain‑randomization, rettigheder til syntetisk data og prompts, SLO’er for adfærdsstabilitet, samt en klar plan for model‑ og promptversionering. Et konkret råd: få på skrift, hvor meget der er garanti versus “best effort”, når adfærden kun er promptet, ikke eftertrænet.
Hvor langt er feltet egentlig
Sammenlignet med den bredere robotikbølge ligger S1‑historien i forlængelse af udviklingen mod større, mere generelle modeller, der kan lære gennem få eksempler. Det særlige her er ambitionen: én video, lang horisont, ingen vægtopdatering. Det er et højt mål. Andre miljøer har også vist fremskridt i multi‑trin planlægning og sim‑to‑real, men fællesnævneren er, at driftsrobusthed tager tid, især når man rykker fra laboratoriets kontrollerede opsætninger til fabrikkens virkelighed.
Det kan ligne et spring. Baseret på de offentlige detaljer ligner det dog et kraftigt skub i en retning, feltet allerede bevæger sig. Den konkrete effekt afhænger af, hvor sikker og stabil S1 er på tværs af kunder, layouts og skiftehold. Der er endnu ikke offentliggjort uafhængige benchmarks, der gør sammenligning nem.
Små praktiske noter fra maskinrummet
Hvis video er prompten, er kameraet din compiler. Sørg for stabil montering, kendte linser og ensartet lys — små skævheder i demonstrationsvideoen kan blive store i udførelsen. Gem videometadata: fps, eksponering, linseprofil. Lav en kort “prompt‑checkliste” før større omlægninger, også selvom modellen ikke skiftes; det virker trivielt, indtil en nattevagt ændrer lys i en zone, og robotten tøver ved kasse nummer tre.
Lav også en plan for auditspor. En robot, der ændrer adfærd på baggrund af en ny demonstration, skal kunne forklares bagudrettet: hvilken video, hvilket miljø, hvilke simuleringer. Ikke for skønhedens skyld, men for at kunne fejlfinde, når noget går galt klokken 02.17. Det lugter af papirer og mapper — men det er driftens ilt.
Konklusion og næste skridt
NVIDIA sætter tydeligt flag på kortet: S1 er bygget på selskabets infrastruktur, kører in‑context på video uden vægtopdatering, og samarbejdet med Skild spænder fra syntetisk data til fysisk deployment. Hvis det holder i skala, forskydes arbejdet fra finetuning til prompt‑ og pipeline‑disciplin og kan gøre omstillinger på fabriksgulvet hurtigere. Men de økonomiske påstande — $100 mio. ARR på ti måneder — er, i det tilgængelige materiale, kun dokumenteret gennem NVIDIA selv, og flere centrale tekniske nøgletal er ikke offentliggjort.