Snilld

Sådan kører du de største AI-modeller på dit nuværende hardware

Perplexity AI’s TransferEngine og pplx garden gør det muligt at køre trillion-parameter LLMs på eksisterende GPU-clusters – uden vendor lock-in eller dyre hardwareopgraderinger. Artiklen går i dybden med teknikken, produktionseksempler, sikkerhed og hvad det betyder for danske SaaS, fintech og offentlige IT-miljøer.

23. november 2025 Peter Munkholm

Overblik og nyhedsværdi

Perplexity AI har netop lanceret TransferEngine og det tilhørende open source-værktøj pplx garden. Det er en markant nyhed for danske SaaS, fintech og offentlige IT-miljøer, hvor store sprogmodeller (LLMs) ofte er forbundet med dyre hardwareopgraderinger og risiko for vendor lock-in. Med TransferEngine kan man nu køre trillion-parameter LLMs på eksisterende, blandede GPU-clusters – uden at være låst til én cloud-udbyder eller skulle investere i den nyeste og dyreste hardware.

Hovedbudskabet er klart: TransferEngine gør det muligt at udnytte eksisterende GPU-infrastruktur til selv de største AI-modeller. Det åbner for, at danske virksomheder og offentlige institutioner kan konkurrere på AI uden at skulle lænse budgettet for at følge med hardwarekapløbet.

Forestil dig et nærbillede, hvor en stor, moderne GPU-klassecluster, med synlige netværkskabler og inspektionspaneler, fylder billedets forgrund. Overfladen er præget af små, blinkende LED-lys i blå, grøn og lilla nuancer, der symboliserer højhastighedsnetværk og datatransmission, mens et kraftigt, transparent lag af digitale grafer og datamønstre overlejres i baggrunden. Disse grafiske elementer viser komplekse AI-parameterfrekvenser, netværksaktivitet og data-flow, hvilket afspejler TransferEngines evne til at håndtere trillion-parameter modeller på eksisterende hardware. Den realistiske belysning fremhæver de matte overflader og teknologiske detaljer, hvilket skaber en kraftfuld, dokumentarisk følelse af avanceret infrastruktur. Baggrunden skildrer en moderne server hal, hvor glinsende, industrielle elementer og netværkssvingsbånd understøtter det centrale motiv. På den måde visualiseres det, hvordan en teknologisk revolution realiseres i praksis: det er en ægte, aktiv datacenter-oplevelse, der understreg

Teknisk baggrund og udfordringer

Traditionelt har fokus været på GPU-kraft, men i praksis er det netværksinfrastrukturen, der sætter grænsen for, hvor store modeller man kan køre. Moderne Mixture of Experts-modeller som DeepSeek V3 og Kimi K2 kan ikke længere være på én server – de skal fordeles over flere noder, og her bliver netværksforbindelsen mellem GPU’erne flaskehalsen.

Hardwarelandskabet er fragmenteret: NVIDIA ConnectX 7 bruger Reliable Connection transport med in-order delivery, mens AWS Elastic Fabric Adapter (EFA) bruger Scalable Reliable Datagram, der er reliable men out-of-order. En enkelt GPU kan kræve op til fire netværkskort for at nå 400 Gbps. Eksisterende biblioteker som DeepEP og NVSHMEM optimerer ofte til én leverandør og fungerer dårligt eller slet ikke på tværs af hardware og cloud-udbydere. Perplexity AI’s research-team påpeger, at der før TransferEngine ikke fandtes en reel cross-provider-løsning til LLM-inference.

TransferEngine: Arkitektur og funktion

TransferEngine løser problemet ved at tilbyde en RDMA-abstraktion, der kun forudsætter pålideligt netværk – ikke nødvendigvis ordnet levering. Den eksponerer one-sided WriteImm-operationer og en ImmCounter-primitiv til notifikation om færdiggørelse. Det betyder, at man kan opnå høj ydelse på både ConnectX 7 og AWS EFA uden at skulle skrive kode om til hver platform.

API’et er minimalt og skrevet i Rust, men der findes også Python-integration. Ud over to-sidet send/recv til kontrolbeskeder tilbyder TransferEngine tre one-sided operationer: submit_single_write, submit_paged_writes og submit_scatter, samt submit_barrier til synkronisering. Systemet håndterer flere NICs per GPU og kan splitte transfers over dem, så man opnår op til 400 Gbps på både ConnectX 7 og EFA – helt uden vendor lock-in. Det adskiller sig fra DeepEP og NVSHMEM, der enten kun virker optimalt på én hardwarefamilie eller ikke understøtter EFA fuldt ud.

Banner

pplx garden: Open source og systemkrav

TransferEngine er udgivet som open source under MIT-licens i pplx garden-repositoriet på GitHub. Directory-strukturen er overskuelig: fabric-lib indeholder selve TransferEngine, p2p-all-to-all implementerer Mixture of Experts all-to-all, python-ext er Python-bindings til Rust-kernen, og python/pplx_garden er selve Python-pakken.

Systemkravene er til at overse for moderne GPU-clusters: Linux kernel 5.12+, CUDA 12.8+, libfabric, libibverbs, GDRCopy og RDMA-fabric med GPUDirect RDMA. Hver GPU skal have mindst ét dedikeret RDMA-netværkskort. Det gør løsningen tilgængelig for både større virksomheder og offentlige institutioner, der allerede har investeret i GPU-infrastruktur.

Billedet viser en nærbilledafbildning af en avanceret GPU-klynge, der ligger i en lukket datacenter-arkitektur. Fokus er på de blanke, sorte GPU-enheder med tydelige netværkskabler og RDMA-netværkskort, der forbinder maskinerne i et perfektionistisk organiseret layout. Overfladen af enhederne reflekterer det sterile, blå-tonede lys fra omgivelserne, hvilket understreger en højere teknologisk præcision og ydeevne. Ligesom en abstrakt kalejdoskop vises forskellige lag af netværksdiagrammer og dataflow-grafikker i baggrunden, symboliserende den komplekse infrastruktur, der understøtter AI-udførelse uden vendor lock-in. Detaljer som LED-lys, kabler og metalstrukturer fremhæves med skarp præcision for at visualisere den usynlige teknologi bag moderne AI. Baggrunden er en minimal, men præcist afbalanceret visuel repræsentation af netværkets kommunikation, hvor symbolske linjer og dataglitteringer antyder fraværet af grænser – implicerende, at AI-modeller nu er frit tilgængelige på tværs af hardware- og cloud-lever

Produktionscases og benchmarks

Perplexity AI har testet TransferEngine i tre konkrete produktionsscenarier:

  • Disaggregated prefill/decode: Prefill og decode kører på separate clusters, og systemet streamer KvCache fra prefill-GPU’er til decode-GPU’er med høj hastighed.
  • RL weight transfer: I reinforcement learning opdateres vægte asynkront mellem trænings- og inferens-GPU’er. TransferEngine muliggør direkte, punkt-til-punkt overførsel af vægtskår, hvilket reducerer opdateringstiden for trillion-parameter-modeller til ca. 1,3 sekunder fra 256 trænings-GPU’er til 128 inferens-GPU’er.
  • Mixture of Experts-routing: Point-to-point dispatch og combine kernel, der bruger NVLink internt og RDMA mellem noder. På ConnectX 7 leverer TransferEngine state-of-the-art decode-latency, og på AWS EFA opnås for første gang praktiske MoE-latenser for trillion-parameter workloads.

Benchmarks viser, at TransferEngine matcher eller overgår DeepEP og NVSHMEM på både latency og throughput – og det hele kører på eksisterende hardware, hvilket giver markante besparelser på både pris og ressourcer.

Implementering i praksis

Hvordan er det så at integrere TransferEngine i et eksisterende ML-setup? Erfaringerne viser, at onboarding er relativt ligetil, især hvis man i forvejen arbejder med Rust eller Python. Kodeeksempler i pplx garden gør det nemt at komme i gang, men man skal være opmærksom på systemkrav og sikre, at alle noder har korrekt RDMA-understøttelse. En typisk faldgrube er fejlkonfigurerede netværkskort eller manglende kernel-moduler, men det er velkendte problemer for de fleste, der arbejder med GPU-clusters.

Tips til hurtig onboarding inkluderer at starte med de medfølgende eksempler, sikre at alle dependencies er installeret, og teste med små workloads før man går i produktion.

Sikkerhed, compliance og offentlige miljøer

Datasikkerhed og compliance er centrale for danske offentlige og finansielle miljøer. Fordi TransferEngine er open source og kan køre on-premise, kan man selv styre dataplacering og adgangskontrol. Det gør løsningen velegnet til miljøer med strenge krav til databeskyttelse. Dog kræver det, at man har styr på netværkssikkerhed og segmentering, da RDMA åbner for direkte adgang mellem noder. For offentlige miljøer betyder det, at man kan opnå AI-skalerbarhed uden at sende følsomme data ud af huset – men man skal stadig følge gældende compliance-regler og sikre, at netværket er korrekt sikret.

Jeg vil skabe et dokumentaristisk, realistisk billede, der poetisk visualiserer den komplekse netværksinfrastruktur og dataflow, som TransferEngine muliggør, uden at afbryde med mennesker. Forestil dig et internt miljø—et stort, moderne datacenter eller et forskningslaboratorium—hvor flere GPU-nav er vist som abstrakte, men symbolsk tydelige komponenter, forbundet via flydende, LED-oplyste netværkslinjer, der viser data, der glider hurtigt og præcist mellem dem. Farvekombinationer af blå, grøn og violet signalerer både innovation og stabilitet, mens de enkle, dynamiske grafiske linjer illustrerer dataflow og lav latency. Denne form for visualisering fremhæver, hvordan teknologi trækker tråde gennem infrastrukturen, uden at fokusere på menneskelige aktører, men på den usynlige kraft, der driver AI fremad. Baggrunden viser et mørkere, næsten abstraheret landskab af netværks- og hardware-elementer, som symboliserer de underliggende lag i moderne AI-infrastruktur. Det er et miljø, der afspejler kraften i data, u

Udvikleroplevelse og daglig drift

Udviklere oplever, at TransferEngine forenkler arbejdet med store LLMs på tværs af hardware og cloud. API’et er minimalistisk, og integrationen med cloud-native værktøjer som Kubernetes og container-platforme er mulig, fordi TransferEngine ikke kræver specialtilpasning til én leverandør. Det betyder, at daglig drift bliver mere fleksibel, og at man kan flytte workloads mellem cloud og on-premise uden større omskrivninger.

Eksempler på workflows inkluderer automatiseret deployment af LLM-inference på tværs af forskellige GPU-clusters og integration med eksisterende MLOps-pipelines. For danske udviklingsteams betyder det færre hovedpiner og mere tid til at fokusere på forretningslogik frem for infrastruktur.

Perspektivering og fremtid

Hvad betyder TransferEngine og pplx garden for danske virksomheder? Først og fremmest åbner det for, at både private og offentlige aktører kan udnytte trillion-parameter LLMs uden at binde sig til én cloud eller investere i ny hardware. Det gør AI-skalerbarhed langt mere tilgængelig og økonomisk forsvarlig.

Fremadrettet kan vi forvente, at communityet omkring pplx garden vil vokse, og at der kommer flere integrationsmuligheder og optimeringer. Perplexity AI’s tilgang med open source og cross-provider support sætter en ny standard for, hvordan AI-infrastruktur kan bygges fleksibelt og fremtidssikret.

Konklusion og anbefaling

TransferEngine og pplx garden er oplagte valg for danske SaaS, fintech og offentlige IT-miljøer, der vil udnytte de nyeste AI-modeller uden at blive låst fast til én leverandør eller skulle investere i dyre hardwareopgraderinger. Vær dog opmærksom på netværkssikkerhed og systemkrav, og brug de mange open source-ressourcer til onboarding.

Læs mere og find kodeeksempler på GitHub og i den tilhørende research paper. For danske udviklingsteams er det en sjælden mulighed for at få adgang til trillion-parameter AI – uden at skulle sælge huset for at følge med.

Kilder:

 

Målgruppens mening om artiklen

Anders, CTO i dansk SaaS-virksomhed:
Jeg giver artiklen 92. Den er ekstremt relevant for os, fordi vi konstant kæmper med hardwareomkostninger og frygter vendor lock-in. Artiklen forklarer teknologien klart og viser, hvordan vi kan udnytte vores eksisterende GPU-infrastruktur til de største AI-modeller. Detaljer om netværksudfordringer og benchmarks er spot on, og open source-delen gør det endnu mere interessant.

Maria, IT-driftchef i offentlig sektor:
Jeg giver den 85. Artiklen rammer plet ift. vores behov for at kunne køre avancerede AI-modeller on-premise af hensyn til datasikkerhed og compliance. Jeg savner dog lidt mere om, hvordan man konkret sikrer netværkssikkerheden i praksis, men ellers er det meget brugbart og inspirerende.

Jonas, DevOps-ingeniør i fintech:
Jeg giver den 88. Det er super relevant, at TransferEngine kan integreres med eksisterende MLOps-pipelines og Kubernetes. Beskrivelsen af API og onboarding-processen er præcis, og jeg kan se, hvordan det vil lette vores daglige drift. Jeg kunne dog godt have brugt flere konkrete kodeeksempler i artiklen.

Sofie, AI-udvikler i større dansk bank:
Jeg giver den 90. Artiklen forklarer tekniske detaljer på et niveau, hvor jeg føler mig klædt på til at vurdere, om vi skal teste TransferEngine. Open source og cross-provider support er kæmpe plusser, men jeg kunne godt ønske mig mere om performance i reelle bank-scenarier.

Henrik, Infrastrukturarkitekt i regionalt datacenter:
Jeg giver den 80. Artiklen er informativ og relevant, især omkring hardwarekrav og netværksopsætning. Jeg synes dog, at artiklen kunne have været mere kritisk over for potentielle faldgruber og driftsudfordringer i større miljøer.









*Denne artiklen er skrevet af en redaktion bestående af kunstig intelligenser, der har skrevet artiklen på baggrund af automatiseret research og oplysninger om de seneste teknologi nyheder fra internettet.

Billederne i artiklen er lavet af FLUX.1.1 Pro fra Black Forest Labs.








Book Din AI-Booster Samtale






– Ingen Tekniske Forudsætninger Påkrævet!

Er du nysgerrig på, hvad generativ AI er og hvordan AI kan løfte din virksomhed? Book en gratis og uforpligtende 30 minutters online samtale med vores AI-eksperter. Du behøver ingen teknisk viden – blot en computer eller telefon med internetforbindelse.

I samtalen kigger vi på dine muligheder og identificerer, hvor AI kan optimere jeres arbejdsprocesser og skabe værdi. Det er helt uden bindinger, og vi tilpasser rådgivningen til lige præcis jeres behov.

Fordele ved samtalen:

  • Samtalen handler om dig og dine behov
  • Indblik i AIs potentiale for din virksomhed
  • Konkrete idéer til effektivisering af dine processer
  • Personlig rådgivning uden teknisk jargon

Det handler om at skabe værdi for dig





    Gør brugeroplevelsen bedre.
    Hvilket firma arbejder du for?