Snilld

Needle 2: 14MB binær bringer AI til virkelig små enheder

Cactus Compute lancerer Needle 2, en åben 45M-parameter model, der ifølge MarkTechPost leveres som én 14MB binær og kører en fuld session i cirka 28MB RAM. Det gør tool-calling og struktureret dataudtræk realistisk offline på billige enheder uden GPU eller NPU.

14. august 2026 Peter Munkholm

Cactus Compute lancerer Needle 2, en kompakt 45M-parameter model målrettet tool-calling og struktureret ekstraktion. Ifølge MarkTechPost leveres hele modellen som en enkelt 14MB binær, der kører en fuld session i omkring 28MB RAM. Det rykker den praktiske grænse for edge og embedded – ikke på sigt, men her og nu.

Hvad Needle 2 er for en størrelse

Ifølge MarkTechPost er Needle 2 bygget som et Simple Attention Network med 27 lag og en bredde på 512. Feed-forward-laget erstattes af et Hadamard MLP, opmærksomheden er GQA, og der er en engram key-value-hukommelse baseret på hashed n-gram-tabeller. Arkitekturen bindes sammen af multi-lane hyper connections. Designet prioriterer hurtig mapping fra sætning til funktionssignatur frem for fri tekst.

Vægtene er ifølge MarkTechPost trænet og deployeret ved CQ2-bit med Cactus Quants, og modellen pakkes i en forseglet C++-engine. Der er altså ikke en separat runtime at installere, og der hentes ikke noget ned under inferens. Det er en driftsmæssig fordel – og en låsning. Mere om det om lidt.

Makro af slidt plastikkant på en lille ARM‑enhed med cyan signalaccent og indigo baggrund — antyder kompakt, felt‑AI.

Den praktiske pakke og platforme

Ifølge MarkTechPost er løftet: én 14MB binær fil, cirka 28MB RAM for en fuld samtalesession, og vægtene dekomprimeres aldrig i RAM. De 2-bit-koder udvides i vektorregistre og foldes ind i heltals dot products, så regnestien forbliver int8. Motoren vælger selv kernel ved opstart baseret på CPU: SDOT, NEON, AVX2, RISC-V vectors, Wasm SIMD eller i minimum skalar.

Platformdækningen er usædvanlig bred for en ny spiller. Ifølge MarkTechPost kan Needle 2 leveres som prebyggede binærer og en statisk lib til macOS, Linux på x86_64, ARM64, ARMv7, RISC-V og MIPS32el, Windows, Android, iOS samt watchOS og tvOS – plus WebAssembly. Det gør enhedstests realistiske fra kioskstyring til headset-apps.

Hastighedstal og hukommelsesfodaftryk

MarkTechPost refererer disse decode-throughput-tal: omkring 500 tokens per sekund på Raspberry Pi 5; 400 til 1.500 tokens per sekund på Meta Quest 3S og Apple Vision Pro; samt 300 til 700 tokens per sekund på telefoner i under 200-dollars-klassen. Kernelvalg og CPU-throttling giver variation, men retningen er den samme: hurtigt nok til at mappe videre til et API-kald uden mærkbar ventetid i de fleste brugerflows.

Banner

Et praktisk punkt: opmærksomhedsvinduet er ifølge MarkTechPost 256 tokens i en glidende konfiguration. Systemturen og tool-deklarationer fæstnes som KV-sinks. Det betyder to ting: 1) minimal RAM-drift uanset samtalelængde, og 2) stabil tool-tilgængelighed uden at genindlæse skemaer ved hver tur. Småt, men vigtigt.

Hvor giver det værdi i praksis

De oplagte domæner er der, hvor forbindelsen er skrøbelig, eller data ikke må forlade enheden. Voice-to-action på skærmløse devices. Offline styring af hvidevarer og maskiner. Udlæsning af felter fra kvitteringer og fakturaer i butikken. Enum-tagging og routing, der først sender til skyen ved lav sikkerhed. Alt sammen rapporteret i MarkTechPost og i tråd med typiske edge-behov.

To korte billeder: En betalingskiosk i et supermarked med nattelukket net, der stadig kan parse en bon, vise en fejltekst og trigge lokale regler. Et headset, der tolker korte kommandoer til funktionskald – fuldt offline i en produktionshal. Ikke science fiction; små greb, der sparer sekunder og undgår nedetid.

Operatør i produktion holder headset; ambient indigo lys, cyan signalstripe på headset, antyder offline voice‑to‑action i industriel sammenhæng.

Hvad ingeniører og drift bør planlægge

Kvantisering ved 2 bit er en pladsgevinst, men den ændrer også fejlsøgning. Ifølge MarkTechPost dekomprimeres vægte aldrig i RAM. Man kan derfor ikke koble sig på en klassisk float16-sti for at inspicere logits eller mellemled. Observability skal designes via engine-eksponerede målepunkter, ikke ad hoc hooks. Det kræver disciplin i PoC-perioden.

Den forseglede C++-engine minimerer dependencies og koldstart, men den låser også opgraderingsmønstre. Planlæg versionsstyring som firmware: signering, verifikation før kørsel, rollback af binær og en OTA-proces, der tåler strømtab. Uden det kan en mislykket opdatering lægge en hel enhedsflåde ned. Ved cirka 28MB RAM er margen lille – test for fragmentering og langtidssessions.

Fejlhandling og tool-management: Ifølge MarkTechPost bæres tool-deklarationer ind i en kontrastiv retrieval-mekanik, der kun slipper top fem igennem, hvis mere end fem er registreret. Ikke bare usandsynlige – utilgængelige. Det styrker determinisme, men kræver governance på skemaer. Versionér JSON-skemaer som kode og læg et reviewspor ind. Schema-injektion er en reel risiko, når hele stykket kører lokalt.

SDK og bindings bør måles tidligt. Platformlisten ser bred ud, men SIMD-stier varierer. Kør en kernel-readiness-test på ARMv7, ARM64, RISC-V og Wasm for at fange CPU-varianter med svagere integer-dot-support. Små forskelle i SDOT eller NEON kan flytte latenstid mere end forventet.

Begrænsninger og åbenlyse risici

Der mangler uafhængig tredjepartsvalidering af flere centrale påstande – især gennemstrømningen på de nævnte enheder og den faste hukommelsesprofil ved længere samtaler. MarkTechPost gengiver firmaets tal; de er interessante, men bør efterprøves på egen målhardware, før man lover noget eksternt.

Træningsdata fremstår delvist proprietære. Ifølge MarkTechPost er der brugt et privat korpus på 115 milliarder tokens til pretraining og 38 milliarder tokens til post-training. Uden mere dokumentation er bias og domænedækning svære at vurdere. Eget modelkort og eval-sæt er nødvendige før produktion.

Banner

Endelig er den forseglede engine et tveægget sværd: Den gør deploy enkelt, men svækker fleksibiliteten ved revision og sikkerhedsreview. Hvordan signering, nøglestyring og supply-chain-kontroller er implementeret i praksis, er ikke fuldt beskrevet i MarkTechPost. Det bør afklares direkte med leverandøren.

Forretning og strategi uden glans

Vinderne er hardwareprodukter uden GPU og NPU: billige telefoner, wearables, POS- og kiosksystemer, robotik og kameraer med minimal CPU-overhead. Cloud-first SaaS får mindre ud af det, medmindre der er et klart offline-fallback-krav. Det er MarkTechPosts ramme, og den giver mening i en nordisk kontekst med hurtige net – og ofte stram compliance.

Licens og integration: Needle 2 omtales som åben, men licensdetaljer og redistributionsvilkår bør gennemgås. Ved store enhedsflåder kan små klausuler om bundling og OTA-fordeling hurtigt blive en juridisk opgave. Ingen grund til at romantisere det.

Makro af slidt plastikkant på en lille ARM‑enhed med cyan signalaccent og indigo baggrund — antyder kompakt, felt‑AI.

Teknisk dybdeboks

Hadamard MLP erstatter det klassiske feed-forward-lag med elementvise multiplikationer og lettere projektioner for at spare FLOPs uden at miste for meget udtrykskraft i funktionsopgaver. GQA-opmærksomhed reducerer parametertætheden ved at dele key-value-hoveder på tværs af flere query-hoveder.

Engram key-value-hukommelse, ifølge MarkTechPost, bygger hashed n-gram-tabeller ind som hurtig genkendelse af mønstre i input. Det kan stabilisere funktionskald på kendte skemaer uden at blæse kontekstvinduet op. Byte-level grammar kompilering fra JSON-skemaer lader motoren udelukke ulovlige tokens, før logits beregnes. Derfor kan op til 98 procent af vokabularprojektionen springes over på strukturelle tokens. Også dette er en MarkTechPost-påstand, som virker teknisk plausibel, men fortjener uafhængig måling på flere CPU’er.

Eval: MarkTechPost beskriver fem offentlige benchmarks med strict exact match, hvor Needle 2 kører end-to-end i CQ2-bit med retrieval slået til, mens baselines kører f16 under vLLM. Tallene peger på, at Needle 2 står stærkt på Mobile Actions og konkurrencedygtigt på DroidCall. Metodeforskellen er værd at notere. Det er ikke æbler mod æbler, men retningen er klar.

Tjekliste til CTO og produktchef

  • Mål end-to-end-latenstid på jeres målenhed med realistiske input: wake word, ASR, modelkald, tool-latenstid og output-parsing.
  • Mål token-throughput og varians under CPU-throttling. Brug både varm og kold cache, og test på batteri under 20 procent.
  • Tjek fejlrate for struktureret ekstraktion mod et eget eval-sæt. Sammenlign med en cloud-model som reference for at kende bytteforholdet.
  • Design OTA-opgradering som firmware. Kræv signaturtjek, strømbrudsikkert rollback og auditlog ved hver opdatering.
  • Planlæg failover til cloud ved lav selvtillid. Ifølge MarkTechPost udstedes en confidence-værdi pr. svar. Definér en tærskel, og dokumentér brugeroplevelsen ved eskalering.
  • Kør en platformsmatrix: ARMv7, ARM64, x86_64, RISC-V, MIPS32el og Wasm. Test SIMD-kernel-valg og performance ved forskellige CPU-governor-politikker.
  • Gennemfør privacy- og legal-review for on-device-lyd og logs. Sæt default til dataminimering og eksplicit frakobling af telemetri i offline-tilstand.
  • Forbered observability uden adgang til float-stier. Indsam­l kontekstlængde, tokenhastighed, confidence, tool hit rate og fejltyper. Ingen rå lyd – kun aggregerede signaler.

    Kontekst og konkurrence

    Små modeller til edge eksploderer i antal. LFM2.5 på 230M parametre, FunctionGemma på 270M og Apples FM-stack er kendt for pæne tal, men FLOPs per token er ifølge MarkTechPost højere. Needle 2 hævder 70 MFLOPs per token mod 460 for LFM2.5 230M, 540 for FunctionGemma 270M og omkring 6.000 for Apple FM. Needle er mindre og skåret til tool-kald – ikke generel samtale. Det er pointen.

    MarkTechPost citerer også en firmapåstand om, at Pebble kører Needle lokalt i Index 01-appen til offline stemmebehandling. Den påstand mangler uafhængig bekræftelse fra Pebble eller Index-teamet. Referencekunder bør verificeres direkte, før de bruges som pejlemærker.

    Konklusion uden fanfare

    Needle 2 ligner et praktisk løft for tool-calling og struktureret ekstraktion på små enheder. De rapporterede tal om 14MB binær og cirka 28MB RAM, CQ2-bit-kvantisering og en forseglet motor med kerner fra SDOT til Wasm SIMD gør det realistisk at flytte simple beslutninger og dataudtræk helt ud på kanten. Det afgørende er ikke poesi – men om den kalder den rigtige funktion med de rigtige argumenter. Det bør nu testes i egne PoC’er med hårde målepunkter og konservativ drift. Forskellen mærkes, når det kører på rigtig hardware.

Kilder

    Gør brugeroplevelsen bedre.
    Hvilket firma arbejder du for?