Snilld

Perplexity lancerer WANDR – åbent benchmark for research‑agenter der søger bredt og dokumenterer dybt

Perplexity har ifølge MarkTechPost frigivet WANDR, et åbent benchmark og evaluerings‑harness til research‑agenter, der skal samle store, kildeunderbyggede datasæt. WANDR rummer 500 opgaver, bruger en komponerbar nøgle‑hierarki‑model og en grader, der genhenter kilder ved evaluering. MarkTechPost beskriver også medianopgave, totalskala og et konkret eksempeltask, men linker ikke til et officielt repo eller licensbeskrivelse.

19. juli 2026 Peter Munkholm

Hvorfor er det vigtigt for teams, der bygger eller køber research‑agenter? Fordi mange rigtige forretningsopgaver handler om fuld dækning og sporbarhed, ikke om et smart enkelt‑svar. Eller som MarkTechPost formulerer det: “Et par overbevisende eksempler er ikke nok her.”

Hvad WANDR faktisk måler

WANDR vurderer to ting på én gang. Bredde: kan agenten finde en stor mængde enheder, der opfylder præcise kriterier. Dybde: kan den dokumentere hvert fund med kilder, der kan tjekkes. Den kombination ændrer spillet. En pæn fortælling uden fuld dækning scorer lavt, og tilfældige links uden tydelige uddrag falder igennem.

MarkTechPost placerer WANDR som “wide”‑søskende til Perplexitys DRACO, der fokuserer på dybe langrapporter med nøjagtighed, fuldhed og objektivitet. Sammen adresserer de to vinkler: indsamling i bredde og formidling i dybde. Enkelt og huskbart: WANDR tester om agenten kan samle beviserne, ikke bare fortælle historien.

Tæt makrofoto af et tamper‑look bevis‑token med synlig tidsstempleffekt — symbol på sporbar dokumentation.

Opbygning og teknisk design

Opgaverne beskrives via en komponerbar qualification key‑model. Et eksempel hos MarkTechPost lyder company(n) -> employee(m) -> url(k). Hver fuld sti i træet valideres separat. Den samme repræsentation kan dække alt fra en flad liste til en indlejret matrix. Det lyder lavpraktisk, fordi teams kan spejle egne datastrukturer her.

WANDR bygger ifølge artiklen opgaver fra de‑identificerede brugsmønstre i produktion via en semi‑automatisk pipeline med fire trin: seeding, authoring, admission og curation, med en indflettet forfatter‑kritiker loop og automatisk linting. Skalaen er tydelig: medianopgaven kræver 50 medlemmer og 245 records. På tværs af alle 500 opgaver kalder WANDR på 170.495 source‑backed records. Sværhedsgraden er jævnt fordelt i tre buckets (167 lavere, 166 mellem, 167 højere) og afhænger af arbejdet pr. record, ikke kun størrelsen.

Banner

Et konkret eksempel fra opgavesættet

Den publicerede opgave ceo_cfo_appointments kræver mindst 70 amerikanske virksomheder, hvor en CEO‑ eller CFO‑udnævnelse først er annonceret i perioden 1. marts til 30. april 2026. For hver virksomhed skal agenten indsende to kilder: en autoritativ udnævnelsesside samt en listing‑authority side. Tilsammen 140 kildestøttede records.

Formelt udtrykt i WANDR‑nøgler er der to hierarkier: company(70) -> company_appointee(1) -> url(1) og company(70) -> url(1). Den form for militant specificitet tvinger agenten til at træffe voksne valg om søgestrategi, kildevalg, datouddrag og evidensudsnit. Der er ingen genveje.

Hvordan WANDR graderer

Hver indsendt record rummer et item, en URL, udvalgte uddrag og et kort svar. Graderen re‑fetcher siden ved evaluering, tjekker at uddragene faktisk findes, og at de sammen opfylder kravene for stien. Point gives i to spor: præcision måler kvaliteten af det indsendte, recall måler kvalitetstilpasset fuldførelse (mangler udløser nul for medlemmer). Artiklen beskriver også “soft” og “hard” scores, hvor hard kun tæller medlemmer, hvis hele undertræet er korrekt.

En tekniker lægger en tidsstemplet evidence‑kapsel i en plastramme — procesmoment i arkivering og re‑fetch‑strategi.

Realistisk og reproducerbart i praksis

At opgaverne udspringer af mønstre fra produktion, øger realismen. Man kan mærke det i udnævnelsesopgaven, hvor både domænetype og tidsvindue betyder noget. Styrken er skala og relevans. Svagheden kan være bias fra de brugsmønstre, der har dannet forlæg: sprog, domæner, tilgængelige kilder. Det kræver et tjek mod egne opgaver, før man konkluderer for bredt.

Reproducerbarheden hænger også på kildernes stabilitet. Re‑fetch lyder robust, men hvis sider ændres, forsvinder bag en paywall, eller blokeres af robots.txt, påvirker det scorer og fairness. Det er ikke et problem unikt for WANDR, men det er her. Teams har brug for arkivering, klare retningslinjer for autoritative domæner og en strategi for lovlig adgang til materiale.

Hvad mangler i den offentlige dokumentation

MarkTechPost linker ikke til Perplexitys officielle udmelding, repo eller licensbeskrivelse i den gennemgåede tekst. Artiklen gennemgår heller ikke graderscripts i dybden, match‑heuristikker, håndtering af paywalls eller præcis definition af “authoritative” og “listing‑authority”.

Banner

Hvorfor betyder det noget for dem, der vil bruge benchmarket i alvor? Licens afgør, om man må køre det kommercielt. Graderscripts og heuristikker afgør reproducerbarhed. Paywall‑ og arkiveringsstrategi afgør stabilitet over tid. Uden klart svar her bør man forvente en pilotfase med ekstra teknisk due diligence.

Praktiske konsekvenser for organisationer

Hvis I vil måle jeres agenter WANDR‑agtigt, rammer tre ting drift med det samme:

  • Sporbarhed og kildearkitektur: Definér domæner og dokumenttyper, der tæller som autoritative, og gem kildesnit med tidsstempel. Brug arkivering eller eget crawl‑arkiv.
  • Test i CI/CD: Indfør et “re‑fetch and verify” trin i pipelines. Log URL, uddrag, hentetid og status. Overvåg brud på kilder med alarmer.
  • Governance: Etabler audit trails, roller for menneskeligt review og klare afvisningsgrunde. Sæt ansvar for at opdatere reglerne, når kilder ændrer sig.

Det er ikke plug and play. Forvent ingeniørarbejde, især på datagrundlag, logging og monitorering.

Tæt makrofoto af et tamper‑look bevis‑token med synlig tidsstempleffekt — symbol på sporbar dokumentation.

Relationen til DRACO

MarkTechPost beskriver WANDR som “wide”‑sidestykke til DRACO, der bedømmer lange rapporter for nøjagtighed, fuldhed og objektivitet. Det gør WANDR nyttig som modstykke: først tester man, om agenten kan samle et stort, validt korpus; derefter om den kan destillere og skrive det korrekt. To forskellige kompetencer, der ofte forveksles.

For købere af agentløsninger betyder det, at kravspecifikationer med fordel skiller de to evner ad. Én leverandør kan være god til indsamling, en anden til skrivning. RFP’er bør afspejle det.

Kort om åbenhed og næste skridt

MarkTechPost omtaler WANDR som et åbent benchmark. Uden et direkte link til Perplexitys eget repository eller licens, er det fornuftigt at:

  • Opspore et officielt repo eller dokumentation og bekræfte licens og graderscripts.
  • Køre en lille pilot (fx ceo_cfo_appointments) og dokumentere jeres egen reproducerbarhed inklusive arkiverede kilder.
  • Teste på egne domænespecifikke opgaver og sammenligne mønstre mod WANDR‑resultaterne.

Så undgår man at læse mere ind i tallene, end de kan bære.

Hvad der kan verificeres nu

På baggrund af MarkTechPost: Perplexity har lanceret WANDR som et åbent benchmark og evaluerings‑harness. Sættet rummer 500 realistiske opgaver. WANDR bruger en komponerbar nøgle‑model, validerer hver fuld sti, og graderen re‑fetcher kilder og tjekker uddrag. Medianopgaven kræver 50 medlemmer og 245 records; samlet kaldes der på 170.495 records. Sværhedsgraden er fordelt i tre buckets. Opgaven ceo_cfo_appointments kræver 70 amerikanske selskaber i tidsvinduet 1. marts til 30. april 2026 med to autoritative kilder per selskab.

Det er solide, praktiske rammer. De sidste detaljer om licens, graderscripts og kildepolitik må findes i Perplexitys eget materiale, når det er offentligt tilgængeligt.

Kilder

    Gør brugeroplevelsen bedre.
    Hvilket firma arbejder du for?