Det korte først. AWS har sammen med Vexcel vist, at man kan gøre enorme biblioteker af luftfoto søgbare med naturlige sætninger. Ikke bare “find alle svømmebassiner i Hvidovre”, men også mere snørklede forespørgsler – uden at træne en ny computer vision‑model hver gang. Nøglen er en kombination af multimodale embeddings, billedtekster fra LLM og vektorsøg. I AWS’ egen evaluering klarede Amazon Nova Multimodal Embeddings sig bedst på F1‑score på tværs af to benchmarks, og arbejdet er siden blevet til Vexcels produkt Vexcel Intelligence. Solidt og praktisk anvendeligt.\n
Hvorfor betyder det noget? Fordi geospatiale brancher som forsikring, ejendom, infrastruktur, landbrug og offentlige myndigheder sidder på uoverskuelige mængder ortofoto og skråbilleder. At forvandle de billeder til svar – ikke bare pixels – kan skære dage af sagsbehandling eller planlægning. Og ærligt: når man kan skrive “solpaneler på etageejendomme omkring stadion” og få brugbare kandidater på få sekunder, er det svært at gå tilbage til manuel gennemklikning.\n
Manuel flaskehals vs. skræddersyede CV‑modeller
Traditionelt har valget stået mellem to onder. Enten man går i gang med manuel inspektion, tile for tile, på tværs af hele byer, eller også udvikler man en særskilt CV‑model for hvert nyt objekt: bassiner, carporte, solceller, vejbanemarkeringer. AWS beskriver netop den kontrast som roden til flaskehalsen. Det er genkendeligt i praksis: hver ny forretningsforespørgsel betyder nye labels, ny træning, ny drift.\n
Og mange forespørgsler er ikke store nok til at retfærdiggøre en dedikeret model. Når en planlægger vil finde “midlertidige byggepladser langs en vejstrækning” for ét projekt, er omkostningen ved en fuld CV‑pipeline typisk for høj. Så ender opgaven manuelt – eller bliver droppet. Her giver semantisk søgning via embeddings mening.\n

Arkitekturen kort fortalt
Løsningen fra AWS bygger på tre byggeklodser. Først multimodale embeddings: en model, der koder billeder og tekst ind i samme vektorrum, så “svømmebassin” og dets visuelle modstykke ligger tæt. Dernæst billedtekster (captions) fra en LLM, som beskriver indholdet i et billede med ord. Og til sidst vektorsøg – nærmeste‑nabo‑søgning i højdimensionelle vektorer – som finder de mest semantisk lignende billeder til en naturlig sprogforespørgsel.\n
I praksis: Hvert billedudsnit og relevante tekster (captions eller støttedata) kodes til vektorer og gemmes i en vektor‑DB. Når brugeren skriver “find carporte i nyere rækkehuskvarterer”, embeddes spørgsmålet og matches mod billedvektorer via cosine‑lignende afstandsmål. Ingen ny træning per feature. Indekser én gang, spørg mange gange.\n
Datasættet ændrer alt
Vexcels rolle er central. Virksomheden driver et af verdens største programmer for luftfoto med egne sensorer og fly og leverer ortomosaikker, skråbilleder fra flere vinkler og højdemodeller i 45+ lande. Kvaliteten er høj, geokorrektionen stram, og multi‑view dækker samme punkt fra top og sider. Det kan lyde som en detalje, men det er præmissen for, at embeddings har noget at arbejde med – komplekse objekter fremtræder forskelligt fra topdown og fra skrå vinkler.\n
Hvad AWS testede – og hvordan
Evalueringen, som beskrives i AWS’ blog, bruger OpenStreetMap som ground truth. Holdet kørte fire eksperimenter: sammenligning af embedding‑modeller, strategier for fusion af flere vinkler pr. lokation, effekten af at tilføje captions og forskellige søgemetoder over multi‑view billeddata. F1‑score var en central metrik, fordi den balancerer precision og recall. Det blev gjort for to benchmarkforespørgsler – navngivet i bloggen – og konklusionen er tydelig: Amazon Nova Multimodal Embeddings leverede de højeste F1‑scores på tværs af begge benchmarks.\n

Der er en fodnote. OSM som sandhedskilde er praktisk, bredt dækket og frit tilgængelig – men ujævn i detaljeringsgrad på tværs af geografi. AWS er eksplicit om setup og metoden, men ikke om hele fordelingen af testcases pr. klasse og geografi. Overførbarheden til nye områder kan derfor svinge. En fair påmindelse at have med i baghovedet.\n

Hvad flytter nålen i praksis
Tre valg går igen. For det første modelvalget: her peger resultaterne på Nova Multimodal Embeddings som det stærkeste bud i deres test. For det andet multi‑view fusion. At samle information fra orto og fire skrå vinkler og eventuelt højdemodel giver ofte et løft – men også mere beregning og større indeks. For det tredje captions. De kan hjælpe ved sjældne mønstre, fordi de tilføjer et tekstligt anker. Men de koster compute og kan skabe bias, hvis sproglige beskrivelser overstyrer billedsignalet.\n
Tradeoffs, man ikke slipper udenom: Mere fusion betyder højere latency ved indeksopbygning og dyrere lagring. Captions øger pipeline‑kompleksitet og kan, hvis de ikke filtreres, give flere falske positiver i kanttilfælde. Og så er der vektor‑DB: Højt recall i stor skala kræver omhu i valg af indeksstruktur og parametre. Billigt bliver det ikke, hvis recall‑målene er aggressive.\n
Fra PoC til drift – kravene viser tænderne
Pipelines skal orkestreres. En typisk opsætning har batch‑indeksering af nye ortofoto ved hver opdatering, med jobstyring, retriable steps og versionsstyring af embeddings. Realtime? Sjældent nødvendigt for luftfoto, men mikro‑batch kan give mening for nyligt indsamlede katastrofeområder. Det vigtige er deterministiske runs og sporbarhed til kildemosaik og sensor‑metadata.\n
Databasen er hjertet. Vælg en vektor‑DB med solid HNSW‑ eller IVF‑PQ‑implementering, tydelige skalaknapper og mulighed for hybrid query (geofilter + vektor). Indeksparametre (M, efConstruction, efSearch i HNSW) styrer både latency og recall. Sæt SLO’er: fx p95‑latency under 400 ms ved k=50 og recall over 0,9 på et fast testset. Uden faste målepunkter bliver optimeringen en mavefornemmelse. Det ender sjældent godt.\n
Begrænsninger og åbne spørgsmål
Evalueringen besvarer ikke alt. Performance på sjældne objekter – fx særlige tagtyper eller regionale vejmarkeringer – kan kræve domænespecifikke eksempler eller varierede prompts. Generalisering til nye lande hænger tæt sammen med billedestetik, byggetraditioner og OSM‑kvalitet. OSM kan være underdækket i landdistrikter, hvilket påvirker både recall og precision‑estimater.\n
Captions er dobbeltkantede. De hjælper med “svære” forespørgsler, men kan også introducere sproglig drift: En formulering som “rækkehuse med smalle indkørsler” kan farve resultater, hvis modellen overfortolker kontekst. AWS rejser selv spørgsmålet om, hvornår captions er pengene værd. Et praktisk svar er: ved komplekse objekter eller hvor billedsignalet er tvetydigt – men mål effekten, før det rulles bredt ud.\n

Sikkerhed, privatliv og compliance
Luftfoto er persondata‑adjacent. I EU skal man regne med GDPR‑hensyn, også når personer ikke er direkte identificerbare. Praktiske tiltag: geofencing af følsomme områder, adgangskontrol og audit‑logs for alle forespørgsler, eksplicit politik for retention og sletning. Offentlige bygninger, kritisk infrastruktur og private haver kan kræve ekstra hensyn eller maskering i visse kontekster.\n
Bias og fejlfund skal også håndteres. Caption‑baserede hits bør kunne forklares – ikke i akademisk forstand, men med en minimal forklarbarhed, fx hvilke views og hvilke ord i caption der udløste match. Og automatiserede triggers (skadesindikatorer efter en storm) bør køre med to‑trins‑bekræftelse ved høje konsekvenser. Ét falsk positivt masseflag, og tilliden forsvinder hurtigt.\n
Hvad koster det egentlig
Der er fire store poster. Lagring af højopløste ortofoto og skråbilleder dominerer ofte, især hvis man holder flere versioner af samme område. Beregning til embeddings (og captions, hvis de bruges) ligger som spidsbelastninger ved hver indeksrunde. Vektor‑DB‑drift skalerer med antallet af vektorer og forespørgsler, og hybridfiltre kan koste ekstra CPU. Endelig vedligehold: reindeksering efter nye mosaikker, retrain‑policy ved modelopdateringer og overvågning.\n
Hvor ryger pengene hurtigst? I praksis på lagring og embedding‑compute ved opbygning af første fulde indeks. Derefter er det vektor‑DB og periodiske reindekseringer, der fylder. Det kan friste at køre hård komprimering (PQ, produktkvantisering), men mål effekten på recall. Billig plads er dyrt, hvis svarene bliver forkerte.\n

Integration i eksisterende landskab
GIS‑teams møder klassiske faldgruber. Koordinatsystemer skal stemme hele vejen fra råbillede til API‑svar. Mapping fra tile til objekt skal være entydig, især når multi‑view blandes med DSM\/DTM. Versionering af mosaikker kræver, at man kan reproducere et svar fra “datostempel X”. Uden det famler man, når to brugere ser forskellige resultater en måned senere.\n
På applikationssiden er en tynd API over vektor‑DB’en ofte vejen. Den bør understøtte naturligt sprog, parametre for k, radius\/geo‑filter samt server‑side reranking med kontekst (fx “kun industriområder”). Log alt: forespørgsel, embedding‑hash, vektor‑DB‑parametre, datasetsversion. Det lyder pedantisk, men det redder dig, når en bruger spørger “hvorfor var mit svar anderledes i går”.\n
Use cases, både de kendte og de glemte
AWS nævner de oplagte: at finde svømmebassiner i forstæder, identificere vejnet i nye områder og tælle solpaneler i byen. De er gode benchmarks, fordi de dækker forskellige skalaer og kontraster. I praksis åbner semantisk søgning også for mere operationelle mønstre: hurtige skade‑triggers efter storm, ændringsdetektion ved nybyg eller nedrivning, grov risikomapping for oversvømmelse baseret på hældning og beliggenhed.\n
Fra idé til pilot – uden at tabe pusten
En faseopdelt plan virker bedst. Start med en hurtig PoC i et afgrænset område og én klasse (fx solpaneler i en enkelt by). Mål precision\/recall på et lille håndmærket testset og sammenlign med OSM, hvor det findes. Sæt latency‑mål for queries og registrer omkostning pr. tusind forespørgsler. Gentag for to klasser til, så man ser generalisering og ikke kun held.\n
Skalering kræver disciplin. Indfør versionsstyring af data og embeddings, etabler en simpel retrain\/reindex‑politik (fx ved større modelopdateringer eller nye mosaikker), og byg en overvågningsside med tre grafer: recall@k på et fast eval‑set, p95‑latency og månedlig lagerstigning. Banalt – men det er det, der holder systemet ærligt.\n
Hvad betyder det for rollerne i organisationen
For forsikring kan man realistisk sigte efter lavere gennemsnitlig sagsbehandlingstid i stormevents og færre manuelle inspektioner per påbegyndt sag, fordi man finder de relevante ejendomme hurtigere og mere systematisk. For GIS\/dataplatform‑teams er opgaven at binde pipeline og vektor‑DB sammen med geofilter, versionsstyring og multi‑view‑linking. For produktfolk er der en klar MVP‑vej: et enkelt postnummer, en veldefineret klasse, en måned og klare metrikker.\n
Compliance og risiko får også en tydelig rolle. De skal godkende logning, adgangsprofiler, retention og en minimal forklarbarhed på resultaterne. Ingen skal stå alene med en automatisk trigger uden en sporbar note om, hvorfor den blev udløst. Når først man har siddet med en sag, hvor et forkert hit starter et dyrt forløb, glemmer man det ikke. Lugten af kold kaffe fra mødelokalet hænger ved.\n
Det, der stadig mangler svar
Tre huller står tilbage i materialet. For det første vides ikke præcist, hvor stort et valideringssæt AWS\/Vexcel havde pr. klasse og geografi – bloggen beskriver metoden, men ikke hele fordelingen. For det andet mangler der pris og klare latencymålinger for indeksopbygning vs. søgning i en given arealstørrelse. For det tredje er effekten af captions på falske positiver\/negativer ikke brudt fuldt ned. Det er ikke showstoppere, men felter, man bør måle i sin egen pilot.\n
Og så er der generalisering. At Nova Multimodal topper i den viste evaluering er stærkt, men ingen model er bedst overalt, altid. Lokale variationer i tagmaterialer, vejtyper og lysforhold kan ændre billedet. Det ville overraske, hvis ikke nogle byer “ser nemmere ud” end andre. Mål selv.\n
Konklusion
Multimodale embeddings, captions og vektorsøg gør luftbilleder søgbare på en ny, praktisk måde. AWS’ evaluering med Vexcel‑data peger på, at man kan indeksere én gang og svare på mange slags spørgsmål uden per‑feature‑træning, med Nova Multimodal Embeddings som den stærkeste kandidat i deres test. Gevinsten er tydelig. Arbejdet er det også: pipeline, datagovernance og drift af en vektor‑DB ved skala.\n
Hvis du vil prøve det i næste uge, så vælg ét område, én klasse, ét sæt mål. Indekser, mål, og skriv resultaterne ned. Ikke store armbevægelser – gør det småt først. Forskellen mærkes først, når man sidder med det i hænderne.\n
Bilag og links
- \n
- AWS blog: Embed the world – Multimodal AI for searchable aerial imagery at scale (arkitektur, evaluering, resultater inkl. Nova Multimodal Embeddings) – https:\/\/aws.amazon.com\/blogs\/machine-learning\/embed-the-world-multimodal-ai-for-searchable-aerial-imagery-at-scale\/\n
- Vexcel Data – produkt- og dataportefølje, geografisk dækning 45+ lande, multi‑view og integrationsmuligheder – https:\/\/vexceldata.com\/\n
- Teknisk videre-læsning: dokumentation for vektor‑DB’er med HNSW\/IVF‑PQ, samt modeldokumentation for Amazon Nova Multimodal Embeddings på AWS’ platforme.\n