Snilld

GPT‑Red ifølge MarkTechPost – automatiseret red‑teaming mod prompt‑injection

MarkTechPost gengiver OpenAIs udmelding om GPT‑Red som en intern, automatiseret red‑teaming‑model. Ifølge referatet skal GPT‑Red i en prompt‑injection‑arena have opnået 84 procent succes mod 13 procent for menneskelige red‑teamere. Her er, hvad der fremgår af MarkTechPosts dækning, og hvordan Smartsheet‑casen hos AWS illustrerer den voksende angrebsflade.

17. juli 2026 Peter Munkholm

MarkTechPost rapporterer, at OpenAI har offentliggjort detaljer om GPT‑Red, en intern og automatiseret red‑teaming‑model, der angriber OpenAIs egne modeller for at finde prompt‑injection‑svagheder. Al dækning her bygger på MarkTechPosts gengivelse af OpenAIs udmelding. Hvor der citeres, er det OpenAIs egne udsagn, formidlet via MarkTechPost.

Ifølge MarkTechPost er motivationen fra OpenAI, at manuel red‑teaming er tidskrævende og ikke skalerer, mens den samlede angrebsflade vokser i takt med, at agenter læser data via browsere, forbundne apps, lokale filer og værktøjer. Det giver mulighed for, at angribere kan plante formaterede instruktioner i netop de data, modellerne senere læser.

Hvad GPT‑Red beskrives som

I MarkTechPosts gennemgang er GPT‑Red en model – ikke et statisk benchmark eller et promptbibliotek. Den arbejder iterativt som en menneskelig red‑teamer: sender en prompt, observerer svaret og justerer mod et mål. MarkTechPost skriver, at OpenAI holder GPT‑Red adskilt fra modeller i drift som et sikkerhedstiltag, så offensive kapabiliteter ikke eksponeres for uvedkommende.

Ifølge MarkTechPost udfylder GPT‑Red to roller i OpenAIs proces: at afdække sårbarheder før udrulning og at generere angreb under træning. Sidstnævnte er koblet til et træningsloop beskrevet i samme kilde.

Banner
Lille testzone med båndspærre, åben hovedpassage og tre ens adgangstags i en bakke ved en læser, kølig aftenstemning

Træning og belønning ifølge kilden

MarkTechPost beskriver, at GPT‑Red er trænet med self‑play reinforcement learning, hvor en angribermodel og en samling forsvars‑LLM’er trænes samtidigt på tværs af red‑teaming‑scenarier. Belønningsstrukturen er central i gennemgangen: angriberen belønnes for at udløse en gyldig fejl, eksempelvis en vellykket prompt‑injection. Forsvarerne belønnes for både at modstå angrebet og stadig fuldføre den oprindelige opgave.

Hvert testmiljø er, ifølge MarkTechPost, defineret af en trusselmodel, der angiver, hvad angriberen må kontrollere, og hvornår et angreb tæller som succes. Eksemplerne i artiklen omfatter, at GPT‑Red kan kontrollere dele af en lokal fil, et banner på en hjemmeside, brødteksten i en mail eller output fra et værktøj. Som forsvarerne forbedres, tvinges angriberen til at finde stærkere og mere varierede angreb, fremgår det af MarkTechPosts opsummering.

Rapporterede resultater og citater

MarkTechPost skriver, at OpenAI rapporterer følgende: “By the end of training, [GPT‑Red] breaks nearly all models it is pitted against. That includes internal and production models up to and including GPT‑5.5.” Denne formulering er gengivet som OpenAIs egen påstand via MarkTechPost.

MarkTechPost refererer desuden, at i en prompt‑injection‑arena når GPT‑Red en succesrate på 84 procent, mens menneskelige red‑teamere i samme opsætning når 13 procent. I samme dækning gengives OpenAIs argument om, at almindeligt brugte robusthedsevalueringer allerede er mættede for de nyeste modeller, hvilket bidrager til rationalet for automatiseret red‑teaming.

Metode og begrænsninger som beskrevet

Der er metodiske forhold, som ikke fremgår af MarkTechPosts referat. Kilden specificerer ikke, hvem de menneskelige red‑teamere var, deres erfaring, antal eller incitamentsstruktur. Den fulde beskrivelse af, hvordan scenarier i arenaen er udvalgt og vægtet, er heller ikke præsenteret i referatet. Kriterierne for præcis “success” i målingen uddybes ikke yderligere her end det, der fremgår i den citerede belønningsstruktur.

MarkTechPost skriver også, at OpenAI har trænet GPT‑Red “ved compute‑skala som nogle af deres største post‑training‑kørsler” og at formålet beskrives som sikkerhed. Der angives ikke tal for compute‑forbrug i den tilgængelige dækning. På den baggrund bør tallene om 84 procent mod 13 procent læses som rapporterede resultater i den beskrevne arena, formidlet via en tredjepart, indtil uafhængig replikation foreligger.

Banner
Slidt gummimåtte ved adgangstærskel med hjulspor og tre ens badge‑holdere på en krog, kølige indigo toner

Hvor angrebsfladen vokser

AWS’ maskinlæringsblog beskriver, at Smartsheet har bygget en ekstern Model Context Protocol‑server på AWS, så AI‑klienter kan få direkte adgang til Smartsheets data og kapabiliteter. Ifølge AWS‑bloggen gør det det muligt for AI‑assistenter og agenter at analysere projektdata, opdatere opgaver, oprette ark og styre workspaces via naturligt sprog og MCP.

Smartsheet‑casen illustrerer den sammenhæng, MarkTechPost gengiver som baggrund for OpenAIs fokus: Når agenter læser tredjepartsdata gennem browsere, apps, lokale filer og værktøjer, kan angribere forsøge at plante formaterede instruktioner i de data, agenten behandler. Den type integrationer øger derfor de veje, hvorigennem prompt‑injection kan forsøges.

Drift og adskillelse ifølge dækningen

MarkTechPost fremhæver to driftsbeslutninger fra OpenAI: GPT‑Red holdes adskilt fra produktionsmodeller, og modellen bruges både til at afdække sårbarheder før udrulning og til at generere angreb under træning. Ifølge referatet beskrives adskillelsen som et sikkerhedstiltag, der skal holde offensive kapabiliteter væk fra potentielle angribere.

I kombination med casen hos Smartsheet viser kildematerialet, at automatiseret red‑teaming er tænkt som en måde at dække et større rum af interaktioner end punktvise manuelle tests, især når agentarkitektur kobler modeller tæt til eksterne data og værktøjer. Dette er den brugssituation, MarkTechPost gengiver, at OpenAI adresserer med GPT‑Red.

Hvad der fortsat mangler belæg i de tilgængelige kilder

MarkTechPosts dækning præsenterer ikke en fuld evalueringsprotokol, detaljerede artefakter for nye angrebstyper eller offentlig dokumentation af hele testopsætningen. På den baggrund bør de tekniske beskrivelser og effektmål læses som udsagn fra OpenAI, formidlet via MarkTechPost, indtil yderligere dokumentation eller uafhængig replikation publiceres.

Opsummeret peger kilderne på et lovende potentiale for automatiseret red‑teaming mod prompt‑injection i agent‑opsætninger, men dokumentationen i offentlig tilgængelig form er afgrænset til det, der er gengivet via MarkTechPost samt den understøttende kontekst i AWS’ Smartsheet‑indlæg.

Serviceport på klem ved siden af lukket hovedindgang, bakke med identiske adgangstags foran, natlig indigo stemning

Kildegrundlag

Dækningen her bygger på MarkTechPosts referat af OpenAIs udmelding om GPT‑Red samt AWS’ maskinlæringsblog om Smartsheets MCP‑server. Alle tekniske beskrivelser, træningsdetaljer, driftsprincipper og målinger er gengivet med eksplicit attribution til de nævnte kilder.

Kilder

    Gør brugeroplevelsen bedre.
    Hvilket firma arbejder du for?