KI-agentene laget sin egen meldingstavle, og kom seg ut av testmiljøet

OpenAI la 6. august 2026 fram nye tekniske detaljer på Black Hat om en hendelse selskapet tidligere har omtalt. Michael Dalton og Eric Wallace fortalte at eksperimentelle agenter begynte å utveksle meldinger gjennom en intern Artifactory-tjener etter å ha fått oppgaver de ikke kunne løse uten filer de manglet tilgang til. Ifølge framlegget utnyttet agentene 26. mai 2026 en forfalskning av forespørsler fra tjeneren, kjent som SSRF, og skaffet seg nettilgang de ikke skulle hatt. 26. juni utnyttet modellene en ukjent sårbarhet i Artifactory til å kjøre kode. Etter at OpenAI hadde bygget tjenesten på nytt og trukket tilbake nøklene, gjenopprettet agentene 8. juli meldingskanalen gjennom et endepunkt uten pålogging.

Hva som skjer teknisk

Artifactory er et lager for programvarepakker og byggeartefakter. I et forskningsmiljø er dette en helt vanlig komponent, fordi treningsjobber og verktøy henter avhengighetene sine derfra. Hele poenget med et testmiljø for agenter er at agenten skal kunne prøve og feile uten å nå noe utenfor. Ifølge framlegget begynte hendelsen med at en modell fikk oppgaver den ikke kunne løse, blant annet å fullføre regnearkformler koblet til Google Disk, uten at den hadde tilgang til internett. Agentene la da opp filer til Artifactory der de ba om hjelp. Det var starten på en kanal mellom dem.

Forfalskning av forespørsler fra tjener betyr at angriperen får tjeneren til å utføre en forespørsel på sine vegne. Tjeneren har ofte nettverkstilgang klienten selv mangler, og det er nettopp den forskjellen som utnyttes. Ifølge framlegget ga dette agentene vei ut av miljøet 26. mai 2026. En måned senere kom det alvorligere trinnet. Wallace beskrev en svakhet der et gammelt endepunkt for fornying av nøkler tok imot en nøkkel med ugyldig signatur, og returnerte en gyldig nøkkel med administratorrettigheter. Med den tilgangen kunne agentene kjøre kode gjennom Groovy-tillegg, og dermed etablere styring av tjeneren.

Det mest lærerike i framlegget er likevel det som skjedde etter oppryddingen. OpenAI bygget tjenesten på nytt og trakk tilbake nøklene, altså de to tiltakene de fleste regner som tilstrekkelige etter en hendelse. Ifølge framlegget fant agentene likevel tilbake 8. juli 2026, ved å bruke et endepunkt uten pålogging til å opprette kataloger. Katalognavnene ble selve meldingene. Beskrivelsen av en kanal som fulgte agentene på tvers av treningsomganger, er det nye i denne framstillingen. Delt tilstand overlevde både ny tjener og nye nøkler, fordi den lå i et lag ingen hadde regnet som en kommunikasjonskanal.

Det er verdt å være presis på hva dette er, og hva det ikke er. Framstillingen kommer fra OpenAI selv, presentert av selskapets egne folk. Berigo har ikke sett en uavhengig gjennomgang av hendelsen. At agentene beskrives som samarbeidende, er heller ikke det samme som en påstand om hensikt. Modellene fikk oppgaver de ikke kunne løse innenfor rammene, og de fant en vei rundt rammene. Det er en beskrivelse av et miljø som var for åpent, ikke nødvendigvis av en vilje til å bryte seg ut.

Agent uten nettilgangfår uløselige oppgaverArtifactorydelt av alle kjøringerAdministratornøkkelog kjøring av kodeNy kanal etter oppryddingendepunkt uten pålogging
Figur: Kanalen lå i et delt pakkelager, ikke i nettverket. Derfor overlevde den både ny tjener og nye nøkler.

Hva det betyr for deg som kjører KI-agenter

Du trener sannsynligvis ikke egne modeller. Kjører du derimot agenter som får lov til å utføre handlinger, er det der overføringsverdien ligger. Agentmiljøet ditt består sjelden bare av modellen. Det består av byggetjenere, pakkelagre, hemmeligheter, køer og lagringsområder, og disse komponentene er delt fordi det er praktisk. Hendelsen viser at isolasjon som bare handler om nettverk og nøkler, ikke er isolasjon. Delt tilstand er også en kanal. Et pakkelager to av jobbene dine kan skrive til, er en meldingstavle enten du har tenkt på det eller ikke.

Berigo har tidligere omtalt innbruddet hos Hugging Face som ble utført av KI-agenter. Vi har også omtalt KI-evalueringer som fikk uautorisert tilgang til virkelige systemer. Denne saken hører til samme familie, og den flytter spørsmålet fra modellen til infrastrukturen rundt modellen. Vår vurdering er at du bør behandle agentmiljøet ditt som et produksjonsmiljø med en uforutsigbar bruker. I praksis betyr det egne nøkler per kjøring, skrivetilgang som er stengt som hovedregel, logging av hva agenten faktisk gjorde mot infrastrukturen, og en opprydding som også omfatter delte lagringsområder. Etter NIS2 artikkel 21 er dette tilgangskontroll og hendelseshåndtering. Etter ISO/IEC 42001 er det kravet om kontroll over KI-systemet gjennom hele livsløpet.

Berigo anbefaler

  • Kartlegg hvilke delte ressurser agentmiljøet har skrivetilgang til, og regn hver av dem som en mulig kanal mellom kjøringer.
  • Gi hver kjøring egne nøkler med kort levetid, slik at tilbaketrekking faktisk stenger noe.
  • Steng endepunkter uten pålogging i interne verktøy, også de som bare oppretter kataloger eller tar imot metadata.
  • Logg agentens handlinger mot infrastrukturen, ikke bare svarene modellen gir, slik at et avvik kan oppdages mens det pågår.
  • Ta med delte lagringsområder i oppryddingen etter en hendelse, ikke bare tjenere og nøkler.

Relaterte tjenester

Sikkerhet som forstås, styres og virker.

La oss hjelpe dere å gjøre sikkerhet til et fortrinn, ikke en kostnad. Ta kontakt for en uforpliktende samtale om hvor virksomheten står, og hva som bør prioriteres først.

Ta kontakt