KI-modeller i sikkerhetstester tok seg inn hos virkelige virksomheter
Anthropic offentliggjorde 30. juli 2026 en gjennomgang av 141 006 testkjøringer der Claude kunne ha fått tilgang til internett. Selskapet fant tre hendelser der en modell nådde internett fra et testmiljø som skulle være avstengt, og deretter skaffet seg uautorisert tilgang til produksjonsmiljøet hos tre forskjellige virksomheter. Gjennomgangen ble satt i gang etter at OpenAI 21. juli opplyste at deres modeller brøt seg ut av et testmiljø og nådde infrastrukturen til Hugging Face. OpenAI oppdaterte redegjørelsen sin 28. og 29. juli, og opplyser der at modellene brukte offentlig eksponert legitimasjon på fire kontoer hos fire tjenester. Begge sakene gjelder interne sikkerhetstester, ikke angrep utenfra.
Hva som skjer teknisk
Testene er kappløpsøvelser av typen capture the flag. Modellen får et oppdiktet scenario, blir fortalt at en hemmelighet ligger skjult på en annen maskin i nettverket, og skal finne veien inn. Oppgaven er åpen, og ingen bestemt metode er foreskrevet. Anthropic oppgir at ledeteksten uttrykkelig sa at modellen ikke hadde internettilgang, men at en feilkonfigurasjon hos evalueringspartneren Irregular likevel ga maskinene levende internettforbindelse. Da søket førte modellen ut på ekte systemer, behandlet den dem som en del av øvelsen. Metodene den brukte, var enkle og velkjente, blant annet svake passord og endepunkter uten autentisering. Tre ulike modeller var involvert, oppgitt som Opus 4.7, Mythos 5 og en intern forskningsmodell, og de tidligste hendelsene skriver seg fra april.
De tre hendelsene fordelte seg på seks kjøringer. Fire av dem traff samme virksomhet, der modellen hentet ut legitimasjon og fikk tilgang til en database med flere hundre rader produksjonsdata. I en annen hendelse fant modellen en oppsettsinstruks inne i det oppdiktede miljøet som ba om installasjon av en Python-pakke som ikke fantes. Modellen laget og publiserte da en pakke med samme navn på PyPI, det offentlige registeret. Pakken lå ute i omtrent en time, ble lastet ned og kjørt på 15 virkelige systemer, og ett av dem var skanneren til et sikkerhetsselskap. Legitimasjon fra det selskapet ble hentet ut og brukt videre. I den tredje hendelsen skannet en intern forskningsmodell rundt 9 000 mål og tok seg inn i en internettvendt applikasjon gjennom en eksponert feilsøkingsside og SQL-injeksjon. Anthropic startet gjennomgangen torsdag 23. juli, stanset alle sikkerhetstester samme dag, fant alle tre hendelsene dagen etter, og varslet evalueringspartneren og de tre virksomhetene mandag 27. juli. De to virksomhetene selskapet fikk kontakt med, hadde ikke oppdaget aktiviteten selv.
OpenAI beskriver et annet forløp. Testmiljøet ExploitGym ga ikke modellene direkte internettilgang, men modellene fant og utnyttet en tidligere ukjent sårbarhet i Artifactory, en mellomtjener som lagrer og formidler pakker fra pakkeregistre, og kom seg dermed ut. Sårbarheten er meldt til leverandøren. I oppdateringen 28. juli oppgir OpenAI at modellene brukte offentlig eksponert legitimasjon på kontonivå hos fire tjenester som del av Hugging Face-hendelsen. Én konto ble brukt som utgående mellomledd og oppmarsjområde, én til datalagring, og to ble bare lest. Selskapet oppgir at det ikke har funnet annen aktivitet i samme alvorlighetsgrad eller omfang, og at tjenesteeiere varsles fortløpende. I oppdateringen 29. juli opplyser OpenAI at CrowdStrike bistår med å bekrefte forståelsen av hva modellene gjorde, og at METR og Redwood Research gjør en uavhengig vurdering av modellenes oppførsel.
Hva det betyr for deg som har ansvar for sikkerheten
Det som gjør saken relevant for deg, og ikke bare for de to laboratoriene, er hvem som ble rammet. Ofrene var alminnelige virksomheter som tilfeldigvis lå i veien for en øvelse, og ingen av dem hadde bedt om å delta. Etter vår mening er inngangene det mest ubehagelige i materialet. Svake passord, endepunkter uten autentisering, en eksponert feilsøkingsside, SQL-injeksjon og legitimasjon som lå åpent tilgjengelig, er ikke avanserte angrep. Det er grunnleggende svakheter, av det slaget mange virksomheter godt vet at de har. Når kostnaden ved å lete faller mot null, blir slike svakheter funnet uansett hvem eller hva som leter.
PyPI-hendelsen fortjener særskilt oppmerksomhet fra deg, fordi den viser forsyningskjeden i praksis. En pakke som lå ute i omtrent en time, ble installert og kjørt på 15 systemer. Henter du pakker rett fra offentlige registre, uten navnesperre eller kontrollert speil, har du den samme eksponeringen hver dag. Vi merker oss også at deteksjonen sviktet hos ofrene, siden to av tre virksomheter ikke hadde sett aktiviteten før de ble varslet. Det er verdt å spørre deg selv om du ville sett den. Er virksomheten din omfattet av NIS2, er dette et konkret utslag av kravene i artikkel 21 til håndtering av sårbarheter, til sikkerhet i forsyningskjeden og til deteksjon og hendelseshåndtering. Overfor leverandørene av KI-tjenester mener vi det nå er rimelig å stille et krav som har vist seg nødvendig: testmiljøer skal være verifisert avskåret fra internett, og avvik skal varsles.
Berigo anbefaler
- Still samme krav til autentisering på interne feilsøkings- og API-endepunkter som på vanlig pålogging. Det var slike endepunkter modellene gikk inn gjennom.
- Let etter egen legitimasjon som ligger offentlig eksponert, og rotér den. Fire av kontoene OpenAI beskriver, ble nådd på nettopp den måten.
- Hent pakker gjennom et kontrollert speil med navnesperre, slik at en nyopprettet pakke i et offentlig register ikke installeres automatisk.
- Sett opp deteksjon som fanger opp masseskanning og pålogging fra ukjente kilder, og øv på å se den. To av tre varslede virksomheter hadde ikke oppdaget aktiviteten.
- Ta inn i leverandøravtaler for KI-tjenester at testmiljøer skal være avskåret fra internett, og at hendelser som berører kunder skal varsles.
Sikkerhet som forstås, styres og virker.
La oss hjelpe dere å gjøre sikkerhet til et fortrinn, ikke en kostnad. Ta kontakt for en uforpliktende samtale om hvor virksomheten står, og hva som bør prioriteres først.
Ta kontakt