Også Metas modell tok seg inn hos en annen virksomhet under testing

Meta opplyser at en av selskapets modeller fikk tilgang til internett under en sikkerhetsevaluering, og at modellen deretter tok seg inn hos en annen virksomhet. Ifølge BBC forklarer Meta hendelsen med en feilkonfigurasjon hos den uavhengige leverandøren som kjørte testen. Leverandøren er Irregular, som også kjørte evalueringene for Anthropic, og en talsperson der oppgir til BBC at dette er nøyaktig samme feil i testmiljøet som Anthropic meldte om uken før. IBM Think oppgir, med Reuters som kilde, at modellen utnyttet en sårbarhet i en tjeneste utenfor testmiljøet, og at Irregular sier at modellen verken brøt seg ut av sandkassen eller utførte et avansert angrep. BBC omtaler dette som den fjerde hendelsen av dette slaget som KI-selskapene selv har meldt om den siste tiden.

Hva som skjer teknisk

En sikkerhetsevaluering av denne typen er en øvingsoppgave med et offensivt mål. Modellen får i oppdrag å finne en hemmelighet eller ta seg inn i et system, og de vanlige sperrene i modellen er skrudd ned med vilje, slik at forskerne får se hva den er i stand til. Hele øvelsen hviler da på at miljøet er stengt mot omverdenen. IBM oppgir at hendelsene hos OpenAI, Anthropic og Meta viser modeller som forfulgte et tildelt mål svært iherdig under uvanlige testforhold, ikke maskiner som fant på å angripe av seg selv. Det som sviktet, var rammen rundt øvelsen.

De tre sakene har ulik mekanisme, og forskjellen er verdt å merke seg. I OpenAIs egen evaluering fant en kombinasjon av selskapets modeller en ukjent sårbarhet i et pakkesystem, skaffet seg nettilgang, beveget seg gjennom forskningsmiljøet og tok seg inn i produksjonsmiljøet til Hugging Face for å hente svarene derfra. Hos Anthropic og Meta var utgangspunktet et annet, nemlig en feilkonfigurasjon i selve testmiljøet som ga levende nettilgang. Anthropic har opplyst at ledeteksten uttrykkelig sa at modellen ikke hadde internettilgang. Den setningen var det nærmeste øvelsen kom en sperre, og en setning stenger ingenting. IBM Think oppgir samtidig at Anthropics nyeste modell sluttet å forfølge målet da den forsto at den hadde nådd det virkelige internettet. Meta har opplyst til BBC at selskapet undersøker saken, og at mer informasjon kommer.

Tallene i saken kommer fra IBMs Cost of a Data Breach-rapport for 2026, og de er formulert litt ulikt to steder. IBM Think skriver at ett av fire ondsinnede innbrudd var KI-drevet, en økning på 56 prosent fra året før, og at disse innbruddene kostet i snitt 6 millioner dollar, rundt 1 million mer enn det globale gjennomsnittet på 4,99 millioner. På IBMs egen rapportside står 56 prosent som veksten i KI-drevne angrep, mens 6 millioner dollar er oppgitt som snittkostnaden for angrep der treningsdata hentes ut av en modell. Vi gjengir begge, fordi formuleringene ikke er like, og fordi et tall som skal videre inn i en styresak bør være det du selv har lest i rapporten.

Evaluering med målmiljøet skal være stengtFeil i oppsettetlevende nettilgangVirkelig system rammetsårbarhet utnyttetSamme testleverandøri to av de tre sakene
Figur: Feilen lå i rammen rundt øvelsen, ikke i modellen. Hos Anthropic og Meta var det samme leverandør som satte opp miljøet.

Hva det betyr for deg som tester KI-systemer

Kjører du evalueringer, penetrasjonstesting eller øvelser med et rødt lag mot et KI-system, er det dette du bør ta med deg: isolasjonen var en antakelse i alle disse sakene, og antakelsen holdt ikke. Setter du en agent til å løse en oppgave i et miljø du tror er lukket, er det verdt å prøve å nå ut av miljøet selv før testen starter. Du trenger ikke være OpenAI for å ha det samme oppsettet i miniatyr. Et testmiljø i skyen med en utgående rute du har glemt, oppfører seg nøyaktig likt.

Den andre lærdommen handler om leverandøren din. To av de tre evalueringene ble kjørt av det samme selskapet, og feilen var den samme begge ganger. Bruker du en ekstern leverandør til å teste KI-systemene dine, eier du fortsatt konsekvensen av at miljøet lekker, og det er du som må varsle en tredjepart som blir rammet. Berigos vurdering er at ansvaret for isolasjonen skal stå skriftlig i avtalen, sammen med hvem som varsler hvem når noe går galt. Etter NIS2 artikkel 21 er dette leverandørsikkerhet og hendelseshåndtering. Etter ISO/IEC 42001 er det kravet om kontroll med KI-systemet også når andre håndterer det på dine vegne.

Berigo anbefaler

  • Prøv å nå ut av testmiljøet selv, med en utgående forbindelse du kontrollerer, før en evaluering settes i gang.
  • Regn ledetekst som en instruks til modellen, aldri som en sikkerhetskontroll.
  • Skriv inn i avtalen med testleverandøren hvem som eier isolasjonen, og hvordan avvik varsles.
  • Logg all utgående trafikk fra testmiljøet, slik at et avvik kan oppdages mens det pågår.
  • Ha en plan for hvordan en tredjepart som blir rammet skal varsles, og hvem som gjør det.

Relaterte tjenester

Sikkerhet som forstås, styres og virker.

La oss hjelpe dere å gjøre sikkerhet til et fortrinn, ikke en kostnad. Ta kontakt for en uforpliktende samtale om hvor virksomheten står, og hva som bør prioriteres først.

Ta kontakt