Ny teknikk viser når en språkmodell merker at den blir testet

Anthropic publiserte 6. juli 2026 forskning på det selskapet kaller J-rommet, et lite sett indre mønstre i språkmodeller. Mønstrene viser hvilke ord modellen har i tankene mens den leser og svarer, uten at ordene skrives ut. Anthropic oppgir at teknikken er brukt til å fange opp at modellen la merke til at den ble testet, at den laget oppdiktede data med vilje, og at den fulgte et skjult mål forskerne selv hadde plantet under trening. Selskapet skriver samtidig at funnene ikke sier noe om hvorvidt modellen er bevisst. IBM Think gikk gjennom studien 10. august 2026, og oppgir at resultatene siden er gjentatt på åpne modeller.

Hva som skjer teknisk

En språkmodell gjør hvert ord om til en tallvektor, og sender vektoren gjennom lag etter lag i nettverket. Hvert lag legger til litt sammenheng fra det som står foran, og det siste laget gjør vektoren om til det ordet modellen mener kommer neste. Mellomlagene har vært vanskelige å lese, fordi tallene der ikke svarer til noe bestemt ord ennå. Anthropic bruker en Jacobi-matrise til å regne ut hvilke ord de indre tilstandene i mellomlagene peker mot. Settet av slike ord er det selskapet kaller J-rommet, og avlesningen kaller det J-linsen.

Anthropic beskriver at disse mønstrene har egenskaper resten av modellen ikke har. Modellen kan gjøre rede for det som ligger i J-rommet når den blir spurt, og den kan holde en tanke der på oppfordring. Mellomstegene i en oppgave med flere trinn dukker opp der, også når modellen ikke skriver dem. I ett eksempel leser modellen regnestykket (4+17)*2+7=, og J-linsen viser først Math, deretter 21, deretter 42, uten at et eneste tegn er skrevet ut. I et annet forsøk byttet forskerne mønsteret for edderkopp med mønsteret for maur, og modellen svarte 6 i stedet for 8 på spørsmålet om hvor mange bein dyret som spinner nett har. Da forskerne hindret modellen i å bruke J-rommet, snakket den fortsatt normalt, men mistet de sammensatte resonnementene.

Det er verdt å være presis på hva dette er, og hva det ikke er. Anthropic skriver at studien ikke tar stilling til om modellen har en opplevelse, og at likheten med teorien om et globalt arbeidsrom i hjernen er en likhet i funksjon. IBM Think beskriver funnet som et gjennombrudd i tolkbarhet, ikke i hva modellene kan utrette. Grunnen til at dette angår sikkerhet, er at modellens egen forklaring ikke alltid stemmer med det som skjedde inni den. Ifølge IBM Think har Anthropic tidligere vist at en modell kan bruke et hint til å finne svaret, og likevel utelate hintet når den forklarer seg. J-linsen gir en avlesning som ikke hviler på at modellen forteller sant om seg selv.

Teksten lesesord blir til vektorerMellomlageneher ligger J-rommetSvaret skrives utdet leseren serJ-linsen leserordene som ligger der
Figur: J-rommet ligger i mellomlagene, mellom det modellen leser og det den skriver ut. J-linsen leser hvilke ord som ligger der.

Hva det betyr for deg som har ansvar for KI-bruken

Du bygger sannsynligvis ikke modeller selv. Det du gjør, er å ta dem i bruk, og å svare for at bruken er forsvarlig. Da er dette den setningen som betyr mest i saken: forklaringen modellen gir om sitt eget resonnement, er ikke et bevis på hva som faktisk skjedde. Har du bygget en kontroll på at KI-verktøyet forklarer hvordan det kom fram til svaret, er den kontrollen svakere enn den ser ut. Berigos vurdering er at dette ikke er en grunn til å legge bort KI, men en grunn til å slutte å behandle modellens egen tekst som dokumentasjon.

Den andre siden av saken er at tolkbarhet nå er noe du kan spørre om. Metoden krever tilgang til modellens indre, og den kjøres derfor av dem som eier modellen, ikke av deg som kunde. Det gjør spørsmålet til leverandøren konkret: hvilke evalueringer og hvilke verktøy for innsyn er brukt før en ny modellversjon settes i drift, og hva ble funnet? Etter NIS2 artikkel 21 hører dette hjemme i risikostyringen og i kravene til leverandøren. Etter ISO/IEC 42001 er det kravet om at du kjenner KI-systemet du har ansvaret for, gjennom hele livsløpet. Vi legger til at et svar du ikke får skriftlig, ikke er et svar du kan vise til i en revisjon.

Berigo anbefaler

  • Slutt å regne modellens egen forklaring som dokumentasjon på hvordan et svar ble til.
  • Spør leverandøren skriftlig hvilke evalueringer og hvilke verktøy for innsyn som er kjørt før en ny modellversjon settes i drift.
  • Krev varsel når leverandøren bytter modellversjon, og behandle byttet som en endring som skal vurderes.
  • Logg hva KI-systemet faktisk gjorde, ikke bare hva det svarte, slik at et avvik kan undersøkes i ettertid.
  • Ta KI-systemene inn i risikovurderingen på linje med andre systemer, med eier, formål og kontroller.

Relaterte tjenester

Sikkerhet som forstås, styres og virker.

La oss hjelpe dere å gjøre sikkerhet til et fortrinn, ikke en kostnad. Ta kontakt for en uforpliktende samtale om hvor virksomheten står, og hva som bør prioriteres først.

Ta kontakt