Marketplace
MarketplaceMobil mega-meny för innehåll, tjänster och konto.

Huvudspår

Köp & säljAnnonserBoendeBostadObjektObjektBe om prisOffertFöretagsregisterFöretagLånBanklånLokaltHittaKarriärJobbDestinationerResorCoinsKryptoDiskussionForumKunskapWiki
AI-nyheter

Golden Gate Claude – Anthropic hittar och styr ett begrepp inne i språkmodellen

Golden Gate Claude – Anthropic hittar och styr ett begrepp inne i språkmodellen

Den 21 maj 2024 publicerade Anthropic forskning om hur miljontals interna mönster i Claude 3 Sonnet kunde kartläggas och tolkas. Ett uppmärksammat experiment blev Golden Gate Claude, där forskarna hittade en intern egenskap kopplad till Golden Gate-bron och förstärkte den tills modellen började nämna bron i nästan alla sammanhang.

Marketplace sammanfattar forskningen i efterhand. Experimentet visade att vissa abstrakta begrepp kan lokaliseras och påverkas inne i en stor språkmodell. Det gav forskare ett nytt verktyg för att undersöka varför modeller beter sig som de gör – men var inte en fullständig karta över modellens tänkande eller ett bevis på att varje intern representation är lätt att förstå.

Golden Gate Claude i korthet

| Punkt | Uppgift |
|---|---|
| Publiceringsdatum | 21 maj 2024 |
| Företag | Anthropic |
| Modell | Claude 3 Sonnet |
| Forskningsområde | Mekanistisk tolkbarhet |
| Metod | Sparse autoencoders för att hitta interna egenskaper |
| Mest känt exempel | En egenskap kopplad till Golden Gate-bron |
| Experiment | Egenskapen förstärktes så att modellen överfokuserade på bron |
| Huvudmål | Förstå, övervaka och på sikt styra modellbeteende |

Problemet med neuroner och blandade betydelser

En språkmodell består av enorma mängder numeriska aktiveringar. En enskild neuron representerar ofta inte ett enda tydligt begrepp. Samma neuron kan reagera på flera helt olika saker, ett fenomen som brukar kallas polysemanticitet.

Det gör modellen svår att tolka. Om forskaren ser att en neuron aktiveras vet den inte automatiskt om det beror på:

  • ett specifikt objekt
  • en språklig konstruktion
  • en känsla
  • ett geografiskt område
  • ett säkerhetsrelevant mönster

Anthropic försökte i stället hitta mer renodlade features, interna egenskaper som återkom när modellen bearbetade ett visst begrepp eller mönster.

Sparse autoencoders

Forskarna använde sparse autoencoders, en metod som försöker förklara modellens täta aktiveringar som en kombination av ett mindre antal tydligare egenskaper.

Förenklat sker följande:

  1. modellen bearbetar text
  2. interna aktiveringar samlas in
  3. autoencodern försöker återskapa aktiveringen
  4. den tvingas använda relativt få egenskaper åt gången
  5. forskaren undersöker vilka textexempel som aktiverar varje egenskap

Sparsiteten är viktig. Om alla egenskaper är aktiva samtidigt blir resultatet lika svårt att förstå som originalet.

Metoden gav miljontals identifierbara mönster, men varje feature var inte perfekt ren eller fullständigt begriplig.

Golden Gate-egenskapen

En feature reagerade på text och bilder som handlade om Golden Gate-bron. Den kunde även aktiveras av relaterade idéer, exempelvis San Francisco eller beskrivningar av den kända röda bron.

Forskarna förstärkte denna interna egenskap under modellens körning. Resultatet blev att Claude började tolka allt genom Golden Gate-bron.

Modellen kunde exempelvis:

  • föra in bron i svar där den inte var relevant
  • beskriva sig själv som bron
  • se likheter mellan andra ämnen och bron
  • skriva med en överdriven fixering

Experimentet gjorde en intern representation synlig genom ett tydligt beteende. Det betyder inte att modellen ”ville” prata om bron. Forskarna förändrade den numeriska signal som påverkade modellens nästa ord.

För stark styrning skapade absurt beteende

När feature-aktiveringen ökades kraftigt blev modellen mindre användbar. Den kunde ignorera instruktionen och återkomma till samma begrepp.

Detta visar att en intern egenskap kan påverka många delar av beteendet samtidigt. En modell är inte ett enkelt register där ett ord kan slås av och på utan bieffekter.

För praktisk kontroll måste forskaren veta:

  • hur stark förändringen får vara
  • vilka andra features som påverkas
  • om effekten varierar med prompten
  • om styrningen skapar nya säkerhetsproblem
  • hur modellen återgår till normalt läge

Farliga och säkerhetsrelevanta features

Anthropic identifierade även egenskaper som verkade kopplade till mer känsliga mönster, exempelvis:

  • bedrägerier
  • biologiska risker
  • skadlig kod
  • manipulation
  • bias
  • sycophancy, där modellen överdrivet håller med användaren

Det öppnade möjligheten att övervaka när en modell närmar sig ett riskfyllt område.

Men en feature-detektor är inte ett komplett säkerhetssystem. Skadligt innehåll kan uttryckas på oväntade sätt, och en harmlös forskningsfråga kan aktivera samma mönster.

En säker produkt behöver fortsatt flera lager: policy, klassificerare, behörigheter, loggning och mänsklig kontroll.

Feature steering

Golden Gate Claude var ett exempel på feature steering – att medvetet förstärka eller dämpa en intern egenskap.

På sikt skulle liknande tekniker kunna användas för att:

  • minska ett oönskat beteende
  • förstärka ärlighet eller osäkerhetskommunikation
  • upptäcka när modellen försöker manipulera
  • analysera varför ett avslag sker
  • kontrollera en specialiserad tonalitet

Styrning kan också missbrukas. En aktör skulle kunna förstärka propaganda, aggressivitet eller övertygelse utan att användaren förstår förändringen.

Transparens kring modellmodifieringar blir därför viktig.

Tolkbarhet är inte samma sak som full förståelse

Forskarna kartlade miljontals features, men en frontiermodell kan innehålla betydligt fler relevanta representationer.

Begränsningar:

  • features kan överlappa
  • samma begrepp kan finnas på flera platser
  • betydelsen kan skifta med kontext
  • analysen gjordes på ett visst lager
  • metoden kräver stor beräkningskapacitet
  • mänskliga etiketter kan förenkla mönstret

Golden Gate-exemplet var lätt att kommunicera eftersom bron är konkret. Abstrakta egenskaper som ärlighet, planering eller bedräglig strategi är mycket svårare att definiera.

Kan man läsa modellens tankar?

Nej, inte på ett enkelt sätt. Features visar statistiska interna mönster, inte en fullständig och ordnad tankeström.

En språkmodell har inte nödvändigtvis samma typ av tankar som en människa. Forskarna kan se vilka representationer som är aktiva och hur de påverkar beteendet, men tolkningen kräver försiktighet.

Det är mer korrekt att säga att metoden ger en bättre karta över vissa interna beräkningar.

Varför detta är viktigt för avancerad AI

När modeller får tillgång till kod, webbläsare och andra verktyg räcker det inte att enbart kontrollera sluttexten. Ett system kan planera riskfyllda handlingar innan resultatet syns.

Tolkbarhetsverktyg skulle kunna hjälpa till att upptäcka:

  1. dolda mål
  2. manipulation
  3. försök att kringgå regler
  4. riskfylld planering
  5. skillnad mellan uttalad och intern strategi

Detta är fortfarande ett forskningsmål. Golden Gate Claude visade en möjlig väg, inte en färdig lösning för fullständig övervakning.

Oberoende granskning

Tolkbarhetsresultat behöver reproduceras av andra forskare. Om bara modellföretaget har tillgång till vikter, aktiveringar och beräkningsresurser blir oberoende kontroll svår.

En trovärdig säkerhetsprocess bör innehålla:

  • publicerade metoder
  • testdata där det är säkert
  • externa forskare
  • jämförelser mellan modeller
  • negativa resultat
  • tydliga begränsningar

Det är särskilt viktigt när företaget använder tolkbarhet som argument för att en modell är säker.

Svenska företag och tolkbarhet

Vanliga företag kommer inte själva att kartlägga miljontals interna features. Men forskningen påverkar vilka kontrollverktyg som kan bli tillgängliga i framtiden.

Företagskunder kan efterfråga:

  • förklaring av avslag
  • riskindikatorer
  • loggning av agentplaner
  • övervakning av känsliga ämnen
  • möjlighet att testa modelluppdateringar
  • oberoende säkerhetsrapporter

Tolkbarhet ska inte blandas ihop med en enkel förklaringsruta. Ett genererat svar om ”varför modellen gjorde så” kan vara ytterligare en gissning från modellen.

Skillnaden mellan feature och ämnesfilter

| Intern feature | Yttre ämnesfilter |
|---|---|
| Mäter ett mönster inne i modellen | Läser prompt eller svar |
| Kan aktiveras innan sluttexten finns | Ser främst uttryckt innehåll |
| Kan ge insikt i modellens representation | Enklare att implementera och kontrollera |
| Svår att tolka och skala | Kan kringgås med omskrivningar |
| Forskningsområde | Vanlig produktkontroll |

De två metoderna kan komplettera varandra.

Vanliga frågor

När publicerades Golden Gate Claude-forskningen?

Anthropic publicerade arbetet den 21 maj 2024.

Var Golden Gate Claude en offentlig modell?

Anthropic gjorde en tillfällig demonstrationsversion tillgänglig, men experimentet var främst en forskningsdemonstration.

Vad gjorde modellen?

Forskarna förstärkte en intern feature kopplad till Golden Gate-bron, vilket fick Claude att nämna och tolka många ämnen genom bron.

Betyder det att Claude är medveten?

Nej. Experimentet visar att interna representationer kan hittas och påverkas, inte att modellen har mänskligt medvetande.

Kan features användas för säkerhet?

Möjligen. De kan hjälpa till att upptäcka riskmönster, men metoden är ännu inte ett komplett säkerhetssystem.

Kan alla modellens begrepp kartläggas?

Inte med dagens metoder. Forskningen hittade miljontals features men täckte inte hela modellens interna beräkning.

Sammanfattning

Golden Gate Claude blev det mest kända exemplet från Anthropics tolkbarhetsforskning i maj 2024. Genom sparse autoencoders hittade forskarna en intern representation av Golden Gate-bron och styrde modellen tills begreppet dominerade dess svar.

Experimentet visade att stora språkmodeller inte är fullständigt ogenomträngliga svarta lådor. Samtidigt är vägen till full förståelse lång. Features kan vara överlappande och kontextberoende, och intern styrning kan skapa oväntade bieffekter. Tolkbarhet är ett viktigt säkerhetsverktyg – men ännu inte en garanti för kontroll.

Faktaunderlag: Anthropic, ”Mapping the Mind of a Large Language Model”, publicerad 21 maj 2024, och den tillhörande Golden Gate Claude-demonstrationen. Artikeln är en historisk sammanfattning publicerad i efterhand.

Utvalda vägar vidare

Jämför och välj med bättre underlag

Tydligt märkta partnererbjudanden, placerade nära rätt beslut.

Partnererbjudande · Banklån

Räkna på banklån innan du ansöker

Se ungefärlig månadskostnad, löptid och villkor på ett ställe.

Räkna på lån

Marketplace kan få ersättning om du går vidare.

Partnererbjudande · Casino · 18+

Casino bonus 2026 – jämför villkor

Se svensk licens, omsättningskrav och aktuell bonusstatus.

Öppna jämförelsen

18+ · Spela ansvarsfullt · Annonslänk · Villkor gäller.

Kommentarer

Kommentarer

Diskutera artikeln i tråden nedan.

Inga omdömen ännu0 omdömen
Fortsätt diskussionen i ForumEn gemensam tråd skapas för artikeln. Har du redan konto kan du logga in och fortsätta direkt.
Diskutera i Forum
Lägg till kommentar

Kommentaren granskas innan den publiceras.

Ditt omdöme