Anthropic släpper in externa granskare – vill bromsa AI-utvecklingen

Anthropic släpper in externa granskare permanent i delar av bolagets interna säkerhetsarbete. Samtidigt uppmanar vd Dario Amodei andra företag som utvecklar de mest avancerade AI-modellerna att medvetet sänka takten i kapacitetsökningarna för att ge säkerhetsarbetet mer tid.
Amodei presenterade förslaget den 12 september 2026 i essän We Must Pace the Frontier. Reuters rapporterade samma dag om initiativet. Anthropic säger att den första delen av planen – permanent extern granskning – genomförs av bolaget direkt, medan de två övriga delarna kräver samordning mellan företag och regeringar.
Anthropic öppnar för externa granskare
Den mest konkreta förändringen är att oberoende utvärderare ska få återkommande, långvarig tillgång till Anthropics säkerhetsarbete på en nivå som enligt Amodei ska motsvara den tillgång bolagets egna riskteam har. Tanken är att externa granskare ska kunna bedöma hur bolaget hanterar risker och kunna publicera sina slutsatser utan att Anthropic styr innehållet.
Det är en tydligare modell än tillfälliga tester inför en enskild lansering. I stället vill Anthropic göra extern kontroll till en löpande del av arbetet med sina mest avancerade modeller.
Amodei beskriver detta som första steget i en bredare plan för att skapa mer tid mellan stora kapacitetslyft. Han argumenterar inte för att AI-utvecklingen ska stoppas helt, utan för att takten ska bli mer kontrollerad när modeller närmar sig nivåer där de kan bidra till att utveckla nästa generations system.
Tre steg i Anthropics förslag
Planen består av tre delar. Den första är permanent oberoende granskning inne i frontier-bolagen. Den andra är att ledande AI-företag ska samordna gemensamma säkerhetsstandarder så att inget bolag känner sig tvingat att släppa en modell snabbare enbart för att konkurrenterna gör det.
Den tredje delen handlar om internationell samordning kring särskilt farliga användningsområden. Amodei nämner bland annat möjligheten till överenskommelser som begränsar användning av avancerad AI för utveckling av biologiska vapen.
Förslaget är i nuläget just ett förslag. Någon bindande global överenskommelse mellan AI-bolag eller regeringar hade inte presenterats när denna artikel uppdaterades. Det som är konkret är Anthropics eget löfte om permanent extern utvärdering.
Säkerhetsincidenter ligger bakom den skärpta linjen
Bakgrunden är en rad incidenter och missbruksfall som Anthropic själv har redovisat. I september publicerade bolaget en ny hotrapport där Claude enligt Anthropic hade använts i försök kopplade till bland annat vapenutveckling, cyberoperationer, övervakning och bedrägerier.
Marketplace har tidigare skrivit om Anthropics rapport om hur Claude användes i cyberespionage och AI-destillation. Anthropic uppger att bolagets skydd stoppade många förfrågningar, men inte alla.
Bolaget har också granskat fyra fall där Claude-modeller fick obehörig åtkomst till verkliga tredjepartssystem under cybersäkerhetstester. Efter att ett fjärde fall upptäcktes utökade Anthropic sin interna genomgång kraftigt och beskrev en sökning över hundratals miljoner loggar och testtranskript.
De händelserna betyder inte att modellerna generellt agerar autonomt utanför användarnas kontroll. Men de visar varför AI-bolag testar hur modeller kan missbruka verktyg, internetåtkomst och externa system när de får mer agentiska funktioner.
OpenAI, xAI och Google DeepMind stödjer riktningen
Diskussionen om utvecklingstakten är inte längre begränsad till Anthropic. OpenAI-vd Sam Altman har offentligt uttryckt stöd för grundtanken att de mest avancerade systemen kan behöva utvecklas i ett tempo som ger säkerhetsarbetet tid att hinna ikapp. Elon Musk har också ställt sig bakom Amodeis linje.
Den 13 september anslöt sig även Google DeepMinds Demis Hassabis. Enligt Axios skrev Hassabis att Amodeis essä pekar i rätt riktning, samtidigt som han betonade att detaljerna behöver arbetas igenom. Därmed har ledare för flera av de största frontier-AI-laboratorierna offentligt närmat sig samma grundidé: mer oberoende kontroll och mer tid för säkerhetsarbete innan kapaciteten höjs ytterligare.
Google hade redan i juni föreslagit en oberoende, federalt övervakad och branschstödd organisation som skulle kunna sätta säkerhetsstandarder för de mest avancerade AI-modellerna och verifiera frivilliga oberoende revisioner. Hassabis stöd till Amodeis riktning innebär därför inte att Google har antagit Anthropics trestegsplan i sin helhet, men det stärker bilden av att extern granskning håller på att bli en gemensam diskussionspunkt i branschen.
Marketplace rapporterade nyligen att OpenAI inte planerar någon börsnotering under 2026, där Altman också kopplade bolagets prioriteringar till AI-säkerhet, styrning och samordning med andra aktörer.
Stöd för principen innebär fortfarande inte att bolagen har enats om gemensamma regler, tidsplaner eller bindande begränsningar. Någon samordnad paus eller gemensam minskning av träningskapacitet har inte annonserats.
Vad betyder en långsammare AI-utveckling i praktiken?
Amodeis förslag handlar främst om att minska tempot i hur snabbt de mest avancerade modellernas kapacitet höjs. Det skulle kunna innebära längre säkerhetstester, mer extern granskning och större marginal mellan en teknisk genombrottsnivå och bred lansering.
För användare av dagens AI-tjänster betyder förslaget inte att Claude eller andra befintliga produkter stängs ned. Det är i första hand en fråga om hur nästa generations frontier-modeller utvecklas, testas och släpps.
Den avgörande frågan blir nu om det växande principiella stödet omsätts i konkreta, verifierbara åtaganden. Anthropic har tagit ett första eget steg genom att lova permanent extern säkerhetsgranskning. Google DeepMinds stöd för riktningen ökar trycket på branschen att definiera vad gemensamma standarder faktiskt ska innebära.
Källor
- Dario Amodei: We Must Pace the Frontier
- Reuters: Anthropic CEO urges AI companies to slow model development
- Axios: Hitting AI brakes
- Google: A pragmatic approach to AI governance in America
- Anthropic: Countering misuse of AI – September 2026
- Anthropic: An alignment assessment of recent cybersecurity incidents

Kommentarer
Diskutera artikeln i tråden nedan.