Hoppa till innehåll
SäkerhetMythosSäkerhetsfilosofi9 min läsning

Säkerhet utan skyddsräcken – Filosofin bakom Mythos

Anthropic valde medvetet att ta bort vissa säkerhetsmekanismer i Mythos 5 – en genomtänkt filosofisk hållning.

65022
Säkerhet utan skyddsräcken – Filosofin bakom Mythos
Säkerhet utan skyddsräcken – en medveten filosofiPhoto: Anthropic

Anthropic valde medvetet att ta bort vissa säkerhetsmekanismer i Mythos 5. Det var en genomtänkt filosofisk hållning.

I Mythos 5 var flera automatiska säkerhetsspärrar svagare eller borttagna. Anthropic gjorde detta medvetet för att förstå modellens fulla potential och samla data om vilka risker som faktiskt uppstår när skyddsnivån sänks.

Detta var alltså inte vårdslöshet – det var ett ingenjörsmässigt och vetenskapligt angreppssätt: för att bygga bra skydd måste man först förstå vad man skyddar mot.

Säkerhetsspektrumet

I stället för en binär syn på AI-säkerhet (skyddad/oskyddad) pekar Mythos-projektet mot ett spektrum av säkerhetsnivåer:

NivåBeskrivningExempelMålgrupp
Fullt skyddadAlla säkerhetsfilter aktivaClaude Opus 4.8Allmänheten
KonservativMythos-klass med filterFable 5Betalande användare
ExperimentellReducerade filter, övervakadMythos 5 (Glasswing)Handplockade experter
ForskningMinimala filter, isolerad miljöInterne Anthropic-forskningAnthropic internt

En ny säkerhetsfilosofi

Mythos-projektet pekar mot en säkerhetsfilosofi där skyddsnivån anpassas efter användaren snarare än att vara konstant. För en bred publik (Fable 5) krävs starka skydd. För en snäv grupp experter (Mythos 5) kan lägre skyddsnivå vara motiverad – under förutsättning att experimentet är noggrant kontrollerat och övervakat.

Detta är en betydande avvikelse från den traditionella synen att samma skyddsnivå bör gälla alla användare. Anthropic argumenterar att den differentierade modellen är både säkrare (eftersom den möjliggör insamling av data om verkliga risker) och mer kapabel (eftersom experter kan utforska modellens fulla potential).

Lärdomar för framtiden

De viktigaste lärdomarna från Mythos-projektets säkerhetsarbete är:

  1. Differentierad säkerhet är möjlig – olika användare kan ha olika skyddsnivåer
  2. Kontrollerade experiment med lägre skydd ger ovärderlig data för att bygga bättre skydd
  3. Ansvarsfull rapportering av upptäckter (som sårbarheter) är avgörande för att differentierad åtkomst ska vara etiskt försvarbar
  4. Exportrestriktioner skapar en ny dimension av differentiering som går bortom Anthropics kontroll

För att bygga bra skydd måste man först förstå vad man skyddar mot. Mythos-projektet är ett ingenjörsmässigt angreppssätt på AI-säkerhet.

- Simon Axelsson

Om författaren

Simon Axelsson
Simon AxelssonIT-konsult & teknisk rådgivare

Simon Axelsson är senior IT-konsult och grundare av SIAX Technology AB. Han hjälper nordiska företag med molninfrastruktur, dataplattformar och AI-automation.

Fler artiklar av Simon