Anthropic valde medvetet att ta bort vissa säkerhetsmekanismer i Mythos 5. Det var en genomtänkt filosofisk hållning.
I Mythos 5 var flera automatiska säkerhetsspärrar svagare eller borttagna. Anthropic gjorde detta medvetet för att förstå modellens fulla potential och samla data om vilka risker som faktiskt uppstår när skyddsnivån sänks.
Detta var alltså inte vårdslöshet – det var ett ingenjörsmässigt och vetenskapligt angreppssätt: för att bygga bra skydd måste man först förstå vad man skyddar mot.
Säkerhetsspektrumet
I stället för en binär syn på AI-säkerhet (skyddad/oskyddad) pekar Mythos-projektet mot ett spektrum av säkerhetsnivåer:
| Nivå | Beskrivning | Exempel | Målgrupp |
|---|---|---|---|
| Fullt skyddad | Alla säkerhetsfilter aktiva | Claude Opus 4.8 | Allmänheten |
| Konservativ | Mythos-klass med filter | Fable 5 | Betalande användare |
| Experimentell | Reducerade filter, övervakad | Mythos 5 (Glasswing) | Handplockade experter |
| Forskning | Minimala filter, isolerad miljö | Interne Anthropic-forskning | Anthropic internt |
En ny säkerhetsfilosofi
Mythos-projektet pekar mot en säkerhetsfilosofi där skyddsnivån anpassas efter användaren snarare än att vara konstant. För en bred publik (Fable 5) krävs starka skydd. För en snäv grupp experter (Mythos 5) kan lägre skyddsnivå vara motiverad – under förutsättning att experimentet är noggrant kontrollerat och övervakat.
Detta är en betydande avvikelse från den traditionella synen att samma skyddsnivå bör gälla alla användare. Anthropic argumenterar att den differentierade modellen är både säkrare (eftersom den möjliggör insamling av data om verkliga risker) och mer kapabel (eftersom experter kan utforska modellens fulla potential).
Lärdomar för framtiden
De viktigaste lärdomarna från Mythos-projektets säkerhetsarbete är:
- Differentierad säkerhet är möjlig – olika användare kan ha olika skyddsnivåer
- Kontrollerade experiment med lägre skydd ger ovärderlig data för att bygga bättre skydd
- Ansvarsfull rapportering av upptäckter (som sårbarheter) är avgörande för att differentierad åtkomst ska vara etiskt försvarbar
- Exportrestriktioner skapar en ny dimension av differentiering som går bortom Anthropics kontroll
“För att bygga bra skydd måste man först förstå vad man skyddar mot. Mythos-projektet är ett ingenjörsmässigt angreppssätt på AI-säkerhet.”
- Simon Axelsson

