Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI holder Zero Data Retention på frontier-modeller • Claude designer proteinbindere autonomt – og laben bekrefter • OpenAI bremser frontier-RL til sikkerheten tar igjen evnene • NVIDIA og OpenAI låser 8 GW AI-fabrikk i Ohio

Anthropic løsner biovern i Claude Fable 5
CIOCISOStyreAnthropicClaudeFable 5AI-sikkerhetBiologiRisikostyringHelse

Anthropic løsner biovern i Claude Fable 5

JH
Joachim Høgby
7. august 20267. august 20264 min lesingKilde: Anthropic

Anthropic justerer sikkerhetsgrensene rundt Claude Fable 5. Selskapet sier at en oppdatert biologi-klassifisering reduserer biologi-relaterte «fallbacks» med omtrent 85 prosent på tvers av produktflatene.

I praksis betyr det at flere hverdagslige og legitime spørsmål innen helse, biologi og utdanning skal besvares av Fable 5, i stedet for å sendes videre til en mindre kapabel modell. Anthropic nevner blant annet tolkning av laboratoriesvar, forståelse av symptomer, læring om biologi og kliniske oppgaver for helsepersonell.

Samtidig holder selskapet fast ved at Fable 5 fortsatt faller tilbake til Opus 5 for forespørsler de vurderer som dual-use, inkludert virologi, toksikologi, molekylær design og legemiddelutvikling. Med andre ord: Anthropic åpner mer for lavrisikobruk, men holder igjen på profesjonell biologi der misbrukspotensialet er høyere.

Hvorfor dette er en ledernyhet

Dette er en liten produktendring hvis man bare ser på brukeropplevelsen. Det er en stor styringssak hvis man ser på hva den avslører om frontier-modeller.

Fable 5 er kapabel nok til at Anthropic mener den kan gi vesentlig støtte i avanserte biologiske oppgaver. Selskapet skriver at modellen kan overgå eksperter på noen komplekse biologiske oppgaver og gi operativ støtte på andre. Det er nyttig for forskning og helse. Det er også farlig hvis samme evner hjelper en aktør med å utvikle biologiske våpen eller andre skadelige systemer.

Derfor lanserte Anthropic Fable 5 med svært strenge biologisperrer. Problemet var falske positiver. Legitimiteten til et AI-system faller raskt hvis ufarlige spørsmål stadig blokkeres eller rutes til en svakere modell. For virksomheter er det samme konflikt i mindre skala: for stramme kontroller gir lav nytte, for løse kontroller gir risiko.

Anthropic beskriver arbeidet som en justering av klassifisererens «constitution», altså reglene som hjelper sikkerhetssystemet å skille mellom beskyttet og tillatt innhold. De har laget nye treningsdata, testet med interne og eksterne eksperter, og forsøkt å slippe gjennom flere godartede forespørsler uten å åpne for skadelig dual-use-arbeid.

Fra blokkering til differensiert tilgang

Den viktige bevegelsen er at AI-sikkerhet blir mer differensiert. Tidlig i en modellgenerasjon er den enkleste kontrollen å blokkere bredt. Det er tryggere, men dyrt i nytte. Neste fase er finere risikoklasser: hvem spør, hva spør de om, hvilken kontekst har de, og hvilken handling kan modellen faktisk hjelpe med?

For helse, forskning og industri kan dette bli avgjørende. En lege, forsker eller farmasøyt trenger høyere nytte enn en tilfeldig forbruker. Samtidig kan profesjonell tilgang ikke baseres på tillit alene. Den må ha identitet, logging, avtaler, revisjon og klare konsekvenser ved misbruk.

Anthropic peker selv på behovet for «trusted access pathways» for de mest kapable biologimodellene. Det er samme retning som cyberområdet går i: avanserte modeller blir ikke bare åpnet eller stengt. De får styrte tilgangsløp.

Hva norske virksomheter bør ta med seg

For norske ledere er læringen overførbar til alle høy-risiko-domener. Hvis virksomheten bruker AI i helse, kjemi, energi, cybersikkerhet, finans eller offentlig saksbehandling, må den ha mer enn en generell AI-policy.

Den må vite hvilke oppgaver som er lavrisiko, hvilke som krever faglig godkjenning, og hvilke som ikke skal gjøres med generelle modeller. Den må kunne forklare hvorfor en modell fikk lov til å svare, hvorfor den nektet, og hvem som kan overstyre beslutningen.

Det er også en anskaffelsessak. Leverandører bør kunne dokumentere hvordan klassifiserere testes, hvor ofte de endres, hva slags fallbacks som brukes, og hvordan kundene får vite når modellen endrer oppførsel. Hvis en modell i går blokkerte en type forespørsel og i dag svarer, er det en endring i kontrollmiljøet.

Anthropics justering er derfor ikke bare en forbedring av Claude. Den er et eksempel på hvordan AI-leverandører må balansere tilgang og katastroferisiko i sanntid. Kundene må bygge styring som tåler at den balansen flytter seg.

Kilder og medier

Kilde: Anthropic, «Improving Fable 5's biology safeguards». Source_url: https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.