Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

Anthropic åpner 250 000 Claude-samtaler – uten rådata
AI-modellerAnthropicClaudeEvalCIOCISOForskningAgenter

Anthropic åpner 250 000 Claude-samtaler – uten rådata

JH
Joachim Høgby
26. august 202626. august 20264 min lesingKilde: Anthropic

Anthropic publiserte 26. august 2026 resultatene av en pilot der tre eksterne forskningsgrupper fikk kjøre egne studier mot aggregert Claude-trafikk. Labben kaller det første gang utenforstående har gjort offentlige, uavhengige studier på et AI-selskaps egen bruksdata. For CIO og CISO er tre rammer mer verdifulle enn transparens-språket. Forskerne så aldri råsamtaler. Team, Enterprise og API-kunder er ute. Og over halvparten av det som kom inn, er arbeid som rammer andre eller er vanskelig å angre.

Hva som faktisk ble åpnet

Verktøyet heter Anthropic Insights, tidligere Clio. En forsker skriver spørsmål. Claude klassifiserer hver samtale. Svaret kommer ut som kategorier og andeler. Rådata og beregning blir på Anthropics servere. Partnerne fikk aggregat etter juridisk og personvernvurdering, den samme Anthropic bruker internt.

Tre grupper sto bak: Stanford SALT Lab, Oxford Human Information Processing Lab og METR. Hver fikk om lag 250 000 samtaler fra april–mai 2026. Stanford og Oxford fikk Claude.ai-trafikk fra Free, Pro og Max. METR fikk Claude Code fra konsumentbrukere som har sagt ja til at Anthropic bruker dataene til modellforbedring, i et vindu som krysset en modellansering. Aggregatene ligger på Hugging Face under Anthropic/enabling-independent-research.

Kontrakten begrenset Anthropics innsigelsesrett til personvern, informasjon som kan hjelpe folk å bryte bruksreglene, konfidensiell informasjon og forskningsnøyaktighet. Partnerne kan publisere funn som er ubeleilige for Anthropic.

Imperial College London fikk to uker på å reidentifisere brukere mot Anthropics trusselmodell. De klarte det ikke. De koblet én klynge til et populært åpen kildekode-prosjekt, uten å knytte det til en person eller organisasjon. Anthropic sier de vil heve minimum antall brukere per klynge i senere studier.

Stanford: tungt arbeid er normalen, ikke unntaket

SALT Labs artikkel, Human–AI Collaboration at Scale, analyserer 249 834 Claude.ai-samtaler fra 25. april til 9. mai 2026. Blant samtaler med klassifiserbar oppgave var 20 prosent flyktige, 24 prosent operative, 44 prosent consequential og 12 prosent høyrisiko. Det gir 56 prosent på consequential eller høyere: arbeid som rammer andre eller er vanskelig å angre. Om lag 34 prosent av hele korpuset hadde ingen handlingsrettet oppgave.

Høyrisiko-samtaler var nesten dobbelt så lange: 12,4 turer mot 6,5 for flyktige. Høyest Task Criticality Index kom i juridisk og finansiell rådgivning (2,14), der nesten en fjerdedel var høyrisiko. Mennesket leder fortsatt. 72 prosent av samtalene er i kategorien der mennesket har hovedansvaret og AI assisterer. Tilpasning av output, ikke klipp-og-lim, var den vanligste modusen og nådde 60 prosent på consequential arbeid. Direkte bruk av uendret output falt når innsatsen økte.

Friksjon oppsto i 49,7 prosent av samtalene. Brukerne forsøkte å rette opp i 78,7 prosent av tilfellene. Claude drev en form for undervisning i 67 prosent av samtalene, spredt over programvare, helse og forretning.

Oxford og METR er ikke ferdige

Oxford HIP Lab ser på hvordan folk har det mens de bruker Claude, og hvordan det henger sammen med modellens atferd. Tidlige signaler: varme svar gikk sammen med mer positive brukere, avslag med motstand, eksentrisitet med mer intellektuelt engasjement. Mønstre av absorpsjon, frustrasjon og nytelse liknet et separat studium av vanlig nettbruk. Full tekst mangler.

METR måler reell produktivitet fra kodeagenter på tvers av modellgenerasjoner. Foreløpig: nyere modeller gir mer tidsgevinst enn eldre, og Claudes anslag på hvor lang en oppgave ville tatt uten AI korrelerte med kjente tider fra en tidligere utviklerstudie. METR vil neste se på hvor mye AI akselererer forskning. Tallene er ikke publisert. Anthropic peker selv på at METRs spørsmål overlapper intern økonomiforskning om kodeagenter.

Hva dette ikke er

Dette er ikke innsyn i enterprise-trafikk. Det er ikke rålogger. Det er ikke en uavhengig kopi av produksjonsdata. Anthropic kjører spørringene, gjennomgår hver klynge manuelt, og strøk klynger som beskrev hvordan brukere omgikk sperrer. I de tre kjøringene ble 1,9 prosent av klyngene (4,28 prosent av samtalene) strøket for Stanford, 3,33 prosent av klyngene (3,85 prosent av samtalene) for Oxford, og 1,8 prosent av klyngene (2,96 prosent av samtalene) for METR.

Metoden er sårbar for spørsmålsformulering fordi Claude dømmer Claude-samtaler. Internt itererer Anthropic i uker. Eksterne fikk ikke det, fordi hver datasettkjøring krever personvernvurdering. De testet på WildChat, som skjev mot uformell og kreativ bruk. Noen spørsmål som virket der, ga misvisende kategorier på ekte Claude-trafikk. Oxford fikk én hel faset fjernet fordi Anthropic mistenkte at et dårlig formulert spørsmål ga misvisende klyngebeskrivelser.

Hva ledergruppen bør gjøre med dette

For norske virksomheter er funnet mer styringsrelevant enn programmet. Konsumentbrukere tar allerede consequential juridisk og finansiell jobb inn i Claude uten Team- eller Enterprise-kontroller. Det er et skygge-IT-signal, ikke et bevis for at deres egne ansatte gjør det samme i produksjon.

Hvis styret ber om uavhengig evaluering av Claude, er dette malen labben selv tilbyr: aggregat, lab-kjørt, uten enterprise-data, med Claude som klassifikator. METRs produktivitetstall kommer senere. Inntil da er det ikke dekkende som ROI-grunnlag for kodeagenter.

Personvernrevisjonen fra Imperial er et pluss for CISO som vurderer om Anthropic kan slippe mer data ut. Den beviser ikke at Insights er trygt mot en motivert inntrenger med intern tilgang, og den beviser ikke at norske personvernkrav er oppfylt hvis dere senere ber om lignende analyser på egne logger.

Kilder og medier

Primærkilde: Anthropic, «Enabling independent research on how people use Claude», 26. august 2026: https://www.anthropic.com/research/enabling-independent-research

Vedlegg med metode, utvalg og personvernrevisjon: https://www-cdn.anthropic.com/files/4zrzovbb/website/8a665c85eec3a63b4d86287b9255657016f50e29.pdf

Stanford SALT Lab: Human–AI Collaboration at Scale, alphaXiv.

Aggregatdata: Hugging Face, Anthropic/enabling-independent-research.

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.