Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

OpenAI dots: Astra 24/7 – Pro stengt i EØS, 4000 apper • AISI: Astra 29 prosent – falsk identitet, payload utenfor scope • OpenAI-agenter: 16 500 UNCTAD-skann – XSS-spill, 82 rate-limits • OpenAI: DNS-hull – pause i trening av de mest kapable • OpenAI-agenter la ut 53 brukerbilder – kan ikke varsle ofrene

AstaBrief 8B: 51 s – Apache, Qwen-base, eval fra 2025
Ai2CIOCISOOpen weightsVitenskapQwenAgenterApacheRapportgenerering

AstaBrief 8B: 51 s – Apache, Qwen-base, eval fra 2025

JH
Joachim Høgby
2. oktober 20262. oktober 20264 min lesingKilde: Ai2

Ai2 åpner 2. oktober 2026 vektene til AstaBrief 8B, en rapportmodell som tar et forskningsspørsmål og hentede litteraturutdrag og skriver en sitert rapport i ett pass. Lisensen er Apache 2.0. Basen er Qwen3-8B. Fast-modus i Asta, Ai2s agentplattform for vitenskap, bruker den mot Claude-drevet Thinking-modus: 51,1 sekunder mot 178,5 i hele pipelinen, om lag 3,5 ganger raskere. Trening og evaluering er fra 2025. Ai2 har ikke kjørt tallene mot dagens frontlinje.

For CIO er dette et valg om syntese bak egen brannmur, ikke en ny chatmodell. For CISO er tre ting viktigere enn 87 i labens egen tabell: Qwen-opphavet, pytorch-bin-vekter uten safetensors, og at sammenligningen er mot Claude 3.5/3.7, o3 og GPT-4.1.

Hva Ai2 faktisk slipper

AstaBrief 8B er en spesialisert tekstmodell, ikke en generell assistent. Den er trent til å skrive hele rapporten i ett løp gitt spørsmål og relevante utdrag. Den hopper over snippet-sammendrag og klynging som Thinking-modus bruker, og den skriver ikke seksjon for seksjon.

Vektene ligger på Hugging Face som allenai/AstaBrief_8B under Apache 2.0, sammen med SFT-sjekkpunktet AstaBrief_8B_SFT og DPO-settet AstaBrief_DPO_Mix. Ai2 peker på et fast prompt-format. Annet format kan gi dårligere eller ustabil oppførsel. Inferens-eksempelet på modellkortet laster SFT-sjekkpunktet, ikke DPO-modellen. Det er en felle for den som kopierer koden blindt.

I Asta ligger Fast-modus ved siden av Thinking. Blant 374 brukere som har prøvd Fast, har 29,1 prosent brukt den to dager eller mer. Snittet er 3,67 rapporttråder. 23 prosent ble i Fast og gikk ikke tilbake. 18 prosent veksler, og bruker Fast i om lag 40 prosent av trådene. Positiv tilbakemelding: 84,2 prosent mot 85,2 for Thinking. Ai2 selv kaller tilbakemeldingene for tynne til sterke konklusjoner.

Åpne vekter er poenget for institusjoner: kjør bak egen brannmur når spørsmålet rører upublisert eller sensitiv forskning. Ai2 legger ved et eksempel-workflow mot egne PDF-er. Det er startkode, ikke et ferdig produksjonssystem.

Tallene, og hva de ikke er

Modellkortet måler ScholarQA-CS2 test, 100 brukerskrevne informatikkspørsmål:

ModellSnittIngredient recallAnswer precisionCitation precisionCitation recall

Qwen3-8B77,377,890,676,264,6
AstaBrief-8B-SFT83,785,290,487,771,3
AstaBrief-8B87,090,289,090,578,2

Sekundær tabell, labens egne tall:

ModellSQA-CS2 devSQA-CS2 testDeepScholarBenchSeier mot Asta SQA (dev)Seier mot Asta SQA (test)

Asta ScholarQA87,686,260,25––
DR-Tulu-8B86,588,856,2636 %54 %
AstaBrief-8B86,387,053,5055 %72 %

AstaBrief taper DeepScholarBench mot ScholarQA-pipelinen. Den vinner LLM-dømte parvise sammenligninger mot samme pipeline på test. I en 14-spørsmåls humanstudie med tre forskere vinner DR-Tulu på samlet preferanse. To av tre foretrekker AstaBrief på siteringsnøyaktighet.

Bloggen er eksplisitt: mesteparten av trening og eval ble ferdig i 2025. Bakmodellene i treningsdataene er Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, GPT-4.1, DeepSeek-V3 og DeepSeek-R1. To dommere, GPT-4.1 og DeepSeek-R1, måtte være enige. Ai2 rapporterer 95 prosent samsvar med menneskelige preferanser på det settet. 90 000 filtrerte spørringer. 47 000 SFT-eksempler. Om lag 6 000 DPO-par. DPO på 8×H100, 7 epoker, maks 16 000 tokens, BF16.

Det er ikke et uavhengig lederboard. Det er ikke målt mot Gemini 4 Argon, GPT-6 Astra eller Claude Opus 5.5. En sitert setning kan fortsatt overdrive funnet: utvalg blir populasjon, fortid blir allmenngyldig presens, beskrivelse blir anbefaling. Ai2 sier selv at evalen ikke fanger det.

Hva ledere bør gjøre nå

Ikke bytt Claude, intern RAG eller manusmal på 51 sekunder og 87 i labens tabell. Test mot egne spørsmål: systematiske oversikter, regulatoriske notater, due diligence. Mål siteringstreff, omfangskryp og tid til første lesbar rapport. Fast er til iterasjon. Thinking er til tyngre syntese. Ai2 har bygd nøyaktig det skillet.

FinOps er åpent fordi det ikke finnes en offentlig tokenpris. Kostnaden er GPU bak brannmuren, eller Asta som produkt. 8B i BF16 er én kort, ikke et cluster. Prompt-formatet er del av kontrakten. Bytt det, og tallene faller.

CISO: Apache 2.0 fjerner lisensfriksjon. Den fjerner ikke Qwen-opphavet, og den fjerner ikke at SFT-målene er destillert fra Anthropic- og OpenAI-modeller. Sjekk om det bryter egne leverandørvilkår før vektene inn i produksjon. Vektene er fire pytorch .bin-shards, ikke safetensors. Pin commit-hash. Kjør i isolert GPU-jobb. Behold menneskelig gjennomgang der rapporten går til beslutning, publisering eller klinikk.

Ansvarlig bruk: Ai2 merker modellen for forskning og utdanning under egne Responsible Use Guidelines. Det er ikke en blanket enterprise-garanti.

Kilder og medier

Primærkilde: Ai2, Open-sourcing AstaBrief, the fast report-generation model in Asta, 2. oktober 2026: https://allenai.org/blog/astabrief

Modellkort: Hugging Face, allenai/AstaBrief_8B (Apache 2.0, finjustert fra Qwen3-8B via AstaBrief_8B_SFT).

Treningsdata: Hugging Face, allenai/AstaBrief_DPO_Mix.

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.