Perplexity pplx-embed v2: 1 kB, MIT, preview uten API
Perplexity slipper 30. september 2026 pplx-embed-v2-context-9b-preview. Det er en kontekstuell embedding-modell for RAG: hele dokumentet kodes i ett løp, og hvert chunk får en vektor som kjenner naboene. Vektene ligger på Hugging Face under MIT. API-en er ikke åpen ennå. Modellkortet merker den som preview. Vekter, grensesnitt og embeddings kan endres uten bakoverkompatibilitet. Indekser du bygger nå, skal ikke blandes med en senere versjon.
For CIO er dette et kost- og leverandørvalg. Voyage Context 4 er hostet API. Perplexity gir self-host med MIT, 1024-dim int8 på 1 kB per vektor, og hevder at det slår Voyage på 2048-dim float32 (8 kB) i deres chunk-retrieval-sett. For CISO er tre ting viktigere enn nDCG: lasting krever trust_remote_code=True, custom_code-klassen heter modeling_pplx_contextual.PplxContextualModel, og GPU er påkrevd. Det er forsyningskjede, ikke en pip-install uten gjennomgang.
Hva Perplexity faktisk slipper
pplx-embed-v2-context-9b-preview er bygget for dokument-chunks, ikke chat. Dokumentet sendes inn som en liste av chunks. Chunks kodes sammen, så hver embedding speiler resten av dokumentet. Én embedding per chunk. Hugging Face lister 8,40 milliarder F32-parametere. Bloggen kaller den 9B. Dimensjonene er 2048, med Matryoshka på 1024 og 2048. Native int8. Ingen instruction-prefiks, faste query- og dokumentprefiks, mean pooling. Krever transformers 5.4.0 eller nyere.
Queries og dokumenter kodes med ulike metoder. encode_queries til spørsmål, encode til chunks. Modellkortet advarer at encode på queries senker retrieval-kvaliteten stille. Embeddings kommer unormaliserte. Sammenlign med cosinus, eller sett normalize_embeddings=True og bruk prikkprodukt. Andre trunkeringsstørrelser enn 1024 og 2048 er ikke trent.
Treningen, slik Perplexity beskriver den, erstatter ett gull-chunk per spørring med destillasjon fra labens query-aware context compression-modell. Læreren scorer hvert token mot spørringen. Chunk-relevans er snittet av de høyeste token-scoreene i chunken. Softmax over chunks i det positive dokumentet gir myke mål. Studenten trenes med forward KL. Dokumenttap er InfoNCE der dokumentet scorer som beste chunk. Læreren kjører bare i trening, så inferens får verken ekstra latens eller lagring. Startpunktet er en intern 9B ColBERT. Perplexity sier de trenet på om lag 430 datasett i over 50 språk, uten ConTEB-data.
Tallene, og hva de ikke er
Perplexity hevder SOTA på ConTEB og på turbopuffers nye, privat holdte context-bench. Bench-en har 2 099 spørringer over 38 894 dokumenter i 21 domener og 2 458 072 setnings-chunks. Median måldokument er om lag 6 100 tokens. Perplexity sier innsendingen var blind.
Labens egne K=10-tall på context-bench: 45,5 prosent answer recall, 40,6 prosent evidence recall, 31,1 prosent all-evidence recall. Document recall er 15,2 prosent ved K=1 og 61,6 prosent ved K=10. Mot voyage-context-4: pluss 14,4 poeng på answer og 5,0 på evidence ved K=10. Chunk-størrelse fra 64 til 512 tokens flytter gjennomsnittsscore fra 81,0 til 79,9 prosent på 74 MTEB-oppgaver, ifølge Perplexity.
context-bench er privat. Vi har ikke et åpent lederboard å kryssjekke mot. Voyage-tallene i gap-tabellen kommer fra Perplexity, ikke fra Voyage. ConTEB er offentlig, men v1-4B vinner NarrativeQA og Nemotron-3-Embed-8B vinner COVID-QA i Perplexitys egen visning. v2 leder snittet, ikke alle deloppgaver. Det er nok til å teste. Det er ikke nok til å bytte produksjonsindeks i morgen.
Hva ledere bør gjøre nå
Ikke bygg produksjons-RAG på preview-vekter. Modellkortet sier eksplisitt at embeddings fra denne utgaven ikke skal blandes med en senere. Re-indeksering av hele corpus koster mer enn å vente på API og stabil sjekksum.
CISO-sjekk før last: trust_remote_code=True betyr at du kjører Perplexitys custom Python fra Hugging Face. Pin commit-hash, kjør i isolert GPU-jobb, og behandl det som tredjepartskode, ikke som en uskyldig safetensors-fil. MIT fjerner lisensfriksjon. Den fjerner ikke kjøretidsrisiko.
FinOps: 1 kB per vektor ved 1024-dim int8 kutter lagringsregningen mot 8 kB float32. Det hjelper når corpus er millioner av chunks. Inferenskostnaden er GPU-tid for en 8-9B-modell, ikke 0,12 dollar per million tokens som hos Voyage. Regn begge sider. v1-familien ligger allerede i Perplexity API. v2-context gjør det ikke.
Hvis dere allerede kjører RAG mot kontrakter, prosedyrer eller kundesaker: test answer og evidence, ikke bare document@10. Perplexitys poeng er at ett gull-avsnitt ikke er det juristene og saksbehandlerne trenger. De trenger svaret og konteksten som gjør det etterprøvbart. Det er den lederen skal måle, uansett leverandør.
Kilder og medier
Primærkilde: Perplexity, «Contextual embedding beyond the gold passage», 30. september 2026: https://www.perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage
Modellkort: Hugging Face, perplexity-ai/pplx-embed-v2-context-9b-preview (MIT).
Sekundærkilder: MarkTechPost og AlphaSignal bekrefter preview, MIT-vekter, at API mangler, og at context-bench er privat hos turbopuffer.
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.