Meta måler multimodale agenter på leveranser, ikke fasit
Meta har begynt å måle multimodale agenter på noe ledere faktisk kjøper: en fil som kan åpnes, kuttes, vises eller sendes videre. 20. august forhåndsviste AI at Meta WildArtifactBench, et internt evalueringsrammeverk for komplekse oppgaver med ulike leveranseformater. Ti oppgaver er lagt ut offentlig. Poenget er ikke en ny fasit-leaderboard. Poenget er om agenten leverer noe som holder i parvis vurdering mot en annen agent.
Det er et skifte fra klassiske modelltester. SWE-bench og multiple choice sier noe om koding og kunnskap. De sier lite om en agent som skal lage en vanntett 3D-mesh, et laserkuttbart SVG, en medisinsk funnfil eller en 3D-modell av en mikrochip med eksplodert visning. WildArtifactBench er bygd for slike leveranser. Meta scorer med vinnrate og Elo fra menneskelige og agentiske preferansedommere, ikke bare strikte fasit-rubrikker. Det utvider dekningsflaten, og det gjør samtidig evalen mer politisk: hvem dømmer, med hvilken smak, og mot hvilken intern modell?
Offentlig forhåndsvisning inneholder ti oppgaver: Bird Sound, Cardiac Ultrasound, Cat Mesh, Coronary Stenosis, Dqn Driving, Kitchen Layout, Materials Metrology, Microchip Model, Plywood Whale og Video Editing. Meta viser side om side-artefakter fra Muse Spark 1.1 og 1.2 på Cat Mesh og Plywood Whale. Det er ikke en uavhengig rangering av alle frontier-modeller. Det er Metas egen nordstjerne for multimodal agentkapasitet, med en åpenere variant varslet senere.
Oppgavene er konkrete nok til å ta inn i et innkjøpsnotat. Cat Mesh krever en sittende lavpoly-katt som én vanntett .obj fra et referansebilde, sentrert i origo, uten hull og non-manifold kanter. Plywood Whale krever et SVG med flate, sammenlåsende biter for 3 mm kryssfiner, spor og tapper som faktisk matcher, base så figuren står, merking for monteringsrekkefølge, og prioritet på at det kan settes sammen fremfor at det ser fint ut. Microchip Model krever en DIP med 14 pinner, intern die, leadframe, bond wires og epoxy, både eksplodert visning og snitt, pluss annotering. Kitchen Layout krever at et bordoppsett fra ett bilde plasseres inn i et annet kjøkken og rendres som realistisk 3D-scene.
Så kommer de kliniske oppgavene. Cardiac Ultrasound ber agenten hente venstre ventrikkel-kontur fra en nii.gz-sekvens, lagre koordinater som JSON, tegne overlay på hvert bilde og plotte areal mot bildeindeks med en plausibel syklus. Coronary Stenosis er tyngre: åtte de-identifiserte angiografi-caser, SYNTAX-segmenter, stenose-lokalisering og alvorlighetsgrad med en maske-basert diameterregel, pluss evidens på tvers av nøkkelbilde og fire tilleggsrammer fra samme opptak. Bird Sound krever artsidentifikasjon av 46 lydfiler mot en yaml-beskrivelse, uten ferdige fugleanalysebiblioteker. I rubrikken står det åpent at modellen ikke kommer i nærheten av 46 av 46 treff. Det er mer ærlig enn de fleste leverandør-slides.
Samme dag viste Meta også nye Muse Spark 1.2-demoer utenfor selve benken: visuell inndata til fungerende kode og spill, bedre verktøybruk når modellen inspiserer bilder, audio-visuell forståelse, og robotdemoer der en variant planlegger deloppgaver, kaller verktøy og løkker til oppgaven er ferdig. Internt brukes Muse Spark mot Muse Image og Muse Video, blant annet til bildetekster og til å gjøre rå multimodal strøm om til signaler. Det er produktkontekst, ikke bevis for at WildArtifactBench er nøytral.
For CIO er signalet at innkjøp av «en modell» blir innkjøp av et leveransesystem. Hvis agenten skal produsere 3D, medisinsk dokumentasjon, layout eller kjørbar kode fra bilde og video, holder det ikke å sitere Terminal-Bench eller en chat-score. Dere må definere artefakt, format, godkjenningskriterium og hvem som får overstyre en preferansedommer. Elo mellom agenter kan rangere smak. Den kan ikke alene bære ansvar i en regulert prosess. Et laserkutt som ikke passer, en stenoseprosent uten sporbar geometri, eller en 3D-fil som ikke er vanntett, er driftsfeil, ikke modellpoeng.
CISO bør lese de medisinske oppgavene som varsellampe, ikke som leketøy. Selv de-identifiserte ultralyd- og angiografifiler er helsedata-adjacent. En agent som skriver funn-JSON, overlay og alvorlighetsprosent inn i en intern arbeidsflyt treffer dokumentasjonsplikt, sporbarhet og modellrisiko. Preferansedommere, menneskelige eller agentiske, må behandles som del av kontrollmiljøet: hvem trener dem, hvilke eksempler de har sett, og om leverandørens egen modell får hjemmebanefordel. Logging av mellomfiler, 3D-assets og medisinske plot tilhører samme dataklasse som kilden, ikke «bare eval-output».
Begrensningene er like viktige som oppgavene. Dette er en forhåndsvisning med ti oppgaver, ikke et åpent, tverrgående leaderboard. Meta eier rammeverket, viser egne 1.1-mot-1.2-eksempler og sier at en mer åpen versjon kommer. Preferansedømming utvider dekning, men den kan belønne overbevisende utseende fremfor målbar korrekthet, særlig der rubrikken allerede blander visuell smak og fysisk monterbarhet. Muse Spark 1.2-lanseringen 5. august, med Muse Code, er en annen sak. WildArtifactBench er eval-laget oppå den historien, ikke en ny basismodell.
Riktig lederrespons er en kontrollert artefaktpilot, ikke en ny modellkontrakt. Velg tre oppgavetyper som ligner deres egne leveranser: én geometrisk (mesh/SVG/CAD), én dokumenterende (JSON pluss evidensbilder) og én multimodal koding fra visuell inndata. Kjør samme brief mot minst to leverandører. Mål om filen åpner, om mål stemmer, om et menneske kan godkjenne uten å gjenskape arbeidet, og hvor lang tid som går med på opprydding. Da får dere et tall som betyr noe i styret: andel godkjente leveranser, ikke andel vunne Elo-kamper.
Kilder og medier
Primærkilde: AI at Meta – https://x.com/AIatMeta/status/2090505413817246050 Verifisering: Meta AI Research, WildArtifactBench-forhåndsvisning med ti oppgaver, blant annet Cat Mesh og Plywood Whale: https://research.meta.ai/wild-artifact-bench/cat-mesh og https://research.meta.ai/wild-artifact-bench/plywood-whale Muse Spark 1.2-lansering 5. august 2026: https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2 Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.