HF: 62 mot 33 i harness – LFM 42 til 54 prosent
Hugging Face har sluppet en åpen guide og syv treningskjøringer som rammer inn et problem de fleste innkjøp av kodeagenter fortsatt ignorerer: poengsummen måler harnessen like mye som modellen.
Samme vekter, samme oppgaver. LFM2.5-2.6B fra Liquid AI løser 62 prosent under Mini-SWE-Agent og 33 prosent under Claude Code. Joel Niklaus, medforfatter og Hugging Face-ansatt, målte GLM-5.2 til 23 prosent i én harness og 52 prosent i en annen på SWE-bench Pro. En annen test med tre modeller som ligger innen tre poeng på en offentlig ledertavle, viser at harnessbytte flyttet GLM-5.1 med 13 poeng, mens modellbytte inne i samme harness flyttet scoren 2,5 til 5.
Hva som er sluppet
Artikkelen «The ultimate guide to multi-harness RL» ligger som Hugging Face Space, datert 1. oktober 2026. Forfatterne er fra Hugging Face, med Leonie Monigatti fra Liquid AI. Rammeverket bruker OpenEnv-capture-proxy, Harbor-oppgaver og TRL Async GRPO. Harnessene kjører uendret: Claude Code 2.1.270, Codex 0.154.0, OpenCode 1.18.31 og Mini-SWE-Agent 2.4.6.
Proxyen snakker fire API-formater (OpenAI Chat Completions, OpenAI Responses, Anthropic Messages og Gemini), tar vare på eksakte token-id-er og logprobs fra vLLM, og trener uten å røre harnesskoden. Harbor 0.22.0 har adaptere for mer enn 40 harnesser. OpenEnv har validert ti ende-til-ende.
Syv sjekkpunkter ligger på Hub: LFM2.5-2.6B og Qwen3.5-2B, RL og SFT, multi-harness og OpenCode-only. LFM-vektene er under LFM Open License v1.0, ikke Apache. Qwen-kjøringen er Apache 2.0. Dette er ikke offisielle Liquid- eller Qwen-utgivelser.
Tallene
Testen er 250 faste SmolDataEnvs-oppgaver, fire harnesser, 1000 celler. Pass@1 er første graderte forsøk.
LFM2.5-2.6B, multi-harness RL, steg 1000: 54,2 prosent totalt (542 av 1000). OpenCode 49,6. Claude Code 48,8. Codex 53,6. Mini-SWE-Agent 64,8. Basen lå på 42 prosent. Verktøykallene falt 31,1 prosent på 356 oppgave/harness-par begge løste.
OpenCode-only RL: 34 til 58 prosent i OpenCode, 52,3 prosent totalt. Bedre i OpenCode (58 mot 50), svakere i Claude Code (42 mot 49) og Codex (43 mot 54).
SFT på 3189 vellykkede ruller fra Qwen3.8-27B: beste SFT 47,5 prosent, multi-harness SFT 43,1. RL slår imitasjon. Artikkelen velger beste RL-sjekkpunkt på testsettet (steg 700, 54,6 prosent). Det flatterer RL litt.
Qwen3.5-2B multi-harness RL ender på 37,0 prosent. Annen oppgaveblanding, kortere kjøring, ingen effektivitetsbonus.
Hva det betyr for CIO og CISO
Hvis dere kjøper eller rangerer kodeagenter på én intern Cursor-, Claude Code- eller Codex-score, måler dere harnessen. Skal modellen inn i en annen loop, kan den falle hardt, inkludert formatkollaps der verktøykallene blir ugyldige.
Krav til innkjøp og evaluering: krev harnessnavn, versjon og tokenbudsjett på alle agenttall. Test i den harnessen som skal i produksjon, ikke i leverandørens. Åpne vekter som skal erstatte en stengt agent, må trenes eller i det minste evalueres i deres loop.
Begrensningene er tydelige. Resultatene er enkeltkjøringer på et dataanalyse-sett, ikke SWE-bench. 2,6B er ikke frontier. Gapet mellom OpenCode-only og multi-harness totalt er 1,9 poeng og innen støy. Per-harness-mønsteret er poenget, ikke totaltallet.
Kilder og medier
Primærkilde: Hugging Face, «The ultimate guide to multi-harness RL», publisert 1. oktober 2026. https://huggingface.co/spaces/FineEnvs/multi-harness-rl
Modellkort: FineEnvs/LFM2.5-2.6B-multiharness-RL. https://huggingface.co/FineEnvs/LFM2.5-2.6B-multiharness-RL
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.