Kumo Tabular: 28–215M – TabArena 1950, OpenMDW 1.1
NVIDIA slipper Kumo Tabular 29. september 2026. Det er en åpen foundation-modell for prediksjon i tabeller: klassifisering og regresjon i én forward-pass, uten trening, uten hyperparameterjakt og uten feature engineering. Tre størrelser, fra 28 millioner til 215 millioner parametere. Vektene ligger på Hugging Face under OpenMDW-1.1, som tillater kommersiell bruk. Koden er GPU-nativ i biblioteket structured-data-models.
For CIO er poenget at churn, kreditt, krav og etterspørsel fortsatt bor i tabeller, ikke i chatten. For CISO er poenget at pretreningen er syntetisk. Kundedata gikk ikke inn i vektene. Inferens krever likevel at labeled rader sendes som kontekst til GPU-en dere selv kjører.
Hva NVIDIA faktisk skipper
Kumo Tabular er ikke et språkmodell-API og ikke en ny chatbot. Den leser en tabell med labeled rader som kontekst og predikerer unlabeled rader. Klassifikasjon og regresjon er egne vekter: small, medium og large har hver classifier.pt og regressor.pt på Hub.
Arkitekturen er en Transformer rundt tabellstruktur. Celle-embedding gjør en gruppe celler til et token. Numeriske og kategoriske verdier går gjennom Fourier-trekk med egne vekter. Manglende verdier trenger ikke imputering. Rad-embedding veksler kolonne- og rad-oppmerksomhet. Et siste Transformer-trinn gjør in-context learning: kontekstrader ser på hverandre, spørrader ser bare på kontekst. Regresjonshodet gir 999 kvantiler, altså punktestimat og usikkerhet.
Pretrening skjer kun på kunstige tabeller, samplet fra strukturelle kausale modeller. Small, medium og large så om lag 35, 71 og 137 millioner syntetiske tabeller. Treningen går i tre steg, fra 1 024 rader opp til 60 000 rader, fortsatt med inntil 100 kolonner. Treningsoppskrift og datageneratorer «kommer snart». Det som er åpent nå, er vektene og inferenskoden, ikke hele treningspipen.
Biblioteket er Apache 2.0. Vektene er OpenMDW-1.1. Runtime er Python 3.11, PyTorch 2.7 og CUDA. pip install structured-data-models. Ingen Inference Provider på Hub. Ingen hosted SLA. Dere kjører den selv.
Samme biblioteket har også TabICLv2, Googles TabFM og KumoRelational. Kumo Tabular er én flat tabell. Relasjonelle prediksjoner over flere tabeller er et annet produkt.
Tallene NVIDIA viser
TabArena, default innstillinger, mot tunede gradient-boosted trees, AutoGluon og andre tabular foundation-modeller: Kumo Tabular først totalt, ELO 1950. NVIDIA oppgir 17 ganger raskere prediksjon enn LimiX-2 på én RTX 6000 Pro.
BeyondArena: ELO 1418, Improvability 7,78 prosent, førsteplass.
TALENT: topp totalt på klassifikasjonsnøyaktighet, log-loss og regresjons-RMSE. Gjennomsnittsrang 6,67, 3,98 og 4,22.
ScoringBench, som måler prediktive fordelinger: Large og Medium første og andre på gjennomsnittsrang.
Tallene er NVIDIAs egne, kjørt mot offentlige lederboards under labens oppsett. Det er ikke en uavhengig revisjon av produksjonsnøyaktighet på norske kundedata.
Hva som ikke skippes
Bare numeriske og kategoriske kolonner. Tekst, bilder og tidsstempler må trekkes om til features via innebygde oppskrifter.
Én forward-pass dekker inntil 10 klasser. Flere klasser går via error-correcting output codes i biblioteket.
Nøyaktighet kan falle når tabellen er langt utenfor treningsområdet, eller når spørrader kommer fra en annen fordeling enn konteksten. NVIDIA sier selv: valider nøyaktighet og kalibrering på egne hold-out-data før produksjon.
Ingen EU-geo. Ingen ZDR-kontrakt. Ingen modellkort med cyber- eller bioklassifisering i GPT-forstand. Dette er prediksjon, ikke en agent.
Hva leder bør gjøre
Tabular ML er der pengene sitter: kreditt, churn, prising, svindel, lager. Gradient-boosted trees har vært standard i to tiår. En åpen modell som predikerer uten per-oppgave-trening kutter AutoML-køen. Den flytter risikoen til kalibrering, skjevhet og GPU-binding på deres data.
CISO: syntetisk pretrening fjerner treningsdata-lekkasje fra laben. Inferens sender likevel labeled rader inn i GPU-konteksten. Kjør on-prem eller i kontrollert VPC. Les OpenMDW-1.1 med juridisk. Ikke putt persondata i kontekst uten DPIA.
CIO: dette er NVIDIAs inn i den siste store ML-flaten som ikke allerede kjører på deres jern. Motvekt: vektene er åpne, koden er Apache 2.0, dere kan bytte. Ikke bytt ut kredittscoren i produksjon på et blogginnlegg. Kjør parallellskygge mot XGBoost eller LightGBM på deres hold-out. Mål kalibrering, ikke bare ELO.
Kilder og medier
Primærkilde: NVIDIA, https://huggingface.co/blog/nvidia/kumo-tabular
Modellvekter: https://huggingface.co/nvidia/Kumo-Tabular
Kode: https://github.com/NVIDIA/structured-data-models
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.