Hopp til hovedinnhold
 AI-nyheter, ferdig filtrert for ledere
SISTE:

Dommer river Pentagons Anthropic-svartelisting – kaller den grunnløs • Alabama stevner OpenAI etter agentinnbruddet i Hugging Face • Bloomberg: NVIDIA-kunder varsles om over 15 prosent prishopp på AI-servere • OpenAI kutter GPT-5.6 Sol mer enn 20 prosent – i tre måneder

Breeze TTS 2 leder åpne stemmer – lisensen stenger produksjon
AI-modellerTTSOpen WeightsArtificial AnalysisCIOCISO

Breeze TTS 2 leder åpne stemmer – lisensen stenger produksjon

JH
Joachim Høgby
26. august 202626. august 20266 min lesingKilde: Hugging Face

Breeze TTS 2 er den beste åpne tekst-til-tale-modellen i Artificial Analysis’ Provider Voices-arena. Elo er 1 215. Det er 90 poeng foran Fish Audio S2 Pro og sjetteplass totalt blant over 100 systemer. Vektene og PyTorch-koden kom på Hugging Face 25. august 2026. For en leder som vurderer stemmeagenter er det to tall som teller mer enn rangeringen: lisensen, og at egenhostet output også er ikke-kommersielt.

Modellen er 3 milliarder parametre. Eager inferens bruker om lag 7,7 GiB GPU-minne. Anbefalt minimum er 12 GB. Hurtigstien vil ha 24 GB. BreezeBlue, under RESONIA, INC., beskriver tre modus: kloning fra referanseaudio og nøyaktig transkript, stemmedesign fra naturlig språk uten referanse, og stemmedireksjon der identiteten beholdes mens tone, tempo og emosjon styres. Inline-hendelser som latter og hoste kan settes inn i teksten. Koden er Apache 2.0. Vektene, derivater og egenhostet output ligger under BreezeBlue Research and Non-Commercial License. Kommersiell bruk krever skriftlig autorisasjon. Hostet API er en annen avtale.

Hva den uavhengige evalen faktisk viser

Artificial Analysis skiller to spor. Provider Voices bruker modellens egne stemmer. Der leder Breeze TTS 2 åpne vekter med 1 215 Elo, foran Fish Audio S2 Pro på 1 125 og Step Audio EditX på 1 102. Totalt er den nummer seks. Controlled Voices tvinger alle modeller til samme referansetaler. Der er Breeze TTS 2 nummer tre blant åpne vekter med 1 002 Elo, likt Fish Audio S2 Pro, og åtte poeng bak Mistrals Voxtral TTS på 1 010. Totalt er den nummer 16 av 39. Kvalitetsledelse på egne stemmer er ikke det samme som kloningskvalitet mot en fasitstemme.

Hastighet og pris peker motsatt vei av Elo. AA måler 45 tegn per sekund. Fish Audio S2 Pro tar 102. Hostet BreezeBlue-endepunkt koster 34 dollar per million tegn. Fish ligger på 15. Vektene kan lastes ned, men «last ned og kjør selv» er ikke en gratis produksjonssti. Lisensen stenger den.

Leverandøren hevder under 40 ms tid til første lyd og 0,32 real-time factor på varm H100-hurtigsti, om lag 3,1 ganger sanntid. Det er laboratorietall, ikke AA-måling. AA-hastigheten er den som skal inn i kapasitetsregnskapet. Streaming-API-en i det åpne runtime-et er dokumentert som én parallell forespørsel. Det er prototyp, ikke kø.

Lisens, språk og kloningsrisiko

Modellkortet merker engelsk og kinesisk. BreezeBlue og AA-tråden hevder 50 språk. Ikke bokfør 50 språk i en innkjøpsmatrise før du har hørt målspraakene du faktisk skal i produksjon med. Norsk er ikke dokumentert som førsteklasses i modellkortet.

CISO-saken er kloning. Referanseaudio pluss transkript bevarer klang, rytme og stil. Direksjon styrer leveransen uten å bytte identitet. Det er nyttig i kundeservice. Det er også et verktøy for etterligning. BreezeBlue forbyr uautorisert kloning, bedrageri og skadelig bruk. Forbud i en lisensfil er ikke kontroll. Krever du stemmeagenter, krev samtykke, vannmerke, logging av referanseaudio og forbud mot leder- og kundeforveksling i policy, ikke i README.

«Åpne vekter» er misvisende for enterprise. Koden kan du lese. Vektene kan du laste ned. Du kan ikke ta dem inn i et kundesystem, en intern hjelpelinje eller en produktstemme uten avtale. Output fra egen host er også lisensbelagt. En PoC på en 12 GB-GPU kan være lovlig forskning. Samme container bak innlogging er en kommersiell handling. Kontaktpunktet for lisens er contact@breeze.blue.

Hva du gjør med det

Bokfør Breeze TTS 2 som en åpen TTS-topp i preferanse, med tre styringsmerker. For det første: Elo på egne stemmer er høy, kloningsspor og hastighet er det ikke. For det andre: 3B og 12 GB gjør lokal test billig, men enkeltløps-API og 45 tegn/s er ikke contact-center-kapasitet. For det tredje: ikke-kommersiell lisens på vekter og output gjør Hugging Face-kortet til en evalueringspakke, ikke en produksjonspakke.

Sammenlign mot Fish Audio S2 Pro og Mistral Voxtral TTS på det sporet du faktisk kjøper: egne stemmer, klonet merkevarestemme, eller styrt referanse. Mål norsk, latenstid til første lyd og tegn per sekund på deres tekst, ikke på leverandørens H100-hurtigsti. Hold ElevenLabs, OpenAI Realtime og Grok Voice utenfor denne tabellen. De er proprietære speech-to-speech-agenter, ikke TTS-vekter. hogby.ai har allerede vist i Speech Agent Arena at stemmen folk liker, ofte ikke er den som fullfører saken.

Følg etter når RESONIA publiserer kommersiell vektslisens, når AA oppdaterer Controlled Voices, og når noen uavhengig måler norsk og flerkanals streaming. Inntil da: ranger den, test den, ikke rull den ut som åpen infrastruktur.

Kilder og medier

Primærkilde: Hugging Face, BreezeBlue/Breeze-TTS-2, vekter og modellkort, 25. august 2026: https://huggingface.co/BreezeBlue/Breeze-TTS-2

Sekundært: Artificial Analysis, Breeze TTS 2-modelside og Provider Voices Speech Arena; BreezeBlue, «Introducing Breeze TTS 2»; GitHub breezeblue-ai/breeze-tts.

Thumbnail: OpenAI Image 2 / hogby.ai

📬 Likte du denne?

AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.