Stability AI tõi turule ärikvaliteediga heligeneratsiooni mudeli

Stable Diffusioni looja Stability AI käivitas Stable Audio 2.5, helimudeli, mis on loodud ärikasutuseks kvaliteetse muusika ja taustaheli tootmiseks suurtes kogustes. Mudelil on vähem kui 2-sek järelduskiirus (GPU peal), mis võimaldab luua kuni 3 min pikkuseid lugusid.

Stability AI sõnul on kohandatud heli ettevõtete jaoks veel avastamata maa, mis lubab teistest eristuda. Ettevõtted peavad looma endale ainulaadse kõla, et toita kasvavat hulka kanaleid – reklaamidest kuni kaupluses esitatava muusikani.

Ekspertide kommentaarid:

  • Bradley Shimmin (Futurum Group): paljud mudeliloojad on olnud muusika­generatsiooni osas ettevaatlikud, kuna valdkond on seotud autoriõiguste rikkumise ja kohtuvaidluste riskiga. „Iga ettevõte, kes teeb äri – olgu see tarkvaratootja, rakenduse arendaja, müügitiim või tugiteenused – vajab heli, sest see puudutab otseselt inimeste kogemust.“ Shimmin lisas, et mudeli inpainting omadust saab kasutada ka kontaktikeskustes või klienditeeninduse keskkondades, kus heli on osa häälassistendist, kioskist või müügiseadmest.
  • Arun Chandrasekaran (Gartner): mudelil on suurim potentsiaal sellistes valdkondades nagu disain, turundus ja kommunikatsioon, kus tiimid võiksid helimudelitest kasu saada. Tõenäoliselt sihib Stability AI SaaS-rakendusi, mis pakuvad multimodaalset AI-d või helitootmise funktsionaalsust.

Stability AI rõhutas, et mudel on äriliselt turvaline ja treenitud täielikult litsentseeritud andmestikul. Stable Audio 2.5 on saadaval Stability AI API kaudu ning platvormidel nagu Replicate, ComfyUI ja Fal.

Stable Audio 2.5 mudeli omadused

  • kolme minuti pikkusega lood < 2 sekundiga
  • optimeeritud muusika jaoks, parendatud muusikaline struktuur: mitmeosaline kompositsioon (sissejuhatus, areng, lõpetamine)
  • treenitud Adversarial Relativistic-Contrastive (ARC) meetodil
  • toetab audio-to-audio ja text-to-audio funktsionaalsust
  • võimaldab audio inpainting’ut: kasutaja saab oma heli üles laadida, määrata alguspunkti ning mudel genereerib ülejäänu konteksti alusel
  • tugev prompt’ide järgimine, reageerib paremini meeleolu kirjeldustele (n „uplifting“) ja muusikalisele sõnavarale žanrite kaupa („lush synthesizers“)
  • võimalus mudelit peenhäälestada ettevõtte heliraamatukogu põhjal, et lisada brändi signatuurheli
  • võimalik käitada ettevõtte enda infrastruktuuris.

Näited ärirakendustest

  • Dünaamilise muusika loomine „reaalajas“
  • Heli­bränding: agentuurid (n Amp) loovad ettevõtetele unikaalse helipildi
  • Videomängude avatiitrid
  • Kaupluse taustamuusika
  • Bränditud teavitustoon, nagu krediitkaardi maksepiiks
  • Auto helisüsteemide kõlad ja signatuurhelid
  • Reklaamvideote ja sotsiaalmeedia klippide taustamuusika automaatne loomine
  • Podcastide ja veebiseminaride helitaustad või üleminekud
  • Personaalsed heliteavitused mobiilirakendustes (nt teated, äratused, meeldetuletused)
  • Messiboksides või turundusüritustel kasutatavad helitaustad
  • Kinoreklaamide või treilerite heliefektid ja muusika
  • Virtuaalreaalsuse (VR) ja liitreaalsuse (AR) keskkondade helidisain
  • Spordiklubide, hotellide ja restoranide kohandatud taustamuusika

Viited
https://stability.ai/stable-audio
https://stability.ai/news/stability-ai-introduces-stable-audio-25-the-first-audio-model-built-for-enterprise-sound-production-at-scale
https://aibusiness.com/generative-ai/stability-ai-releases-audio-generation-model-for-enterprises

Demo
https://stableaudio.com/