AI-modeller og plattformer
Stability AI lanserer Stable Audio 2.0: Empowerer kreatører med avansert AI-generert lyd

Stability AI har igjen presset grensene for innovasjon med lanseringen av Stable Audio 2.0. Dette banebrytende modellen bygger på suksessen til sin forgjenger, og introduserer en rekke banebrytende funksjoner som lover å revolusjonere måten kunstnere og musikere skaper og manipulerer lydinnhold.
Stable Audio 2.0 representerer en betydelig milepæl i utviklingen av AI-generert lyd, og setter en ny standard for kvalitet, fleksibilitet og kreativ potensiale. Med sin evne til å generere full-lengde spor, transformere lydprøver ved hjelp av naturlige språkliggjøring, og produsere en rekke lydeffekter, åpner denne modellen opp en verden av muligheter for innholdsskapere over ulike bransjer.
Ettersom etterspørselen etter innovative lydløsninger fortsetter å vokse, er Stability AI’s nyeste tilbud godt posisjonert til å bli et uerstattelig verktøy for profesjonelle som søker å forbedre sin kreative utgang og strømlinje sin arbeidsflyt. Ved å utnytte kraften fra avansert AI-teknologi, gir Stable Audio 2.0 brukerne mulighet til å utforske ukjente territorier i musikkomposisjon, lyddesign og lydpostproduksjon.
Hva er de viktigste funksjonene i Stable Audio 2.0
Stable Audio 2.0 har en imponerende rekke funksjoner som kan omdefinere landskapet for AI-generert lyd. Fra full-lengde spor-generering til lyd-til-lyd-transformasjon, forbedret lydeffektproduksjon og stiloverføring, gir denne modellen skapere en komprehensiv verktøykasse for å bringe deres auditive visjoner til live.
Full-lengde spor-generering
Stable Audio 2.0 skiller seg ut fra andre AI-genererte lydmodeller med sin evne til å skape full-lengde spor opptil tre minutter lange. Disse komposisjonene er ikke bare forlengete utdrag, men heller strukturerte stykker som inkluderer distinkte seksjoner som en introduksjon, utvikling og avslutning. Denne funksjonen gir brukerne mulighet til å generere fullstendige musikalske verk med en koherent narrativ og fremgang, og hever potensialet for AI-assistert musikk-skaping.
I tillegg inkorporerer modellen stereo lydeffekter, som legger til dybde og dimensjon til den genererte lyden. Denne inklusjonen av romlige elementer forbedrer realismen og den immersive kvaliteten til sporene, og gjør dem egnet for en rekke anvendelser, fra bakgrunnsmusikk i videoer til selvstendige musikalske komposisjoner.
Lyd-til-lyd-generering
En av de mest spennende tilleggene til Stable Audio 2.0 er lyd-til-lyd-genereringskapasiteten. Brukere kan nå laste opp sine egne lydprøver og transformere dem ved hjelp av naturlige språkliggjøring. Denne funksjonen åpner opp en verden av kreative muligheter, og gir kunstnere og musikere mulighet til å eksperimentere med lydmanipulasjon og regenerasjon på måter som tidligere var utenkelige.
Ved å utnytte kraften fra AI, kan brukerne enkelt modifisere eksisterende lydaktiva for å tilpasse dem til deres spesifikke behov eller kunstneriske visjon. Enten det er å endre timbren til et instrument, å endre humøret til et stykke, eller å skape helt nye lyder basert på eksisterende prøver, gir Stable Audio 2.0 en intuitiv måte til å utforske lydtransformasjon.
Forbedret lydeffektproduksjon
I tillegg til sin musikk-genereringskapasitet, utmerker Stable Audio 2.0 seg i skapelsen av diverse lydeffekter. Fra diskrete bakgrunnsskyer som lyden av blad som rustler eller summen av maskineri til mer immersive og komplekse lydlandskap som travle bygater eller naturlige miljøer, kan modellen generere en rekke lydelementer.
Denne forbedrede lydeffektproduksjonsfunksjonen er spesielt verdifull for innholdsskapere som arbeider i film, TV, videospill og multimediaprojekter. Med Stable Audio 2.0 kan brukerne raskt og enkelt generere høykvalitets lydeffekter som ellers ville kreve omfattende foley-arbeid eller dyre lisensiert aktiva.
Stiloverføring
Stable Audio 2.0 introduserer en stiloverføringsfunksjon som gir brukerne mulighet til å endre den estetiske og tonale kvaliteten til generert eller lastet opp lyd. Denne kapasiteten gjør det mulig for skapere å tilpasse lydutgangen til å matche de spesifikke temaene, sjangrene eller emosjonelle undertoner til deres prosjekter.
Ved å anvende stiloverføring, kan brukerne eksperimentere med ulike musikksjangre, blande sjangre eller skape helt nye lydpaletter. Denne funksjonen er spesielt nyttig for å skape sammenhengende soundtrack, tilpasse musikk til å matche visuell innhold eller utforske kreative mashups og remixer.
Teknologiske fremsteg i Stable Audio 2.0
Under overflaten er Stable Audio 2.0 drevet av banebrytende AI-teknologi som muliggjør dens imponerende ytelse og høykvalitetsutgang. Modellens arkitektur er blitt nøye designet for å håndtere de unike utfordringene ved å generere koherente, full-lengde lydkomposisjoner samtidig som den opprettholder fin-granet kontroll over detaljene.
Latent diffusjonsmodellarkitektur
I kjernen av Stable Audio 2.0 ligger en latent diffusjonsmodellarkitektur som er optimalisert for lydgenerering. Denne arkitekturen består av to nøkkelkomponenter: en høyt komprimert autoencoder og en diffusjonstransformator (DiT).
Autoencoderen er ansvarlig for å effektivt komprimere rå lydbølger til kompakte representasjoner. Denne komprimeringen gjør det mulig for modellen å fange de essensielle funksjonene til lyden samtidig som den filterer ut mindre viktige detaljer, og resulterer i mer koherent og strukturert generert utgang.
Diffusjonstransformatorn, lignende den som er brukt i Stability AI’s banebrytende Stable Diffusion 3-modell, erstatter den tradisjonelle U-Net-arkitekturen som ble brukt i tidligere versjoner. DiT er spesielt egnet til å håndtere lange sekvenser av data, og gjør det mulig for modellen å prosessere og generere utvidede lydkomposisjoner.

Forbedret ytelse og kvalitet
Kombinasjonen av den høyt komprimerte autoencoderen og diffusjonstransformatorn gjør det mulig for Stable Audio 2.0 å oppnå bemerkelsesverdige forbedringer i både ytelse og utgangskvalitet sammenlignet med sin forgjenger.
Autoencoderens effektive komprimering gjør det mulig for modellen å prosessere og generere lyd med en raskere rate, og reduserer de komputasjonelle ressursene som kreves, og gjør det mer tilgjengelig for en bredere rekke av brukere. Samtidig sikrer diffusjonstransformatorns evne til å gjenkjenne og reproducere store strukturer at den genererte lyden opprettholder en høy kvalitet og musikalsk integritet.
Disse teknologiske fremstegene kulminerer i en modell som kan generere slående realistisk og emosjonelt resonant lyd, enten det er en full-lengde musikalsk komposisjon, en kompleks lydlandskap eller en diskret lydeffekt. Stable Audio 2.0’s arkitektur legger grunnlaget for fremtidige innovasjoner i AI-generert lyd, og åpner veien for enda mer sofistikerte og uttrykksfulle verktøy for skapere.
Skaperrettigheter med Stable Audio 2.0
Ettersom AI-generert lyd fortsetter å utvikle seg og bli mer tilgjengelig, er det viktig å adresse de etiske implikasjonene og sikre at skaperrettighetene beskyttes. Stability AI har tatt proaktive skritt til å prioritere etisk utvikling og rettferdig kompensasjon for kunstnere hvis arbeid bidrar til treningen av Stable Audio 2.0.
Stable Audio 2.0 ble utviklet eksklusivt på en lisensiert datasett fra AudioSparx, en pålitelig kilde for høykvalitets lydinnhold. Denne datasett består av over 800 000 lydfiler, inkludert musikk, lydeffekter og enkelt-instrumentstammer, samt tilhørende tekstmetadata. Ved å bruke en lisensiert datasett, sikrer Stability AI at modellen er bygget på en basis av lovlig innhentet og korrekt attributert lyddata.
Stability AI anerkjenner viktigheten av skaperautonomi, og ga alle kunstnere hvis arbeid er inkludert i AudioSparx-datasettet mulighet til å trekke seg ut fra å bruke deres lyd i treningen av Stable Audio 2.0. Denne uttrekksmekanismen gjør det mulig for skapere å opprettholde kontroll over hvordan deres arbeid brukes, og sikrer at bare de som er komfortable med å bruke deres lyd til AI-trening er inkludert i datasettet.
Stability AI er dedikert til å sikre at skapere hvis arbeid bidrar til utviklingen av Stable Audio 2.0, får rettferdig kompensasjon for deres innsats. Ved å lisensiere AudioSparx-datasettet og gi uttrekksalternativer, demonstrerer selskapet sin tilknytning til å etablere en bærekraftig og rettferdig økonomi for AI-generert lyd, hvor skapere respekteres og belønnes for deres bidrag.
For å ytterligere beskytte skaperrettighetene og forebygge brudd på opphavsrett, har Stability AI inngått samarbeid med Audible Magic, en ledende leverandør av innholdsgjenkjenningsteknologi. Ved å integrere Audible Magic’s avanserte innholdsgjenkjenningssystem (ACR) i lydlastingsprosessen, kan Stable Audio 2.0 identifisere og markere potensielt krenkende innhold, og sikre at bare originalt eller korrekt lisensiert lyd brukes innenfor plattformen.
Gjennom disse etiske overveielser og skaper-sentriske initiativer, setter Stability AI en sterk presedens for ansvarlig AI-utvikling i lyddomenet. Ved å prioritere skaperrettighetene og etablere klare retningslinjer for dataanvendelse og kompensasjon, skaper selskapet en samarbeidende og bærekraftig miljø hvor AI og menneskelig kreativitet kan sameksistere og blomstre.
Forming the Future of Audio Creation with Stability AI
Stable Audio 2.0 markerer en betydelig milepæl i AI-generert lyd, og gir skapere en komprehensiv samling av verktøy til å utforske nye grenser i musikk, lyddesign og lydproduksjon. Med sin banebrytende latent diffusjonsmodellarkitektur, imponerende ytelse og tilknytning til etiske overveielser og skaperrettigheter, er Stability AI i forkant av å forme fremtiden for lydskaping. Ettersom denne teknologien fortsetter å utvikle seg, er det klart at AI-generert lyd vil spille en stadig mer avgjørende rolle i det kreative landskapet, og gi kunstnere og musikere de verktøyene de trenger til å utvide grensene for sin kunst og omdefinere hva som er mulig i lydens verden.












