Teknik

Suno läser nu upp din dikt och komponerar musiken till den i samma tagning

Susan Hill
Lägg till oss på Google

Suno, appen som slog igenom genom att förvandla en rad text till en låt, gör nu något märkligare med dina ord: den läser upp dem och skriver musiken till i samma svep. Skriv in en dikt, ett tal eller en godnattsaga, beskriv rösten och stämningen du vill ha, så skapar Speech ett enda spår där berättarrösten och musiken har tagits fram tillsammans i stället för att läggas ovanpå varandra i efterhand. Det svåra med att skapa eget ljudmaterial har sällan varit själva rösten. Utmaningen har varit att få rösten och musiken att låta som om de hör hemma i samma rum.

För den som skapar bröllopstal, kortvideor, guidade meditationer eller poddvinjetter innebär det att ett arbetsmoment försvinner – ett som vanligtvis kräver två appar och en tidslinje för redigering. I dag behöver man spela in berättarrösten på ett ställe, leta upp royaltyfri bakgrundsmusik på ett annat och sedan justera volymen tills musiken inte längre dränker orden. Sunos idé är att en enda modell hanterar båda delarna, så att musiken komponeras kring talet i stället för att bara klistras in under det.

Speech har två lägen. I Simple beskriver du en idé, till exempel en piratkapten som eldar på sin besättning, och Suno skriver orden och framför dem. Advanced utgår från ditt eget manus och låter dig styra röstens kön, talstil och hur mycket framförandet varierar från en generering till en annan. Spåren kan bli ungefär åtta minuter långa – tillräckligt för en hel godnattsaga eller en kort meditation – och musik är påslagen som standard. Det finns en knapp för att ta bort den för den som bara vill ha berättarrösten.

Jack Brody, Sunos produktchef, beskriver Speech som den första ljudmodellen som genererar röst och musik tillsammans i ett sammanhängande spår. Syntetiskt tal är i sig inget nytt. ElevenLabs, Adobe och Google DeepMind erbjuder alla text-till-tal som låter mänskligt, men musiken lämnas åt användaren, som måste skapa den separat och mixa den för hand. Suno tar sig an området från motsatt håll: som ett musikföretag som lägger till en röst, snarare än ett röstföretag som lägger till musik.

Bristerna är påtagliga, och Suno lyfter själv fram några av dem. Företaget varnar för att en brittisk accent kan glida över till australiensisk och tillbaka igen, och att dramatiska pauser kan bli väldigt dramatiska. Det går inte att styra exakt längd eller tajma enskilda ord, och Suno har inte sagt om de anpassade röster som användare redan kan spela in för låtar också fungerar i Speech. Företaget har inte heller offentliggjort vilka språk funktionen klarar, en brist som spelar roll för lyssnare utanför de engelskspråkiga marknaderna, eller hur många krediter ett uppläst spår kostar. Med Sunos kostnadsfria abonnemang behåller företaget enligt standardvillkoren äganderätten till det användarna skapar, och kommersiell användning är inte tillåten. Den som planerar en podd med intäkter eller en reklamfilm bör därför läsa det finstilta först.

Speech blev tillgängligt för alla Suno-användare på webben och i iOS- och Android-apparna den 1 oktober, efter ungefär en månads testning med en mindre grupp. Funktionen är fortfarande märkt som beta, använder samma kreditupplägg som musikgenereringen och Suno har inte meddelat när en färdig version ska lanseras.

Lanseringen sker också mitt i en juridisk strid. Warner Music Group nådde en uppgörelse med Suno och licensierade musik till företaget i november 2025, men Universal Music Group och Sony Music lämnade in en ny stämningsansökan i september om musikmodellerna v6. De anklagar företaget för att ha kopierat fler än 60 000 inspelningar och kräver upp till 9 miljarder dollar i lagstadgat skadestånd. Målet behandlas fortfarande i federal domstol i Boston, vilket innebär att musiken till din godnattsaga kommer från ett företag som ännu försvarar hur det lärde sig att skapa musik.

Taggar: , , , , ,

Lägg till oss på Google

Diskussion

Det finns 0 kommentarer.