AI-musikskaberen Suno byder nu på mere end bare instrumenter og beats. Platformen har lanceret en ny Speech-funktion i offentlig beta, der kan generere talte ord baseret på scriptede beskrivelser eller brugerprompts – og kombinerer det med AI-komponeret baggrundsmusik på samme tidspunkt.
Funktionen gives simultant udgang på både Sunos web- og mobilplatforme. Det er ikke længere nødvendigt at gemte musikken og talen separat og derefter samle dem i efterbehandling. I stedet danner stemmen og musikken nu én sammenhængende lydtakk.
En ny vinkel på tekstbaseret tale
At generere kunstig tale fra tekst er langt fra nyt. DeepMind har eksperimenteret med deep learning-baseret stemmesyntese i over ti år, Adobe tilbyder tekst-til-tale-værktøjer, og ElevenLabs er siden 2023 blevet en af de mest kendte platforme på området. Suno rykker nu ind på markedet – sandsynligvis for at diversificere sit produktudbud, eftersom Sunos musikgenerator har pådraget sig adskillige retssager om ophavsret.
Kombinationen af AI-musik og genereret stemme er Sunos tilgang til tekstbaseret tale. Baggrundsmusikken er frivillig og kan slukkes med et enkelt trin, hvis man ønsker ren tale uden instrumentering. Ifølge Suno selv kan kombinationen være særligt brugbar til formål som at lægge en beroligende soundtrack under et digt eller tilføje energi til dramatiske voiceovers og motiverende taler.
Sådan bruger du funktionen
Speech-funktionen tilgås ved at vælge fanebladet “Create” og derefter navigere til Speech-muligheden. Der er to driftsmodi: Simple-mode, hvor du beskriver, hvad du vil skabe via et promptfelt (eksempelvis “en piratvejleder som samler sin besætning”), og Advanced-mode, som giver dig mulighed for at tilføje et brugerdefineret script, hvis du præcist ved, hvad du ønsker sat i lyd.
De avancerede indstillinger tillader justerin af køn på AI-stemmen, talestyle og hvor meget variation hver stemmegenerering skal have. Maksimal lydlængde er omkring otte minutter pr. generation.
Erkender manglerne – og arbejder videre
Suno giver ikke finere ord på det: funktionen er ikke perfekt endnu. “Beta betyder virkeligt beta,” siger Jack Brody, chef for produktudvikling hos Suno. “Britiske accenter kan af og til vandre over til australsk og tilbage igen. Dramatiske pauser kan blive meget dramatiske. I vil næsten helt sikkert opdage anvendelser for dette, som aldrig er faldet os ind.”
Platformen lover imidlertid at forbedre Speech løbende ud fra brugerfeedback. Det betyder, at imperfektioner med stavelser, tonefald og accentblandinger skal blive færre, jo mere data og brugerinput systemet får.
