ByteDance wprowadza model generowania dźwięku Seed Audio 1.0
ByteDance zaprezentował model do tworzenia dźwięku Seed Audio 1.0, który potrafi generować jednocześnie dialogi, efekty dźwiękowe i dźwięki otoczenia na podstawie jednego promptu, a także kontrolować wprowadzenie dźwięku w czasie. Model obsługuje wejścia tekstowe oraz referencyjne nagrania dźwiękowe, z precyzją kontroli czasu wynoszącą 100 milisekund. Może generować około 2 minut dźwięku jednorazowo, z możliwością dalszego wydłużania, przy zachowaniu spójności barwy głosu postaci. Seed Audio 1.0 obsługuje ponad 20 języków, a ta sama barwa głosu może być przenoszona między językami, z możliwością zmiany tonu i emocji. Oficjalne testy wykazały, że użyteczność dźwięku w większości scen przekracza 90%, a naturalność w większości języków osiąga wynik MOS powyżej 4. Model jest już dostępny w centrum doświadczeń Volcano Ark i udostępnia interfejs API.
Cena --
Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.
Możesz również polubić

Cztery narzędzia sprzed 20 lat, których Windows 11 wciąż nie może zastąpić

Anthropic ujawnia sposób na wprowadzenie niewidocznego znaku wodnego w tekstach Claude'a

Model XiaoHongShu o 4,9 punktu wyższy niż amerykański OpenAI

ByteDance wprowadza model AI SeedRealtime do aplikacji Doubao

Firma Audio AI Noiz zakończyła finansowanie w rundzie seed na dziesiątki milionów

ByteDance wprowadza model SeedRealtime do dwukierunkowej komunikacji audio-wideo

Ford wprowadza Territory Platinum, najlepiej wyposażony SUV w swojej gamie

Sam Altman twierdzi, że ChatGPT może generować podcasty o dorastaniu dzieci

Fish Audio pozyskuje 720 milionów wonów w inwestycji seed

ByteDance wprowadza Seedance 2.5, generując 30-sekundowe wideo z 50 materiałami

Grok Voice Think Fast 2.0 zdobywa pierwsze miejsce w ocenie Agentów, ceny API wzrastają o 60%

Google DeepMind wprowadza model generowania muzyki Lyria 3.5, który wspiera tworzenie utworów o długości do 3 minut

OpenAI wprowadza GPT Transcribe i GPT Live Transcribe, obniżając ceny o 25%

NBU uprościł zasady identyfikacji klientów w bankach

Departament Obrony USA opublikował 40 dokumentów i filmów o UFO

Fałszywe wideo z Ronaldo wykorzystane do promocji tokena kryptowalutowego USWR

Moment płatności agentów AI: Kto zostanie Stripe’em gospodarki maszynowej?

Brytyjska policja skonfiskowała bitcoiny o wartości 1,4 miliona dolarów z zamkniętego rynku dark web

Analiza techniczna vs analiza fundamentalna: definicje, różnice i sposoby ich wykorzystania - Świat Fintech

Instrumenty pochodne zaczynają wpływać na rynek spot: Koreańskie prawo do wyceny aktywów odpływa za granicę

HYPE staje w obliczu wycofania zespołu o wartości 36 milionów dolarów 6 września

USD1 przepływa do Binance, gdy portfel Fireblocks przenosi 30 mln dolarów

Bitcoin: 12 lat później odzyskuje swój portfel i staje się milionerem

Prawnik Ripple łączy ustawę CLARITY z wzrostem zatrudnienia w USA

Przedstawicielka EBC wzywa banki centralne do przyjęcia technologii blockchain

25. słowo: Sekretny sejf w Twoim portfelu Ledger

Tom Lee w najnowszym wywiadzie: Cztery czynniki, które napędzą wzrost ETH w tym roku

Japońska Komisja Usług Finansowych żąda zwiększenia budżetu o 13,4 miliarda jenów na rok 2027, planując utworzenie nowego biura do monitorowania aktywów kryptograficznych

Czy Strategy w końcu wraca do trybu „kupuj, kupuj, kupuj” po 10 tygodniach przerwy?






