ByteDance lance le modèle audio génératif Seed Audio 1.0
ByteDance a lancé le modèle de création audio Seed Audio 1.0, capable de générer simultanément des dialogues, des effets sonores et des ambiances à partir d'une seule invite, tout en contrôlant l'entrée des sons sur une timeline. Ce modèle prend en charge les entrées de texte et d'audio de référence, avec une précision de contrôle temporel de 100 millisecondes, permettant de générer environ 2 minutes d'audio par session, avec la possibilité de prolonger tout en maintenant la cohérence de la tonalité des personnages. Seed Audio 1.0 prend en charge plus de 20 langues, permettant la migration de la même tonalité entre différentes langues, ainsi que le changement de ton et d'émotion. Les évaluations officielles montrent que le taux d'utilisabilité de l'audio dans la plupart des scénarios dépasse 90 %, et la naturalité MOS de la plupart des langues dépasse 4. Ce modèle est désormais disponible au centre d'expérience Volcano Ark et propose un accès API.
Prix de --
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

Le modèle XiaoHongShu surpasse l'OpenAI américain de 4,9 points

Tiffany, un acteur menaçant, soupçonné de vol d'actifs cryptographiques et de jeu

ByteDance applique le modèle AI à double sens SeedRealtime sur l'application Doubao

La société d'IA audio Noiz termine un tour de financement de plusieurs millions de yuans

Alibaba Cloud Wan3.0 atteint 30 secondes de génération, égalant Seedance 2.5

ByteDance lance le modèle de grande taille SeedRealtime pour l'audio et la vidéo en duplex intégral

Sam Altman déclare que ChatGPT peut générer des podcasts sur la croissance des enfants

ByteDance lance Seedance 2.5, permettant de générer des vidéos de 30 secondes avec 50 éléments

Grok Voice Think Fast 2.0 obtient la première place des évaluations d'Agent, le prix de l'API augmente de 60%

Google DeepMind lance le modèle de génération musicale Lyria 3.5, capable de créer des chansons de 3 minutes maximum

OpenAI lance GPT Transcribe et GPT Live Transcribe, avec une réduction de 25% des prix

Fish Audio lève 50 millions de dollars lors d'un tour de financement de démarrage

Messi investit dans World Labs fondé par Fei-Fei Li

Le Japon lance le projet Noetra AI, Nvidia fournit 27 500 GPU Rubin

La NBU simplifie les règles d'identification des clients dans les banques

Lancement de l'outil Agent Step Edge pour le traitement local, avec un délai d'appel minimum de 0,1 seconde

Une vidéo falsifiée de Cristiano Ronaldo utilisée pour promouvoir le jeton cryptographique USWR





