Grok Voice Think Fast 2.0 obtient la première place des évaluations d'Agent, le prix de l'API augmente de 60%
SpaceXAI a lancé Grok Voice Think Fast 2.0, un modèle d'Agent vocal destiné aux services clients, aux ventes et aux scénarios téléphoniques, capable de comprendre les utilisateurs, de générer des réponses vocales et d'appeler des outils. La nouvelle version améliore les capacités de raisonnement, de transcription et de dialogue. Les évaluations d'Artificial Analysis montrent que l'indice global vocal de Grok est de 82,9 %, se classant deuxième, juste derrière le Qwen Audio 3.0 Realtime Plus avec 84,1 %. Dans le test de référence τ-Voice pour les tâches de service client, Grok se classe premier avec 56,5 %, devant Qwen à 54,6 % et GPT-Realtime-2.1 High à 45,7 %. Le temps de première réponse est de 0,70 seconde. Le prix de l'API est passé de 0,05 USD par minute à 0,08 USD, soit une augmentation de 60 %, le coût audio par heure étant de 4,80 USD.
Prix de --
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

Le modèle XiaoHongShu surpasse l'OpenAI américain de 4,9 points

Tiffany, un acteur menaçant, soupçonné de vol d'actifs cryptographiques et de jeu

ByteDance applique le modèle AI à double sens SeedRealtime sur l'application Doubao

La société d'IA audio Noiz termine un tour de financement de plusieurs millions de yuans

Alibaba Cloud Wan3.0 atteint 30 secondes de génération, égalant Seedance 2.5

ByteDance lance le modèle de grande taille SeedRealtime pour l'audio et la vidéo en duplex intégral

Sam Altman déclare que ChatGPT peut générer des podcasts sur la croissance des enfants

ByteDance lance Seedance 2.5, permettant de générer des vidéos de 30 secondes avec 50 éléments

Google DeepMind lance le modèle de génération musicale Lyria 3.5, capable de créer des chansons de 3 minutes maximum

OpenAI lance GPT Transcribe et GPT Live Transcribe, avec une réduction de 25% des prix

Fish Audio lève 50 millions de dollars lors d'un tour de financement de démarrage

Messi investit dans World Labs fondé par Fei-Fei Li

ByteDance lance le modèle audio génératif Seed Audio 1.0

Le Japon lance le projet Noetra AI, Nvidia fournit 27 500 GPU Rubin

La NBU simplifie les règles d'identification des clients dans les banques

Lancement de l'outil Agent Step Edge pour le traitement local, avec un délai d'appel minimum de 0,1 seconde

Une vidéo falsifiée de Cristiano Ronaldo utilisée pour promouvoir le jeton cryptographique USWR









