OpenAI lance GPT Transcribe et GPT Live Transcribe, avec une réduction de 25% des prix
OpenAI a lancé deux modèles de transcription vocale : GPT Transcribe et GPT Live Transcribe. GPT Transcribe est conçu pour traiter des fichiers audio et des tâches en lot, tandis que GPT Live Transcribe est adapté aux sous-titres en direct et aux scénarios en temps réel tels que les appels téléphoniques. Ces deux modèles peuvent combiner le sujet de l'enregistrement, des mots-clés et des indications linguistiques pour améliorer la reconnaissance des phrases courtes, des chiffres, des termes techniques, des accents variés et dans des environnements bruyants. Selon une évaluation d'Artificial Analysis, le taux d'erreur de mots de GPT Transcribe est de 3,31 %, soit 0,7 point de pourcentage de moins que la génération précédente, GPT-4o Transcribe. Le prix du nouveau modèle a également été réduit de 25 %, facturant 4,5 dollars pour 1000 minutes d'audio.
Prix de --
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

Le modèle XiaoHongShu surpasse l'OpenAI américain de 4,9 points

Tiffany, un acteur menaçant, soupçonné de vol d'actifs cryptographiques et de jeu

ByteDance applique le modèle AI à double sens SeedRealtime sur l'application Doubao

La société d'IA audio Noiz termine un tour de financement de plusieurs millions de yuans

Alibaba Cloud Wan3.0 atteint 30 secondes de génération, égalant Seedance 2.5

ByteDance lance le modèle de grande taille SeedRealtime pour l'audio et la vidéo en duplex intégral

Sam Altman déclare que ChatGPT peut générer des podcasts sur la croissance des enfants

ByteDance lance Seedance 2.5, permettant de générer des vidéos de 30 secondes avec 50 éléments

Grok Voice Think Fast 2.0 obtient la première place des évaluations d'Agent, le prix de l'API augmente de 60%

Google DeepMind lance le modèle de génération musicale Lyria 3.5, capable de créer des chansons de 3 minutes maximum

Fish Audio lève 50 millions de dollars lors d'un tour de financement de démarrage

Messi investit dans World Labs fondé par Fei-Fei Li

ByteDance lance le modèle audio génératif Seed Audio 1.0

Le Japon lance le projet Noetra AI, Nvidia fournit 27 500 GPU Rubin

La NBU simplifie les règles d'identification des clients dans les banques

Lancement de l'outil Agent Step Edge pour le traitement local, avec un délai d'appel minimum de 0,1 seconde

Une vidéo falsifiée de Cristiano Ronaldo utilisée pour promouvoir le jeton cryptographique USWR








