OpenAI presenta dos modelos de IA para transcribir conversaciones en tiempo real y procesamiento por lotes, con mejoras significativas en precisión respecto a versiones anteriores.
OpenAI ha anunciado el lanzamiento de dos nuevos modelos de voz de Inteligencia Artificial diseñados expresamente para conversaciones: GPT-Live-Transcribe, optimizado para cargas de trabajo de baja latencia en transcripción de habla a texto en tiempo real, y GPT-Transcribe, diseñado para archivos de audio completos y procesamiento por lotes asíncrono.
Ambos modelos tienen la capacidad de comprender mejor el contexto de las conversaciones y ofrecen una transcripción de mayor calidad del audio, incluso comprendiendo mejor acentos e idiomas, frases cortas, números, términos especializados y conversaciones con ruido de fondo fuerte. GPT-Live-Transcribe se caracteriza por su habilidad para utilizar automáticamente textos transcritos con anterioridad como contexto.
OpenAI ha compartido datos del rendimiento en la prueba de reconocimiento automático de voz (ASR) con reconocimiento de contexto, que muestran que añadir contexto mejoró la precisión semántica del 38,5 por ciento al 44,6 por ciento en GPT-Live-Transcribe, mientras que en GPT-Transcribe pasó del 41,6 por ciento al 45,2 por ciento. Aportar información a ambos modelos, como los idiomas esperados o el tema de la reunión, mejora considerablemente su capacidad de transcripción, ya sea en una conversación en tiempo real o a través de un audio grabado anteriormente.
Por lo que respecta al rendimiento en audios del mundo real, GPT-Live-Transcribe registró una tasa de error de transcripción del 9,60 por ciento, en comparación con el 11,65 por ciento de GPT-Realtime-Whisper (la versión anterior de OpenAI), mientras que GPT-Transcribe consiguió una tasa de error del 8,98 por ciento, mejorando respecto al 15,21 por ciento de Whisper-1 (el modelo original de OpenAI para convertir voz a texto).
El laboratorio independiente de análisis Artificial Analysis reportó una tasa de error de palabras del 3,31 por ciento para GPT-Transcribe, una mejora significativa respecto a los modelos anteriores de OpenAI. GPT-Transcribe se convierte en el mejor modelo de OpenAI en esta categoría, aunque queda ligeramente por detrás de alternativas como Voxtral Small de Mistral y Gemini 3.1 Pro de Google, ambas con un 2,8 por ciento de tasa de error.
OpenAI ha fijado el precio de GPT-Transcribe en 4,50 dólares por cada mil minutos de audio procesado.
Participa en la conversación con respeto. Tu comentario se publicará automáticamente, aunque podrá ser retirado por la redacción.
Comentarios (0)