
Google ha presentado Gemini 3.5 Transcribe, su nuevo modelo de conversión de voz a texto diseñado para interacciones de voz inteligentes con capacidad para capturar el estilo de habla natural y realizar tareas desde la voz.
Google ha presentado su modelo "más preciso hasta la fecha" para transformar voz en texto. Gemini 3.5 Transcribe entiende el habla de los usuarios a la perfección y transcribe en más de 85 idiomas, eliminando expresiones de relleno como "ums" o "ahs" y capturando la intención natural y estilo.
El modelo ha sido mejorado para capturar audio con precisión en entornos ruidosos, distinguir hasta tres hablantes distintos con marcas de tiempo y detectar acentos regionales o dialectos. Google ha explicado que convierte el audio sin procesar directamente en texto "preciso, pulido y formateado", gestionando las autocorrecciones mientras la persona habla.
Estas mejoras se traducen en datos como una tasa de error de palabras promedio del 4 por ciento para la transmisión de datos y del 2,6 por ciento para los casos de uso sin transmisión, según mediciones de Análisis Artificial. El modelo también cuenta con tasas de error mejoradas y latencia reducida con respecto al antecesor, con un tiempo de transcripción final que mejora en un 70 por ciento.
Integración en múltiples plataformas
Google ha anunciado que integra la comprensión contextual directamente en interfaces como Gboard, Antigravity, la aplicación Gemini y próximamente en Chrome. En Gboard para Android, Gemini 3.5 Transcribe permitirá transformar los pensamientos hablados en texto eliminando palabras de relleno.
En Google Antigravity podrá combinar contexto de pantalla e historial de chat de los usuarios para realizar una transcripción precisa. En Google AI Studio, los usuarios podrán utilizar el modelo para escribir código de aplicaciones con la voz, disponible solo en el modo Build.
En la aplicación de Gemini para macOS, el modelo facilitará usar comandos de voz integrados con contexto de pantalla para optimizar flujos de trabajo, permitiendo resumir archivos, reutilizar texto en diferentes aplicaciones o generar imágenes con solo la voz. Google está trabajando en una opción en Chrome para que los usuarios puedan dictar texto en cualquier campo web.
Gemini 3.5 Transcribe ya está disponible para todos los usuarios en la aplicación de Gemini para macOS en inglés y en Gboard para Android. Para los desarrolladores, se ha lanzado en versión preliminar pública en la API Gemini a través de Google AI Studio y Google Antigravity, también disponible en versión preliminar en Gemini Enterprise Agent Platform.
Participa en la conversación con respeto. Tu comentario se publicará automáticamente, aunque podrá ser retirado por la redacción.
Comentarios (0)