Gemini 3.5 Transcribe: transcripción inteligente de Google

La nueva era de la transcripción por voz

Google ha presentado Gemini 3.5 Transcribe, su modelo de transcripción de voz más avanzado hasta la fecha. Diseñado para superar las limitaciones de los sistemas tradicionales, este modelo convierte audio en texto limpio y estructurado, incluso en entornos ruidosos o con vocabulario técnico complejo. La compañía lo describe como una herramienta que entiende la intención del hablante, no solo las palabras, lo que abre nuevas posibilidades para aplicaciones de voz en tiempo real y procesamiento de audio grabado.

La novedad llega en un momento en que los asistentes de voz y las herramientas de dictado son cada vez más comunes. Sin embargo, la mayoría de los sistemas existentes fallan ante muletillas, autocorrecciones o jerga especializada. Gemini 3.5 Transcribe aborda estos problemas de raíz, ofreciendo una experiencia más natural y fluida tanto para consumidores como para desarrolladores.

¿Qué hace especial a Gemini 3.5 Transcribe?

El modelo se ha entrenado para manejar tres desafíos principales: el ruido de fondo, los términos técnicos y las disfluencias del habla (como los ‘ums’ y ‘ahs’). A diferencia de los transcriptores convencionales, no se limita a transcribir literalmente, sino que limpia el texto, elimina las muletillas y respeta las autocorrecciones del hablante. Por ejemplo, si alguien dice ‘reunión el martes… no, mejor el miércoles’, el modelo transcribe correctamente ‘reunión el miércoles’, captando la intención final.

Además, Gemini 3.5 Transcribe es capaz de reconocer más de 85 idiomas y adaptarse a distintos acentos regionales. También puede identificar a diferentes hablantes en una conversación y asignar etiquetas a cada intervención, lo que resulta muy útil para reuniones y entrevistas. Estas capacidades lo convierten en una herramienta versátil para sectores como la salud, la educación, el servicio al cliente y la producción de contenido.

Características principales

  • Eliminación de muletillas: filtra automáticamente ‘ums’, ‘ahs’ y otras interrupciones para producir texto limpio.
  • Manejo de autocorrecciones: entiende cuando el hablante se corrige y transcribe la versión final.
  • Reconocimiento de jerga: se adapta a vocabulario técnico o especializado mediante vocabulario personalizado.
  • Soporte multilingüe: más de 85 idiomas con detección automática y manejo de acentos.
  • Identificación de hablantes: atribuye cada frase a su autor en audio pregrabado.
  • Marcas de tiempo: proporciona marcas de tiempo a nivel de palabra para facilitar la navegación.
  • Baja latencia: streaming en tiempo real con respuestas en menos de un segundo.

Dos APIs para diferentes necesidades

Google ha lanzado Gemini 3.5 Transcribe a través de dos interfaces complementarias. La primera, la Live API, está pensada para aplicaciones que requieren transcripción en tiempo real, como asistentes de voz o subtitulado en vivo. La segunda, la Interactions API, se orienta al procesamiento de audio pregrabado, como reuniones o llamadas, donde se necesita mayor detalle y análisis posterior.

CaracterísticaLive APIInteractions API
Uso principalStreaming en tiempo realAudio pregrabado
Modelogemini-3.5-transcribe-livegemini-3.5-transcribe
LatenciaSub-segundoDepende de la duración del audio
Identificación de hablantesNo disponibleSí, hasta 3 hablantes
Marcas de tiempoNoSí, a nivel de palabra
Ideal paraAsistentes de voz, subtitulado en vivoReuniones, análisis de llamadas

Esta doble vía permite a los desarrolladores elegir la herramienta adecuada según su caso de uso. Por ejemplo, una aplicación de dictado médico podría usar la Live API para transcribir mientras el doctor habla, mientras que un servicio de transcripción de podcasts usaría la Interactions API para procesar episodios completos con mayor precisión.

Integraciones y disponibilidad

Gemini 3.5 Transcribe ya está disponible en varios productos de Google. En la aplicación de Gemini para macOS, los usuarios pueden dictar comandos para generar imágenes, resumir archivos o buscar información. En Android, la función Rambler utiliza este modelo para limpiar la transcripción de voz en el teclado Gboard, permitiendo además editar texto mediante comandos de voz. También se ha integrado en Google Antigravity, donde combina el contexto de la pantalla con el historial de chat para mejorar la precisión.

Para los desarrolladores, el modelo está en vista previa pública en Google AI Studio y en la plataforma Gemini Enterprise Agent Platform. Próximamente llegará a Chrome, donde los usuarios podrán dictar texto en cualquier campo de formulario. Además, empresas como Agora, LiveKit y Pipecat ya han anunciado soporte para Gemini 3.5 Transcribe en sus plataformas, facilitando la creación de interfaces de voz avanzadas.

Preguntas y respuestas

¿Qué diferencia hay entre Gemini 3.5 Transcribe y otros modelos de transcripción?

La principal diferencia radica en su capacidad para manejar disfluencias y autocorrecciones de forma natural. Mientras que otros modelos transcriben literalmente lo que escuchan, Gemini 3.5 Transcribe interpreta la intención del hablante y produce un texto más limpio y coherente. Además, su soporte para más de 85 idiomas y su baja latencia en streaming lo hacen especialmente adecuado para aplicaciones en tiempo real.

¿Cómo puedo probar Gemini 3.5 Transcribe?

Si eres desarrollador, puedes acceder a la vista previa pública a través de Google AI Studio o la plataforma Gemini Enterprise Agent Platform. Para consumidores, la función Rambler en Android y la aplicación de Gemini en macOS ya incluyen esta tecnología. También estará disponible próximamente en Chrome.

¿Qué tipo de aplicaciones puedo construir con este modelo?

Las posibilidades son amplias: asistentes de voz, subtitulado en vivo, transcripción de reuniones, análisis de llamadas de servicio al cliente, herramientas de dictado médico, y mucho más. La combinación de la Live API y la Interactions API permite cubrir tanto necesidades en tiempo real como procesamiento por lotes.

¿Cuánto cuesta usar Gemini 3.5 Transcribe?

Google no ha publicado los precios oficiales en el anuncio. Sin embargo, al estar en vista previa pública, es probable que exista un nivel gratuito con límites de uso, similar a otros servicios de la plataforma Gemini. Se recomienda consultar la documentación oficial para obtener detalles actualizados.

¿Qué idiomas soporta?

¿Qué implicaciones tiene para los usuarios?

Supone una evolución práctica en la accesibilidad y capacidades disponibles en el sector.

El modelo soporta más de 85 idiomas, incluyendo detección automática del idioma hablado. También maneja acentos regionales y vocabulario técnico mediante la configuración de vocabulario personalizado.