Gemini 3.5 Transcribe: el modelo de transcripción inteligente de Google
Google presenta Gemini 3.5 Transcribe: un avance en transcripción de voz
Google ha lanzado su nuevo modelo de transcripción de voz a texto, llamado Gemini 3.5 Transcribe. Según la compañía, se trata de su modelo más preciso hasta la fecha, diseñado para convertir audio en texto de forma inteligente. A diferencia de los sistemas tradicionales, este modelo es capaz de manejar ruido de fondo, jerga especializada y también limpiar las dudas del habla, como muletillas o correcciones.
La gran novedad es que el modelo trabaja directamente con el audio crudo, sin necesidad de pasos intermedios. Esto permite obtener transcripciones pulidas y bien formateadas. Ya se está usando en productos como la aplicación Gemini, tanto en Android como en macOS, y ahora Google lo pone a disposición de los desarrolladores a través de la API de Gemini en Google AI Studio y en la plataforma Google Antigravity.
El objetivo principal es que los desarrolladores puedan integrar esta tecnología en sus propias aplicaciones, como asistentes de voz, herramientas de subtitulado en vivo o sistemas de análisis de llamadas. Todo ello con una latencia muy baja y una alta precisión.
Dos formas de usar el modelo
Gemini 3.5 Transcribe se ofrece a través de dos API diferentes, según la necesidad:
- Live API: para transcripción en tiempo real, con latencia inferior a un segundo. Usa el modelo gemini-3.5-transcribe y está pensado para interacciones de voz continuas y bidireccionales.
- Interactions API: para procesar audio ya grabado, con atribución de hablantes y marcas de tiempo. Utiliza el modelo gemini-3.5-transcribe y permite transcribir reuniones, llamadas y archivos de audio.
Esta doble vía facilita que cada desarrollador elija la opción que mejor se adapte a su caso de uso: si necesita respuesta inmediata o si prefiere un análisis más detallado de grabaciones completas.
Características principales de Gemini 3.5 Transcribe
- Precisión mejorada: Según mediciones externas, logra una tasa de error de palabra (WER) del 4,0% en casos de uso no streaming y una mejora del 70% en el tiempo de transcripción final.
- Vocabulario personalizado: Permite incorporar términos específicos, como nombres propios o jerga de un sector, para que la transcripción reconozca ortografías especiales.
- Soporte multilingüe: Detecta automáticamente más de 85 idiomas, adaptándose a acentos regionales y variantes.
- Identificación de hablantes: En audio pregrabado, puede atribuir el discurso a hasta tres hablantes diferentes.
- Filtrado de imperfecciones: Elimina muletillas como “um” o “eh” y corrige la fluidez del habla.
- API flexible: Se ofrece en dos modalidades: la Live API para streaming en tiempo real con latencia submilisegundo, y la de audio pregrabado con marcas de tiempo detalladas.
Además, el modelo supera al anterior Chirp 3 en varios benchmarks, como FLEURS, mejorando la precisión en múltiples idiomas.
Google ha decidido ofrecer este modelo en varias versiones según el público. Para desarrolladores está disponible en vista previa pública en la API de Gemini. Para empresas, se integra en la plataforma Gemini Enterprise Agent Platform. También se ha anunciado que estará disponible en Chrome próximamente, lo que permitirá dictar texto en el navegador de forma natural.
Disponibilidad y casos de uso
Los productos que ya utilizan esta tecnología incluyen la aplicación Gemini en macOS y la función Rambler en Android. Además, Google ha confirmado que el modelo se puede usar para crear subtítulos en tiempo real, asistentes de voz y herramientas de análisis de conversaciones.
Entre las funcionalidades más destacadas se encuentran:
- Transcripción inteligente: Limpia el discurso y lo convierte en texto bien formateado.
- Reconocimiento de jerga: Acepta argot técnico o términos específicos de cada sector.
- Attribution de hablante: Diferencia quién habla en una conversación grabada.
- Latencia mínima: Pensado para interacciones en tiempo real, como subtítulos en directo.
- Amplia cobertura de idiomas: Más de 85 lenguas con acentos variados.
Mejoras frente a Chirp 3
Respecto al modelo anterior, Chirp 3, Gemini 3.5 Transcribe presenta mejoras notables. Por ejemplo, la latencia se ha reducido un 70%, lo que significa que la transcripción se genera mucho más rápido. Además, la precisión en entornos ruidosos es mayor, y ahora se pueden añadir vocabularios personalizados para términos técnicos o nombres propios.
Otra mejora clave es la capacidad de procesar conversaciones en vivo con varios hablantes. Aunque el soporte para más de tres hablantes todavía está en fase experimental, la versión actual ya puede distinguir hasta tres voces en audio pregrabado.
En cuanto a los idiomas, el modelo automáticamente detecta y transcribe más de 85 lenguas, incluyendo variantes regionales y acentos, lo que facilita su uso en entornos internacionales.
Un aspecto interesante es que Google ha destacado su capacidad para trabajar con ruido de fondo. Esto es crucial para aplicaciones del mundo real, como grabaciones en lugares públicos o reuniones con varios participantes. El modelo “limpia” las impurezas del audio y produce un texto ordenado, con puntuación y formato.

Comparativa con el modelo anterior
| Característica | Chirp 3 | Gemini 3.5 Transcribe |
|---|---|---|
| Precisión (WER en FLEURS) | Base | Mejora notable (4% en modo no streaming) |
| Latencia | Mayor | 70% más rápida |
| Vocabulario personalizado | Limitado | Sí |
| Identificación de hablantes | No | Hasta 3 hablantes (experimental para más) |
| Idiomas | – | Más de 85 |
| Disponibilidad | – | API, AI Studio, Antigravity |
Estas mejoras posicionan a Gemini 3.5 Transcribe como una alternativa competitiva frente a otros servicios de transcripción, especialmente en el ámbito del desarrollo de aplicaciones que requieren una interacción por voz natural y adaptada a contextos complejos.
Para los usuarios finales, esta tecnología ya está presente en funciones como la transcripción en vivo o el control por voz en dispositivos. Sin embargo, el verdadero potencial se desplegará cuando los desarrolladores empiecen a integrar estas capacidades en sus propias herramientas.
¿Cómo funciona la transcripción inteligente?
El modelo se basa en un sistema de aprendizaje profundo que procesa el audio de extremo a extremo. En lugar de separar el reconocimiento del habla en etapas, el sistema analiza la señal completa y genera el texto directamente. Esto le permite entender el contexto y aplicar correcciones de fluidez, puntuación y ortografía de forma automática.
Por ejemplo, si una persona dice “um, me gustaría pedir el producto XYZ, con el código 1234”, el modelo transcribirá “Me gustaría pedir el producto XYZ, código 1234”, eliminando la muletilla y reconociendo el acrónimo y el número.
Además, el modelo puede funcionar en tiempo real, lo que lo hace ideal para subtitulación en vivo o para asistentes que responden al instante. En el caso de audio grabado, ofrece la posibilidad de identificar quién habla en cada momento, aunque esta función es experimental cuando hay más de tres interlocutores.
¿Qué significa esto para los usuarios?
Para los usuarios finales, la mejora se nota en aplicaciones como la búsqueda por voz, la transcripción de notas o la generación de subtítulos. Para los desarrolladores, el modelo abre la puerta a crear experiencias más naturales y menos frustrantes, donde el sistema entiende la intención del usuario incluso con acentos, ruidos o vocabulario técnico.
Google está incluyendo este modelo en sus herramientas de desarrollo, por lo que cualquier persona puede probarlo desde Google AI Studio. Además, la integración con Antigravity permite prototipar rápidamente agentes de voz.
Aunque todavía hay aspectos experimentales, como la identificación de más de tres hablantes, el modelo marca un paso importante en la evolución de la transcripción automática.
Preguntas y respuestas
¿Cuáles son los aspectos más destacados de Gemini 3.5 Transcribe: el modelo de transcripción inteligente de Google?
Introduce optimizaciones relevantes en rendimiento, facilidad de uso y adaptación a distintos flujos de trabajo.
¿Cuándo estará disponible de forma general?
El despliegue se realizará de forma progresiva según los canales y especificaciones oficiales.

