Volver al Blog
Inteligencia Artificial

Gemini 3.5 Transcribe: la IA de Google que transcribe voz y por qué le importa a marketing y ventas

28 de Agosto, 202611 min de lectura
Gemini 3.5 Transcribe: la IA de Google que transcribe voz y por qué le importa a marketing y ventas

Todos los años Google lanza un modelo nuevo y la reacción típica es "otro más". Pero cuando ese modelo, en este caso Gemini 3.5 Transcribe, convierte cada llamada de tu equipo comercial, cada ticket de soporte por voz y cada reunión de ventas en texto estructurado y analizable, deja de ser una curiosidad técnica y se convierte en una pieza de infraestructura para marketing y ventas.

El 26 de agosto de 2026, Google anunció Gemini 3.5 Transcribe, su nuevo modelo de voz a texto. No es un lanzamiento menor: reemplaza a Chirp 3 como la oferta de transcripción insignia de la compañía y unifica el reconocimiento de voz con la misma API que los desarrolladores ya usan para texto y multimodalidad. El anuncio reemplaza a Chirp 3 como la oferta insignia de transcripción de Google y, de forma notable, consolida el reconocimiento de voz en la misma superficie de API de Gemini que los desarrolladores ya usan para tareas de texto y multimodales [6].

¿Qué es Gemini 3.5 Transcribe y en qué se diferencia de un transcriptor tradicional?

Gemini 3.5 Transcribe es un modelo de voz a texto construido sobre las capacidades de comprensión de audio de Gemini, que no solo escribe lo que escucha sino que limpia, formatea y estructura la transcripción usando razonamiento. A diferencia de un motor de reconocimiento de voz clásico, decide cuándo eliminar muletillas, corregir autocorrecciones habladas y atribuir turnos a cada hablante.

[1] Gemini 3.5 Transcribe entrega transcripción de baja latencia y alta precisión, con detección de idioma por enunciado, diarización de hablantes, marcas de tiempo por palabra, transcripción inteligente y sesgo de vocabulario personalizado [1][2]. En lugar de tratar la voz como un problema de procesamiento de señales, el modelo aplica razonamiento para resolver autocorrecciones, eliminar muletillas, formatear la salida, atribuir hablantes y hasta delegar tareas posteriores (como generar una imagen o analizar un archivo) a otros modelos de Gemini mediante function calling [6].

La detección automática cubre más de 85 idiomas, incluido el cambio de idioma a mitad de frase, algo relevante para empresas latinoamericanas que atienden clientes que mezclan español e inglés en la misma llamada [8].

¿Qué tan preciso es y cuánto cuesta usarlo?

Google reporta una tasa de error de palabra (WER) de 2,6% en modo no continuo y 4,0% en modo streaming, medida por Artificial Analysis, con un tiempo hasta la transcripción final un 70% más rápido que Chirp 3 [8]. El precio funciona por token: 2 dólares por millón de tokens de audio de entrada y 12 dólares por millón de tokens de texto de salida.

Esa estructura de precios se traduce, según el propio Google, en algo muy concreto para presupuestar un proyecto:

Facturación por token: el audio de entrada cuesta 2,00 dólares por millón de tokens y el texto de salida 12,00 dólares por millón, lo que la página de precios de Google traduce en una tarifa efectiva de aproximadamente 0,005 dólares por minuto de audio, o cerca de 30 centavos por hora [7]. El modelo de streaming, gemini-3.5-transcribe-live, cuesta cerca de 0,009 dólares por minuto [7].

Para dimensionarlo: un centro de contacto que procesa 1.000 horas de llamadas al mes gastaría, en la versión no continua, alrededor de 300 dólares mensuales solo en transcripción, antes de sumar el análisis posterior con otro modelo de lenguaje.

¿Cómo se compara Gemini 3.5 Transcribe con Chirp 3, OpenAI y Microsoft?

Frente a Chirp 3, su predecesor directo, la mejora está en precisión, velocidad y en un salto cualitativo llamado "smart transcription": Chirp 3 devolvía la voz tal cual se escuchaba, mientras que el modelo nuevo limpia disfluencias y formatea el resultado [4]. La diarización de hablantes y el vocabulario personalizado de hasta 1.000 frases ya existían en Chirp 3, así que no son la novedad [4].

El comparativo más relevante es contra los otros dos grandes lanzamientos de voz a texto de 2026:

ModeloProveedorWER reportadoLatencia / velocidadPrecio aproximado
Gemini 3.5 TranscribeGoogle DeepMind2,6% (no streaming) / 4,0% (streaming) en FLEURS70% más rápido que Chirp 3~$0,005/min (no streaming), ~$0,009/min (streaming)
MAI-Transcribe-1Microsoft3,8% WER promedio en FLEURS, 25 idiomasDisponible vía Azure AI FoundryVariable según plan Azure
GPT-Realtime-Whisper / GPT-TranscribeOpenAINo divulgado en la misma métricaOptimizado para streamingDesde $0,017 por unidad de uso reportada

Microsoft lanzó MAI-Transcribe-1 en abril de 2026, reportando un 3,8% de WER promedio en FLEURS en 25 idiomas, disponible a través de Azure AI Foundry, mientras que OpenAI lanzó GPT-Realtime-Whisper en mayo de 2026, un modelo optimizado para streaming [6]. La lectura honesta es que Google cerró en buena parte la brecha con proveedores especializados, sumando capacidades como diarización de hablantes, marcas de tiempo por palabra, vocabulario personalizado y function calling que la mayoría de APIs de transcripción dedicadas cobran aparte o simplemente no ofrecen [6].

El modelo se ofrece en dos variantes con precios y límites distintos, algo que conviene planear desde el inicio de cualquier proyecto: se ofrece como dos endpoints, no uno: gemini-3.5-transcribe maneja archivos pregrabados a través de la Interactions API, mientras que gemini-3.5-transcribe-live maneja streaming bidireccional a través de la Live API, y ambos no comparten el mismo conjunto de funciones, límites ni precio [8].

¿Dónde ya está integrado y qué significa para el usuario final?

Google ya integró Gemini 3.5 Transcribe en varios productos propios antes de abrirlo como API de uso general, lo que sugiere que la compañía lo trata como infraestructura crítica y no como un experimento aislado. En Gboard en Android, la función Rambler convierte pensamientos hablados en texto bien formateado filtrando muletillas [5].

En Google Antigravity combina contexto de pantalla e historial de chat para lograr precisión en nombres de archivos y documentos activos, y en la app de Gemini para macOS transcribe habla libre en texto limpio y permite comandos de voz que se combinan con contexto de pantalla para flujos de trabajo complejos [5]. Próximamente llegará a Chrome para dictar en cualquier campo web [5].

Esta integración profunda es la señal que un gerente de marketing o ventas debería leer con atención: cuando Google mete un modelo en su teclado, su navegador y su sistema operativo de escritorio al mismo tiempo, es porque apuesta a que la voz se vuelve la interfaz por defecto para interactuar con la IA, no un canal secundario.

¿Qué casos de uso reales tiene para atención al cliente y ventas?

Para una empresa que no vende software de IA sino que la usa para operar mejor, Gemini 3.5 Transcribe importa por lo que permite construir encima, no por el modelo en sí. Google mismo señala como industrias objetivo a contact centers, plataformas de CX, documentación clínica, legal y de seguros, herramientas de reuniones y aplicaciones de desarrollo controladas por voz [8].

Los casos más aplicables a marketing y ventas en el mercado latinoamericano son estos:

  1. Análisis de llamadas de ventas a escala. Transcribir automáticamente cada llamada del equipo comercial y alimentar esa transcripción a un modelo de análisis para detectar objeciones repetidas, tiempo de habla del vendedor versus el prospecto y momentos donde se pierde el deal.
  2. Auditoría de calidad en atención al cliente. Reemplazar el muestreo manual de llamadas (escuchar el 2% para control de calidad) por transcripción y análisis del 100% del volumen, con diarización que separa automáticamente al agente del cliente.
  3. Registro automático en el CRM. Convertir la llamada de un vendedor en una nota estructurada dentro del CRM, sin que el vendedor tenga que digitarla, con marcas de tiempo que permiten volver al minuto exacto de una promesa comercial.
  4. Cualificación de leads entrantes por voz. En un centro de llamadas de ventas, transcribir en tiempo real la conversación para que un agente humano o un agente de IA sugiera la siguiente pregunta de calificación mientras el prospecto sigue hablando.
  5. Transcripción de reuniones de descubrimiento B2B. Para equipos de venta consultiva, tener la transcripción exacta de una reunión de descubrimiento evita reconstruir de memoria los requisitos técnicos de un comprador.
Llamada de ventas (audio)
        |
        v
Gemini 3.5 Transcribe (texto + diarización + timestamps)
        |
        v
Modelo de análisis (objeciones, sentimiento, próximos pasos)
        |
        v
CRM (nota automática) + Dashboard de coaching comercial

Este flujo conecta directamente con lo que ya hemos explorado sobre chatbots de atención al cliente con IA y sobre cómo las herramientas de AI SDR automatizan la prospección: la transcripción de calidad es el insumo de datos que hace posible que esos sistemas funcionen bien, porque un modelo de análisis o de scoring de leads solo es tan bueno como el texto que recibe.

¿Cómo empezar a usarlo en tu empresa sin sobre-invertir?

La forma más barata de probarlo es a través del nivel gratuito de la API de Gemini en Google AI Studio, sin comprometer presupuesto ni infraestructura. A nivel de empresa aplica para cualquier tamaño: desarrolladores independientes y startups pueden empezar en el nivel gratuito de la API de Gemini vía Google AI Studio, los equipos de mercado medio migran al nivel pagado para límites de tasa más altos, y las empresas reguladas enrutan a través de Gemini Enterprise Agent Platform, que añade throughput aprovisionado, controles de cumplimiento y descuentos por volumen [8].

Vale la pena recordar que tanto el nivel de desarrollador como el empresarial siguen en preview público, así que cualquier compromiso de producción debe tratarse con esa salvedad [8]. Antes de construir un pipeline completo de transcripción y análisis, conviene validar con un piloto acotado (por ejemplo, un solo equipo comercial durante un mes) y medir el impacto real en tiempo de gestión administrativa y en calidad de los insights de venta, algo que se conecta con lo que ya cubrimos sobre análisis predictivo de ventas B2B.

Si la meta es integrar esto dentro de un flujo más amplio de agentes que orquesten transcripción, análisis y actualización de CRM sin intervención manual, ese es exactamente el tipo de arquitectura que cubre nuestro servicio de automatización con agentes de IA y MCP.

Conclusiones Clave

  1. Gemini 3.5 Transcribe reemplaza a Chirp 3 como el modelo de voz a texto insignia de Google y unifica transcripción con la API general de Gemini.
  2. La precisión reportada es competitiva: 2,6% de WER en modo no continuo y 4,0% en streaming, con 70% menos tiempo hasta la transcripción final frente a Chirp 3.
  3. El precio es accionable para pymes: aproximadamente 30 centavos de dólar por hora de audio en modo no continuo.
  4. La novedad real frente a Chirp 3 es la "smart transcription": limpieza de muletillas, autocorrecciones y formateo automático, no la diarización ni el vocabulario personalizado que ya existían.
  5. El caso de uso de negocio más claro está en análisis de llamadas de ventas, auditoría de calidad en atención al cliente y registro automático en el CRM.
  6. Todavía está en preview público, tanto en el nivel de desarrollador como en el empresarial, así que cualquier despliegue en producción debe planearse con esa reserva.
  7. La competencia se mueve rápido: Microsoft (MAI-Transcribe-1) y OpenAI (GPT-Realtime-Whisper) lanzaron modelos comparables meses antes, así que conviene evaluar los tres antes de comprometerse con uno.

¿Vale la pena adoptarlo ya?

Si tu empresa ya tiene un volumen relevante de llamadas de ventas o de soporte y hoy no las transcribe ni las analiza sistemáticamente, la respuesta es sí: el costo por hora es bajo y el retorno en visibilidad sobre lo que realmente pasa en cada conversación comercial suele justificar un piloto rápido. Si ya usas Chirp 3, Whisper o un proveedor especializado como Deepgram o AssemblyAI, vale la pena correr una comparación de precisión y costo antes de migrar, en lugar de cambiar solo porque el anuncio viene de Google.


Sobre el Autor

Juan P Franco es consultor en expansión digital, comercio electrónico y automatización con agentes de IA. Ayuda a empresas de todo tamaño y modelo de negocio (B2B, B2C, retail, D2C) a crecer en canales digitales con estrategias basadas en datos y tecnología.

Referencias

[1] Gemini 3.5 Transcribe | Gemini API | Google AI for Developers

[2] Gemini 3.5 Transcribe | Gemini Enterprise Agent Platform | Google Cloud Documentation

[3] Google launches Gemini 3.5 Transcribe, which powers Gboard Rambler & is coming to Chrome (9to5Google)

[4] Gemini 3.5 Transcribe: Google's New Speech-to-Text Model (Spokenly)

[5] Intelligent transcription with Gemini 3.5 Transcribe (Google Blog)

[6] Google DeepMind Launches Gemini 3.5 Transcribe Speech-to-Text Model (TUN)

[7] Gemini 3.5 Transcribe pricing detail (Spokenly)

[8] Google AI Releases Gemini 3.5 Transcribe: A Speech-to-Text Model Reporting 2.6% Average WER Across 85+ Languages (MarkTechPost)

Temas relacionados:
Gemini 3.5 Transcribespeech-to-text IAtranscripción de voz con IAGoogle DeepMindatención al cliente con IAanálisis de llamadas de ventas

¿Te resultó útil este artículo?

Recibe cada semana estrategias de expansión digital B2B, eCommerce y tendencias de IA directamente en tu bandeja de entrada.

Sin spam. Cancela cuando quieras. Leer política de privacidad.

¿Necesitas ayuda con tu estrategia digital?

Agenda una consulta gratuita de 30 minutos y exploremos cómo puedo ayudarte.

Agendar Consultoría Gratuita