Google presentó Gemini 2.5 Flash Transcribe y Gemini 2.5 Pro Transcribe, modelos de conversión de voz a texto que heredan la arquitectura de su actual generación Gemini 2.5 en lugar de ser sistemas ASR diseñados específicamente. El resultado práctico es claro: obtienes transcripciones que pueden aprovechar una comprensión del lenguaje más profunda, no solo coincidencia de patrones acústicos, lo que es especialmente importante en audio ruidoso, acentos marcados, vocabulario técnico y contenido multilingüe.

Ambos modelos están disponibles hoy a través de la API de Gemini. Flash Transcribe se posiciona como la opción de baja latencia y bajo costo, ideal para procesos de alto volumen, mientras que Pro Transcribe apunta a casos donde la precisión es crítica y estás dispuesto a gastar más por token para obtener mejores resultados en audio difícil.

Google lanza Gemini 2.5 Flash y Pro Transcribe: reconocimiento de voz basado en sus últimos modelos

Lo interesante desde el punto de vista arquitectónico es que Google trata la transcripción como una tarea de generación en lugar de clasificación. El modelo produce texto de la misma manera que genera cualquier otro resultado, lo que significa que puede aplicar razonamiento contextual: entender que un hablante mencionó un nombre de producto o un término técnico basándose en el contexto circundante, no solo en similitud fonética.

Para desarrolladores que actualmente usan Whisper, AWS Transcribe o la API anterior de Speech-to-Text de Google, vale la pena comparar esto con tus datos de audio reales. Los benchmarks agregados rara vez reflejan el desempeño en el mundo real con contenido específico de un dominio. Prueba una muestra de tus casos de transcripción más complejos —grabaciones largas, hablantes superpuestos, jerga técnica— y mide directamente la tasa de error de palabras.

El precio y los límites de velocidad a través de la API de Gemini determinarán si esto es viable a escala de producción para la mayoría de los equipos. El enfoque de familia de modelos también sugiere que Google tiene la intención de mantener las capacidades de transcripción actualizadas en sincronía con sus mejoras de modelo central, en lugar de mantener una hoja de ruta ASR separada, una consideración importante a largo plazo al elegir infraestructura.