Google anunció Gemini 3.5 Transcribe el 26 de agosto a las 17:00 UTC, un modelo de voz a texto orientado a interfaces de voz. La publicación contiene cuatro cifras de tasa de error de palabras. Se citarán dos; las otras dos son las que describen el rendimiento multilingüe.
Los dos pares
El primer par se atribuye a Artificial Analysis, un evaluador externo: el modelo "alcanza una tasa media de error de palabras (WER) del 4,0% para streaming y del 2,6% para casos de uso sin streaming." El segundo par es propio de Google, en el benchmark multilingüe FLEURS en los principales idiomas y localizaciones: "5,50% de WER en modo streaming y 5,04% de WER en casos de uso sin streaming." Entre la mejor cifra de la publicación y la peor, la diferencia es de 2,1 veces.
Qué falla en el encuadre habitual
La cifra que circula es 2,6%, y se está asociando a la afirmación de que el modelo admite 85+ idiomas. Son dos mediciones distintas. El 2,6% es una media sobre lo que la publicación denomina casos de uso principales; la cifra multilingüe, en un benchmark multilingüe estándar, es 5,04%, casi el doble. La tasa de error de un modelo de transcripción solo tiene sentido junto con el conjunto de idiomas y las condiciones de audio con las que se ha medido, y esta publicación es inusualmente transparente al publicar ambas. La distorsión se produce aguas abajo, cuando la cifra de terceros se acopla a la afirmación multilingüe para producir una especificación que no aparece en la fuente.
Vista previa, no lanzamiento
El estado es de vista previa pública. Esa expresión importa. El modelo está disponible a través de la Gemini API en Google AI Studio y en la plataforma de agentes Gemini Enterprise, y aparece en Rambler en Android en países e idiomas seleccionados, en la app de Gemini en macOS, y en Gboard y Google Antigravity. Chrome figura como disponible próximamente. Una vista previa pública no conlleva compromiso de nivel de servicio, garantía de estabilidad de precios ni assurance de que el endpoint sobreviva en su forma actual.
Por qué la brecha del streaming importa más que el titular
En ambos pares, el streaming es peor que el modo sin streaming: 4,0% frente a 2,6%, y 5,50% frente a 5,04%. Eso era esperable: un modelo en streaming se compromete con las palabras antes de haber oído el resto de la frase. Pero es la cifra de streaming la que determina los agentes de voz en directo, la aplicación para la que se posiciona este modelo. Quien dimensione un producto de voz frente al 2,6% estará comparándolo con el caso batch en un subconjunto de condiciones, cuando la cifra que decidirá si el producto resulta utilizable es la de streaming multilingüe, del 5,50%.
