O Google anunciou o Gemini 3.5 Transcribe em 26 de agosto às 17:00 UTC, um modelo de speech-to-text voltado a interfaces de voz. O post contém quatro números de taxa de erro de palavras. Dois deles serão citados; os outros dois são os que descrevem o desempenho multilíngue.
Os dois pares
O primeiro par é atribuído à Artificial Analysis, uma avaliadora externa: o modelo "atinge uma Taxa Média de Erro de Palavras (WER) de 4,0% para streaming e 2,6% para casos de uso sem streaming." O segundo par é do próprio Google, no benchmark multilíngue FLEURS em idiomas e localidades principais: "5,50% de WER em modo streaming e 5,04% de WER em casos de uso sem streaming." Entre o melhor número do post e o pior, a diferença é de 2,1 vezes.
O que o enquadramento comum interpreta errado
O número que circula é 2,6%, e ele está sendo associado à दावा de que o modelo lida com 85+ idiomas. São duas medições diferentes. Os 2,6% são uma média do que o post chama de casos de uso principais; o número multilíngue, em um benchmark multilíngue padrão, é 5,04% — quase o dobro. A taxa de erro de um modelo de transcrição só faz sentido junto com o conjunto de idiomas e as condições de áudio em que foi medida, e este post é incomumente transparente ao publicar ambas. A distorção acontece depois, quando o número da terceira parte é acoplado à दावा multilíngue para produzir uma especificação que não aparece em nenhum lugar da fonte.
Prévia, não lançamento
O status é prévia pública. Essa expressão importa. O modelo pode ser acessado pela Gemini API no Google AI Studio e na plataforma de agentes Gemini Enterprise, e aparece no Rambler no Android em países e idiomas selecionados, no app Gemini no macOS, e no Gboard e no Google Antigravity. O Chrome é listado como disponível em breve. Uma prévia pública não traz compromisso de nível de serviço, garantia de estabilidade de preços nem assegura que o endpoint sobreviverá em sua forma atual.
Por que a diferença no streaming importa mais do que a manchete
Em ambos os pares, o streaming é pior do que o sem streaming — 4,0% contra 2,6%, e 5,50% contra 5,04%. Isso é esperado: um modelo de streaming se compromete com palavras antes de ouvir o restante da frase. Mas é a taxa de streaming que rege agentes de voz ao vivo, a aplicação para a qual este modelo está posicionado. Quem dimensionar um produto de voz com base em 2,6% estará se baseando no caso em lote sob um subconjunto de condições, quando o número que determinará se o produto parece utilizável é o de streaming multilíngue, em 5,50%.
