28 de agosto de 2026 · Google DeepMind
Google lanza Gemini 3.5 Transcribe: voz a texto con 2.6% de tasa de error en 85+ idiomas
Mi opinión: Google DeepMind lanzó esta semana Gemini 3.5 Transcribe, un modelo de reconocimiento de voz que registra una tasa de error promedio de 2.6% en modo estándar y 4.0% en modo streaming, según mediciones de la firma independiente Artificial Analysis. Reconoce automáticamente más de 85 idiomas, elimina muletillas, separa hablantes y es un 70% más rápido que su predecesor, Chirp 3.
Para creadores de contenido, periodistas, podcasters y cualquier profesional que trabaje con audio, esto es una herramienta concreta y medible: transcripción precisa en varios idiomas, sin tener que editar manualmente los errores más comunes. Yo uso herramientas de transcripción todos los días, y la diferencia entre un 5% y un 2.6% de tasa de error no es menor: es la diferencia entre una revisión rápida y una edición completa.
La pregunta práctica es: ¿cuántas horas a la semana pierdes transcribiendo, revisando o reformateando audio o video? Si la respuesta es más de dos, herramientas como esta empiezan a tener sentido económico. La IA no lo hará perfecto siempre, pero a 2.6% de tasa de error, ya es útil la mayor parte del tiempo.
¿Quieres usar estas herramientas? Mira las reseñas sin filtro o vuelve a las noticias.