Fish Speech V1.5 es un modelo líder de generación de Text a voz (TTS) de código abierto. El modelo emplea una arquitectura innovadora DualAR de tipo transformador autorregresivo dual. Soporta múltiples idiomas, con más de 300 000 horas de datos de entrenamiento tanto para inglés como para chino, y más de 100 000 horas para japonés. En evaluaciones independientes realizadas por TTS Arena, el modelo obtuvo un rendimiento excepcional, con una puntuación ELO de 1339. El modelo alcanzó una tasa de error de palabra (WER) del 3.5 % y una tasa de error de caracteres (CER) del 1.2 % para el inglés, y una CER del 1.3 % para los caracteres chinos....