CosyVoice 2 es un modelo de síntesis de voz en streaming basado en un gran modelo de lenguaje, que emplea un diseño de marco unificado de streaming y no streaming. El modelo mejora la utilización del libro de códigos de token de voz mediante la cuantificación escalar finita (FSQ), simplifica la arquitectura del modelo de lenguaje de Text a voz y desarrolla un modelo de emparejamiento de streaming causal con reconocimiento de fragmentos que admite diferentes escenarios de síntesis. En el modo de streaming, el modelo logra una latencia ultrabaja de 150 ms mientras mantiene una calidad de síntesis casi idéntica a la del modo no streaming. En comparación con la versión 1.0, la tasa de errores de pronunciación se ha reducido entre un 30% y un 50%, la puntuación MOS ha mejorado de 5.4 a 5.53 y se admite un control detallado de las emociones y los dialectos. El modelo es compatible con el chino (incluidos dialectos: cantonés, dialecto de Sichuan, shanghainés, dialecto de Tianjin, etc.), inglés, japonés, coreano, y admite escenarios multilingües y de idiomas mixtos....