FunAudioLLM/CosyVoice2-0.5B
Acerca de FunAudioLLM/CosyVoice2-0.5B
CosyVoice 2 es un modelo de síntesis de voz en streaming basado en un gran modelo de lenguaje, que emplea un diseño de marco unificado de streaming y no streaming. El modelo mejora la utilización del libro de códigos de token de voz mediante la cuantificación escalar finita (FSQ), simplifica la arquitectura del modelo de lenguaje de Text a voz y desarrolla un modelo de emparejamiento de streaming causal con reconocimiento de fragmentos que admite diferentes escenarios de síntesis. En el modo de streaming, el modelo logra una latencia ultrabaja de 150 ms mientras mantiene una calidad de síntesis casi idéntica a la del modo no streaming. En comparación con la versión 1.0, la tasa de errores de pronunciación se ha reducido entre un 30% y un 50%, la puntuación MOS ha mejorado de 5.4 a 5.53 y se admite un control detallado de las emociones y los dialectos. El modelo es compatible con el chino (incluidos dialectos: cantonés, dialecto de Sichuan, shanghainés, dialecto de Tianjin, etc.), inglés, japonés, coreano, y admite escenarios multilingües y de idiomas mixtos.
Serverless disponible
Ejecute consultas de forma inmediata y pague solo por el uso
Precio
$
7.15
/ M UTF-8 bytes
Metadatos
Especificación
Estado
Available
Arquitectura
LLM-based TTS
Calibrado
Sí
Mezcla de expertos
No
Parámetros totales
1B
Parámetros activados
0.5B
Razonamiento
No
Precisión
FP8
Longitud del contexto
0K
Tokens máximos
Funcionalidades admitidas
Serverless
Compatible
Serverless LoRA
No compatible
Ajuste fino
No compatible
Embeddings
No compatible
Rerankers
No compatible
Soporte para Input de Image
No compatible
JSON Mode
No compatible
Outputs estructuradas
No compatible
Herramientas
No compatible
Finalización de Fim
No compatible
Completado de prefijo de Chat
No compatible
Comparar con otros modelos
Descubre cómo se compara este modelo con otros.

