Fish-Speech-1.5
Acerca de Fish-Speech-1.5
Fish Speech V1.5 es un modelo líder de generación de Text a voz (TTS) de código abierto. El modelo emplea una arquitectura innovadora DualAR de tipo transformador autorregresivo dual. Soporta múltiples idiomas, con más de 300 000 horas de datos de entrenamiento tanto para inglés como para chino, y más de 100 000 horas para japonés. En evaluaciones independientes realizadas por TTS Arena, el modelo obtuvo un rendimiento excepcional, con una puntuación ELO de 1339. El modelo alcanzó una tasa de error de palabra (WER) del 3.5 % y una tasa de error de caracteres (CER) del 1.2 % para el inglés, y una CER del 1.3 % para los caracteres chinos.
Serverless disponible
Ejecute consultas de forma inmediata y pague solo por el uso
Precio
$
15.0
/ M UTF-8 bytes
Metadatos
Especificación
Estado
Available
Arquitectura
DualAR Transformer
Calibrado
No
Mezcla de expertos
No
Parámetros totales
Parámetros activados
Razonamiento
No
Precisión
FP8
Longitud del contexto
0K
Tokens máximos
Funcionalidades admitidas
Serverless
Compatible
Serverless LoRA
No compatible
Ajuste fino
No compatible
Embeddings
No compatible
Rerankers
No compatible
Soporte para Input de Image
No compatible
JSON Mode
No compatible
Outputs estructuradas
No compatible
Herramientas
No compatible
Finalización de Fim
No compatible
Completado de prefijo de Chat
No compatible
Comparar con otros modelos
Descubre cómo se compara este modelo con otros.
