Última generación

Biblioteca de modelos de IA

Una sola API para ejecutar inferencias en más de 200 modelos de IA de vanguardia y desplegarlos en segundos

Última generación

Biblioteca de modelos de IA

Una sola API para ejecutar inferencias en más de 200 modelos de IA de vanguardia y desplegarlos en segundos

Última generación

Biblioteca de modelos de IA

Una sola API para ejecutar inferencias en más de 200 modelos de IA de vanguardia y desplegarlos en segundos

IndexTeam

Text-to-Speech

IndexTTS-2

IndexTTS2 es un modelo de Text-to-Speech (TTS) zero-shot autorregresivo y revolucionario, diseñado para abordar el desafío del control preciso de la duración en sistemas TTS a gran escala, lo cual representa una limitación significativa en aplicaciones como el doblaje de Video. Introduce un método nuevo y general para el control de la duración del habla, que admite dos modos: uno que especifica explícitamente el número de tokens generados para una duración precisa y otro que genera el habla libremente de manera autorregresiva. Además, IndexTTS2 logra el desacoplamiento entre la expresión emocional y la identidad del hablante, lo que permite un control independiente del timbre y la emoción a través de indicaciones independientes. Para mejorar la claridad del habla en expresiones altamente emocionales, el modelo incorpora representaciones latentes de GPT y utiliza un paradigma de entrenamiento nuevo de tres etapas. Con el fin de reducir la barrera para el control emocional, también cuenta con un mecanismo de instrucciones suaves basado en descripciones de Text, desarrollado mediante el ajuste fino de Qwen3, para guiar de manera efectiva la generación de habla con el tono emocional deseado. Los resultados experimentales muestran que IndexTTS2 supera a los modelos TTS zero-shot más avanzados en tasa de error de palabras, similitud de hablante y fidelidad emocional en múltiples conjuntos de datos....

$

7.15

/ M UTF-8 bytes

Input almacenada en caché:

$

texto

/ M UTF-8 bytes

Fish Audio

Text-to-Speech

Fish-Speech-1.5

Fish Speech V1.5 es un modelo líder de generación de Text a voz (TTS) de código abierto. El modelo emplea una arquitectura innovadora DualAR de tipo transformador autorregresivo dual. Soporta múltiples idiomas, con más de 300 000 horas de datos de entrenamiento tanto para inglés como para chino, y más de 100 000 horas para japonés. En evaluaciones independientes realizadas por TTS Arena, el modelo obtuvo un rendimiento excepcional, con una puntuación ELO de 1339. El modelo alcanzó una tasa de error de palabra (WER) del 3.5 % y una tasa de error de caracteres (CER) del 1.2 % para el inglés, y una CER del 1.3 % para los caracteres chinos....

$

15.0

/ M UTF-8 bytes

Input almacenada en caché:

$

texto

/ M UTF-8 bytes

FunAudioLLM

Text-to-Speech

FunAudioLLM/CosyVoice2-0.5B

CosyVoice 2 es un modelo de síntesis de voz en streaming basado en un gran modelo de lenguaje, que emplea un diseño de marco unificado de streaming y no streaming. El modelo mejora la utilización del libro de códigos de token de voz mediante la cuantificación escalar finita (FSQ), simplifica la arquitectura del modelo de lenguaje de Text a voz y desarrolla un modelo de emparejamiento de streaming causal con reconocimiento de fragmentos que admite diferentes escenarios de síntesis. En el modo de streaming, el modelo logra una latencia ultrabaja de 150 ms mientras mantiene una calidad de síntesis casi idéntica a la del modo no streaming. En comparación con la versión 1.0, la tasa de errores de pronunciación se ha reducido entre un 30% y un 50%, la puntuación MOS ha mejorado de 5.4 a 5.53 y se admite un control detallado de las emociones y los dialectos. El modelo es compatible con el chino (incluidos dialectos: cantonés, dialecto de Sichuan, shanghainés, dialecto de Tianjin, etc.), inglés, japonés, coreano, y admite escenarios multilingües y de idiomas mixtos....

$

7.15

/ M UTF-8 bytes

Input almacenada en caché:

$

texto

/ M UTF-8 bytes

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

¿Listo para acelerar tu desarrollo de IA?

© 2026 SiliconFlow

© 2026 SiliconFlow

© 2026 SiliconFlow