IndexTTS2 es un modelo de Text-to-Speech (TTS) zero-shot autorregresivo y revolucionario, diseñado para abordar el desafío del control preciso de la duración en sistemas TTS a gran escala, lo cual representa una limitación significativa en aplicaciones como el doblaje de Video. Introduce un método nuevo y general para el control de la duración del habla, que admite dos modos: uno que especifica explícitamente el número de tokens generados para una duración precisa y otro que genera el habla libremente de manera autorregresiva. Además, IndexTTS2 logra el desacoplamiento entre la expresión emocional y la identidad del hablante, lo que permite un control independiente del timbre y la emoción a través de indicaciones independientes. Para mejorar la claridad del habla en expresiones altamente emocionales, el modelo incorpora representaciones latentes de GPT y utiliza un paradigma de entrenamiento nuevo de tres etapas. Con el fin de reducir la barrera para el control emocional, también cuenta con un mecanismo de instrucciones suaves basado en descripciones de Text, desarrollado mediante el ajuste fino de Qwen3, para guiar de manera efectiva la generación de habla con el tono emocional deseado. Los resultados experimentales muestran que IndexTTS2 supera a los modelos TTS zero-shot más avanzados en tasa de error de palabras, similitud de hablante y fidelidad emocional en múltiples conjuntos de datos....