
Tencent
Text Generation
Hunyuan-A13B-Instruct
Hunyuan-A13B-Instruct activa solo 13 B de sus 80 B de parámetros, pero iguala a LLMs mucho más grandes en los principales benchmarks. Ofrece un razonamiento híbrido: modo "rápido" de baja latencia o modo "lento" de alta precisión, intercambiables por llamada. Un contexto nativo de 256 K-tokens le permite digerir documentos del tamaño de un libro sin degradación. Las habilidades de agente están ajustadas para el liderazgo en BFCL-v3, τ-Bench y C3-Bench, lo que lo convierte en un excelente motor para asistentes autónomos. La tecnología Grouped Query Attention junto con la cuantificación multiformato ofrece una inferencia ligera en memoria y eficiente en GPU para implementaciones en el mundo real, con soporte multilingüe integrado y una sólida alineación de seguridad para aplicaciones de nivel empresarial....
Contexto total:
131K
Output máx.:
131K
Input:
$
0.14
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
0.57
/ M Tokens

Tencent
Text Generation
Hy4-preview
Hy4 preview es el modelo insignia de productividad de nueva generación de Tencent Hy, basado en Gated DeepSeek Sparse Attention con diseño residual iHC, con aproximadamente 770B de parámetros totales y 49B de parámetros activos por token. Soporta de forma nativa una ventana de contexto de 1M con hasta 64k de Output y una capa MTP nativa para decodificación especulativa que aumenta el rendimiento de generación. Demuestra una gran comprensión, planificación y ejecución sostenida en tareas complejas, y admite de forma nativa llamadas a herramientas, Output estructurado y almacenamiento en caché de contexto. Profundamente optimizado para escenarios de Agent, Coding y productividad, se adapta a la planificación a largo plazo y a los flujos de trabajo de código....
Contexto total:
1049K
Output máx.:
262K
Input:
$
0.834
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
2.501
/ M Tokens

Tencent
Text Generation
Hy3
Creado para escenarios empresariales del mundo real, Hy3 cuenta con una arquitectura MoE activa de 295B/21B, soporte nativo de contexto de 256K y tres modos de razonamiento. Mejora la codificación, la comprensión de textos largos, el diálogo multiturno y la ejecución de tareas agénticas, equilibrando la fiabilidad, la eficiencia y el coste tanto en interacciones de alta frecuencia como en flujos de trabajo complejos....
Contexto total:
262K
Output máx.:
262K
Input:
$
0.132
/ M Tokens
Input almacenada en caché:
$
texto
/ M Tokens
Output:
$
0.528
/ M Tokens

