Presentación preliminar de Tencent Hy4: Contexto de 1M, programación y guía de API
Índice de contenidos

Tencent Hy4 Preview es un modelo de código abierto de tipo Mixture-of-Experts diseñado para razonamiento de contexto largo, desarrollo de software, investigación y flujos de trabajo de agentes. Su red troncal de 770.000 millones de parámetros activa 49.000 millones de parámetros por token y admite una ventana de contexto de hasta un millón de tokens.
Estas especificaciones hacen que Hy4 Preview sea relevante para la programación a escala de repositorios, análisis de múltiples archivos, uso extendido de herramientas y grandes colecciones de documentos. Sin embargo, la etiqueta "Preview" es importante: Tencent identifica el exceso de razonamiento y la verificación propia innecesaria como limitaciones conocidas. Los equipos deben evaluar el modelo en tareas representativas antes de utilizarlo en producción.
¿Qué es Tencent Hy4 Preview?
Hy4 Preview es un modelo de generación de Text desarrollado por el equipo Tencent Hy. Utiliza una arquitectura MoE dispersa para combinar un recuento total de parámetros muy grande con una huella de cálculo activa más pequeña para cada token generado.
Tencent ha lanzado tanto el punto de control estándar de Hy4 Preview como una versión FP8 bajo la licencia Apache License 2.0. El modelo se puede autohospedar a través de marcos de inferencia compatibles como vLLM y SGLang. Su tarjeta de modelo oficial de Hy4 Preview incluye pesos de modelo, instrucciones de implementación, configuraciones de generación recomendadas y limitaciones conocidas.
Especificaciones principales de Hy4 Preview
Especificación | Hy4 Preview |
|---|---|
Arquitectura | Mixture-of-Experts |
Parámetros de la red troncal | 770B |
Parámetros de la red troncal activados | 49B por token |
Capas de la red troncal | 78 |
Longitud del contexto | 1M de tokens |
Expertos enrutados por capa MoE | 256 |
Expertos compartidos por capa MoE | 1 |
Expertos enrutados activados por token | 8 |
Tipo de atención | DSA con compuertas (Gated DSA) |
Flujos residuales | 4 |
Capa MTP nativa | 10B en total, 0,7B activados |
Licencia | Apache 2.0 |
Modalidad de Input | Text |
Las cifras para el total de 770B y los 49B de parámetros activados cubren la red troncal. La capa adicional nativa de Multi-Token Prediction contiene 10B de parámetros, lo que eleva la arquitectura completa a aproximadamente 780B de parámetros.
Parámetros totales frente a activados
Los parámetros totales describen la capacidad completa almacenada en el modelo. Los parámetros activados indican qué parte de esa capacidad participa en el procesamiento de cada token.
Hy4 Preview contiene 256 expertos enrutados y un experto compartido en cada una de sus 77 capas MoE. Para cada token, el modelo selecciona ocho expertos enrutados y al mismo tiempo utiliza el experto compartido. Este enrutamiento permite al modelo mantener una amplia especialización sin calcular los 770B de parámetros de la red troncal para cada token.
La cifra de 49B activos no debe interpretarse como el tamaño de implementación del modelo. El alojamiento aún requiere almacenar el punto de control completo, junto con la memoria para la caché de claves-valores (KV cache), las operaciones de tiempo de ejecución y las solicitudes de contexto largo.
¿Cómo gestiona Hy4 Preview un contexto de 1M de tokens?
Hy4 Preview admite una longitud de contexto declarada de un millón de tokens. Su arquitectura utiliza atención dispersa y reutilización de índices entre capas para reducir parte del cálculo asociado con el procesamiento de secuencias muy largas.
Un límite de un millón de tokens es un techo de capacidad, no una garantía de un recuerdo perfecto en todo el prompt. La calidad de la recuperación sigue dependiendo de la estructura del documento, el diseño del prompt, la densidad de la información y el lugar donde aparece la evidencia relevante.
Gated DSA e IndexCache
Hy4 Preview utiliza Gated DeepSeek Sparse Attention, o Gated DSA. En lugar de realizar una atención completa en cada par de tokens en cada capa, el indexador disperso selecciona hasta 2.048 tokens relevantes para cada posición de consulta.
IndexCache reduce la sobrecarga adicional al permitir que las capas seleccionadas reutilicen los índices de tokens dispersos calculados por las capas cercanas. La investigación subyacente de IndexCache informa que, en un modelo DSA de 30B independiente, eliminar el 75 % de los cálculos del indexador produjo hasta una aceleración de prellenado de 1,82 veces y una aceleración de decodificación de 1,48 veces con una pérdida de calidad limitada.
Estas cifras de rendimiento provienen de la configuración de investigación de IndexCache y no deben tratarse como una latencia garantizada de la API de Hy4 Preview.
iHC y MTP nativo
El modelo también utiliza identity Hyper-Connections, o iHC, con cuatro flujos residuales. Según la descripción de la arquitectura de Tencent, este diseño amplía las rutas a través de las cuales la información puede moverse entre las capas.
Su capa nativa de Multi-Token Prediction admite la decodificación especulativa. La capa MTP propone múltiples tokens futuros, que el modelo principal puede verificar conjuntamente. Esto puede reducir la latencia interactiva cuando el motor de inferencia, el hardware y la carga de trabajo están configurados para beneficiarse de la decodificación especulativa.
MTP no mejora automáticamente cada implementación. Bajo cargas de trabajo con un procesamiento por lotes pesado, el costo de generar y verificar tokens de borrador puede compensar el beneficio de latencia.
¿Qué puede hacer Hy4 Preview?
Hy4 Preview es más adecuado para tareas que combinan entradas largas, razonamiento de múltiples pasos, generación de código o uso de herramientas. Los modelos más pequeños pueden seguir siendo más económicos para tareas de clasificación corta, extracción y solicitudes habituales de Chat.
Flujos de trabajo de programación y agentes
El modelo está diseñado para tareas de software de largo alcance tales como:
Explorar grandes repositorios antes de proponer un cambio
Rastrear el comportamiento en archivos fuente, pruebas y documentación
Planificar e implementar refactorizaciones de múltiples archivos
Escribir y reparar pruebas
Depurar fallos a través de la terminal o herramientas de desarrollo
Para un uso fiable de los agentes, las aplicaciones deben definir permisos de herramientas, tiempos de espera de ejecución, límites de reintento y puntos de aprobación humana. Una puntuación alta en una prueba de rendimiento de programación no hace que el acceso sin restricciones a la consola de comandos o la implementación automática en producción sean seguros.
Tareas de documentación e investigación
La gran ventana de contexto también admite flujos de trabajo con gran volumen de documentos, incluida la comparación de contratos, la revisión de literatura técnica, el análisis financiero y la síntesis de múltiples informes.
Los desarrolladores deben estructurar las entradas grandes en lugar de colocar una colección de documentos desorganizada en un solo prompt. Las prácticas útiles incluyen agregar identificadores de documentos, solicitar al modelo que cite secciones de origen, separar la extracción de la síntesis y validar las conclusiones importantes frente al material original.
Un contexto largo puede reducir el número de pasos de recuperación, pero no elimina la necesidad de sistemas de recuperación. RAG sigue siendo útil cuando las colecciones cambian con frecuencia, exceden el límite de contexto, requieren control de acceso o necesitan una selección de fuentes rastreable.
¿Cómo rinde Hy4 Preview?
Tencent informa de mejoras sustanciales con respecto a Hy3 en evaluaciones de programación, agentes, búsqueda, oficina y razonamiento. Los resultados son prometedores, aunque la mayoría de las cifras disponibles actualmente son informadas por el proveedor en lugar de mediciones independientes.
Pruebas de rendimiento de programación y agentes
Los resultados seleccionados del apéndice de pruebas de rendimiento de Tencent incluyen:
Prueba de rendimiento | Puntuación de Hy4 Preview | Enfoque de la tarea |
|---|---|---|
Terminal-Bench 2.1 | 85.4 | Tareas de agente basadas en terminal |
DeepSWE | 64.3 | Ingeniería de software |
SWE Atlas Refactoring | 53.3 | Refactorización de base de código |
OneMillionBench With Tools | 65.4 | Uso de herramientas de contexto largo |
Toolathlon-Verified | 74.1 | Tareas de agentes multiherramienta |
APEX-Agents, Pass@1 | 37.1 | Agentes profesionales del mundo real |
Tencent evaluó los modelos en sus configuraciones de razonamiento más altas disponibles y utilizó entornos de agentes específicos para las pruebas de rendimiento. Algunos resultados de comparación se reprodujeron internamente en lugar de tomarse de evaluaciones públicas idénticas.
La conclusión práctica es que vale la pena probar Hy4 Preview para la programación a escala de repositorios y flujos de trabajo basados en herramientas. La selección para producción aún debe utilizar un conjunto de evaluación privado que refleje los lenguajes, repositorios, definiciones de herramientas, objetivos de latencia y criterios de aceptación del equipo.
Limitaciones conocidas de la versión Preview
Tencent identifica dos problemas de comportamiento actuales: el modelo puede razonar más de lo necesario en tareas complejas y puede verificar en exceso su propio Output.
Estas tendencias pueden aumentar el tiempo de respuesta, la longitud de la salida y el costo de inferencia. También pueden hacer que un agente repita las comprobaciones sin mejorar sustancialmente el resultado.
Los equipos pueden gestionar este comportamiento de las siguientes maneras:
Estableciendo condiciones de parada explícitas
Limitando las llamadas a herramientas y los turnos de los agentes
Utilizando modos de razonamiento más cortos para tareas directas
Definiendo esquemas de Output
Midiendo el costo por tarea aceptada en lugar del costo por solicitud
Requiriendo aprobación antes de acciones irreversibles
El estado de vista previa del modelo también significa que es posible que sea necesario revisar los prompts y los umbrales de evaluación a medida que se lancen puntos de control posteriores.
Cómo acceder y utilizar Hy4 Preview
Tencent proporciona recetas oficiales de implementación para vLLM y SGLang. Debido a que el punto de control completo es excepcionalmente grande, el autohospedaje requiere una memoria de acelerador sustancial y una infraestructura de inferencia distribuida. El punto de control FP8 reduce la carga de almacenamiento y memoria, pero sigue siendo una implementación a gran escala.
La receta oficial de vLLM Hy4 Preview configura la atención dispersa, la decodificación especulativa MTP, el análisis de llamadas a herramientas y un punto de conexión local compatible con OpenAI.
Ejemplo de API de Python
Después de implementar Hy4 Preview a través de vLLM o SGLang, se puede llamar al servidor local con el cliente OpenAI de Python:
Tencent recomienda temperature=0.9 y top_p=1.0 para el punto de control lanzado. El ejemplo utiliza el nombre del modelo autohospedado y el punto de conexión local documentados en las instrucciones de implementación de Tencent. Un servicio alojado puede utilizar un punto de conexión, ID de modelo, límite de contexto o conjunto de parámetros diferentes.
Precios de Hy4 Preview y cálculo de costos
El precio de Hy4 Preview no es una tarifa única universal. Los costos dependen de si el modelo se autohospeda o se accede a él a través de una API administrada.
Para una API alojada, estime el costo de la solicitud con:
Por ejemplo, una solicitud que contenga 700.000 tokens de entrada no almacenados en caché, 200.000 tokens almacenados en caché y 50.000 tokens de salida costaría:
Utilice los precios de entrada almacenada en caché únicamente cuando el proveedor seleccionado lo admita explícitamente para Hy4 Preview.
El autohospedaje requiere un cálculo diferente. Los costos relevantes incluyen horas de GPU, utilización del clúster, tiempo de carga del modelo, uso de memoria de contexto largo, redes, monitoreo y soporte de ingeniería. La licencia Apache 2.0 elimina la tarifa de licencia de los pesos del modelo, pero no hace que la inferencia sea gratuita.
Para cualquiera de los modelos de implementación, compare el costo por tarea aceptada. Una solicitud más barata puede resultar más cara si las llamadas repetidas a herramientas, el razonamiento excesivo o los resultados fallidos requieren ejecuciones adicionales.
Preguntas frecuentes sobre Tencent Hy4 Preview: contexto de 1M, programación, implementación y costos de API
P1. ¿Es Hy4 Preview de código abierto?
Sí. Tencent ha lanzado los pesos de Hy4 Preview y Hy4 Preview FP8 bajo la licencia Apache License 2.0. Los desarrolladores aún deben revisar la licencia y los requisitos operativos antes de modificar, redistribuir o implementar el modelo comercialmente.
P2. ¿Admite Hy4 Preview la entrada de Image?
No. El punto de control de Hy4 Preview lanzado está documentado como un modelo de generación de texto, y sus ejemplos de implementación oficiales utilizan mensajes de texto. La entrada de Image no figura como una modalidad admitida para este lanzamiento.
P3. ¿Puede el contexto de 1M reemplazar la recuperación?
No. Una ventana de contexto de 1M de tokens puede reducir los pasos de recuperación para conjuntos de documentos limitados, pero RAG sigue siendo valioso para colecciones cambiantes, permisos de fuentes, citas, costos de prompt más bajos y conjuntos de datos que exceden el contexto disponible.
P4. ¿Qué es Hy4 Preview FP8?
Hy4 Preview FP8 es la versión de menor precisión de Tencent del modelo instruct. Está destinada a reducir la memoria de implementación y mejorar la viabilidad de la inferencia en hardware compatible, al tiempo que conserva la misma arquitectura general del modelo y la capacidad de contexto de un millón de tokens.
Hy4 Preview es un fuerte candidato para la programación de contexto largo, la investigación y la evaluación de agentes. Sus pesos abiertos, su diseño de atención dispersa y sus recetas oficiales para servidores hacen posible la experimentación, mientras que su escala y su comportamiento en fase de vista previa requieren una planificación cuidadosa de la infraestructura, controles de costos y pruebas específicas para cada tarea.
