Tencent a récemment annoncé le lancement de Hy4-preview, un nouveau modèle d’intelligence artificielle à pondération ouverte, spécifiquement conçu pour des tâches telles que la programmation, la recherche et d’autres activités nécessitant un investissement temporel important. Son point le plus marquant, avec 770 milliards de paramètres, ne représente cependant qu’une partie de son architecture : grâce à un système de mixage d’experts, seulement environ 49 milliards de paramètres sont activés pour traiter chaque token. L’objectif est de marier une grande capacité globale à un coût computationnel inférieur à celui des modèles denses de comparable taille.
Les poids, le code associé et la documentation technique de Hy4 sont mis à disposition sous licence Apache 2.0 sur diverses plateformes, dont Hugging Face. À noter que cette version est qualifiée de préliminaire. Tencent reconnaît également que Hy4 peut parfois générer des raisonnements excessifs et vérifier ses réponses de manière excessive. Ces réserves sont d’autant plus pertinentes en regard des résultats des tests largement fournis par l’entreprise elle-même.

Un modèle colossal n’activant qu’une fraction de ses experts
Hy4 possède 78 couches. La première inclut un bloc neuronal dense classique, tandis que les 77 suivantes reposent sur un mélange d’experts. Chacune de ces couches comprend 256 experts spécialisés, plus un expert commun. Pour chaque token, un routeur sélectionne les huit experts jugés les plus pertinents, en plus du bloc commun. Cette architecture permet d’éviter de mobiliser les 770 milliards de paramètres à chaque calcul.
Il est donc essentiel de distinguer la capacité de stockage de l’activation réelle. Le nombre total de paramètres donne une indication sur la diversité potentielle du système et la taille des poids à intégrer, tandis que les 49 milliards activés déterminent le volume d’opérations nécessaires lors de l’inférence. Cette approche est devenue une caractéristique centrale des récents modèles chinois, tel que le DeepSeek V4. Elle ne supprime toutefois pas les contraintes matérielles : accueillir tous les experts demeure inaccessibile pour un ordinateur personnel standard.
La fiche officielle de Hy4 mentionne également un mécanisme de prédiction de jetons multiples (MTP) visant à accélérer la génération spéculative. Une petite couche auxiliaire anticipe les suites, puis le modèle principal valide plusieurs éléments en un seul passage lorsque les prédictions sont correctes. Tencent y ajoute une attention limitée et un cache d’index pour restreindre le coût d’un contexte allant jusqu’à un million de jetons.
Polyvalence dans le codage, la recherche et la cybersécurité
Tencent positionne Hy4 comme un outil aux multiples applications dans le domaine de l’ingénierie logicielle, la recherche, la finance, la cybersécurité et le développement de jeux. En théorie, un contexte d’un million de jetons peut englober de vastes référentiels de code ou de longs documents. Toutefois, cette limite ne garantit pas que le modèle exploite chaque détail avec la même précision : la qualité des informations distantes doit encore être validée par des tests indépendants.
Pour ses évaluations internes, Tencent a mobilisé 163 experts sur 203 tâches d’ingénierie concrètes. La société affirme que Hy4 obtient une note moyenne de 2,99, contre 2,92 pour GLM-5.3 et 2,94 pour Kimi K3. Comparativement à GLM-5.3, Hy4 aurait remporté 46,8 % des comparaisons, avec 12,8 % d’égalité. En affrontement contre Kimi K3, la part de victoire annoncée atteint 51,2 %, avec 7,9 % d’égalité. Bien que ces chiffres soient indicatifs pour cerner l’orientation du produit, ils ne remplacent pas une campagne d’évaluation indépendante et reproductible basée sur des paramètres similaires.
Cet lancement intensifie la concurrence rapide entre les laboratoires chinois. KultureGeek a récemment suivi les accusations américaines concernant Kimi K3, tandis que Meta a présenté Muse Glimmer, misant sur un modèle pouvant tenir sur un seul PC. En revanche, Hy4 s’inscrit à l’opposée : ouvert au téléchargement et à l’audit, mais conçu pour des infrastructures serveur de grande envergure.
L’ouverture ne garantit pas une accessibilité immédiate
La licence Apache 2.0 offre une flexibilité pour la réutilisation commerciale et facilite l’expérimentation par des équipes externes. Cette transparence permet d’inspecter les poids, de personnaliser le modèle et d’évaluer ses défauts sans dépendre uniquement d’une API fermée. Néanmoins, au moment de l’annonce, aucune offre d’inférence hébergée n’était encore proposée directement sur sa page Hugging Face. Pour de nombreux développeurs, l’accès pratique se réalisera donc soit par le biais d’un fournisseur de calcul externe, soit par les futures intégrations prévues par Tencent.
Le groupe envisage d’intégrer Hy4 dans CodeBuddy et WorkBuddy. Cette transition, de la publication des poids à la mise en place d’un service utilisable, sera cruciale : la latence, le coût, les quotas et les politiques de conservation des données s’avèrent tout aussi déterminants que les résultats bruts pour une entreprise. Le marché des modèles ouverts est également en pleine consolidation, illustré par le projet d’acquisition de Hugging Face par Nvidia.
Il est prématuré de désigner Hy4 comme un nouveau champion sur la seule base de ses évaluations internes. Il représente néanmoins une publication significative en raison de sa taille, de sa licence et de son orientation vers des tâches pratiques. De futurs tests devront établir si son routage expert tient ses promesses, si son contexte très long reste fiable et si les bénéfices justifient la complexité inhérente à son hébergement. Ce sont précisément les avantages d’une diffusion ouverte : les affirmations de Tencent pourront être confrontées aux mesures communautaires.






