Découvrez Qwen3.8-Max, le nouveau modèle MoE de 2,4 billions de paramètres d'Alibaba qui redéfinit le codage autonome et les capacités multimodales.

Le 3 août 2026 restera gravé dans l'histoire de l'intelligence artificielle. L'équipe Alibaba Qwen vient de lever le voile sur Qwen3.8-Max, un modèle qui ne se contente pas de répondre à des questions, mais qui agit véritablement comme un agent autonome capable de gérer des projets complexes sur de longues durées.
Ce n'est pas simplement une mise à jour incrémentale. Avec une architecture Mixture-of-Experts (MoE) massive de 2,4 billions de paramètres, Qwen3.8-Max franchit la barrière entre l'assistance textuelle et l'exécution professionnelle complète. Pour les ingénieurs et les développeurs, cela signifie passer de la génération de snippets de code à la délégation de projets entiers.
Au cœur de Qwen3.8-Max se trouve une architecture MoE optimisée qui permet une efficacité de calcul phénoménale malgré sa taille colossale. Contrairement aux modèles précédents, la multimodalité est ici native : le modèle ne se contente pas de 'voir' des images, il intègre la compréhension visuelle dans tout son cycle de planification et d'exécution.
Cette capacité permet une analyse sémantique profonde de documents ultra-longs et de contenus vidéo étendus. Le modèle peut planifier une tâche, l'exécuter, vérifier le résultat visuel et itérer de manière autonome. C'est cette boucle de rétroaction fermée qui permet au modèle de s'auto-évoluer lors de tâches à long horizon.
L'une des preuves les plus frappantes de la puissance de Qwen3.8-Max est sa capacité de codage autonome. Le modèle a démontré qu'il pouvait construire le projet 'oh-my-cli' de zéro, en partant d'un dossier vide pour livrer un projet complet sur une période simulée de plus de 10 jours.
Pour y parvenir, il utilise un 'self-evolving harness' (dispositif d'auto-évolution) qui combine une machine à états pour les tickets (issues), un dispatcher, un moniteur et un watchdog. Le processus est rigoureux : les exigences passent par des états 'ready', 'leased' et 'active', suivis de tests E2E et de vérifications CI avant toute fusion de Pull Request. Le système déclenche automatiquement des tests de build, des tests unitaires et des validations de cycle de vie desktop après chaque mise à jour.
Les chiffres parlent d'eux-mêmes. Sur les benchmarks de codage agent, Qwen3.8-Max surclasse ses prédécesseurs et ses concurrents directs. Il atteint notamment un score de 67.7 sur SWE-bench Pro et domine PaperBench avec 93.0. Dans le domaine des agents généraux, il excelle avec 81.9 sur WideSearch.
Un exploit remarquable a été réalisé lors du challenge WWW2025 sur la plateforme Alibaba Cloud Tianchi. En seulement 24 heures, Qwen3.8-Max a battu 458 équipes humaines (87% du terrain) dans la reconnaissance d'intentions de dialogue multimodal. Le modèle a construit sa propre solution en code, combinant BERT, MacBERT, RoBERTa et Qwen2.5-VL-7B dans un système de vote pondéré, faisant grimper sa précision de 0.60 à 0.853.
Alibaba propose une structure de prix compétitive, pensée pour l'échelle industrielle. L'accent est mis sur l'efficacité grâce à des mécanismes de cache sophistiqués, réduisant drastiquement les coûts pour les requêtes répétitives ou les contextes longs.
Le système de cache explicite et implicite permet aux développeurs d'optimiser leurs coûts de production, notamment pour les agents qui nécessitent de maintenir un historique de conversation ou de document très volumineux.
Qwen3.8-Max est conçu pour les environnements de production exigeants. Que ce soit pour le développement logiciel complet, l'analyse financière complexe ou la gestion de services clients multimodaux, le modèle agit comme un collaborateur de niveau senior.
Pour commencer, les développeurs peuvent accéder au modèle via l'API officielle d'Alibaba Cloud. L'intégration se fait via les SDK standards, permettant de déployer rapidement des agents capables de gérer des workflows dynamiques, de la session replay jusqu'à l'exécution de commandes desktop.
API Pricing — Input: $2 / 1M tokens / Output: $6 / 1M tokens / Context: Explicit cache creation $2.5/1M, explicit cache read $0.17/1M