HomeRessources, Guides & Actualités – Actualités de l’intelligence artificielleIntelligence artificielleTop : 10 Modèles LLM Open Source Majeurs en 2026

Top : 10 Modèles LLM Open Source Majeurs en 2026

Choisir un modèle ouvert adapté à vos contraintes de calcul exige d’évaluer précisément l’équilibre entre taille mémoire, vitesse d’exécution et architecture. Cette sélection rassemble les 10 modèles en tête de l’écosystème en 2026, retenus pour leur adoption par les développeurs, leurs résultats sur les bancs d’essai et leurs spécifications techniques.

Des architectures massives à mélange d’experts (MoE) jusqu’aux formats optimisés pour machines locales, voici leurs caractéristiques détaillées.

Le choix d’un modèle dépend de trois critères concrets :

  • L’auto-hébergement direct sur du matériel grand public (PC portable ou GPU local).
  • Le déploiement sur grappes de GPU d’entreprise pour des besoins d’infrastructure privée.
  • L’adéquation avec une tâche cible : programmation autonome, calculs mathématiques ou analyse de contextes documentaires très longs.
ModèleCréateurParamètres (Total / Actifs)Fenêtre de contexteAtout principal
Kimi K3Moonshot AI2,8 T / ~50B1M tokensPlafond de performance brute et agents autonomes
DeepSeek-V4-ProDeepSeek AI1,6 T / 49B1M tokensRaisonnement profond et programmation logicielle
GLM-5.2 / 5.3Zhipu AI (Z.ai)744B / 40B1M tokensContexte long, agents et analyse cyber
Llama 4 MaverickMeta Platforms400B / 17B10M tokensMultimodalité native et auto-hébergement privé
MiniMax M3MiniMax428B / 23B1M tokensVitesse d’attention et orchestration d’outils
Qwen3.6-A3B / Qwen3.7 PlusAlibaba Cloud35B (3B actifs) / Cloud262k à 1M tokensExécution locale légère et interaction d’interface
DeepSeek-V4-Flash (V4.1)DeepSeek AI284B / 8B à 16B1M tokensDébit d’inférence élevé et coût minimal
Nemotron 3 UltraNVIDIA550B / 55B1M tokensExécution d’agents longs sur matériel d’entreprise
Gemma 4Google DeepMind2B, 9B et 31B (denses)128k tokensRapport taille-performance sur GPU grand public
GPT-oss 120bOpenAI117B / 5,1B128k tokensRaisonnement inspectable sous licence Apache 2.0

1. Kimi K3 (Moonshot AI) : le plafond de performance pour les flux autonomes

Développé par la structure pékinoise Moonshot AI et mis en ligne en juillet 2026, Kimi K3 constitue la référence en matière de volume brut parmi les modèles ouverts à mélange d’experts (MoE).

Spécifications architecturales :

  • Volume de paramètres : Environ 2,8 trillions de paramètres au total. L’architecture mobilise 896 experts, mais n’en active que 16 par token (soit environ 50 milliards de paramètres actifs) pour conserver une vitesse d’exécution exploitable.
  • Mécanismes d’attention : Intègre les technologies Kimi Delta Attention (KDA) et Attention Residuals (AttnRes), ce qui multiplie par 2,5 l’efficacité d’échelle par rapport aux versions précédentes de Kimi.
  • Contexte et multimodalité : Fenêtre native de 1 million de tokens, capable de traiter nativement le texte, l’image et la vidéo.

Le système a été conçu pour maintenir des sessions d’ingénierie prolongées avec une supervision humaine minimale. Il gère la navigation dans d’immenses bases de code, les boucles de commandes en terminal, le débogage assisté par vision et l’optimisation de noyaux GPU. Sur le plan de la recherche, il orchestre des essaims d’agents capables d’extraire des données pour générer des tableaux de bord et des rapports interactifs. Il intervient également sur des chaînes de montage vidéo (découpe, synchronisation et lecture de schémas techniques complexes).

Accès et licence : Le modèle est accessible via l’interface en ligne sur kimi.com, l’espace Kimi Work, l’agent en ligne de commande Kimi Code et par API. Les tarifs d’inférence de base s’établissent autour de 3 $ par million de tokens en entrée et 15 $ par million de tokens en sortie. La licence open-weights impose une clause de partage de revenus pour les fournisseurs d’inférence commerciale dépassant 20 millions de dollars de chiffre d’affaires annuel.

2. DeepSeek-V4-Pro (DeepSeek AI) : raisonnement lourd et bascule vers V4.1

Lancé en version préliminaire en avril 2026 puis en version de production en août 2026, DeepSeek-V4-Pro cible les tâches de programmation complexes et le raisonnement logique poussé.

Architecture et particularités techniques :

  • Paramètres : 1,6 trillion de paramètres au total pour 49 milliards de paramètres actifs par token.
  • Attention hybride : Combine Compressed Sparse Attention (CSA) et Heavily Compressed Attention (HCA). Sur une fenêtre de contexte de 1 million de tokens, cette approche n’occupe que 10 % de la mémoire de cache Key-Value (KV) requise par un modèle comme DeepSeek-V3.
  • Stabilité d’entraînement : Utilise les hyper-connexions contraintes par variétés (mHC) et l’optimiseur Muon pour éliminer les instabilités numériques durant la phase d’apprentissage.
  • Spécialisation : Recourt à l’algorithme GRPO (Group Relative Policy Optimization) pour développer des branches d’experts avant distillation finale.

DeepSeek-V4-Pro propose deux modes opérationnels : le Thinking Mode (raisonnement par chaîne de pensée explicite) et le Non-Thinking Mode (génération directe à faible latence). Sur les bancs d’essai comme SWE-bench, il rivalise avec les meilleurs systèmes fermés. Intégré à des environnements d’agents tels que Claude Code ou les outils internes de DeepSeek, il peut concevoir des simulations 3D interactives en JavaScript sans dépendre de logiciels de modélisation tiers.

Transition opérationnelle : Dès septembre 2026, DeepSeek a amorcé le retrait de son point d’accès API pour V4-Pro. Les tests indépendants ayant prouvé que l’architecture plus compacte V4.1-Flash dépasse V4-Pro en rapidité, coût et performances globales, les requêtes vers l’API deepseek-v4-pro sont automatiquement réorientées vers V4.1-Flash à tarif remisé, en attendant la sortie de V4.1-Pro. Les poids originaux de V4-Pro restent néanmoins téléchargeables pour la recherche et l’hébergement local via le portail DeepSeek.

3. GLM-5.2 / 5.3 (Zhipu AI / Z.ai) : contextes longs et découverte de vulnérabilités

Conçus par Z.ai (émanation internationale du laboratoire Zhipu AI issu de l’Université Tsinghua), les modèles GLM-5 ont connu une accélération marquée après l’introduction en bourse de la structure à Hong Kong en janvier 2026.

GLM-5.3 n’est pas une refonte complète du modèle de base : il réutilise exactement le socle MoE de 744 milliards de paramètres de GLM-5.2 (activant 40 milliards de paramètres par token). Ses gains reposent sur des optimisations post-entraînement massives via l’apprentissage par renforcement.

Caractéristiques fondamentales :

  • Gestion mémoire : Intègre l’attention clairsemée de DeepSeek pour limiter la charge sur le cache KV à travers sa fenêtre de 1 million de tokens.
  • Optimisation matérielle chinoise : Compilé nativement pour tourner sur des architectures matérielles locales (nœuds Huawei Ascend Atlas, Moore Threads, Hygon), ce qui réduit les coûts d’auto-hébergement en entreprise de près de 50 %.
  • Génie logiciel autonome : Affiche un résultat de 77,8 % sur le banc d’essai SWE-bench Verified. Il génère directement des documents structurés complexes (fichiers .docx, .pdf, .xlsx) via l’exécution dynamique de scripts de code.

Alerte sur les capacités de sécurité logicielle : Lors de la phase de post-entraînement de GLM-5.3, le modèle a doublé ses scores sur CyberGym par rapport à la version 5.2. Durant les phases de tests pré-lancement (red teaming), il a mis au jour plus de 2 000 failles de sécurité historiques dans des dépôts open source majeurs, dont certaines étaient présentes depuis des décennies. Face à cette prolifération de capacités offensives, Z.ai a suspendu temporairement le téléchargement libre des poids pour effectuer un examen de sécurité, réservant d’abord l’accès au modèle via les API de sa plateforme Z.ai.

En parallèle, l’écosystème comprend GLM-5.3-Flash, une variante allégée de 320 milliards de paramètres totaux (18 milliards actifs) conçue pour un débit élevé, qui a temporairement pris la tête des volumes de requêtes sur OpenRouter.

4. Llama 4 Maverick (Meta Platforms) : multimodalité native et standard d’auto-hébergement

Llama 4 Maverick incarne le virage de Meta vers des modèles ouverts à mélange d’experts conçus pour concilier performance élevée et empreinte matérielle modérée.

Spécifications techniques :

  • Poids et exécution : Totalise 400 milliards de paramètres, mais n’en sollicite que 17 milliards par token. Cette faible empreinte active permet de l’exécuter localement sur des configurations multi-GPU sans exiger de serveurs de calcul d’échelle industrielle.
  • Multimodalité par fusion précoce (« Early Fusion ») : Contrairement aux générations antérieures utilisant des adaptateurs visuels externes, le texte, le code et les images sont injectés dès le départ au sein des mêmes couches neuronales de base.
  • Entraînement : Pré-entraîné sur un corpus multimodal de 22 trillions de tokens, combinant code public, données sous licence et distillation issue du modèle propriétaire interne Llama 4 Behemoth.
  • Contexte : Capable de supporter des contextes géants s’étendant jusqu’à 10 millions de tokens.

Maverick excelle dans l’analyse de documents visuels denses, le repérage de coordonnées dans les images et la conversion de diagrammes techniques. Sur le plan algorithmique, ses 17 milliards de paramètres actifs lui permettent d’égaler les performances de modèles beaucoup plus lourds tels que DeepSeek-V3.

Distribution et cadre légal : Les poids sont disponibles au téléchargement sur Hugging Face, et des versions managées sont proposées sur Amazon Bedrock et Google Cloud Model Garden. La licence Llama 4 autorise l’usage commercial et la recherche, mais maintient des restrictions d’usage territoriales spécifiques, notamment au sein de l’Union européenne en raison des réglementations locales sur les données.

5. MiniMax M3 (MiniMax) : orchestration d’outils et optimisation VRAM

Sorti en juin 2026 par le laboratoire MiniMax, le modèle M3 s’est imposé comme l’un des choix les plus économiques pour les environnements de développement pilotés par agents.

Architecture logicielle :

  • Répartition des paramètres : MoE de 428 milliards de paramètres au total, activant 23 milliards de paramètres par token.
  • Attention MSA et GQA : Remplace l’attention dense traditionnelle par la MiniMax Sparse Attention (MSA) couplée à la Grouped-Query Attention (GQA). Cela produit une accélération de 9x lors de la phase de pré-remplissage (prefill) et de 15x au décodage par rapport aux versions M2 antérieures, réduisant les ressources nécessaires par token à un vingtième.
  • Fenêtre de 1 million de tokens : Capable de digérer des bases de code complètes ou environ 47 minutes de flux vidéo ininterrompu.

Le modèle a été pensé pour des environnements de programmation comme Cursor, Claude Code ou OpenCode. Sur les bancs d’essai opérationnels, il atteint 59 % sur SWE-bench Pro et 66 % sur TerminalBench, validant sa capacité à exécuter des commandes dans un terminal système de façon sécurisée.

L’API disponible via minimax.io et OpenRouter (facturée 0,23 $ par million de tokens entrants et 0,96 $ par million de tokens sortants) propose trois modes de travail modulables :

  1. enabled : impose une chaîne de réflexion continue pour une précision logique maximale.
  2. adaptive : évalue de lui-même la complexité de la consigne et active les tokens de réflexion uniquement si nécessaire.
  3. disabled : coupe la réflexion interne pour privilégier la vitesse pure de réponse.

Pour le déploiement sur machine locale, les versions quantifiées au format GGUF via des moteurs comme Unsloth et vLLM permettent de faire tourner MiniMax M3 sur Mac, Windows et Linux avec des réductions de consommation de mémoire vidéo (VRAM) atteignant 70 %.

6. Qwen3.6-A3B et Qwen3.7 Plus (Alibaba Cloud) : exécution locale et agents d’interface

L’écosystème open source Qwen développé par Alibaba Cloud propose deux déclinaisons majeures répondant à des contraintes opérationnelles distinctes :

Qwen3.6-35B-A3B : le choix local

Lancé en avril 2026, ce modèle MoE multimodal a été calibré directement pour les stations de travail individuelles :

  • Structure A3B : 35 milliards de paramètres au total, mais seulement 3 milliards de paramètres actifs par token, garantissant un coût d’inférence minimal tout en préservant le vocabulaire d’un modèle 35B.
  • Architecture hybride : Combine Gated DeltaNet (mécanisme d’attention linéaire) et Gated Attention au sein de sa structure MoE pour éviter les engorgements mémoire.
  • Contexte : Fenêtre native de 262 000 tokens, extensible jusqu’à 1 million. Associé à des frameworks comme OpenClaw, il automatise les boucles d’ingénierie logicielle directement en terminal local.

Qwen3.7 Plus : l’agent cloud interactif

Lancé en juin 2026, Qwen3.7 Plus fonctionne comme un moteur multimodal unifié disponible par API (environ 0,32 $ par million de tokens en entrée et 1,28 $ en sortie). Sa spécificité repose sur l’interaction avec les interfaces graphiques (GUI) : il peut analyser l’écran de l’utilisateur, interpréter une maquette visuelle, produire le code correspondant et exécuter ce code dans un environnement en direct sans interruption de contexte.

La gamme évolue continuellement : Alibaba a également mis à disposition des modèles de gabarits supérieurs tels que Qwen3.8-Max (2,4 trillions de paramètres) et ouvert les poids de Qwen3.8-27B sous licence permissive Apache 2.0.

7. DeepSeek-V4-Flash / V4.1-Flash (DeepSeek AI) : architecture CED et débit d’inférence

Initialement déployé sous forme de préversion de 284 milliards de paramètres (13 milliards actifs) en avril 2026, ce système a été complètement remplacé en septembre 2026 par DeepSeek-V4.1-Flash.

L’architecture Causal Encoder-Decoder (CED) :

DeepSeek abandonne ici la structure Transformer dense classique au profit d’un agencement à 40 couches partagé entre 20 couches d’encodeur causal et 20 couches de décodeur. Le modèle ne mobilise que 8 milliards de paramètres pendant la phase de pré-remplissage et 16 milliards lors du décodage. Les données d’entrée évitent ainsi les calculs lourds de la phase de décodage durant la lecture du contexte documentaire.

Gains mesurés :

  • Débit : Vitesse de génération mesurée entre 200 et plus de 400 tokens par seconde.
  • Empreinte mémoire : L’allocation du cache KV est divisée par quatre par rapport à l’ancienne génération V4 Flash sur une fenêtre de 1 million de tokens intégrant la vision.
  • Hiérarchie interne : V4.1-Flash surpasse l’ancien fleuron V4-Pro en vitesse pure, en coût de calcul et en efficacité globale.

Les identifiants d’API deepseek-v4-flash et deepseek-flash appliquent une tarification débutant à 0,15 $ par million de tokens d’entrée non mis en cache, avec une réduction de 50 % durant les heures creuses.

8. Nemotron 3 Ultra (NVIDIA) : exécution d’agents d’entreprise et accélération matérielle

Mis en ligne en juin 2026, Nemotron 3 Ultra (550 milliards de paramètres) a été pensé par NVIDIA pour servir de cerveau central à des harnais d’agents d’entreprise (comme NemoClaw ou Hermes Agent) plutôt que de simple outil de conversation.

Innovations structurelles :

  • Parcimonie LatentMoE : N’active que 55 milliards de paramètres par token (90 % de parcimonie), lui conférant la réactivité d’un modèle moyen malgré son volume global.
  • Couplage Mamba et Transformer : L’architecture entrelace des couches d’espace d’état Mamba-2 (qui stabilisent le cache KV sur les contextes longs séquentiels) et des couches d’attention traditionnelles pour maintenir la rigueur logique.
  • Multi-Token Prediction (MTP) : Prédiction simultanée de plusieurs tokens agissant comme un décodage spéculatif natif, générant plus de 300 tokens par seconde sur matériel NVIDIA adapté.
  • Apprentissage par distillation MOPD : Entraîné via la méthode Multi-Teacher On-Policy Distillation, qui a fait intervenir plus de 10 modèles enseignants distincts pour valider et corriger chaque étape de raisonnement durant l’apprentissage.

Le modèle dispose d’un paramètre de budget de réflexion réglable (On, Off, ou Low-Effort) pour limiter le volume de tokens internes émis et maîtriser les coûts matériels. Sur des tâches d’ingénierie complexes, NVIDIA indique que le système requiert environ 30 % d’interactions et de tokens en moins que ses concurrents directs.

Distribué sous la licence permissive NVIDIA Open Model License, Nemotron 3 Ultra s’installe en production sous forme de microservice NVIDIA NIM optimisé en précision FP4 pour les puces Hopper (H100, H200) et Blackwell (B200).

9. Gemma 4 (Google DeepMind) : efficacité maximale pour le matériel grand public

Rafraîchie début 2026 avec les formats 2B et 9B, puis complétée par une déclinaison de 31 milliards de paramètres, la gamme Gemma 4 conçue par Google DeepMind cible l’inférence locale sur machines grand public.

Profil technique du format 9B :

  • Modèle dense : Repose sur une structure dense exploitant la Grouped-Query Attention (GQA) et des plongements de position rotatifs.
  • Données d’entraînement : Pré-entraîné sur 15 trillions de tokens regroupant mathématiques, code informatique et contenus multimodaux.
  • Contexte : Fenêtre de base de 128 000 tokens.
  • Performances relatives : Sur les bancs d’évaluation HumanEval (programmation) et GSM8K (raisonnement mathématique), les formats 9B et 31B dépassent régulièrement des modèles historiques trois à quatre fois plus volumineux.

Gemma 4 propose des déclinaisons vision-langage de type Paligemma pour exécuter du sous-titrage d’images, de l’analyse documentaire et de la reconnaissance d’interfaces directement hors ligne. Les poids sont téléchargeables via la page Gemma 4 de Google, avec une compatibilité native dans Ollama, vLLM et Llama.cpp (quantification GGUF en 4 bits et 8 bits).

10. GPT-oss 120b (OpenAI) : raisonnement inspectable sous licence Apache 2.0

Publié en août 2025, GPT-oss-120b marque le retour d’OpenAI aux modèles à poids ouverts, une première depuis la sortie de GPT-2. Ce système MoE de 117 milliards de paramètres (cadre de 116 à 120 milliards) n’en active que 5,1 milliards par token lors de l’inférence.

Spécifications et compatibilité matérielle :

  • Attention : Alterne entre motifs d’attention denses et clairsemés en bandes locales, combinés à une attention multi-requêtes groupée (groupes de 8) et des plongements RoPE sur un contexte de 128 000 tokens.
  • Empreinte serveur : Grâce à la quantification native en format MXFP4, le modèle loge intégralement dans la mémoire d’un GPU professionnel unique de 80 Go (comme une puce NVIDIA H100 ou AMD MI300X).
  • Raisonnement modifiable : Offre un réglage d’effort de réflexion (low, medium, high) permettant d’arbitrer entre latence de traitement et rigueur logique.
  • Transparence de la chaîne de pensée : Expose l’intégralité des étapes internes de réflexion (Chain-of-Thought) directement au développeur, facilitant le débogage et l’audit des prises de décision.

Le modèle est nativement aligné pour manipuler des environnements d’exécution Python, naviguer sur le web, exécuter des appels de fonctions et produire du JSON strict. Diffusé sous licence permissive Apache 2.0, il s’intègre directement aux bibliothèques Transformers, Ollama et vLLM, avec l’ensemble des spécifications documentées sur le portail OpenAI pour développeurs.

Leave a Reply

Your email address will not be published. Required fields are marked *