HomeRessources, Guides & Actualités – Actualités de l’intelligence artificielleIntelligence artificielleMemoComparatif des modèles Ollama en 2026 : Lequel choisir selon votre VRAM ?

Comparatif des modèles Ollama en 2026 : Lequel choisir selon votre VRAM ?

Ça fait un bon moment maintenant que je fais tourner toute ma stack d’IA en local avec Ollama, et s’il y a bien une chose que j’ai apprise à la dure, c’est qu’on ne choisit pas son modèle d’après sa hype sur Twitter, mais d’après sa propre fiche technique.

Le nerf de la guerre, c’est la mémoire. Si vous n’avez pas assez de VRAM (ou de RAM unifiée sur Mac), votre modèle va déborder sur le processeur (CPU) et vous allez vous retrouver avec une vitesse d’écriture digne d’un minitel en fin de vie.

Pour faire simple, gardez en tête cette règle d’or : il vous faut environ 1 Go de VRAM pour 1 milliard de paramètres sur un modèle quantifié standard en 4-bit (le format Q4_K_M d’Ollama).

Voici mon retour d’expérience concret sur ce qui tourne le mieux en ce moment, trié par catégorie et par taille de machine.

💻 1. La dure réalité du matériel : que pouvez-vous faire tourner ?

Avant de télécharger quoi que ce soit, faites un clic droit sur votre barre des tâches (ou regardez les specs de votre puce Apple Silicon) pour voir ce que vous avez sous le capot.

  • 8 Go de VRAM / RAM (PC portable classique, Mac de base) : Vous êtes limité aux modèles de 7B à 8B paramètres maximum (ex: qwen3:8b, deepseek-r1:7b).
  • 16 Go de VRAM / RAM (GPU de milieu de gamme, Mac Pro) : Vous pouvez viser les modèles de 14B à 20B (ex: gpt-oss:20b, mistral-small:24b).
  • 24 Go – 32 Go de VRAM (RTX 4090, Mac Max) : C’est la zone de confort pour les modèles de 30B à 32B (ex: qwen3-coder:30b, qwen2.5-coder:32b).
  • 48 Go+ de VRAM (Dual GPU, Mac Ultra) : Le très haut de gamme. Vous faites tourner les monstres de 70B+ (llama3.3:70b, gemma4).

✍️ 2. Usage général et Rédaction (Le match du Français)

Si vous cherchez un assistant polyvalent pour rédiger des e-mails, traduire ou résumer des documents en français, inutile de vous compliquer la vie.

  • Le choix “Souverain” (Mistral Small – 24B) : Si vous avez 16 Go de VRAM, foncez sur mistral-small. Développé par la boîte parisienne Mistral AI, il a un vocabulaire français magnifique. Pas d’anglicismes bizarres, un ton percutant et une excellente gestion de l’humour et des nuances.
  • Le couteau suisse ultra-rapide (Qwen 3 : 8B) : Sur une machine légère (8 Go), qwen3:8b (ou la version 3.5) est impressionnant. Sa grammaire française est impeccable, souvent plus naturelle que celle de Llama sur les petites tailles.
  • Pour un français authentique (OpenEuroLLM-French) : Lancez ollama run jobautomation/OpenEuroLLM-French (basé sur Gemma 3). Il est affiné pour éliminer les tournures de phrases trop “robotiques” issues des traductions de l’anglais.
  • Le monstre (Llama 3.3 : 70B) : Si vous avez le matériel pour le faire tourner, c’est le roi. Sa cohérence narrative sur les textes très longs est bluffante.

💻 3. Programmation & Agents : Les modèles de code

Pour le dev, j’ai complètement arrêté d’utiliser les modèles généralistes. Les modèles spécialisés gèrent beaucoup mieux la syntaxe et les dépendances multi-fichiers.

  • Le roi incontesté : Qwen3-Coder (30B). C’est un modèle de type Mixture of Experts (MoE). Concrètement, il fait 30 milliards de paramètres, mais il n’en active que 3,3 milliards par token généré. Résultat ? Vous profitez de la logique d’un gros modèle avec la vitesse d’exécution d’un petit. Sa fenêtre de contexte native de 256K est incroyable pour lui injecter des pans entiers de votre codebase.
  • Pour les laptops : Qwen2.5-Coder (7B). Si vous n’avez qu’un vieux PC ou un petit MacBook, c’est le meilleur compromis. Il surclasse tout le monde dans sa catégorie de taille.
  • Pour l’autocomplétion en ligne (Style Copilot) : CodeGemma (7B). Conçu spécifiquement pour le Fill-in-the-Middle (FIM), il s’intègre parfaitement dans les extensions VS Code ou Cursor pour compléter vos lignes de code en temps réel sans latence.
  • Pour les agents autonomes : GLM-5.1 / 5.2 ou devstral:24b. Ils ont été pensés pour le tool-calling (l’appel d’outils) et les boucles d’exécution autonomes.

🧠 4. Logique, Mathématiques et “Thinking” Models

Si vous lui demandez de résoudre des énigmes ou de débugger un script asynchrone ultra-complexe, un modèle classique va souvent répondre trop vite et se planter. C’est là qu’entrent en scène les modèles de raisonnement (Chain of Thought).

  • L’ovni : DeepSeek R1. Ce modèle prend le temps de “réfléchir” en arrière-plan avant de cracher sa réponse (vous verrez sa pensée s’afficher entre des balises <think>).
    • Sur un laptop (8 Go VRAM) : utilisez deepseek-r1:8b (distillé sur une base Qwen). C’est presque magique de voir un si petit modèle résoudre des problèmes de logique aussi complexes.
    • Sur une grosse machine : deepseek-r1:32b ou deepseek-r1:70b. C’est le niveau des meilleures IA du cloud, directement chez vous.
  • L’alternative sécurisée : GPT-OSS Safeguard (20B). Il utilise une structure MoE (~3.6B de paramètres actifs) très performante pour l’audit technique et la classification sans fioritures.
  • L’efficace : Phi-4 Reasoning (14B). Développé par Microsoft, il est redoutable sur les sujets scientifiques et tient sur des GPU de milieu de gamme.

👁️ 5. Analyse d’Images (Multimodal)

Si vous voulez lui envoyer une capture d’écran de tableau Excel, un schéma technique ou faire de l’OCR (reconnaissance de texte) sur un PDF :

  • Gemma 4 (e4b) : Sorti récemment, c’est le modèle optimisé pour l’exécution rapide “on-device”. Idéal pour parser des visuels légers très vite.
  • Llama 3.2 Vision : Un grand classique, très robuste pour extraire des structures de tableaux ou légender des images complexes.

⚠️ Le piège technique du contexte (À lire absolument)

C’est l’erreur classique que tout le monde fait au début (et je me suis fait avoir aussi).

Par défaut, pour économiser votre mémoire, Ollama limite souvent la taille du contexte de vos discussions à 2048 ou 4096 tokens (environ 3000 mots maximum). Si vous demandez à un modèle comme Llama 3.3 de vous faire un résumé de rapport, il va “oublier” vos premières consignes très rapidement, alors même qu’il est capable de gérer 130 000 tokens !

Pour corriger ça :

  1. Si vous utilisez une interface graphique comme Open WebUI : Allez dans les paramètres du modèle -> Options -> cherchez le paramètre num_ctx et passez-le à 32768 (ou plus selon votre RAM).
  2. Si vous lancez Ollama depuis votre terminal sous Linux/macOS, vous pouvez forcer la taille globale du contexte avec cette variable avant de lancer le service :
   OLLAMA_CONTEXT_LENGTH=64000 ollama serve

En résumé, mon setup du moment :

  • Pour coder au quotidien (RTX 3090/4090) : ollama run qwen3-coder:30b
  • Pour réfléchir à un problème logique ou concevoir une architecture : ollama run deepseek-r1:32b
  • Pour de la rédaction de mails rapides ou de la traduction en français : ollama run mistral-small

Et vous, vous faites tourner quoi en local en ce moment ? Des retours sur les derniers Qwen 3.6 ?

Leave a Reply

Your email address will not be published. Required fields are marked *