Salut tout le monde,
Je voulais partager une petite révolution avec vous. Si vous utilisez Ollama, vous savez qu’on était habitués aux modèles multimodaux (comme LLaVA ou Qwen3-VL) qui sont super pour décrire des images ou faire de l’OCR, mais qui sont totalement incapables de créer un visuel à partir de zéro.
Eh bien, ça a changé. Ollama prend désormais en charge la génération d’images 100% locale et autonome. Après avoir passé mon week-end à faire chauffer ma bécane, voici mon retour d’expérience sur les deux modèles disponibles, comment les faire tourner selon votre OS, et lequel choisir.
1. FLUX.2 [klein] : La bête de course ultra-rapide
Développé par Black Forest Labs (les cerveaux derrière Stable Diffusion), FLUX.2 Klein est taillé pour la vitesse absolue grâce à la méthode de step-distillation.
- Pourquoi il est bluffant : Il génère une image complète en seulement 4 étapes (steps) d’inférence. Sur ma machine, c’est quasi instantané. Sa gestion de la typographie et des logos est propre (fini les textes qui ressemblent à de l’elfique).
- Deux versions dispo :
- La version 4B (4 milliards de paramètres – ~5.7 Go) : Elle est sous licence Apache 2.0 (donc commercialisable). Elle ne demande que 10 à 12 Go de VRAM. Pour la récupérer :
ollama pull x/flux2-klein - La version 9B (~12 Go) : Sous licence non-commerciale, mais elle gère beaucoup mieux l’anatomie (les mains !) et les compositions complexes. Pour l’avoir :
ollama pull x/flux2-klein:9b
- La version 4B (4 milliards de paramètres – ~5.7 Go) : Elle est sous licence Apache 2.0 (donc commercialisable). Elle ne demande que 10 à 12 Go de VRAM. Pour la récupérer :
Mon avis : C’est mon chouchou pour itérer rapidement. Si vous voulez créer un design d’interface (UI) ou une illustration moderne, il est incroyable.
2. Z-Image Turbo : Le roi du photoréalisme (par Alibaba / Tongyi Lab)
Là, on change de registre. Z-Image Turbo utilise une architecture “Single-Stream” (S3-DiT) qui fusionne l’analyse du prompt et des pixels en un seul flux.
- Pourquoi il se démarque : Il utilise la distillation Decoupled-DMD, ce qui lui permet de sortir une qualité folle en seulement 8 étapes. Il excelle dans le rendu de la peau, des textures biologiques (gouttes d’eau, rides) et gère le texte bilingue (anglais/chinois) à la perfection.
- Les versions dispo :
- La version FP8 (~13 Go) : C’est celle par défaut. Il faut environ 16 Go de VRAM/mémoire unifiée pour être tranquille.
ollama pull x/z-image-turbo - La version BF16 (~33 Go) : Pour les grosses machines (Mac de 36 Go de RAM ou plus).
ollama pull x/z-image-turbo:bf16
- La version FP8 (~13 Go) : C’est celle par défaut. Il faut environ 16 Go de VRAM/mémoire unifiée pour être tranquille.
Petit conseil d’ami : Oubliez les prompts façon “4k, masterpiece, dslr” séparés par des virgules. Son encodeur de texte (Qwen 3) adore les phrases descriptives et naturelles, comme si vous décriviez une scène de film. Il est entraîné pour du 1024×1024 natif.
Comment on lance ça ? (Mac vs Windows, le grand écart)
C’est là que ça devient technique, car le comportement n’est pas encore le même selon votre OS.
🍏 Sur macOS (Le paradis du terminal)
C’est natif et super fluide. Si vous utilisez un terminal moderne comme Ghostty ou iTerm2, l’image s’affiche directement dedans !
Pour tester un prompt rétro de café :
ollama run x/z-image-turbo "A cinematic medium shot of a vintage 1950s American diner at night. Rain streaks on the windows. On the neon sign outside, the text clearly reads 'OLLAMA CAFE' in bright pink neon letters."
L’image est automatiquement enregistrée au format .png ou .jpg dans le dossier où votre terminal est ouvert.
Pour changer la taille sur Mac :
Quand vous êtes dans l’interpréteur interactif du modèle, tapez simplement :
/set width 1024
/set height 768
Puis balancez votre prompt. (Réduire la taille fait gagner un temps fou si vous manquez de VRAM).
🪟 Sur Windows (Via l’API locale)
L’intégration native sur Windows est en cours de développement. Si vous lancez la commande directement, ça risque de coincer ou de ne pas sauvegarder l’image proprement.
Pour contourner ça, on utilise l’API locale d’Ollama. Comme l’API renvoie du texte brut encodé en Base64, j’ai écrit ce petit script PowerShell qui fait tout le boulot : il envoie la requête, définit la taille, récupère le Base64 et le convertit directement en un fichier PNG sur votre bureau.
Ouvrez PowerShell et collez ceci :
# 1. On définit le modèle, la taille et le prompt
$body = @{
model = "x/flux2-klein"
prompt = "A professional product studio photograph of a sleek aluminum water bottle. On the side of the bottle, the brand name 'FLUX' is crisply printed. Perfect reflections."
width = 1024
height = 1024
} | ConvertTo-Json
# 2. On appelle l'API locale d'Ollama
Write-Host "Génération de l'image en cours..." -ForegroundColor Cyan
$response = Invoke-RestMethod -Uri "http://localhost:11434/v1/images/generations" `
-Method Post `
-ContentType "application/json" `
-Body $body
# 3. On décode la réponse Base64 et on enregistre
$base64Data = $response.data[0].b64_json
$imageBytes = [System.Convert]::FromBase64String($base64Data)
$outputPath = Join-Path (Get-Location) "resultat_ollama.png"
[System.IO.File]::WriteAllBytes($outputPath, $imageBytes)
Write-Host "Succès ! Image enregistrée sous : $outputPath" -ForegroundColor Green
(Note pour les power-users sur Windows : si vous voulez pousser le truc plus loin avec des LoRA ou ControlNet, l’alternative du moment reste de coupler ces modèles avec ComfyUI).
Le bilan : Lequel choisir ?
- Z-Image Turbo si vous cherchez le photoréalisme pur, les portraits bluffants et des intégrations de textes complexes dans des scènes naturelles. C’est plus lourd, mais le résultat est souvent bluffant.
- FLUX.2 Klein si vous avez une config plus modeste, que vous voulez générer des interfaces d’applications, des logos, ou juste tester 50 idées à la minute sans faire ramer votre PC.
Franchement, voir ces modèles tourner à cette vitesse, à la maison et sans envoyer la moindre donnée sur le cloud, ça reste un kiff absolu. Des gens ont testé l’interface communautaire “Ollama Image Generator” sur GitHub pour éviter de passer par le terminal ? Je suis curieux d’avoir vos retours !