PagedAttention : comment optimiser la mémoire GPU lors de l’inférence des LLM
Quand on commence à déployer des modèles de langage à grande échelle, on se heurte très vite à un mur invisible mais […]
La quantification des LLM : Mon guide pour choisir le bon format selon votre matériel
Faire tourner un grand modèle de langage de plusieurs milliards de paramètres sur sa propre machine ressemble souvent à un parcours du […]
Kimi K3 : Tout savoir sur le géant à 2,8 trillion de paramètres qui redéfinit les standards de l’IA
Je me souviens précisément de l’ambiance lors de cette journée lourde et moite, caractéristique du mois de juillet à Shanghai, en plein […]
Comment installer et optimiser vLLM : Le Guide complet sur Linux, Mac, Windows et Docker
Quand j’ai commencé à m’intéresser au déploiement local de modèles de langage, j’ai vite compris que la gestion de la mémoire et […]
Deep Learning : Principes fondamentaux, Types, Modèles et Architectures modernes
Lorsque j’ai commencé à m’intéresser de près aux réseaux de neurones, j’ai rapidement compris que le succès d’un projet ne dépend pas […]
vLLM : Guide déploiement, optimisation VRAM et architecture matérielle Inférence de LLM à grande échelle
Ce qu’il faut retenir de mon expérience avec vLLM L’origine et l’écosystème de vLLM vLLM (Virtual Large Language Model) s’est rapidement imposé […]
L’IA en médecine et en santé : toutes les applications expliquées
Lorsque j’observe l’évolution de nos pratiques médicales, je constate que l’intégration de l’intelligence artificielle n’est plus une simple perspective d’avenir. Elle s’est […]
Qui a créé Ollama et à qui appartient la plateforme ?
Quand on commence à s’intéresser sérieusement à l’exécution de modèles de langage en local, on se retrouve inévitablement face à Ollama. C’est […]
Agent Loop : Comment Concevoir et Bâtir des Boucles d’Agents Autonomes
Quand on commence à travailler sérieusement avec les grands modèles de langage, on se heurte vite à la limite frustrante de l’interaction […]
Où sont stockés les modèles Ollama et comment gérer votre espace disque ?
La première fois que j’ai lancé Ollama, j’ai tout de suite aimé cette simplicité d’utilisation : une simple commande et on fait […]
Vision par Ordinateur : Top frameworks et Modèles (serveur et mobile)
Au fil de mes projets en vision par ordinateur, j’ai rapidement compris qu’il n’existe pas d’outil universel. Pour passer de la manipulation […]
Inférence et déploiement de LLM en production : Ce que j’ai appris pour équilibrer latence, débit et budget vRAM
Seifeddine Guizani — Quand on commence à déployer des grands modèles de langage en production, on réalise vite que l’évaluation de la […]