TensorRT-LLM : Comment j’optimise l’inférence de mes LLM pour la production
Je me souviens de la première fois où j’ai dû déployer un grand modèle de langage pour une application à fort trafic. […]
vLLM-Omni : Déployer et optimiser des modèles d’IA omni-modaux
Quand j’ai commencé à m’intéresser aux modèles d’IA dits “any-to-any” (capables de traiter et générer simultanément du texte, du son, des images […]
PagedAttention : comment optimiser la mémoire GPU lors de l’inférence des LLM
Quand on commence à déployer des modèles de langage à grande échelle, on se heurte très vite à un mur invisible mais […]
La quantification des LLM : Mon guide pour choisir le bon format selon votre matériel
Faire tourner un grand modèle de langage de plusieurs milliards de paramètres sur sa propre machine ressemble souvent à un parcours du […]
Kimi K3 : Tout savoir sur le géant à 2,8 trillion de paramètres qui redéfinit les standards de l’IA
Je me souviens précisément de l’ambiance lors de cette journée lourde et moite, caractéristique du mois de juillet à Shanghai, en plein […]
Comment installer et optimiser vLLM : Le Guide complet sur Linux, Mac, Windows et Docker
Quand j’ai commencé à m’intéresser au déploiement local de modèles de langage, j’ai vite compris que la gestion de la mémoire et […]
Deep Learning : Principes fondamentaux, Types, Modèles et Architectures modernes
Lorsque j’ai commencé à m’intéresser de près aux réseaux de neurones, j’ai rapidement compris que le succès d’un projet ne dépend pas […]
vLLM : Guide déploiement, optimisation VRAM et architecture matérielle Inférence de LLM à grande échelle
Ce qu’il faut retenir de mon expérience avec vLLM L’origine et l’écosystème de vLLM vLLM (Virtual Large Language Model) s’est rapidement imposé […]
L’IA en médecine et en santé : toutes les applications expliquées
Lorsque j’observe l’évolution de nos pratiques médicales, je constate que l’intégration de l’intelligence artificielle n’est plus une simple perspective d’avenir. Elle s’est […]
Qui a créé Ollama et à qui appartient la plateforme ?
Quand on commence à s’intéresser sérieusement à l’exécution de modèles de langage en local, on se retrouve inévitablement face à Ollama. C’est […]
Agent Loop : Comment Concevoir et Bâtir des Boucles d’Agents Autonomes
Quand on commence à travailler sérieusement avec les grands modèles de langage, on se heurte vite à la limite frustrante de l’interaction […]
Où sont stockés les modèles Ollama et comment gérer votre espace disque ?
La première fois que j’ai lancé Ollama, j’ai tout de suite aimé cette simplicité d’utilisation : une simple commande et on fait […]