Éléments d’un prompt en ingénierie des prompts
Concevoir une instruction de qualité pour un grand modèle de langage ressemble à la création d’un plan d’architecte. Le document final guide […]
Marre des lenteurs sur Ollama ? Voici comment j’ai quadruplé mes tokens/seconde (mes retours d’XP et optimisations)
Salut à tous, Franchement, au début, je ne comprenais pas. J’ai installé Ollama pour faire tourner des LLM en local, pensant que […]
Chain-of-Thought Prompting : C’est quoi?
Imaginez un instant un horloger qui tente de réparer un mécanisme complexe d’un seul coup d’œil, sans démonter les rouages un par […]
ollama n’est pas reconnu en tant que commande interne, Voilà comment régler ça une bonne fois pour toutes
Je viens de passer une bonne heure à m’arracher les cheveux sur mon PC portable en essayant de lancer un LLM en […]
Qu’est-ce que le ReAct prompting ?
Je rencontre souvent des ingénieurs confrontés au même mur. Leurs modèles d’intelligence artificielle génèrent des réponses absurdes dès que la tâche demande […]
Tourner Ollama sous Docker avec GPU (Nvidia/AMD) sans s’arracher les cheveux (et avec Open WebUI)
Salut à tous, Je me suis récemment lancé dans l’auto-hébergement de LLM en local. Après avoir testé pas mal de configurations, je […]
Few-Shot Prompting
Je rencontre chaque jour des ingénieurs confrontés au même défi. Leurs modèles manquent de rigueur. Pour résoudre ce problème sans passer par […]
Optimiser l’inférence des LLM : Retour d’expérience sur les Techniques et Outils indispensables
Après avoir passé beaucoup de temps à configurer, mesurer et optimiser des serveurs d’inférence, j’ai fini par dégager quelques principes fondamentaux pour […]
Guide complet VRAM et GPU pour Ollama : ce que j’ai appris à la dure (RTX, Mac, AMD…)
J’ai passé ces derniers mois à tester à peu près toutes les configurations possibles pour faire tourner Ollama en local. J’ai commencé […]
Prompt Engineering : Définition, Techniques & Exemples
Les points clés à retenir pour optimiser vos interactions avec l’IA : Je définis le prompt engineering comme l’art de concevoir des […]
Comment j’ai enfin compris les GPU layers sur Ollama (et pourquoi votre modèle rame probablement sur le CPU)
Franchement, au début, je ne comprenais pas pourquoi mon Llama 3.1 ramait autant sur ma bécane alors que j’ai une configuration plutôt […]
Zero-Shot prompting : C’est quoi et comment ça marche?
Le prompting zero-shot constitue la méthode d’interaction la plus simple avec les modèles de langage de grande taille (LLM). Vous demandez à […]