Le projet Colibri propose une approche singulière. Ce moteur d’inférence écrit en pur C élimine les dépendances lourdes pour exécuter des modèles de langage géants à mélange d’experts (MoE) sur des machines ordinaires.
Un colibri pèse quelques grammes mais visite mille fleurs par jour. Ce moteur maintient en vie des géants de 744 milliards de paramètres avec des rations de passereau : un processeur classique, un disque SSD et un peu de patience.
- Une exécution sans GPU obligatoire : Le moteur utilise la mémoire système, le stockage NVMe et la mémoire vidéo comme un seul espace adressable.
- Des tailles de modèles inédites à domicile : Colibri fait tourner des structures de 744 milliards à 2,8 billions de paramètres.
- Une architecture minimaliste : Le code se résume à un fichier C par famille de modèles, sans aucune surcouche Python lors de l’exécution.
- Une optimisation dictée par les mesures : Chaque gain de vitesse doit être prouvé par un test comparatif rigoureux avant d’intégrer le tronc commun.
La hiérarchie de mémoire multicouche
Dans un modèle MoE de 744 milliards de paramètres comme GLM-5.2, chaque jeton généré n’active qu’environ 40 milliards de paramètres. La partie dense du réseau reste résidente en mémoire vive. Les experts restants attendent sur le stockage et rejoignent la mémoire à la demande.
Cette approche traite les poids comme des données dynamiques.
- La section dense stable requiert 9,9 Go de RAM en quantification int4.
- Les 19 456 experts résident sur le disque SSD pour un volume total de 370 Go.
- Un algorithme d’anticipation charge l’expert nécessaire une couche à l’avance.
- L’historique des requêtes permet de figer en RAM les experts les plus sollicités.
Performances et bande passante : Les chiffres réels
La vitesse d’inférence dépend directement du débit de lecture de vos supports de stockage physiques.
| Configuration Matérielle | Vitesse de génération (décodage) | Temps de réponse initial (TTFT) |
|---|---|---|
| 6x RTX 5090 (résidence complète en VRAM) | 5,8 à 6,8 jetons par seconde | Environ 13 secondes |
| Ordinateur de bureau (processeur seul, 128 Go RAM) | Environ 1,8 jeton par seconde (cache chaud) | Variable selon l’accès disque |
| Ordinateur portable avec puce RTX 5070 Ti | 1,07 jeton par seconde | Inconnu |
| Machine de test minimale (25 Go de RAM, accès disque froid) | 0,05 à 0,1 jeton par seconde | Plusieurs minutes |
Techniques d’accélération du stockage
Puisque le goulot d’étranglement réside dans l’accès au disque, plusieurs solutions techniques diminuent la latence.
L’utilisation de deux disques SSD en parallèle double la bande passante disponible. L’utilisateur peut copier le modèle sur un second disque pour activer le mode miroir.
COLI_MODEL=/fast/glm52_i4 COLI_MODEL_MIRROR=/second/glm52_i4 ./coli chat
- L’accès direct : L’activation de la variable
DIRECT=1contourne le cache du système d’exploitation et augmente la vitesse de lecture de 34% sur certains disques performants. - La compression d’état : L’implémentation de l’attention MLA réduit la taille de l’état Key-Value par un facteur de 57, libérant de l’espace en mémoire vive.
- La prédiction d’experts : L’analyse statistique montre que la sélection de la couche suivante est prévisible à 71,6%, ce qui permet de précharger les données.
Exigences matérielles selon les modèles supportés
Chaque modèle possède des besoins propres en stockage et en mémoire vive.
| Modèle supporté | Taille totale / Active | Espace disque requis | Mémoire vive requise (Minimum) |
|---|---|---|---|
| OLMoE | 7B / 1B | Environ 4 Go | 8 Go |
| DeepSeek V4 Flash | 284B / 13B | Environ 167 Go | 16 Go (22 Go recommandés) |
| GLM-5.2 | 744B / 40B | Environ 372 Go | 16 Go (24 Go recommandés) |
| Inkling | 975B / 41B | Environ 469 Go | 25 Go (avec compression dense) |
| Kimi K3 | 2,8T / 104B | Environ 1,6 To | 32 Go ou plus |
Démarrage rapide et commandes utiles
Pour exploiter au mieux votre équipement, l’outil propose des utilitaires de diagnostic intégrés.
Vous devez récupérer le moteur compilé pour votre plateforme et télécharger le conteneur quantifié adapté, par exemple le fichier GLM-5.2 disponible sur Hugging Face.
# Vérifier la compatibilité du matériel avec le modèle ciblé
COLI_MODEL=/nvme/glm52_i4 ./coli doctor
# Analyser la répartition optimale entre VRAM, RAM et disque
COLI_MODEL=/nvme/glm52_i4 ./coli plan
# Lancer l'interface de discussion en ligne de commande
COLI_MODEL=/nvme/glm52_i4 ./coli chat
Le script d’analyse examine la configuration de votre ordinateur pour proposer le meilleur compromis de placement. Les experts sont alors chargés de manière transparente.
Perspectives de recherche
Le développement se concentre sur l’intégration de nouvelles architectures et l’étude des transferts asynchrones entre processeurs. L’objectif consiste à abaisser le coût unitaire du jeton généré.
Des travaux explorent l’intégration prochaine de modèles comme Qwen3 MoE ou MiniMax. L’équipe de recherche invite les utilisateurs à partager leurs données de performance pour affiner les planificateurs automatiques.