Calculateur d'inférence LLM
VRAM, vitesse et optimisations pour votre GPU
Tous les calculs s'exécutent dans votre navigateur. Aucune donnée n'est envoyée.
Optimisations recommandées
| Quantification | Pruning | |
|---|---|---|
| Mécanisme | Réduit la précision numérique des poids (ex. : FP16 → INT4) | Supprime des poids, neurones ou couches jugés peu utiles |
| Réduction de VRAM | Élevée et prévisible (proportionnelle aux bits) | Variable, dépend du taux d'élagage et du support matériel |
| Matériel requis | Formats larges pris en charge (GGUF, AWQ, GPTQ) sur GPU grand public | Le pruning non structuré nécessite un support noyau spécifique pour un vrai gain |
| Perte de précision | Faible à modérée, bien maîtrisée en dessous de 4 bits avec AWQ/Q4_K_M | Variable ; un élagage agressif dégrade nettement sans réentraînement |
| Étape du workflow | Post-entraînement, souvent en une passe, sans réentraînement | Nécessite généralement un fine-tuning de récupération |
Choisissez d'abord la quantification si vous voulez un gain de VRAM rapide, prévisible et largement supporté (llama.cpp, vLLM, TensorRT-LLM) sans réentraîner le modèle.
Choisissez le pruning si vous contrôlez tout le pipeline d'entraînement, visez une réduction structurelle durable (moins de couches/têtes) et pouvez investir dans un fine-tuning de récupération.
Estimations fondées sur les spécifications publiées et des modèles de bande passante idéalisés ; les résultats réels varient de ±20 %.