Quel niveau de quantification faut-il utiliser pour l'déploiement s des LLM sur Edge ?
Résumé
- La quantification des modèles LLM réduit la précision du modèle afin de diminuer l'utilisation de la mémoire et d'accélérer la vitesse d'inférence, ce qui entraîne une certaine perte de qualité des résultats.
- Q4_K_M est le meilleur paramètre par défaut pour la plupart des déploiements en périphérie, car il offre un bon équilibre entre l'utilisation de la VRAM, le débit et la qualité du modèle.
- Les niveaux supérieurs, tels que Q5_K_M et Q8_0, améliorent la précision en matière de codage et de raisonnement structuré, mais nécessitent davantage de mémoire.
- Le format GGUF est privilégié pour Ollama et llama.cpp sur les équipements locaux et périphériques, tandis que le format AWQ est mieux adapté à l'inférence sur GPU dans le cloud.
- Si le modèle Q4_K_M n'est pas adapté à votre matériel, il est généralement préférable de choisir un modèle plus petit plutôt que d'utiliser une quantification Q3 ou Q2 plus agressive.
La quantification des grands modèles linguistiques (LLM) réduit la précision des poids de ces modèles, ce qui permet au modèle d’utiliser moins de mémoire et de fonctionner plus rapidement lors de l’inférence. Ce compromis se traduit par une légère perte de qualité des résultats, en contrepartie d’une réduction des besoins en mémoire vidéo (VRAM). Pour la plupart des déploiements en périphérie, le paramètre Q4_K_M constitue le bon choix par défaut, car il se situe au point d’équilibre optimal entre la VRAM, le débit et la qualité.
Les recherches montrent systématiquement que le modèle Q4_K_M offre une qualité proche de celle du FP16 tout en réduisant suffisamment les besoins en mémoire pour fonctionner efficacement sur du matériel aux ressources limitées. Ne passez aux modèles Q5_K_M ou Q8_0 que si votre matériel dispose d’une mémoire vidéo (VRAM) suffisante et que votre charge de travail exige une plus grande fidélité de sortie, en particulier pour le codage et le raisonnement structuré. Si vous hésitez encore sur le modèle à déployer, consultez le guide de sélection des modèles pour choisir celui qui convient le mieux à votre matériel en périphérie.
Le problème est que les référentiels GGUF proposent plusieurs options, notamment Q4_0, Q4_K_S, Q4_K_M, Q5_K_M, Q6_K, Q8_0 et IQ4_XS, sans préciser laquelle correspond le mieux à votre matériel ou à votre charge de travail. De nombreux ingénieurs se retrouvent donc à deviner quel fichier télécharger pour un Raspberry Pi 5, un Jetson Orin Nano, un Mac Mini M4 ou un processeur graphique (GPU) grand public. En pratique, il s’agit de choisir le compromis où la mémoire VRAM disponible, le débit d’inférence et la qualité de sortie correspondent à votre objectif d’ déploiement .
Dans cet article, vous découvrirez la signification de chaque niveau de quantification GGUF, lequel correspond à votre matériel, et dans quels cas il est judicieux de choisir Q4_K_M, Q5_K_M ou Q8_0. Vous apprendrez également dans quels cas les niveaux de quantification inférieurs permettent de réaliser des économies de mémoire et dans quels cas ils réduisent trop la qualité du résultat.
PTQ contre QAT
Pour la plupart des déploiements en périphérie, la quantification post-apprentissage (PTQ) est l’approche que vous utiliserez. La PTQ applique le processus de quantification après la formation du modèle, ce qui vous permet de convertir un modèle existant en un modèle quantifié sans avoir à le reformer. Cela fait de la PTQ le choix le plus pratique pour les ingénieurs qui déploient des LLM à poids ouverts avec Ollama ou llama.cpp, car elle ne nécessite aucun accès aux données d’ apprentissage s d’origine ni au pipeline d’ apprentissage . La PTQ génère la plupart des fichiers GGUF, y compris les variantes Q4_K_M et Q8_0. Elle réduit la taille du modèle, la consommation de mémoire et les besoins en ressources de calcul, avec une perte de qualité minimale.
L'apprentissage e tenant compte de la quantification (QAT) adopte une approche différente. Au lieu d'effectuer la quantification après l'apprentissage, elle intègre la quantification dans le processus d'apprentissage , de sorte que le modèle apprenne à compenser l'erreur de quantification au fur et à mesure que ses poids sont mis à jour. Cette méthode permet généralement de conserver une meilleure précision maximale que le PTQ, car le réseau neuronal s’adapte à une précision réduite tout au long de l’ apprentissage. En contrepartie, le QAT nécessite l’accès à l’ensemble de l’ apprentissage , y compris les données d’ apprentissage , le pipeline d’optimisation et le processus de fin-ajustement. À moins que vous ne soyez en train de procéder à l’ apprentissage ou au fin-ajustement de votre propre modèle, le QAT n’est pas une option pratique.
Le QAT nécessite également des ressources supplémentaires en termes de temps et de sélection des paramètres.

Le fonctionnement du QAT et du PTQ
GPTQ, AWQ et GGUF pour le temps d'exécution
Choisissez le format de quantification adapté à votre environnement d'déploiement . Les formats GPTQ, AWQ (Activation-Aware Weight Quantization) et GGUF (GPT-Generated Unified Format) permettent tous de réduire la taille du modèle et la consommation de mémoire, mais ils sont destinés à des environnements d' différents.
GPTQ vise à optimiser la vitesse d'inférence sur les GPU NVIDIA. Il applique une quantification post-apprentissage e couche par couche, en utilisant des données d'étalonnage pour minimiser l'erreur de quantification tout en préservant la qualité du modèle. Les modèles GPTQ sont particulièrement adaptés aux déploiements sur serveur bénéficiant d'une accélération par GPU, ce qui en fait un choix courant pour les services d'inférence auto-hébergés et les charges de travail d'apprentissage automatique s'exécutant sur du matériel GPU dédié.
AWQ cible également l'inférence sur GPU, mais utilise des modèles d'activation pour identifier et préserver les poids les plus importantslors du processus de quantification. Cela permet aux modèles AWQ de conserver une grande précision tout en offrant une excellente vitesse d'inférence sur le matériel pris en charge. AWQ est le format privilégié pour les déploiements dans le cloud utilisant vLLM, car il est plus rapide que GPTQ sur les systèmes compatibles.
GGUF répond à un besoin différent. Il est optimisé pour l’inférence locale et en périphérie avec Ollama et llama.cpp, et prend en charge les variantes modernes de K-quant et IQ-quant telles que Q4_K_M, Q5_K_M, Q8_0 et IQ4_XS. Si vous effectuez un déploiement sur un Raspberry Pi, un Mac Mini, un Jetson ou tout autre appareil en périphérie, GGUF est le choix qui s’impose.
Une étude réalisée par Local AI Master compare les performances de différents formats de quantification et présente les résultats sous la forme d'un tableau de bord de quantification.

Tableau comparatif des scores de quantification entre GGUF, GPTQ et AWQ
Comprendre la convention de nommage
Vous pouvez identifier le fichier GGUF approprié en lisant son nom. Une fois que vous comprenez ce que représente chaque partie de la convention de nommage, il devient très simple de comparer des options telles que Q4_0, Q4_K_M, Q5_K_M, Q6_K, Q8_0 et IQ4_XS.
Le chiffre qui suit immédiatement le « Q » indique le nombre moyen de bits utilisés pour stocker chaque poids du modèle. Les chiffres les plus bas réduisent les besoins en VRAM et augmentent généralement le débit d’inférence, tandis que les chiffres les plus élevés préservent davantage la qualité du modèle d’origine. En pratique, Q4 est le choix par défaut pour la plupart des déploiements en périphérie, car il offre le meilleur compromis entre l’utilisation de la mémoire et la qualité du résultat. Les options Q5, Q6 et Q8 améliorent progressivement la qualité, mais chaque niveau augmente la consommation de mémoire.
Le suffixe identifie la méthode de quantification. La famille K correspond à la quantification moderne à précision mixte, dans laquelle les différentes couches du modèle sont stockées à des niveaux de précision variés. Parmi ces variantes, Q4_K_M est la recommandation standard, car elle alloue davantage de précision aux couches sensibles à la qualité, telles que les matrices d'attention et la projection de sortie, tout en conservant une précision moindre pour les couches moins sensibles. Cette approche produit des résultats nettement meilleurs que les anciens formats uniformes à 4 bits, sans augmentation significative de l'utilisation de la mémoire. Q4_K_S utilise une stratégie de compression légèrement plus agressive, tandis que Q4_K_M reste la valeur par défaut privilégiée pour la plupart des charges de travail.
Le suffixe « 0 », comme dans Q4_0 ou Q8_0, indique une quantification symétrique sans décalage du point zéro. Chaque poids se voit attribuer le même nombre de bits, quelle que soit son importance pour la qualité du modèle. Cette conception rend le format Q4_0 nettement moins précis que le format Q4_K_M, même si les deux sont théoriquement des formats à 4 bits. À moins que le format Q4_K_M ne dépasse votre mémoire disponible ou ne soit pas disponible pour le modèle que vous avez choisi, vous devriez éviter le format Q4_0 et sélectionner plutôt la version K-quant.
Le préfixe « IQ » signifie « Importance-matrix Quantization » (quantification par matr ice d’importance). Au lieu de traiter tous les poids de la même manière, la quantification IQ utilise une matrice d’importance pour préserver les poids qui contribuent le plus à la qualité du modèle. Ainsi, des formats tels que IQ4_XS peuvent atteindre une qualité similaire à celle du format Q4_K_M tout en utilisant encore moins de mémoire. Cet avantage s’applique principalement à l’inférence sur GPU. Sur les systèmes fonctionnant uniquement avec un processeur central (processeur), tels que les déploiements sur Raspberry Pi, la surcharge supplémentaire liée à la déquantification annule souvent les économies de mémoire, ce qui fait de la quantification K-quant le meilleur choix.
Le format à virgule flottante 16 bits (FP16) sert de référence en matière de qualité, plutôt que le format par défaut « déploiement ». Il préserve le modèle sans perte due à la quantification, mais ses besoins en mémoire le placent au-delà des limites pratiques de la plupart des périphériques en périphérie, car il utilise davantage de bande passante et d’énergie. À moins de disposer d’une mémoire vidéo (VRAM) abondante ou d’évaluer la qualité d’un modèle, les formats Q4_K_M, Q5_K_M ou Q8_0 offriront un meilleur équilibre entre l’utilisation de la mémoire et les performances d’inférence.
Le compromis entre mémoire vidéo (VRAM), débit et qualité
Vous devez considérer la quantification comme un choix d’allocation des ressources, car il est impossible d’optimiser à la fois l’efficacité de la VRAM, le débit d’inférence et la qualité de sortie. Chaque niveau de quantification occupe un point différent sur cette courbe. Une quantification à faible nombre de bits réduit l’utilisation de la mémoire et augmente la vitesse d’inférence, mais elle supprime également davantage d’informations du modèle d’origine. Une quantification à nombre de bits élevé préserve davantage la qualité du modèle d’origine, mais elle nécessite beaucoup plus de mémoire et offre un débit inférieur. Votre objectif n’est pas de choisir le niveau de quantification le plus élevé ou le plus bas. Votre objectif est de choisir le point qui correspond le mieux à votre matériel et à votre charge de travail.
Le compromis apparaît clairement lorsque l'on compare les besoins en mémoire d'un même modèle. Un modèle de 7 milliards de paramètres (7B) au format FP16 nécessite environ 14 Go de VRAM, ce qui exclut d'emblée la plupart des appareils en périphérie. Le même modèle en Q4_K_M nécessite environ 4 à 4,5 Go de VRAM tout en conservant environ 97 à 99 % de la qualité FP16 et en offrant un débit environ deux à trois fois supérieur. Dans la pratique, c’est souvent ce qui fait la différence entre un modèle qui se charge correctement et un autre qui échoue avec une erreur de mémoire insuffisante. À l’autre extrémité du spectre, le modèle Q8_0 reste pratiquement sans perte, avec une perplexité se situant entre environ 0,02 et 0,05 point par rapport au format FP16, mais il nécessite environ deux fois plus de VRAM que le modèle Q4_K_M. Ce gain de qualité n’a de valeur que si votre matériel est capable de le prendre en charge.
Les études montrent systématiquement que le paramètre Q4_K_M constitue le juste milieu idéal pour l’ déploiement en périphérie, car il concilie ces trois contraintes mieux que tout autre format GGUF largement utilisé. Descendre en dessous de Q4 permet d’économiser de la mémoire, mais la perte de qualité devient de plus en plus perceptible, en particulier pour le codage, le raisonnement structuré et les charges de travail de type « agentique ». Dépasser Q4 améliore la qualité des résultats, mais les besoins supplémentaires en VRAM limitent le matériel capable d’exécuter le modèle efficacement. Pour la plupart des ingénieurs utilisant Ollama ou llama.cpp, la question est de savoir si l’amélioration de la qualité justifie le surcoût en mémoire pour votre matériel.
| Niveau de quantification | Mémoire vidéo approximative (modèle 7B) | Préservation de la qualité par rapport au format FP16 |
| Q4_K_M | 4 à 4,5 Go | Entre 97 % et 99 % environ |
| Q5_K_M | 6 à 7 Go | Supérieur à Q4_K_M |
| Q6_K | 7 à 9 Go | Supérieur à Q5_K_M |
| Q8_0 | Environ deux fois la mémoire vidéo (VRAM) du Q4_K_M | Pratiquement sans perte ; avec un écart de perplexité compris entre environ 0,02 et 0,05 par rapport au format FP16 |
| FP16 | Environ 14 Go | 100% |
Compromis de quantification pour un modèle 7B
Les niveaux de VRAM et la quantification adaptée à chacun d'entre eux
La quantité de VRAM dont vous disposez devrait déterminer votre niveau de quantification. Une fois que vous connaissez la quantité de mémoire fournie par votre matériel, vous pouvez rapidement affiner vos choix. Pour la plupart des déploiements en périphérie, Q4_K_M reste la meilleure valeur par défaut. À mesure que la quantité de VRAM disponible augmente, vous pouvez passer à des niveaux de quantification plus élevés qui améliorent la qualité de sortie, en particulier pour les charges de travail exigeant une grande précision. Les contraintes matérielles influencent également les choix d’ déploiement s plus généraux, notamment la conception des agents.
4 à 6 Go de mémoire vidéo (VRAM)
Si vous vous situez dans la partie haute de cette fourchette (6 Go), un modèle 7B ou 8B sur Q4_K_M tient dans la mémoire disponible. Si vous ne disposez que de 4 Go, optez pour une classe de modèle plus petite (comme 3B) à Q4_K_M plutôt que d'essayer de faire tenir de force un modèle 7B ou de descendre à Q3 ou Q2. Un modèle plus petit fonctionnant à Q4_K_M produit presque toujours de meilleurs résultats qu'un modèle plus grand fortement compressé, car une quantification agressive entraîne une perte de qualité bien plus importante.
8 à 12 Go de mémoire vidéo (VRAM)
Q4_K_M reste le meilleur choix pour la plupart des charges de travail de cette gamme. La mémoire vidéo supplémentaire (VRAM) vous offre davantage de flexibilité pour exécuter des modèles plus volumineux, augmenter la longueur du contexte ou passer à des niveaux de quantification de meilleure qualité. Si votre « charge de travail » principale concerne le codage, le raisonnement structuré ou d’autres tâches exigeant une grande précision, optez pour Q5_K_M. Le surcoût en mémoire est justifié par l’amélioration mesurable de la qualité des résultats pour ces charges de travail.
12 à 16 Go de mémoire vidéo (VRAM)
Optez pour Q5_K_M ou Q6_K si votre matériel dispose de 12 à 16 Go de VRAM. Ces deux formats offrent une meilleure qualité que Q4_K_M, l’amélioration étant particulièrement perceptible en matière de génération de code, de raisonnement mathématique et de sortie structurée. Des études montrent également que le gain de qualité entre Q4_K_M et Q6_K est plus important que celui entre Q6_K et Q8_0, ce qui fait de Q6_K une option intéressante lorsque vous disposez de suffisamment de mémoire mais que vous n'avez pas besoin de la VRAM supplémentaire requise par Q8_0.
16 à 24 Go de mémoire vidéo (VRAM)
Q8_0 devient le choix privilégié dès que votre matériel atteint ce niveau. Il produit un résultat pratiquement sans perte, avec une perplexité se situant entre environ 0,02 et 0,05 point par rapport au format FP16, tout en évitant les besoins en mémoire considérables inhérents au format FP16 lui-même. Si vous effectuez régulièrement du développement logiciel, des raisonnements complexes ou d’autres tâches exigeant une grande précision, c’est à ce stade que la mémoire vidéo supplémentaire apporte des avantages mesurables.
24 Go de VRAM ou plus
Le FP16 devient viable sur cette catégorie de matériel pour les modèles allant jusqu’à environ 8 milliards de paramètres. Les modèles plus volumineux, tels que ceux de 13 milliards de paramètres, sont généralement déployés en Q8_0, même sur des GPU de 24 Go. Si votre objectif est d’obtenir une fidélité maximale du modèle et que la mémoire n’est plus un facteur limitant, le FP16 élimine entièrement les pertes liées à la quantification. Pour la plupart des déploiements en périphérie, cependant, l’amélioration par rapport à Q8_0 est suffisamment faible pour que de nombreux ingénieurs continuent de choisir Q8_0 afin de réduire la consommation de mémoire tout en conservant une qualité de sortie pratiquement identique.
Une recommandation s'applique quel que soit le niveau de performance du matériel. Si votre matériel permet d'exécuter soit un modèle plus volumineux en Q4_K_M, soit un modèle plus petit en Q8_0, optez pour le modèle plus volumineux. Les études montrent systématiquement qu'un modèle plus volumineux en Q4_K_M offre presque toujours de meilleures performances qu'un modèle plus petit en Q8_0 sur un matériel équivalent, car la capacité du modèle a un impact plus important sur la qualité des résultats que les légères améliorations apportées par la quantification.
| Niveau VRAM | Quantification | Taille typique des modèles pris en charge | tâche notes |
| 4 à 6 Go | Q4_K_M | 7B | Le meilleur compromis entre qualité, mémoire et débit. Optez pour un modèle plus petit si la mémoire est insuffisante. |
| 8 à 12 Go | Q4_K_M, Q5_K_M pour le codage | de 7B à 13B | Q4_K_M pour l'inférence générale. Q5_K_M pour le codage et le raisonnement structuré. |
| 12 à 16 Go | Q5_K_M ou Q6_K | 13B | Une meilleure qualité pour les charges de travail exigeantes en matière de précision, avec des besoins en mémoire raisonnables. |
| 16 à 24 Go | Q8_0 | 13B et plus | Qualité pratiquement sans perte. Idéal pour les tâches de raisonnement et de développement logiciel. |
| 24 Go et plus | FP16 | Jusqu'à 8B (FP16) | Fidélité maximale du modèle lorsque la mémoire n'est pas une contrainte. |
Quantification recommandée en fonction de la mémoire VRAM disponible
Quand s'écarter de la méthode Q4_K_M
Vous devriez vous en tenir à Q4_K_M, sauf si votre charge de travail ou votre matériel vous donne une raison évidente d'opter pour une autre solution. Pour les conversations générales, les réponses aux questions, la génération augmentée par la recherche (RAG) et l'appel d'outils par des agents, Q4_K_M fonctionne bien. Le compromis change lorsque la précision de la sortie devient plus importante que l'efficacité de la mémoire ou lorsque votre matériel ne peut pas prendre en charge le modèle de manière optimale.
Programmation et raisonnement structuré
Passez au niveau Q5_K_M ou Q8_0 si vous disposez de suffisamment de VRAM, pour les charges de travail nécessitant une plus grande précision en sortie. La différence de qualité entre le niveau Q4_K_M et les niveaux de quantification supérieurs est généralement imperceptible pour les tâches de conversation, mais elle devient mesurable pour la génération de code, le raisonnement mathématique, les sorties structurées et les tâches nécessitant une mise en forme cohérente. Si votre matériel dispose d’une mémoire vidéo (VRAM) suffisante, le surcoût en mémoire en vaut la peine, car cela améliore la précision là où de petites erreurs sont plus susceptibles d’affecter les systèmes en aval.
processeur- les systèmes disposant de moins de 4 Go de mémoire
Privilégiez un modèle plus petit plutôt qu’une version quantifiée de manière plus poussée d’un modèle plus volumineux. Si un modèle 7B en Q4_K_M dépasse votre mémoire disponible, passer en Q3 ou Q2 peut permettre de charger le modèle, mais la perte de qualité est significative pour les charges de travail de type « agentic ». Un modèle de 3 milliards de paramètres avec un niveau de quantification Q4_K_M produira généralement des réponses plus fiables qu’un modèle de 7 milliards de paramètres contraint de passer en Q3 ou Q2, car il préserve davantage les capacités acquises par le modèle. Si votre matériel ne peut pas faire tourner le modèle de manière fluide au niveau Q4_K_M, réduisez la taille du modèle plutôt que le niveau de quantification.
Discussions générales et charge de travail des agents
Optez pour Q4_K_M pour les tâches de conversation générales. Q4_K_M est pratiquement imperceptible dans le cadre des discussions quotidiennes, des réponses aux questions, du RAG et de l’appel d’outils d’agent. Pour la plupart des chatbots en production et des assistants IA embarqués, Q4_K_M offre le meilleur compromis entre qualité de réponse, débit et efficacité mémoire.
Choisissez le format adapté à votre durée d'exécution
Utilisez GGUF pour l'inférence locale et la quantification des poids tenant compte de l'activation (AWQ) pour l'exécution dans le cloud. Le niveau de quantification que vous choisissez ne constitue qu'une partie de la décision relative à l'déploiement . Vous devez également sélectionner un format de modèle adapté à votre environnement d'exécution d'inférence. L'utilisation d'un format inadapté peut empêcher le chargement du modèle ou réduire les performances d'inférence.
Si vous effectuez un déploiement avec Ollama ou llama.cpp sur du matériel en périphérie, téléchargez la version GGUF de votre modèle. Le format GGUF est optimisé pour l’inférence locale et constitue le format natif pris en charge par les deux environnements d’exécution. Il prend en charge les méthodes de quantification modernes telles que Q4_K_M, Q5_K_M, Q6_K et Q8_0, ce qui en fait le choix standard pour le Raspberry Pi, le Jetson Orin Nano et le Mac Mini M4. Vous n'avez pas besoin de convertir les modèles manuellement, car Ollama peut récupérer directement les modèles GGUF compatibles depuis sa bibliothèque de modèles.
Utilisez AWQ pour déployer des modèles avec vLLM dans des environnements cloud optimisés pour les GPU. AWQ est conçu pour l'inférence GPU à haut débit et s'intègre aux environnements d'exécution développés pour la mise en production. Tenter de charger un modèle GGUF dans vLLM entraîne une incompatibilité de format ou un débit nettement inférieur à celui des environnements d'exécution GGUF natifs tels que llama.cpp.
La règle est simple : adaptez le format du modèle à l'environnement d'exécution. Utilisez GGUF pour Ollama et llama.cpp sur les équipements locaux et en périphérie, et utilisez AWQ pour vLLM dans les déploiements sur GPU dans le cloud. En choisissant le bon format, vous vous assurez que les gains de performances liés au niveau de quantification sélectionné ne seront pas perdus en raison d'un environnement d'exécution incompatible.
Pour conclure
Choisissez Q4_K_M, sauf si votre matériel ou votre charge de travail vous donne une raison d'en faire autrement. Ce paramètre offre le meilleur compromis entre l'utilisation de la VRAM, le débit d'inférence et la qualité de sortie pour la plupart des déploiements en périphérie, ce qui en fait le paramètre par défaut idéal pour Ollama et llama.cpp. Optez pour Q5_K_M ou Q8_0 uniquement si votre matériel dispose de suffisamment de VRAM et si votre application tire parti de la précision supplémentaire, notamment pour le codage, le raisonnement structuré ou d’autres tâches exigeant une grande précision.
La quantification ne constitue qu'une des couches d'une « edge- déploiement » réussie. Une fois que vous avez sélectionné le bon modèle et le fichier GGUF, vous avez encore besoin d'une couche de recherche efficace pour alimenter les workflows RAG et les agents. Cela revêt une importance particulière sur les appareils en périphérie aux ressources limitées, où l'association de modèles tels que Gemma 2 à une base de données vectorielle optimisée pour la périphérie, comme Actian VectorAI DB, permet une recherche rapide et précise tout en maintenant une latence et une consommation de ressources faibles.
Commencez dès aujourd'hui à utiliser Actian VectorAI DB Community Edition. Consultez la documentation pour obtenir des informations sur l'déploiement ation et les instructions d'utilisation, et rejoignez la communauté Discord pour bénéficier d'support s et participer à des discussions.
Questions fréquemment posées
Le modèle Q4_K_M est-il suffisamment performant pour les charges de travail des agents de production ?
Oui. Le modèle Q4_K_M conserve environ 97 à 99 % de la qualité du modèle FP16 tout en utilisant beaucoup moins de VRAM. Il s'agit d'un réglage par défaut raisonnable pour les chatbots, le RAG et l'appel d'outils d'agent. Si votre charge de travail est axée sur la génération de code, le raisonnement mathématique ou la production de résultats structurés, optez pour le modèle Q5_K_M ou Q8_0 (si votre matériel dispose de ressources suffisantes pour le prendre en charge).
Dois-je utiliser Q4_0 si Q4_K_M n'est pas disponible ?
Uniquement si vous n'avez pas d'autre choix. Q4_K_M utilise une précision mixte, en allouant davantage de bits aux couches sensibles à la qualité, telles que les matrices d'attention et la projection de sortie. Q4_0 utilise une quantification uniforme à 4 bits plus ancienne, qui produit une qualité nettement inférieure. Lorsque les deux options sont disponibles, choisissez Q4_K_M.
Que se passe-t-il si je passe en dessous du niveau Q4 ?
Passer au format Q3 ou Q2 réduit l'utilisation de la mémoire, mais la perte de qualité devient perceptible. Bien que ces formats puissent permettre à un modèle plus volumineux de tenir dans une mémoire limitée, ils entraînent souvent un raisonnement moins performant, une moins bonne exécution des instructions et un comportement moins fiable de l'agent. Si le modèle Q4_K_M ne tient pas, il est généralement préférable de choisir un modèle plus petit plutôt que d'utiliser les formats Q3 ou Q2.
Problèmes courants
Le modèle génère une erreur de mémoire insuffisante au niveau de Q4_K_M
Vérifiez si votre matériel dispose d’une mémoire vidéo (VRAM) suffisante pour le modèle et sa fenêtre de contexte. Si la mémoire reste insuffisante, optez pour un modèle plus petit plutôt que de descendre en dessous du niveau Q4. Cette approche permet de préserver la qualité de sortie plus efficacement qu’une quantification trop poussée.
Le débit est inférieur aux prévisions
Vérifiez que votre environnement d'exécution utilise bien l'accélération GPU au lieu de se rabattre sur l'processeur. Si l'accélération GPU n'est pas disponible, assurez-vous que les pilotes requis et la configuration de l'environnement d'exécution sont correctement installés avant de réduire le niveau de quantification.
La qualité des résultats est médiocre dans les exercices de raisonnement
Si votre charge de travail implique la génération de code, des calculs mathématiques ou la production de résultats structurés, passez de la version Q4_K_M à la version Q5_K_M ou Q8_0 si votre matériel dispose d’une mémoire vidéo (VRAM) suffisante. Des études montrent que ces niveaux de quantification plus élevés apportent des améliorations mesurables en termes de qualité pour les tâches sensibles à la précision.