Qwen3.8-27B en local : un 27B qui tient sur 16 Go avec LM Studio
Qwen3.8-27B sort en poids ouverts Apache 2.0 : modèle dense multimodal de 27B, quantifications Unsloth dès 9 Go, utilisable sur 16 Go avec LM Studio.
2 septembre 2026

Alibaba a publié le 14 août 2026 Qwen3.8-27B, un modèle dense multimodal distribué sous licence Apache 2.0. Avec 27,78 milliards de paramètres et une fenêtre de contexte de 262 000 tokens, cette version s’inscrit dans la continuité de la famille Qwen tout en apportant des améliorations significatives en raisonnement, en code et en compréhension multimodale. Le modèle est disponible immédiatement sur les plateformes de téléchargement habituelles et peut être exécuté localement sur des machines équipées de GPU ou de CPU suffisamment dimensionnés.
Architecture et attention hybride
Qwen3.8-27B repose sur une architecture transformer dense, sans mixture-of-experts, ce qui simplifie le déploiement par rapport aux modèles MoE de taille comparable. L’innovation architecturale majeure concerne le mécanisme d’attention hybride : le modèle alterne entre 48 couches d’attention linéaire et 16 couches d’attention complète (full attention). Cette combinaison vise à réduire la complexité computationnelle sur les longues séquences tout en préservant la capacité de raisonnement sur les tokens récents et les relations à longue portée.
Le cache KV (Key-Value) est optimisé à 64 Ko par token, un chiffre remarquablement bas qui permet de tenir des contextes de 262 000 tokens dans une empreinte mémoire raisonnable lors de l’inférence. Pour les utilisateurs qui traitent des documents entiers, des bases de code volumineuses ou des conversations longues, cette compression du cache constitue un avantage décisif par rapport à des modèles concurrents exigeant une mémoire GPU proportionnellement plus élevée.
Performances sur les benchmarks
Les résultats publiés par l’équipe Qwen placent le 3.8-27B parmi les modèles open weights les plus compétitifs de sa catégorie de taille :
- GPQA (Graduate-Level Google-Proof Q&A) : 89,2 % — performance solide en questions scientifiques de niveau graduate.
- LiveCodeBench : 90,3 % — excellente capacité de génération et correction de code en conditions dynamiques.
- SWE-bench Pro : 61,7 % — capacité avérée à résoudre des problèmes réels de dépôt de code.
- Terminal-Bench : 73,0 % — bonnes performances en tâches d’agent terminal, incluant navigation shell et manipulation de fichiers.
Ces scores positionnent Qwen3.8-27B comme une alternative crédible aux modèles fermés de taille moyenne pour les usages de développement, d’analyse documentaire et d’assistance technique.
Quantification GGUF avec Unsloth
Pour les déploiements locaux sur CPU ou GPU avec mémoire limitée, la communauté Unsloth propose des quantifications GGUF optimisées. Le tableau suivant récapitule les tailles de fichier et les recommandations RAM correspondantes :
| Quantification | Taille disque | RAM recommandée |
|---|---|---|
| UD-IQ2_XXS | 9,0 Go | 12 Go minimum |
| UD-Q2_K_XL | 10,7 Go | 14 Go minimum |
| UD-Q3_K_XL | 13,4 Go | 16 Go minimum |
| IQ4_XS | 15,7 Go | 20 Go minimum |
| Q4_K_M | 17,1 Go | 24 Go minimum |
| Q5_K_M | 19,8 Go | 28 Go minimum |
| Q6_K | 22,9 Go | 32 Go minimum |
| Q8_0 | 29,0 Go | 40 Go minimum |
| BF16 (pleine précision) | 53,8 Go | 64 Go minimum (GPU recommandé) |
En pratique, la quantification Q4_K_M offre le meilleur compromis qualité/performance pour la plupart des usages conversationnels et de code. Les variantes UD (Unsloth Dynamic) IQ2 et Q2 conviennent aux machines avec 16 Go de RAM unifiée, typiques des MacBook Air M2/M3, moyennant une légère dégradation sur les tâches de raisonnement complexe.
Exécution avec LM Studio
LM Studio reste l’outil le plus accessible pour tester Qwen3.8-27B sur poste de travail. Après téléchargement du fichier GGUF depuis le catalogue intégré ou depuis un dépôt communautaire, chargez le modèle et configurez les paramètres suivants pour un usage général :
- Température : 0,6 à 0,7 pour la conversation ; 0,2 à 0,3 pour le code et le raisonnement.
- Top-p : 0,9
- Top-k : 40
- Répétition penalty : 1,05 à 1,1
- Context length : ajustez selon votre RAM ; commencez à 32 768 tokens si la mémoire est limitée.
LM Studio active automatiquement le template Jinja du modèle lorsque le fichier GGUF inclut les métadonnées chat_template. Vérifiez que le format de conversation (ChatML ou équivalent Qwen) est bien reconnu dans l’interface avant de lancer une session.
Exécution avec llama.cpp
Pour un contrôle plus fin ou un déploiement serveur, llama.cpp avec le flag --jinja est la référence. Le template Jinja garantit que les tokens de rôle (system, user, assistant) sont formatés correctement, condition indispensable pour obtenir des réponses cohérentes avec Qwen3.8.
llama-server
-m qwen3.8-27b-Q4_K_M.gguf
--jinja
-c 32768
-ngl 99
--host 0.0.0.0
--port 8080
--temp 0.7
--top-p 0.9
--top-k 40
L’option -ngl 99 délègue toutes les couches au GPU lorsque disponible. Sur Mac avec Apple Silicon, utilisez -ngl 99 avec le backend Metal activé. Sur CPU pur, retirez ce flag et ajustez -t au nombre de threads physiques de votre processeur.
Étapes spécifiques Mac
Sur macOS, la procédure recommandée passe par Homebrew :
- Installer llama.cpp :
brew install llama.cpp - Télécharger le GGUF Q4_K_M ou Q5_K_M selon la RAM unifiée (16 Go → Q4, 24 Go et plus → Q5).
- Lancer avec Metal :
llama-server -m ./qwen3.8-27b-Q4_K_M.gguf --jinja -c 16384 -ngl 99 - Tester via l’interface web locale sur
http://localhost:8080.
Les Mac Studio et MacBook Pro M3 Max/M4 Max avec 36 Go de RAM unifiée ou plus peuvent exécuter Q6_K avec d’excellentes performances. Les MacBook Air 16 Go doivent rester sur Q4_K_M ou IQ4_XS pour éviter le swap disque.
Variantes uncensored : prudence recommandée
Comme pour la plupart des modèles open weights populaires, des variantes « uncensored » circulent sur les dépôts communautaires. Ces versions ont subi un fine-tuning ou un ablation des garde-fous alignment du modèle original. Leur utilisation comporte des risques : génération de contenu inapproprié, non-conformité aux politiques d’usage professionnel, et qualité parfois dégradée sur les tâches de raisonnement faute d’un alignment soigné.
Pour un usage en entreprise ou dans un contexte soumis au RGPD, préférez systématiquement le modèle officiel Apache 2.0 publié par Alibaba. Les variantes uncensored ne bénéficient d’aucun support ni garantie de l’équipe Qwen, et leur provenance est souvent difficile à tracer.
Déploiement local en France et conformité RGPD
Exécuter Qwen3.8-27B en local sur un serveur ou un poste situé en France ou dans l’Union européenne présente un avantage réglementaire majeur : les données traitées ne quittent pas votre infrastructure. Aucun transfert vers des serveurs tiers aux États-Unis ou en Chine n’est nécessaire, ce qui simplifie l’analyse d’impact (AIPD) et réduit les obligations liées aux clauses contractuelles types.
Points de vigilance pour un déploiement conforme :
- Documenter le traitement dans le registre des activités de traitement.
- Informer les utilisateurs finaux que leurs requêtes sont traitées par un modèle local.
- Mettre en place une politique de rétention des logs d’inférence si des journaux sont conservés.
- Vérifier que les données d’entraînement du modèle ne posent pas de problème sectoriel spécifique (santé, finance, défense).
La licence Apache 2.0 autorise l’usage commercial sans redevance, ce qui facilite l’intégration dans des produits SaaS hébergés en Europe, sous réserve du respect du RGPD et des réglementations sectorielles applicables.
Multimodalité et cas d’usage
Qwen3.8-27B intègre des capacités multimodales natives : analyse d’images, compréhension de schémas, extraction de texte depuis des captures d’écran et description de contenus visuels. Cette dimension ouvre des cas d’usage concrets en support technique (diagnostic à partir de photos d’erreur), en accessibilité (description automatique d’images) et en analyse documentaire (OCR intelligent couplé au raisonnement textuel).
Combiné à la fenêtre de 262 000 tokens, le modèle peut ingérer des rapports complets accompagnés de figures, des dépôts de code avec documentation inline, ou des dossiers juridiques avec annexes scannées — dans la limite de la mémoire disponible sur la machine hôte.
Conclusion
Qwen3.8-27B confirme la maturité de l’écosystème open weights chinois et sa compétitivité face aux modèles occidentaux de taille équivalente. L’attention hybride, le cache KV compact et la licence Apache 2.0 en font un candidat sérieux pour les déploiements locaux exigeant confidentialité, performance et multimodalité. Que vous passiez par LM Studio pour un test rapide ou par llama-server pour une infrastructure de production, les quantifications Unsloth permettent d’adapter le modèle à virtually tout matériel, du MacBook Air 16 Go au serveur GPU 80 Go.