LLM local
quel modèle pour votre GPU ou Mac ?
Ollama, LM Studio, llama.cpp : choisissez votre carte graphique (RTX, AMD, Apple Silicon) ou saisissez la VRAM. On liste les GGUF qui tournent bien, juste, ou qui ne rentrent pas — avec contexte max et tokens/seconde estimés.
Vous cherchez quel LLM local faire tourner sur votre PC ? La VRAM et la bande passante du GPU décident ce qui rentre vraiment (Ollama, LM Studio, GGUF). Cet outil estime le fit et la vitesse avant de télécharger des Go de poids. Voir les comparatifs · Guides
1. Matériel
La RAM système active l’offload (couches / cache KV). Multi-GPU : VRAM additionnée, bande passante avec overhead.
2. Filtres
Comment lire « Tourne bien », « Juste » et « Ne rentre pas » ?
Tourne bien : le modèle tient en VRAM avec au moins 4K de contexte (et vos filtres). Juste : il rentre mais avec peu de contexte, sous votre seuil, ou via offload RAM. Ne rentre pas : les poids seuls dépassent la mémoire disponible.
D’où viennent les tok/s estimés ?
La génération de tokens est surtout limitée par la bande passante mémoire du GPU. L’outil estime tok/s ≈ bande passante / (poids + ~1 Go de surcoût moteur). Sans GPU listé (VRAM saisie à la main), la vitesse n’est pas affichée.
Quantization, KV cache, offload — en bref
La quantization (Q4, Q8…) réduit la taille des poids. Le KV cache grossit avec le contexte. L’offload envoie une partie des couches ou du cache en RAM système : le modèle tourne, mais souvent beaucoup plus lentement (Ollama, LM Studio, llama.cpp).
Estimations indicatives — les perfs réelles dépendent du runtime, des drivers et de la charge. Catalogues GPU et modèles GGUF mis à jour régulièrement. · Comparatifs · Modèles