Hermes sur modèles locaux : sans API key, sans compte, entièrement hors ligne

C’est vendredi soir, vous êtes dans le train, ordinateur portable ouvert, prêt à confier à Hermes ce codebase survolé dans la journée — et vous découvrez que votre quota d’API est épuisé, pendant que le GPU discret au fond du sac n’a, lui, servi qu’à faire tourner des jeux. Ou alors vous relisez un contrat pas encore public et vous ne voulez pas qu’un seul caractère transite par le cloud de qui que ce soit, même en transit. Depuis début septembre 2026, Hermes a transformé « faire tourner de gros modèles en local » d’un hobby capricieux en un simple interrupteur à un clic : il télécharge et maintient pour vous le moteur d’inférence llama.cpp, choisit la build de chaque modèle adaptée à votre matériel et gère la mémoire GPU de bout en bout. Pas de compte, pas d’API key — et une fois le modèle téléchargé, tout fonctionne entièrement hors ligne.
Pourquoi les modèles locaux en DIY étaient si pénibles
Si vous avez déjà essayé de faire tourner un modèle ouvert sur votre propre machine, vous connaissez la galère. D’abord, installer un moteur d’inférence (llama.cpp, Ollama ou équivalent). Ensuite, dénicher un fichier GGUF — le format d’empaquetage standard de la communauté, qui range les poids et l’architecture d’un modèle dans un seul fichier. Mais ce n’est que le début : des téléchargements interrompus à refaire à la main ; des erreurs de VRAM insuffisante qui vous obligent à déterminer quelles couches déborder dans la RAM système, et dans quel ordre ; une fenêtre de contexte qui démarre beaucoup trop petite ; et des choix de quantification (compresser les poids en précision réduite pour économiser la mémoire — Q4 ou Q8 ?) dignes d’un pile ou face.
Des outils comme Ollama ont réglé une partie du problème. Hermes va plus loin et prend en charge toute la chaîne — moteur, téléchargements et placement en mémoire — pour ne vous laisser que trois clics.
Le parcours desktop en trois étapes
Dans une version récente d’Hermes Desktop, ouvrez « Réglages → Fournisseurs → Modèles locaux ». Sur macOS et Windows, cette entrée est désormais visible par défaut. Ensuite :
- Cliquez sur « Installer le runtime ». Hermes télécharge la build officielle de llama.cpp pour votre matériel (quelques centaines de Mo), la vérifie et la maintient à jour lors des releases suivantes. llama.cpp est le moteur open source qui fait tourner le modèle sur votre GPU ou votre CPU.
- Choisissez un modèle dans le catalogue et cliquez sur « Télécharger ». Les nouvelles conversations tourneront sur le modèle local.
- Cliquez sur « Utiliser ». Votre modèle local est actif.
Le serveur démarre et s’arrête avec Hermes et survit aux redémarrages de l’application. Revenir à un provider cloud ? Un seul clic dans le sélecteur de modèles.
Ce que contient le catalogue — et si votre GPU peut le faire tourner
Le catalogue sélectionné compte actuellement quatre modèles, du gabarit quotidien jusqu’à la classe frontier :
| Modèle | Profil | Configuration matérielle requise |
|---|---|---|
| Qwen3.8 27B | Modèle agent polyvalent ; capable en vision ; contexte long qui reste rapide | GPU 16 Go et plus pour une qualité élevée |
| Qwen3.6 35B-A3B | Modèle mixture-of-experts plus grand, avec prédiction multi-tokens | GPU 16 Go et plus ; plus de marge = plus de stabilité |
| Qwen3.8 Flash Next | Modèle d’échelle frontier | Nécessite un très gros GPU |
| DeepSeek V4 Flash | Modèle de classe frontier | Machines de 128 Go de mémoire et plus |
Avant le moindre téléchargement, chaque ligne est évaluée par rapport à votre machine : adéquation mémoire (vert = tourne entièrement dans la mémoire GPU, orange = déborde en RAM système et tourne plus lentement, rouge = cette machine ne peut pas le faire tourner), fenêtre de contexte et taille du téléchargement. Hermes choisit la build de meilleure qualité qui tient entièrement dans votre GPU — et il ne propose jamais rien sous la quantification 4 bits, car en dessous, la perte de qualité est trop sévère. Une machine qui ne peut pas accueillir la build 4 bits ne peut tout simplement pas faire tourner ce modèle, et Hermes vous le dit.
Le catalogue est un point de départ sélectionné, pas une limite. Trouver d’autres modèles, sur la même page, cherche dans tout Hugging Face, avec une vérification d’adéquation fichier par fichier, calibrée sur votre machine avant le téléchargement. Vous avez déjà un .gguf sur le disque ? Ajouter un fichier de modèle l’ajoute à votre bibliothèque sans le copier, utilisable immédiatement.
Gestion de la mémoire : le sale boulot, pris en charge
Les modèles locaux vivent ou meurent selon le placement en mémoire : Hermes le gère donc de bout en bout, sans exposer le moindre réglage :
- La fenêtre de contexte démarre à une taille qui tient entièrement dans votre GPU et grandit vers le maximum natif du modèle à mesure que la conversation a besoin de place. Si vous voyez « Fenêtre de contexte élargie » dans le flux de statut pendant les longues sessions, c’est la fenêtre qui s’agrandit — pas une erreur.
- Chaque modèle recommandé bénéficie d’au moins 64K de fenêtre de contexte. Quand un modèle est plus grand que la mémoire de votre GPU, Hermes place délibérément le surplus en RAM système, dans l’ordre qui fait le moins de dégâts (les poids des experts d’abord, jamais le cache d’attention) — en sacrifiant un peu de vitesse pour préserver la garantie de contexte.
- La compression ne se déclenche qu’à la fenêtre maximale du modèle. L’agrandissement passe toujours en premier ; votre historique n’est jamais résumé préventivement.
- Les modèles inactifs se déchargent après 15 minutes pour libérer la mémoire GPU, et se rechargent automatiquement au message suivant.
Envie de le voir en direct ? Cliquez avec le bouton droit sur la barre de statut et activez Ressources système pour suivre l’utilisation GPU en temps réel, la mémoire GPU et la RAM. Le compteur de contexte reflète toujours la fenêtre avec laquelle le modèle tourne réellement.
Vie privée et hors ligne : une fois téléchargé, rien ne quitte la machine
C’est tout l’intérêt des modèles locaux, dit sans détour : pas de compte, pas d’API key et aucun accès réseau une fois le modèle téléchargé. Prompts, appels d’outils, code — tout reste local. Pour du code non publié, des contrats ou des données médicales, ce n’est pas « un peu plus rassurant », c’est une autre catégorie : la requête ne quitte jamais votre ordinateur.
Hermes respecte aussi les installations qui font déjà tourner l’inférence ailleurs :
- Si un llama-server tourne déjà sur votre machine, Hermes le détecte et l’utilise au lieu d’en lancer un qui lui soit propre.
- Pour un contrôle manuel total, pointez
model.providervers n’importe quel serveur compatible OpenAI. - Sur Ollama, MLX ou des builds personnalisées, la doc officielle propose des guides dédiés : configuration Ollama et fonctionnement sur Mac.
Configuration : CLI et machines headless
L’interface desktop écrit la configuration pour vous, mais les clés restent ouvertes pour une utilisation en CLI et headless. Le runtime géré est contrôlé par la section local_runtime du fichier config.yaml :
local_runtime:
enabled: true # true = démarrer le serveur géré avec Hermes
backend: auto # auto | cuda | metal | vulkan | hip | cpu
# auto = CUDA sur NVIDIA, Metal sur macOS, Vulkan sur les autres GPU, sinon CPU
Les modèles et les builds du runtime vivent sous le répertoire personnel d’Hermes (models/ et runtimes/llamacpp/). Faire d’un modèle local votre modèle principal utilise les réglages standards model.provider: llamacpp + model.default — la même forme que pour tous les autres providers, sélectionnable en interactif avec hermes model.
Prérequis et état de la release
- Windows et Linux : GPU NVIDIA (CUDA) ou CPU. macOS : Apple Silicon (Metal). Les builds Vulkan servent les GPU AMD.
- Un GPU de 8 Go et plus fait tourner confortablement les plus petits modèles du catalogue ; 16 Go et plus fait tourner les modèles 27–35B en haute qualité.
- Les téléchargements sont vérifiés octet par octet contre le catalogue ; un téléchargement incomplet est supprimé et signalé, jamais utilisé à moitié. (Les zips du moteur du runtime sont vérifiés par SHA-256.)
Une réserve honnête : cette fonctionnalité est arrivée via la PR #100667 (le runtime géré lui-même, fusionnée le 1er septembre) et la PR #101823 (point d’entrée activé par défaut pour macOS/Windows, fusionnée le 3 septembre). Elle vit actuellement sur main en amont et n’a pas encore été livrée dans une release — elle est plus récente que v0.21.0. Pour l’essayer dès aujourd’hui, mettez Hermes à jour vers le main le plus récent ; sur desktop, assurez-vous que la build inclut les deux fusions. Pour le contexte sur la direction du produit agent, voir nos notes de release v0.21.0 Pantheon et notre guide pour choisir ses modèles.
En résumé : de « est-ce que ça peut tourner ? » à « un clic »
Le vrai progrès des modèles locaux n’est pas qu’un modèle soit devenu plus fort — c’est que la barrière a disparu : le moteur s’installe tout seul, la build se choisit toute seule, la mémoire se gère toute seule et les modèles inactifs se déchargent tout seuls. Ce qui vous coûtait un après-midi de tutoriels ne coûte plus que trois clics dans les réglages. La prochaine fois que vous serez sans connexion — ou face à des documents que vous ne voulez pas confier au cloud —, souvenez-vous qu’il existe un agent qui vit sur votre machine depuis toujours. Il n’attendait que quelqu’un pour le réveiller. Commencez par le guide d’installation, puis cherchez l’entrée modèles locaux dans le sélecteur de modèles (référence de la commande hermes model).