Hermes 本地模型完全指南:不注册、不填 Key,断网也能用


周五晚上,你带着笔记本上了高铁,想把白天没看完的一份代码库丢给 Hermes 分析——结果一联网就发现 API 额度用完了,而包里那台带独立显卡的电脑,除了打游戏什么都没干过。又或者,你在处理一份还没公开的合同,不想让任何一个字经过云端的服务器,哪怕只是“路过”。从 2026 年 9 月起,Hermes 把“本地跑大模型”从一门折腾人的手艺,变成了一键开关——它会自动下载并维护 llama.cpp 推理引擎、按你的显卡挑选合适的模型版本、替你管好显存。没有账号、不填 API key,模型下载完成后,完全断网也能用。

以前自己搭本地模型,到底有多折腾?

如果你试过在本地跑开源模型,应该能体会那种挫败感:先要装推理引擎(比如 llama.cpp 或 Ollama),再手动下载 GGUF 格式的模型文件——GGUF 是社区通用的模型打包格式,把权重和结构塞进一个文件里。但这只是开始:文件下载到一半断了要重来;模型跑起来显存不够,要把一部分层“溢出”到内存,可你又不知道哪几层放出去损失最小;上下文窗口默认开多大?量化版本——即把模型权重从高精度压缩到低精度以省显存的做法——选 Q4 还是 Q8?每一步都在劝退。

Ollama 这类工具解决了其中一部分,但 Hermes 现在走得更远:它把“推理引擎 + 模型下载 + 显存管理”整条链路都接管了。你只需要做三件事。

桌面端三步开启本地模型

在最新版 Hermes Desktop 里,打开 Settings(设置)→ Providers(提供商)→ Local Models(本地模型)——macOS 和 Windows 上这个入口现在默认就是显示的——然后:

  1. 点击 “Install runtime”(安装运行时)。 Hermes 会为你的硬件下载官方 llama.cpp 构建(几百 MB),校验后安装,以后每次发版还会自动帮你更新。llama.cpp 是一个开源的本地推理引擎,专门负责把大模型跑在你的 GPU 或 CPU 上。
  2. 从目录里挑一个模型,点击 “Download”(下载)。 目录里每个模型都标注了适配信息(见下文),你不用猜。
  3. 点击 “Use”(使用)。 新开的对话就运行在这个本地模型上了。

服务器会随 Hermes 启动和停止,重启应用后依然有效;想切回云端模型,在模型选择器里点一下即可。

目录里有什么?你的显卡能跑什么,一目了然

内置目录目前有四个精选模型,从能跑在 8GB 显存笔记本上的日常模型,到需要 128GB 以上内存的“前沿级”大块头:

模型 定位 硬件门槛
Qwen3.8 27B 全能型 agent 模型,支持视觉,长上下文依然流畅 16GB 以上显存可高质量运行
Qwen3.6 35B-A3B 更大的混合专家(MoE)模型,自带多 token 预测 16GB 以上显存,配置更高更稳
Qwen3.8 Flash Next 前沿规模模型 需要非常大的 GPU
DeepSeek V4 Flash 前沿级模型 128GB+ 内存的机器

每个模型在你下载之前,就会按你这台机器的实际配置算好三件事:显存是否放得下(绿色 = 完全跑在 GPU 里,黄色 = 需要借用系统内存、会慢一些,红色 = 这台机器跑不动)、上下文窗口多大、下载体积多大。Hermes 会为你的硬件挑选质量最高且能完整塞进显存的量化版本——量化等级低于 4-bit 的版本质量损失太严重,所以它永远不会给你推荐那种“省显存但变笨”的选择。

目录只是起点,不是边界。同一页的 Find more models(发现更多模型) 会直接搜索整个 Hugging Face——每个结果都带按你机器算好的适配检查,下载前你就知道能不能跑。你手上如果已经有 .gguf 文件,“Add model file(添加模型文件)“可以直接把它链接进模型库,文件原地不动,立刻可用。

显存管理:它把最脏最累的活全干了

本地模型的成败几乎全看显存怎么安排,Hermes 的策略是端到端托管,不给你任何旋钮:

  • 上下文窗口从“能完整塞进 GPU”的大小起步,随着对话变长自动朝模型的原生上限增长。长会话里你可能会在状态栏看到 “Context window grown”(上下文窗口已扩展)——那是窗口在变大,不是报错。
  • 每个推荐模型至少保证 64K 的上下文窗口。模型太大放不进 GPU 时,Hermes 会把溢出部分按“损失最小”的顺序放进系统内存(专家权重优先溢出,注意力缓存绝不溢出),用一点速度换上下文保证。
  • 上下文压缩只发生在模型达到最大窗口之后——窗口增长永远优先于压缩,不会动不动就把你的历史对话摘要掉。
  • 空闲 15 分钟自动卸载模型释放显存,下一条消息发出时再自动载回。

想看效果?右键状态栏,打开 System resources(系统资源),就能实时看到 GPU 利用率、显存和内存占用;旁边的上下文计量器永远显示模型当前真实运行的窗口大小。

隐私与离线:下载完成后,数据不出这台机器

这是本地模型最直白的价值:没有账号、没有 API key,模型下载完成后不再需要任何网络访问。你的提示词、工具调用、代码——所有东西都留在本地。对处理未公开代码、合同、医疗数据的人来说,这不是“更安心一点”,而是性质完全不同:请求根本不离开你的电脑。

Hermes 也照顾到了“我已经有别的推理服务”的情况:

  • 如果你机器上已经跑着一个 llama-server,Hermes 会自动检测到它并直接使用,不再自己启动一个;
  • 想完全手动控制的话,可以把 model.provider 指向任意 OpenAI 兼容的服务器;
  • 用 Ollama、MLX 或自定义构建的,官方文档里有单独的 Ollama 手动配置指南Mac 本地运行指南 可以参考。

配置:CLI 和无头机器怎么用

虽然桌面 UI 会自动写好配置,config.yaml 里的字段对 CLI 和无头(无图形界面)用户也是开放的。被托管的运行时由 local_runtime 小节控制:

local_runtime:
  enabled: true     # true = 随 Hermes 启动托管服务器
  backend: auto     # auto | cuda | metal | vulkan | hip | cpu
                    # auto = NVIDIA 上选 CUDA,macOS 上选 Metal,其他 GPU 选 Vulkan,否则 CPU

模型文件和运行时都放在 Hermes 主目录下(models/runtimes/llamacpp/)。把一个本地模型设为主模型,用的就是标准的 model.provider: llamacpp + model.default 设置——和所有其他提供商一样的写法,可以用 hermes model 命令交互式选择。

硬件要求与当前状态

  • Windows 和 Linux: NVIDIA GPU(CUDA)或 CPU;macOS: Apple Silicon(Metal);Vulkan 构建支持 AMD GPU。
  • 8GB 以上显存的 GPU 能舒适跑目录里的小模型;16GB 以上能以高质量跑 27–35B 的模型。
  • 模型下载过程会按目录逐字节核对,不完整的下载会被删除并明确报告,绝不会出现“下载到一半的文件被拿来用”的情况(运行时引擎的压缩包则是 SHA-256 校验)。

需要说明的是:这套本地模型能力由 PR #100667(托管运行时本体,9 月 1 日合并)和 PR #101823(macOS/Windows 默认开启入口,9 月 3 日合并)引入,目前在上游 main 分支上,尚未进入正式版本——也就是说它比 v0.21.0 更新。想立即体验,把 Hermes 更新到最新的 main 即可;桌面端请确认使用的是包含这两次合并的构建。相关背景可以看看我们写的 v0.21.0 Pantheon 发版解读如何选择模型

总结:从“能不能跑”到“点一下就跑”

本地模型最大的进步不是某个模型变强了,而是门槛消失了:引擎自动装、版本自动挑、显存自动管、空闲自动卸。以前你要花一个下午查教程配置的东西,现在变成了 Settings 里的三个点击。下次在没网的地方、或面对不想交给云端的敏感材料时,记得你电脑里其实一直住着一个随时能用的 agent——只是以前没人帮你把它叫醒而已。安装 Hermes 后,从安装指南起步,在模型选择器里(命令参考见 hermes model)就能找到本地模型入口。