Hermes 实战知识档案
开源可部署的工具与推理模型
Nous Research 开源的大模型家族,主打工具调用、推理和长期任务编排,常被用来搭建需要记忆和规划的 Agent 系统。
#架构定位
1. Hermes 是什么?
Hermes 是 Nous Research 开源的大模型家族,主打工具调用和推理。它基于 Llama 3.1 做了专门微调,提供 8B、70B、405B 等多个尺寸,可以部署在本地或私有服务器上。
除了模型本身,围绕 Hermes 还有一个 Hermes Agent 框架,用来把模型组装成能长期运行、能记住事情、能调用工具的 Agent。
2. 和 Codex / Claude 的区别
- Codex:专注帮你写代码、跑测试、改项目,重在工程执行。
- Claude:通用大模型助手,聊天、写作、分析样样行,主要在云端使用。
- Hermes:主打开源、可私有部署、可自定义,适合对数据隐私要求高,或者想把模型和 Agent 完全掌控在自己手里的团队。
3. 核心能力
- 工具调用(Tool Use):能调用外部 API、数据库、搜索等工具完成任务。
- 结构化输出:支持用 XML 标签输出规范化内容,方便程序解析。
- 推理透明化:通过内部独白(inner monologue)和步骤标记,让你看到模型是怎么想的。
- Mermaid 图表:能直接生成流程图、时序图,帮助可视化复杂流程。
- 长期记忆:Hermes Agent 框架支持把项目经验、用户偏好沉淀下来,跨会话使用。
4. 适合谁用?
- 有隐私要求的企业:想把模型和数据留在自己服务器上。
- AI 应用开发者:需要可商用的开源模型做二次开发。
- 个人技术爱好者:想本地跑一个能调用工具的 Agent。
5. 使用边界
- 对提示词敏感:Hermes 很受 system prompt 影响,空 system prompt 不一定给出“ helpful assistant”风格。
- 本地部署需要算力:405B 版本需要很强的 GPU,8B 版本可以在普通消费级显卡上跑。
- 它不直接写生产代码:具体代码改动建议交给 Codex 这类专门工具。
#上手指南
1. 获取模型
Hermes 3 的权重托管在 Hugging Face。根据硬件选择版本:
- 8B:适合本地测试,消费级显卡可跑。
- 70B:性能更强,需要多卡或云服务器。
- 405B:顶级性能,需要专业算力集群。
2. 运行方式
- 用 vLLM、Ollama、llama.cpp 等推理框架加载。
- 启动后它会暴露一个兼容 OpenAI API 的接口,方便现有项目接入。
3. 设计 system prompt
Hermes 对 system prompt 非常敏感。建议:
- 明确告诉它“你是谁、能做什么、输出格式”。
- 需要工具调用时,在 prompt 里列出可用工具的名称和参数。
- 不要用空 system prompt 跑正式任务。
4. 工具调用配置
让 Hermes 调用工具通常分三步:
- 定义工具列表(函数名、参数、用途)。
- 在对话里描述用户任务。
- 解析模型返回的 XML/JSON,执行工具,再把结果喂回去。
5. Hermes Agent 框架
如果想做长期记忆、多项目隔离,可以看看 Hermes Agent:
- 它提供记忆分层(工作记忆、项目记忆、全局记忆)。
- 支持 MCP 协议,能连接常见工具。
- 适合搭建个人知识助手或企业内部的 Agent 工作流。
6. 性能与成本
- 本地部署省去 API 调用费,但要付硬件和电费。
- 小模型响应快但理解深,大模型能力强但慢且贵。
- 建议先用 8B 验证思路,再决定是否上 70B/405B。
#实战手册
实战手册 1:搭建本地私有知识助手
目标:把所有项目文档、笔记、规范喂给一个本地 Agent,随问随答。
- 选 8B 或 70B 模型,用 Ollama 本地启动。
- 把文档按项目分文件夹,建立向量索引。
- 配置 Hermes Agent 的记忆层,区分项目记忆和全局记忆。
- 测试常见问答:架构决策、接口约定、历史 Bug 原因。
- 定期清理过期记忆,防止记忆膨胀。
实战手册 2:多步推理任务
目标:让 Hermes 完成需要分步骤思考的复杂分析。
- 在 system prompt 里要求它“先列步骤,再逐条执行”。
- 开启内部独白,让它把推理过程显式写出来。
- 每一步结束后,把中间结果返回给模型确认。
- 最终输出结构化结论,方便下游程序处理。
实战手册 3:工具调用工作流
目标:让 Hermes 自动查天气、搜资料、写报告。
- 定义 3-5 个核心工具:搜索、计算器、文件读取、邮件发送。
- 用 XML 格式描述工具签名。
- 让模型在每次回复中决定是否调用工具。
- 执行工具后把结果拼回对话,继续下一轮。
#版本演进
2026-09 当前状态
- Hermes Agent 框架文档完善:提供从模型部署到工具调用的完整指南。
- MCP 协议兼容:Hermes Agent 能接入主流编程 Agent 运行时。
- 本地嵌入与向量检索:支持低成本本地嵌入模型,降低云端检索依赖。
2025 下半年
- Hermes 3 系列更新:基于 Llama 3.1 的 8B / 70B / 405B 版本持续优化工具调用和推理稳定性。
- 自适应记忆剪枝:根据任务语义自动召回相关记忆,淘汰过期事实。
2024 下半年:Hermes 3 发布
- 推出基于 Llama 3.1 的指令与工具调用模型。
- 引入 XML 标签、scratchpad、内部独白、Mermaid 图表等 Agent 能力。
- 在多个公开基准上取得开源模型领先成绩。
对用户意味着什么
Hermes 适合那些想把模型和 Agent 完全掌控在自己手里的人。它不是开箱即用的 SaaS,但给了开发者最大的定制空间。
#故障排查
1. 模型回答风格不稳定
现象:同样的问法,有时像助手,有时像 raw LLM。
处理:
- 检查 system prompt 是否为空或冲突。
- 明确指定角色和输出格式。
- 405B 版本对 system prompt 最敏感,小模型相对好一些。
2. 本地部署太慢或爆显存
现象:生成一个字卡很久,或启动时报 OOM。
处理:
- 8B 模型用 16G 显存即可;70B 需要多卡或量化。
- 使用 4-bit/8-bit 量化降低显存占用。
- 换用更快的推理后端,如 vLLM。
3. 记忆互相冲突
现象:Hermes Agent 记住了互相矛盾的信息。
处理:
- 给记忆加时间戳和来源。
- 定期做记忆剪枝,删除过期内容。
- 把全局记忆和项目记忆分开,减少冲突面。
4. 工具调用格式错误
现象:模型返回的工具调用 XML 解析失败。
处理:
- 在 prompt 里给出完整示例。
- 用 XML schema 严格定义参数类型。
- 失败后把错误信息返回给模型,让它重试。