长期记忆 状态: active

Hermes 实战知识档案

开源可部署的工具与推理模型

Nous Research 开源的大模型家族,主打工具调用、推理和长期任务编排,常被用来搭建需要记忆和规划的 Agent 系统。

访问官方站点 → GitHub 仓库 → 更新时间 2026-09-09

#架构定位

1. Hermes 是什么?

Hermes 是 Nous Research 开源的大模型家族,主打工具调用推理。它基于 Llama 3.1 做了专门微调,提供 8B、70B、405B 等多个尺寸,可以部署在本地或私有服务器上。

除了模型本身,围绕 Hermes 还有一个 Hermes Agent 框架,用来把模型组装成能长期运行、能记住事情、能调用工具的 Agent。

2. 和 Codex / Claude 的区别

  • Codex:专注帮你写代码、跑测试、改项目,重在工程执行。
  • Claude:通用大模型助手,聊天、写作、分析样样行,主要在云端使用。
  • Hermes:主打开源、可私有部署、可自定义,适合对数据隐私要求高,或者想把模型和 Agent 完全掌控在自己手里的团队。

3. 核心能力

  • 工具调用(Tool Use):能调用外部 API、数据库、搜索等工具完成任务。
  • 结构化输出:支持用 XML 标签输出规范化内容,方便程序解析。
  • 推理透明化:通过内部独白(inner monologue)和步骤标记,让你看到模型是怎么想的。
  • Mermaid 图表:能直接生成流程图、时序图,帮助可视化复杂流程。
  • 长期记忆:Hermes Agent 框架支持把项目经验、用户偏好沉淀下来,跨会话使用。

4. 适合谁用?

  • 有隐私要求的企业:想把模型和数据留在自己服务器上。
  • AI 应用开发者:需要可商用的开源模型做二次开发。
  • 个人技术爱好者:想本地跑一个能调用工具的 Agent。

5. 使用边界

  • 对提示词敏感:Hermes 很受 system prompt 影响,空 system prompt 不一定给出“ helpful assistant”风格。
  • 本地部署需要算力:405B 版本需要很强的 GPU,8B 版本可以在普通消费级显卡上跑。
  • 它不直接写生产代码:具体代码改动建议交给 Codex 这类专门工具。

#上手指南

1. 获取模型

Hermes 3 的权重托管在 Hugging Face。根据硬件选择版本:

  • 8B:适合本地测试,消费级显卡可跑。
  • 70B:性能更强,需要多卡或云服务器。
  • 405B:顶级性能,需要专业算力集群。

2. 运行方式

  • 用 vLLM、Ollama、llama.cpp 等推理框架加载。
  • 启动后它会暴露一个兼容 OpenAI API 的接口,方便现有项目接入。

3. 设计 system prompt

Hermes 对 system prompt 非常敏感。建议:

  • 明确告诉它“你是谁、能做什么、输出格式”。
  • 需要工具调用时,在 prompt 里列出可用工具的名称和参数。
  • 不要用空 system prompt 跑正式任务。

4. 工具调用配置

让 Hermes 调用工具通常分三步:

  1. 定义工具列表(函数名、参数、用途)。
  2. 在对话里描述用户任务。
  3. 解析模型返回的 XML/JSON,执行工具,再把结果喂回去。

5. Hermes Agent 框架

如果想做长期记忆、多项目隔离,可以看看 Hermes Agent:

  • 它提供记忆分层(工作记忆、项目记忆、全局记忆)。
  • 支持 MCP 协议,能连接常见工具。
  • 适合搭建个人知识助手或企业内部的 Agent 工作流。

6. 性能与成本

  • 本地部署省去 API 调用费,但要付硬件和电费。
  • 小模型响应快但理解深,大模型能力强但慢且贵。
  • 建议先用 8B 验证思路,再决定是否上 70B/405B。

#实战手册

实战手册 1:搭建本地私有知识助手

目标:把所有项目文档、笔记、规范喂给一个本地 Agent,随问随答。

  1. 选 8B 或 70B 模型,用 Ollama 本地启动。
  2. 把文档按项目分文件夹,建立向量索引。
  3. 配置 Hermes Agent 的记忆层,区分项目记忆和全局记忆。
  4. 测试常见问答:架构决策、接口约定、历史 Bug 原因。
  5. 定期清理过期记忆,防止记忆膨胀。

实战手册 2:多步推理任务

目标:让 Hermes 完成需要分步骤思考的复杂分析。

  1. 在 system prompt 里要求它“先列步骤,再逐条执行”。
  2. 开启内部独白,让它把推理过程显式写出来。
  3. 每一步结束后,把中间结果返回给模型确认。
  4. 最终输出结构化结论,方便下游程序处理。

实战手册 3:工具调用工作流

目标:让 Hermes 自动查天气、搜资料、写报告。

  1. 定义 3-5 个核心工具:搜索、计算器、文件读取、邮件发送。
  2. 用 XML 格式描述工具签名。
  3. 让模型在每次回复中决定是否调用工具。
  4. 执行工具后把结果拼回对话,继续下一轮。

#版本演进

2026-09 当前状态

  • Hermes Agent 框架文档完善:提供从模型部署到工具调用的完整指南。
  • MCP 协议兼容:Hermes Agent 能接入主流编程 Agent 运行时。
  • 本地嵌入与向量检索:支持低成本本地嵌入模型,降低云端检索依赖。

2025 下半年

  • Hermes 3 系列更新:基于 Llama 3.1 的 8B / 70B / 405B 版本持续优化工具调用和推理稳定性。
  • 自适应记忆剪枝:根据任务语义自动召回相关记忆,淘汰过期事实。

2024 下半年:Hermes 3 发布

  • 推出基于 Llama 3.1 的指令与工具调用模型。
  • 引入 XML 标签、scratchpad、内部独白、Mermaid 图表等 Agent 能力。
  • 在多个公开基准上取得开源模型领先成绩。

对用户意味着什么

Hermes 适合那些想把模型和 Agent 完全掌控在自己手里的人。它不是开箱即用的 SaaS,但给了开发者最大的定制空间。

#故障排查

1. 模型回答风格不稳定

现象:同样的问法,有时像助手,有时像 raw LLM。

处理

  • 检查 system prompt 是否为空或冲突。
  • 明确指定角色和输出格式。
  • 405B 版本对 system prompt 最敏感,小模型相对好一些。

2. 本地部署太慢或爆显存

现象:生成一个字卡很久,或启动时报 OOM。

处理

  • 8B 模型用 16G 显存即可;70B 需要多卡或量化。
  • 使用 4-bit/8-bit 量化降低显存占用。
  • 换用更快的推理后端,如 vLLM。

3. 记忆互相冲突

现象:Hermes Agent 记住了互相矛盾的信息。

处理

  • 给记忆加时间戳和来源。
  • 定期做记忆剪枝,删除过期内容。
  • 把全局记忆和项目记忆分开,减少冲突面。

4. 工具调用格式错误

现象:模型返回的工具调用 XML 解析失败。

处理

  • 在 prompt 里给出完整示例。
  • 用 XML schema 严格定义参数类型。
  • 失败后把错误信息返回给模型,让它重试。

#信息源与证据

信息源名称 类型 权威等级 核验说明 链接
Nous Research Official Publications official-blog ★★★★★ Hermes 模型家族核心研究与论文 访问 →
Hermes Open Source Agent Harness github ★★★★★ 开源代码库与记忆协议实现 访问 →
Hermes Agent Documentation official-docs ★★★★★ Hermes Agent 框架与工具调用指南 访问 →