开源、自学习、Provider 无关的 AI Agent 框架。终端、Telegram、微信、Discord — 同一个 Agent,完整的系统访问,持久的记忆。
Hermes Agent 由 Nous Research 开源,定位与 Claude Code / Codex 同类 — 自主执行任务的 AI Agent。区别在于:它不绑定某一模型、不限定某一平台、不遗忘你的习惯。
跨 Session 记住你是谁、你的偏好、环境配置、踩过的坑。下次对话不需要重新解释。
解决复杂问题后自动保存为可复用 Skill。下次遇到类似任务直接加载,越用越强。
Telegram、微信、Discord、Slack、邮件、SMS... 同一个 Agent,完整工具访问,不止是聊天。
OpenRouter、Anthropic、OpenAI、DeepSeek、GLM、本地模型... 工作流中途切换,其他不变。
终端命令、文件读写、浏览器、代码执行、图像生成、Web 搜索... 30+ 内置工具。
delegate_task 子 Agent 批量并行、Kanban 工作队列、多 Profile 隔离运行。
Hermes 的核心是一个 Tool-calling Agent Loop,围绕它构建了记忆、技能、调度、多平台网关等子系统。
关键设计:所有平台共享同一个 Agent Loop 和 Memory。你在 Telegram 里让它记住的事,CLI 里启动新 Session 时它也知道。这不是简单的"聊天历史",而是结构化的 Memory Store(user profile + agent notes),每次 Session 启动时注入 System Prompt。
以下数据来自我的 Hermes 实例近 30 天真实使用统计。
| Platform | Sessions | Messages | Tokens | 占比 |
|---|---|---|---|---|
| Telegram | 110 | 4,274 | 124.8M | 79% |
| Cron (自动任务) | 37 | 1,295 | 32.8M | 21% |
| 2 | 37 | 0.5M | <1% |
| Tool | Calls | % | 用途 |
|---|---|---|---|
web_search | 1,511 | 54.7% | 信息检索、技术调研、新闻聚合 |
terminal | 528 | 19.1% | 脚本执行、系统操作、git |
web_extract | 177 | 6.4% | 网页内容提取、论文阅读 |
read_file | 144 | 5.2% | 代码审查、配置检查 |
skill_view | 69 | 2.5% | 加载专业知识 |
write_file | 61 | 2.2% | 生成代码、文档 |
browser_navigate | 42 | 1.5% | 动态网页交互 |
洞察:web_search 占了 54.7% 的工具调用 — Hermes 在我的使用场景中主要角色是「研究员 + 信息聚合器」,而非纯编码助手。这得益于 Cron + Telegram 的组合:每天自动搜索、聚合、推送。
工具按 Toolset 分组,可按平台独立配置。这是我的实际配置:
按需启用,减少不必要的工具定义可以节省 token 和降低模型困惑度。
| Tool | 能力 | 实际场景 |
|---|---|---|
terminal | Shell 命令执行 + 后台进程管理 | 部署服务、跑测试、git 操作 |
execute_code | 沙箱 Python (hermes_tools 内置工具) | 数据处理、批量 web_extract、条件逻辑 |
delegate_task | 子 Agent 并行 (max 3 concurrent) | 并行研究多个主题、代码审查 |
web_search + web_extract | 搜索 + 网页内容提取 | 技术调研、新闻聚合、论文阅读 |
browser_navigate | Headless 浏览器自动化 | 需要 JS 渲染的页面交互 |
vision_analyze | 图像理解 (auxiliary model) | 截图分析、UI 审查 |
cronjob | 定时任务调度 | 每日推送、监控看门狗 |
session_search | FTS5 全文搜索历史会话 | "之前怎么解决的?" — 跨 Session 记忆 |
Skill 是可复用的工作流文档 — 包含步骤、命令、陷阱、验证方法。Agent 遇到匹配任务时自动加载,相当于给 LLM 临时注入领域专家知识。
hermes-agent (配置/扩展)、autonomous-coding-agents (Claude Code / Codex 集成)
TDD、系统调试、代码审查、计划编写、Spike 验证、子 Agent 驱动开发
Cloudflare Pages 部署、Cloudflare Tunnel、AI API 中继站、Oracle Cloud、Kanban 编排
arXiv 搜索、博客监控、YouTube 转录、市场分析、技术调研、用户画像
vLLM 推理、llama.cpp、W&B、lm-eval-harness、DSPy、HuggingFace Hub
架构图 SVG、ASCII Art、p5.js、像素画、Excalidraw、Manim 视频、音乐创作
自学习闭环:遇到复杂问题 → 解决后 → Agent 主动建议保存为 Skill → 下次类似任务自动加载 → 越用越强。还有 Curator 后台进程自动维护 Skill 生命周期(标记过期 → 归档 → 备份)。
Cron 系统让 Hermes 从「被动应答」变成「主动推送」。这是我实际运行的 7 个定时任务:
脚本 stdout 直接作为消息推送。零 token 消耗。适合固定格式输出(监控、告警、数据抓取)。
脚本输出注入 Agent prompt → LLM 推理 → 生成内容推送。适合需要理解、筛选、总结的场景。
设计要点:脚本模式 (no-agent) 是 Cron 最经济的用法 — 日常监控、版本追踪这类固定逻辑完全不需要 LLM,省 token 又快。Agent 模式留给需要理解和总结的任务。
从早上醒来到晚上睡觉,Hermes 如何融入日常工作流。
Cron 任务自动推送 GitHub Trending + LLM 新闻到 Telegram 频道。醒来直接刷。
在 Telegram 上直接发消息讨论技术方案。Agent 有完整记忆,不需要重复上下文。
Cron 自动生成美股 + 加密复盘图文。盘中用 market-analysis skill 实时分析。
Telegram 发指令 → Agent 执行终端命令、写代码、部署到 Cloudflare Pages。全程手机操作。
delegate_task 并行研究多个主题 → web_search + web_extract + arxiv → 汇总报告。
Agent 自动总结当天工作。Memory 持久化关键信息。Skill Curator 后台维护。
早上在 Telegram 讨论的方案,下午在 CLI 里 hermes --continue 继续工作 — Memory、Skills、Session 上下文全部共享。这不是"另一个聊天窗口",是同一个 Agent 的不同入口。
遇到重复性任务 → 让 Agent 解决后保存为 Skill。下次遇到类似场景自动加载,不需要重新教。
Memory 有 char limit (2200 chars)。用 operations 批量写入:删除旧的 + 添加新的,一次原子操作。
独立操作批量调用。读取 5 个文件不需要等一个读完再读下一个 — 一次 response 里全部发出。
子 Agent 的中间结果不进入父 Agent 上下文 — 只有最终 summary 返回。适合产生大量中间数据的任务。
固定逻辑的定时任务用 script-only 模式。零 token,纯脚本。stdout 非空 = 推送,空 = 静默。
FTS5 全文搜索历史会话。"之前怎么解决的这个问题?" — 跨 Session 记忆。
3+ 个工具调用 + 中间逻辑 → 用 execute_code 写 Python 脚本编排。条件分支、循环、过滤全在一处。
approvals.mode = smart(自动审批低风险命令)。secret redaction 默认开启,防 API key 泄露到 context。
30 天 158M tokens、149 sessions、7 个 cron 任务稳定运行。从信息聚合到代码部署全链路打通。
多 Agent Kanban 协作、MCP 服务器扩展工具边界、自治编码 Agent (Claude Code / Codex 集成)。
从工具到伙伴 — Memory 让它记住你,Skills 让它学习你,Cron 让它主动帮你。Agent 不是工具调用器,是你的数字分身。
核心 Takeaway:Hermes Agent 的价值不在于"比 ChatGPT 聪明",而在于它是一个有记忆、有工具、有主动性的 Agent。它知道你的项目结构、记住你的偏好、主动推送信息、跨平台连续工作。这才是 AI Agent 该有的样子。