Hermes · 52

Muse Spark 1.2 白菜价版铺开:OpenCode 直接限时免费

比推消息, AI 快讯,Meta 的 Muse Spark 1.2 Contributor 版本正在快速铺到第三方平台。OpenRouter 最新接入后,价格与 Meta 官方保持一致:每百万 Token 输入 0.10 美元、输出 0.20 美元,缓存输入仅 0.002 美元。普通 Muse Spark 1.2 则分别要 1.25、4.25 和 0.15 美元。Contributor 版本并不是低配版模型。它使用相同模型和能力,代价是用户的输入和输出可以被 Meta 用于训练和改进产品。按输出价格算,比普通版便宜约 95%。现在能用它的地方已经不少。OpenCode Zen 甚至把 Contributor 做成了限时免费模型。Command Code 也已接入,连最低档 Go 套餐都能使用。Vercel AI Gateway 和 NanoGPT 同样提供 API,其中 Vercel 还能直接接到 Claude Code、Codex、Hermes、OpenCode 和 OpenClaw 等工具。Artificial Analysis 最新给 Muse Spark 1.2 xhigh 的 Intelligence Index 是 57。这个价格确实已经低得离谱,不过社区实测评价很分裂。有人把它当 DeepSeek V4 Flash 的低价替代,也有人反馈长任务和工具调用仍不够可靠。适合公开代码和低成本实验,私有代码则要先考虑数据是否愿意交给 Meta。

1分钟前

DeepSeek V4 Pro 跑 5 套 Harness:Pi 成功率第一,DSH 最省钱

比推消息, AI 快讯,Agent 工具公司 Composio 把同一个 DeepSeek V4 Pro 0813 分别放进 Pi Agent、DeepSeek Harness 0.1、Claude Code、OpenCode 和 Hermes Agent,统一开到 max reasoning,跑了 30 个多步骤 Agent 任务。通过率:1. Pi Agent:21/302. DeepSeek Harness:20/303. Claude Code:19/304. OpenCode:19/305. Hermes Agent:18/3030 道题里,15 道五家全过,7 道五家全挂。剩下 8 道只换了 Harness,结果就会翻转。速度排名:1. Claude Code:181.8 秒2. DeepSeek Harness:252.1 秒3. Hermes Agent:273.6 秒4. OpenCode:280.6 秒5. Pi Agent:362.9 秒单次成功成本:1. DeepSeek Harness:0.028 美元2. Pi Agent:0.031 美元3. OpenCode:0.032 美元4. Hermes Agent:0.037 美元5. Claude Code:0.074 美元Pi 通过率最高,DeepSeek 官方 Harness 最省钱,Claude Code 最快但最贵。Composio 此前用 DeepSeek V4 Flash 做过同类测试,当时 Pi 同样拿到最高通过率。

2天前

Hermes Agent 跟进 Grok Bot:把多 Agent 做成普通人也能用的 AI 团队

比推消息,据监测,Nous Research 开始公测 Hermes Agent 的 Bot Mode。目前先以独立插件提供,收集反馈后计划整合进 Hermes Desktop。Hermes 原本就支持多个独立 Profile,也能通过 Kanban 让不同 Agent 分工协作。Bot Mode 这次没有重做底层,主要是把这些能力重新做成一个更直观的产品界面。官方直接写明,一个 Bot 本质上就是一个 Hermes Profile。现在每个 Profile 都会显示成一个有名字、头像和身份的 Bot。它们各自保留模型、Skill、记忆和聊天记录。用户可以直接 @ 另一个 Bot 派活,Bot 之间也有固定收件箱,可以互相发消息。每个 Bot 还能单独设置定时任务。这套产品形态明显在跟进刚上线的 Grok Bot。社区有人直接问,这是不是补上了 Hermes 相比 Grok Bot 缺少的功能,Hermes 联合创始人 Teknium 回答Yep。

8天前
Hermes 登顶背后:一个 Web3 团队的进阶之路

Hermes 登顶背后:一个 Web3 团队的进阶之路

作者:Jacob Zhao原标题:IOSG Weekly Brief|Hermes 登顶背后:一个 Web3 团队的进阶之路 #340Hermes 的现象级增长,并非源于 OpenClaw 原理上无法复制的独家技术,而是因为在个人 Agent 品类成型的关键窗口期,最精准地闭合了一套「挑战者增长系统」:承接 OpenClaw 已经教育成熟的用户池,建立起「可委托性」(Delegation Trust)这一比「自我进化」叙事更真实的体验差异。当专业执行 Agent 越来越强时,用户仍然需要一个长期在线、值得托付的总管家。打开 OpenRouter 的公开应用排行榜,Hermes Agent 以 30.5 万亿的 Token 使用量位居全平台第一,同时在 Productivity、Coding Agents、Personal Agents 和 CLI Agents 四个品类中排名第一,断崖式领先 OpenClaw、Claude Code 等知名 Agent。▲ 图 1 · Hermes Agent 在 OpenRouter 的历史数据快照(截取于 2026 年 8 月 4 日,动态页面数据会随时间变化)尽管 OpenRouter 的统计口径无法覆盖直连官方 API(如 Claude 或 Codex 原生订阅)的全行业 Token 消耗,但作为当前全球最具规模的 AI 大模型路由与聚合平台,其榜单具有极强的「风向标」意义。虽然在高端专业任务层面,大量用户的核心业务工作流——复杂代码生成、架构设计、高价值数据分析——仍流向 Claude Code 和 ChatGPT,但 Hermes 在后台自动化、消息入口响应、长期在线监听与轻量级任务调度等使用场景保持优势。作为一个由 Web 3 团队打造的 Agent 产品,Hermes 取得了远超预期的传播、社区与使用强度成功,我们不禁要关注:· Hermes 为何能在 OpenRouter 推理调用上实现反超?· 它与 OpenClaw 之间的真实分野,究竟在哪里?· 与 Claude Code 和 Codex 的关系中,Hermes 如何保持「差异化共存」而非「正面竞争」?从开发框架到个人 AI 系统——OpenClaw 之路为什么早期 Agent 框架没有产生消费产品在 OpenClaw 出现前,Agent 领域虽已具备成熟的基础设施,但存在根本局限:其采用单位是「开发项目企业工作流」,而非「个人用户」。早期框架的共同特征是面向开发者、输出代码或配置——它们构建了 Agent 的基础设施,却未交付 Agent 本身。过高的工程门槛导致始终困于「开发者工具」阶段,缺乏将技术转化为「个人专属资产」的产品化闭环,直接面向终端用户的「个人 Agent 产品层」几乎处于空白。▲ 图 1 · Agent 技术栈六层结构(模型层→协议层→ SDK 开发框架层→编排运行时层→执行基础设施层→部署治理层)▲ 图 1 · Hermes Agent 在 OpenRouter 的历史数据快照(截取于 2026 年 8 月 4 日,动态页面数据会随时间变化)OpenClaw 真正改变了什么OpenClaw 并未在底层重新发明 Agent Loop 或任务调度技术,其核心贡献在于产品层面的系统性封装。LangChain 解决的是「如何构建 Agent」,而 OpenClaw 解决的是「如何拥有 Agent」。它跳过了技术栈的中间层,将散落的框架能力整合为个人可直接配置与长期使用的完整产品,实现了采用单位从「开发项目」向「个人」的根本转移...

9天前burnking#agent #Hermes #WEB3

DeepSeek V4 Flash 换 8 套 Harness:Pi Agent 成功率最高且最省钱,Claude Code 最快但最贵

比推消息,据监测,AI Agent 基础设施公司 Composio 把 DeepSeek V4 Flash 接进 8 套 Harness,用同一批 30 个 Agent 任务测试。Harness 就是模型外面的执行框架,负责上下文、工具调用和任务执行。任务涉及 Gmail、GitHub、Slack、Calendar、Notion 等真实应用。8 套 Harness 的通过情况分别是:1. Pi Agent:20/302. Oh My Pi:17/303. Claude Code:16/304. Codex:16/305. Deep Agents:16/306. Hermes Agent:15/307. Prime Agent:15/248. OpenCode:14/30仅仅更换 Harness,DeepSeek V4 Flash 就能从通过 14 个任务变成 20 个。成本和速度也差得很大。Pi Agent 每个成功任务只花约 0.028 美元,Claude Code 为 0.195 美元,接近 7 倍。Claude Code 最快,中位耗时 122.7 秒;Oh My Pi 最慢,为 272.4 秒。不过 Pi 的测试配置与统一条件有差异:它使用 high 而非 max 推理强度,30 个任务中还有 24 个走 DeepSeek 官方 API,而非 OpenRouter。因此这组差距不一定能完全归因于 Harness。Composio 此前还用 Kimi K3 做过另一轮 Harness 横评。当时 Oh My Pi 以 22/25 排第一,原版 Pi Agent 为 18/25。OMP 本身就是从 Pi 分叉出来的 Coding 增强版,加入了子 Agent 等能力。换成 DeepSeek V4 Flash 后,反而是原版 Pi 跑到了第一。

11天前

MetaMask 推出自托管 AI 钱包 Agent Wallet,支持自主链上交易

比推消息,MetaMask 周四推出自托管钱包 Agent Wallet,允许 AI 代理在用户设定限制内执行链上交易,面向使用 AI 代理监控市场、识别机会并自主执行交易的交易者和开发者。用户可设置支出上限、批准特定协议、选择风险设置,并在 Guard Mode 与 Beast Mode 之间选择不同自动化级别。Agent Wallet 支持 Claude Code、Codex、Cursor、OpenClaw、Hermes、OpenCode,以及 Hyperliquid 和以太坊虚拟机兼容网络。Agent Wallet 支持 gas 抽象,用户可用正在转移的资产支付网络费,无需持有对应网络原生代币。MetaMask 表示,受支持交易将经过交易模拟、威胁扫描和智能交易 MEV 保护,符合条件交易若通过安全检查后仍产生亏损,可获得每月最高 1 万美元 Transaction Protection 覆盖。

16天前

Claude Code 跑 Kimi K3 最贵最慢,成本是 Hermes Agent 近 4 倍

比推消息,据监测,AI Agent 基础设施公司 Composio 扩大测试,把同一款 Kimi K3 接入 6 套 Agent 框架,完成 26 项相同任务。这里比较的是运行框架,底层模型均为 Kimi K3。Kimi Code 完成 21 项排名第一。Hermes 完成 20 项,Pi Agent 和 Claude Code 均为 19 项,OpenCode 为 18 项,Codex 以 17 项垫底。按 Kimi K3 官方价格估算,Hermes 和 Pi Agent 平均每项任务成本最低,分别为 0.39 美元和 0.40 美元。Claude Code 达到 1.47 美元,约为 Hermes 的 3.8 倍。Pi Agent 速度最快,单项任务中位耗时为 161.7 秒。Claude Code 最慢,达到 347.6 秒。同一模型换套框架,成功数最多只差 4 项,平均成本却相差近 4 倍,耗时相差超过 2 倍。

21天前

Kimi K3 接入 Claude Code,平均任务成本是 Kimi Code 的 9 倍

比推消息,据监测,AI Agent 基础设施公司 Composio 将同一款 Kimi K3 接入 Kimi Code、Hermes 和 Claude Code,完成 28 项相同任务。三套运行框架的成功数只差 2 项,Token 用量和成本却相差很大。Kimi Code 完成 22 项,Hermes 完成 21 项,Claude Code 完成 20 项。单项任务 Token 中位数分别为 6.1 万、6.7 万和 34 万。Composio 估算,平均每项任务成本约为 0.22 美元、0.28 美元和 2 美元。个别任务的 Token 用量最多相差 30 倍。Hermes 速度最快,单项任务中位耗时为 179 秒。Kimi Code 为 297 秒,Claude Code 为 348 秒。Writer 的另一项研究也得到相近结果。研究人员在 22 项企业任务和 6 款模型上只替换运行框架,Token 用量下降 38%,单项成本下降 41%,耗时下降 44%,完成质量基本持平。

23天前

Kimi 被指蒸馏 Fable,Hermes Agent 创始人反讽:Anthropic 先蒸馏了全人类

比推消息,据监测,白宫科技政策办公室主任 Michael Kratsios 指控,月之暗面用 Anthropic 的 Fable 训练 Kimi K3。其称月之暗面还搭建内部平台,批量调用美国模型并规避检测。帖文没有公开证据,月之暗面暂未回应。Hermes Agent 开发商 Nous Research 联合创始人 Teknium 随后照抄这段句式。他称 Anthropic 为训练 Fable,抓取了自己的 GitHub、X、Reddit、Discord 和 Facebook 帖子。随后补充:他们其实是在蒸馏地球上的所有人。Teknium 显然是在反讽。网页抓取和模型蒸馏不是一回事。Anthropic 公开承认,其模型训练数据包括公开互联网信息。Teknium 质疑的是:美国模型吸收全网内容时叫训练,中国模型学习美国模型时却被定性为偷窃。

30天前

分析:美联储基本会按兵不动,通胀仍是难以预测的经济变量

比推消息,据金十报道, Federated Hermes 基金经理 Karen Manna 在一份报告中表示,该机构继续认为美联储基本会按兵不动,而通胀仍是最难预测的宏观经济变量之一。她表示,从 2008-09 年金融危机后的低通胀环境向疫情后通胀激增的转变,是由供应链受阻、消费模式转变和劳动力市场失衡推动的。虽然许多这些扭曲现象已经消退,但一系列新的变量继续给通胀前景蒙上阴影。这些变量包括去年实施的关税、去年秋季政府停摆前后经济可见度降低的时期、高企的能源价格以及与人工智能相关的大量资本支出。“结果可能是,通胀回落过程将比市场在以往周期中经历的更加不平衡和具有阶段性,这强化了美联储谨慎且以经济数据为依据的做法。”

37天前