Hermes Agent 官方推出了 Agent 性能排行榜 Hermes Index。这不是传统的推理 benchmark,而是模型在真实 Agent 环境中的成绩单——包含预置工作空间、真实文件、多轮对话和安全测试。数据来自 portal.nousresearch.com/bench,评测日期为 2026-10-09。
排行榜:14 个模型
| 排名 | 模型 | Hermes Index |
|---|---|---|
| 1 | Claude Opus 5.5 | 63.31 |
| 2 | GPT 6 Astra | 56.25 |
| 3 | Claude Sonnet 5.5 | 53.14 |
| 4 | GPT 6 Sol | 44.10 |
| 5 | Grok 4.7 | 39.32 |
| 6 | GLM 5.3 | 39.23 |
| 7 | Kimi K3 | 39.16 |
| 8 | Gemini Flash 3.8 | 38.12 |
| 9 | DeepSeek V4.1 Flash | 36.91 |
| 10 | Qwen 3.8 Max | 36.17 |
| 11 | GLM 5.3 Flash | 34.95 |
| 12 | GPT 6 Luna | 33.89 |
| 13 | HY4 | 26.13 |
| 14 | LING 3.0 Flash | 21.56 |
Hermes Index 是四个测试套件的平均分,所有评测采用 PASS@1,reasoning effort 设为 high。
四个评测套件
| 套件 | 任务数 | 测试内容 |
|---|---|---|
| Hermes Bench | 150 | 25个类别:技能、研究、图表、记忆、工具使用、安全 |
| TerminalBench 4 | — | 终端/Shell 任务,排除 4 个 GPU 任务 |
| TerminalBench Science | — | 科学计算任务 |
| SkillsBench | — | 技能执行任务 |
Hermes Bench 是核心套件:150 个任务包含 87 个技能、43 个研究、21 个视觉创意、5 个记忆、5 个工具使用、1 个安全。评分采用 64 个自动评测、77 个混合评测(自动+LLM 裁判)、8 个视觉裁判。涉及 88 个预置工作空间、293 个工作空间文件、24 个多轮对话任务。
成本差 200 倍
| 模型 | $ / Task |
|---|---|
| LING 3.0 Flash | $0.054 |
| GPT 6 Luna | $0.141 |
| DeepSeek V4.1 Flash | $0.259 |
| HY4 | $0.482 |
| GLM 5.3 Flash | $0.497 |
| GPT 6 Sol | $2.23 |
| Claude Sonnet 5.5 | $2.82 |
| Gemini Flash 3.8 | $3.17 |
| GLM 5.3 | $3.78 |
| Claude Opus 5.5 | $4.99 |
| Kimi K3 | $6.50 |
| Qwen 3.8 Max | $6.69 |
| Grok 4.7 | $10.77 |
| GPT 6 Astra | $11.61 |
最便宜的 LING 3.0 Flash 每任务 $0.054,最贵的 GPT 6 Astra 每任务 $11.61,差距达 215 倍。
Pareto 最优线
Pareto 最优线上的模型,意味着比它便宜的所有模型分数都更低。6 个模型在最优线上:
| 模型 | Hermes Index | $ / Task |
|---|---|---|
| Claude Opus 5.5 | 63.31 | $4.99 |
| Claude Sonnet 5.5 | 53.14 | $2.82 |
| GPT 6 Sol | 44.10 | $2.23 |
| DeepSeek V4.1 Flash | 36.91 | $0.259 |
| GPT 6 Luna | 33.89 | $0.141 |
| LING 3.0 Flash | 21.56 | $0.054 |
GPT 6 Astra 不在 Pareto 线上——它比 Claude Opus 5.5 贵两倍多但分数更低。Grok 4.7 以 $10.77 只拿到 39.32 分,性价比不佳。
值得注意的数据点
- TerminalBench Science 几乎全军覆没:14 个模型中只有 GPT 6 Astra(57.1)和 Claude Opus 5.5(52.9)超过 50 分,其余 12 个全部低于 40 分,Grok 4.7、GLM 5.3、HY4 仅 1.4 分
- Grok 4.7 的矛盾:Hermes Bench 74.38 排第 2,但 TB 4 仅 12.7、TB SCI 仅 1.4,被两个弱项拖到总分 39.32
- GLM 5.3 vs Kimi K3:分数仅差 0.07(39.23 vs 39.16),但 GLM 5.3 每任务 $3.78 比 Kimi K3 的 $6.50 便宜 42%
- GPT 6 家族内差距:Astra 56.25 排第 2,Luna 33.89 排第 12,相差 22 分
- DeepSeek V4.1 Flash 性价比最高:每任务 $0.259,排名 36.91 分,成本不到 Claude Opus 5.5 的 1/19
声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。