跳转到主要内容
CONEX
Agent Smartness 应用图标

Agent Smartness

macOS 14 Sonoma 及以上

你的 AI 编程智能体,实力还和当初一样吗。

在 App Store 下载 (即将上线)

价格: 免费,全部功能均可使用。可选的「咖啡」打赏为消耗型 App 内购买。

Agent Smartness 是什么

Agent Smartness 是一款 macOS 菜单栏应用,用你自己的账号和用量额度持续测量 OpenAI 的 Codex 和你自行安装的 Claude Code,并盯住其中的变化。

  • 它测的不是正确率,而是智能体「还能解出多难的题」本身。
  • 测量记录留在这台 Mac 上,不向开发者发送任何内容。
  • 不对 Codex 和 Claude Code 排名。有意义的比较,是拿一个智能体和它自己过去的测量结果比。

术语说明 — 序贯检验:每有一次新观测就更新一次判断的统计方法,无需等到预先设定的次数攒够即可得出结论。消耗型:不解锁任何功能、且可重复购买的 App 内购买形式。

主要特性

  • 测量还能解出的难度 — 答对就把题目调难,并持续在它出错的难度附近出题。因此正确率会稳定在大约一半,真正变化的是「能走到多远」。如果一直出固定的题目,当前的智能体几乎总能拿满分:实测中 Codex 30 次全部满分——只消耗了 token,什么也没测出来。
  • 两类题目 — 数一段长字符串中某个双字符组合出现了多少次,以及把两个多位整数精确相乘。两类题目的答案都唯一确定,评分在这台 Mac 上完成,不会交给另一个模型来判定。
  • 「计数能覆盖的字符数」「乘法能算对的位数」 — 连同估计所在的区间一并显示。测量次数越多,区间越窄。
  • 变化检测 — 当智能体开始在原本能解的难度上接连出错时提醒你。由于采用序贯检验,证据足够即可判断,不必等待固定的观测窗口。
  • 数值与格式分开评分 — 写出推导过程不算错,只有专门考查格式的题目才要求完全一致。
  • Agentic 任务(可选,仅限 Claude Code) — 每天一次,在 Agent Smartness 自行创建的临时文件夹内,以只读方式完成一个小任务。Codex 目前尚不支持这个维度。
  • 不把故障误判为能力下降 — 网络故障、超时、用量额度耗尽导致的失败会单独记录,不按 0 分计。
  • 保留答错的题目 — 把期望答案和智能体的回答记录在这台 Mac 上,你可以自己核对评分是否合理。
  • token 用量显示 — 汇总你自己的 Claude Code 和 Codex 已按会话记录的 token 数并显示。不会读取对话内容。
  • 演示模式 — 合成数据、不联网、无需账号。在真正连接任何服务之前,即可试用整个仪表板。
  • 其他 — 支持导出 JSON 的历史记录与诊断信息、菜单栏状态显示、日语与英语界面、键盘快捷键、VoiceOver 标签。

分数怎么看

分数是相对于每个智能体自身基准的相对值。Agent Smartness 不会给 Codex 和 Claude Code 排名,也不主张哪一个更好。有意义的比较,是拿一个智能体和它自己过去的测量结果比。

价格

Agent Smartness 免费,任何人都能使用全部功能。为愿意支持开发的用户准备了可选的「咖啡」打赏(消耗型 App 内购买),但购买后功能不会有任何变化

隐私

Agent Smartness 不含分析统计,也不向开发者发送任何内容。测量记录保存在这台 Mac 本地的 SQLite 数据库中。

测量时发送给你所选服务商(OpenAI 或 Anthropic)的,只有 Agent Smartness 生成的基准测试题目内容;在 Agentic 任务中,还包括它自己创建的那些小文件。你的源代码、文件和凭据不会被发送。

完整说明请见隐私政策

运行环境

  • 系统:macOS 14 Sonoma 及以上
  • 账号:你自己的 OpenAI(Codex / ChatGPT)账号,和/或你另行安装的 Claude Code 及其订阅方案。仅试用演示模式则两者都不需要。
  • 用量额度:测量会消耗你自己的用量额度。
  • 界面语言:日语 / 英语

联系我们

关于 Agent Smartness 的问题与建议,欢迎通过联系表单告诉我们。

关于关联关系

Agent Smartness 并非由 OpenAI 或 Anthropic 提供、认可或与之存在合作关系。相关商标归各自权利人所有。