本文へスキップ
CONEX
Agent Smartness アプリアイコン

Agent Smartness

macOS 14 Sonoma 以降

あなたの AI コーディングエージェントの実力が、変わっていないか。

App Store でダウンロード (配信準備中)

価格: 無料(すべての機能を利用可能)。任意の「コーヒー代」は消耗型の App内課金

Agent Smartness とは

Agent Smartness は、OpenAI の Codex と、あなたが導入した Claude Code を、あなた自身のアカウントと利用枠で継続的に測定し、実力の変化を見張る macOS メニューバーアプリです。

  • 測るのは正答率ではなく、エージェントが「解ける難易度」そのものです。
  • 測定履歴はこの Mac の中に残ります。開発者には何も送信されません。
  • Codex と Claude Code を順位付けしません。比べる相手は、そのエージェント自身の過去の測定です。

用語メモ — 逐次検定:観測が増えるたびに判定を更新し、あらかじめ決めた回数ぶんのデータが揃うのを待たずに結論を出す統計手法。消耗型:購入しても機能が増えず、繰り返し購入できる形式の App内課金。

主な特徴

  • 解ける難易度を測る — 正解するたびに問題を難しくし、間違える難しさの近くで出題し続けます。そのため正答率はおよそ半分に保たれ、動くのは「どこまで解けるか」です。固定の問題を出し続ける方式では、現在のエージェントはほぼ満点を取り続けます(実測で Codex は 30 回すべて満点。トークンを消費するだけで、何も測れていません)。
  • 2 種類の出題 — 長い文字列の中で 2 文字の並びが何回現れるかを数える問題と、多桁の整数どうしを正確に掛ける問題です。どちらも答えは一意に決まり、採点はこの Mac の中で完結します(別のモデルに判定させません)。
  • 「計数で解ける文字数」「乗算で解ける桁数」 — その推定の幅とあわせて表示します。測定を重ねるほど幅が狭くなります。
  • 変化の検知 — これまで解けていた難易度で続けて間違え始めたときに知らせます。逐次検定を使うため、固定窓を待たずに判断します。
  • 採点の分離 — 答えの値と出力形式を分けて採点します。途中式を書いても値が合っていれば正解とし、形式そのものを問う問題だけ完全一致で採点します。
  • Agentic 課題(任意・Claude Code 限定) — 1 日 1 回、Agent Smartness が作った一時フォルダー内のファイルだけを読み取り専用で読ませる、小さな課題です。Codex は現時点でこの軸に対応していません。
  • 障害を性能低下と混同しない — 通信障害・タイムアウト・利用枠切れによる失敗は能力とは別に記録し、0 点として扱いません。
  • 間違えた問題を記録 — 期待した答えとエージェントの回答をこの Mac に記録します。採点が妥当だったかを、あなた自身が確かめられます。
  • トークン消費の表示 — あなた自身の Claude Code と Codex がセッションごとに記録しているトークン数を集計して表示します。会話の内容は読みません
  • デモモード — 合成データ・通信なし・アカウント不要。実際に接続する前に、ダッシュボード全体を試せます。
  • その他 — JSON 書き出しに対応した履歴と診断情報、メニューバーでの状態表示、日本語・英語 UI、キーボードショートカット、VoiceOver ラベル。

スコアの考え方

スコアは各エージェント自身の基準からの相対値です。Agent Smartness は Codex と Claude Code を順位付けしたり、どちらが優れているかを主張したりしません。意味があるのは、あるエージェントをそのエージェント自身の過去の測定と比べることです。

料金

Agent Smartness は無料で、すべての機能を誰でも使えます。開発を応援したい方向けに、任意の「コーヒー代」の購入(消耗型の App内課金)を用意していますが、購入しても機能は変わりません

プライバシー

Agent Smartness は アナリティクスなし開発者には何も送信されません。測定履歴は、この Mac 上のローカル SQLite データベースに保存されます。

測定時に各プロバイダー(OpenAI または Anthropic)へ送るのは、Agent Smartness が用意したベンチマークの問題文だけです(Agentic 課題では、Agent Smartness が作った小さなファイルの内容も含みます)。あなたのソースコード・ファイル・認証情報は送信しません。

詳細はプライバシーポリシーをご覧ください。

動作環境

  • OS:macOS 14 Sonoma 以降
  • アカウント:あなた自身の OpenAI(Codex / ChatGPT)アカウント、および/または、あなたが別途導入した Claude Code とそのプラン。デモモードを試すだけなら、どちらも不要です。
  • 利用枠:測定はあなた自身の利用枠を消費します。
  • 表示言語:日本語 / 英語

お問い合わせ

Agent Smartness についてのご質問・ご要望は、お問い合わせフォームからお寄せください。

提携について

Agent Smartness は OpenAI または Anthropic が提供・承認・提携するアプリではありません。各商標はそれぞれの権利者に帰属します。