O que é o Agent Smartness
O Agent Smartness é um app da barra de menus do macOS que mede ao longo do tempo o Codex da OpenAI e o Claude Code que você instalou — usando suas próprias contas e sua própria cota — e fica de olho nas mudanças.
- Ele mede a dificuldade que o seu agente ainda consegue resolver, e não uma taxa de acertos.
- O histórico de medições fica no seu Mac. Nada é enviado ao desenvolvedor.
- Ele não classifica o Codex em relação ao Claude Code. A comparação que importa é a de um agente com as próprias medições anteriores.
Termos — Teste sequencial: método estatístico que atualiza o veredicto conforme as observações chegam, sem esperar por um número de resultados definido de antemão. Consumível: compra no app que não libera nada e pode ser feita de novo.
O que ele faz
- Medir a dificuldade ainda alcançável — cada pergunta fica mais difícil quando o agente acerta, e as seguintes continuam perto do ponto em que ele erra. Assim a taxa de acertos se mantém por volta da metade, e o que se move é até onde o agente consegue ir. Com perguntas fixas, os agentes atuais acertam quase sempre: o Codex tirou nota máxima nas nossas 30 medições de 30, o que gasta tokens sem medir nada.
- Dois tipos de pergunta — contar quantas vezes uma sequência de dois caracteres aparece em uma cadeia longa e multiplicar com exatidão dois inteiros grandes. Cada uma tem uma única resposta certa, e a correção acontece no seu Mac: nenhum outro modelo é consultado para julgar.
- Quantos caracteres ele percorre contando e quantos dígitos consegue multiplicar — exibidos junto com a faixa em que a estimativa os posiciona. Essa faixa se estreita conforme as medições se acumulam.
- Detecção de mudanças — avisa quando o agente passa a errar em uma dificuldade que antes dominava. Como usa um teste sequencial, decide assim que as evidências bastam, sem esperar por uma janela fixa.
- Valor e formato corrigidos separadamente — mostrar o raciocínio não conta como erro; só as perguntas sobre o formato exigem correspondência exata.
- Tarefa agêntica (opcional, apenas Claude Code) — uma vez por dia, uma pequena tarefa somente leitura dentro de uma pasta temporária criada pelo próprio app. O Codex ainda não contempla esse eixo.
- Falhas não se confundem com queda de desempenho — tempos esgotados, falhas do provedor e cota esgotada são registrados à parte e nunca valem zero.
- Os erros ficam guardados no seu Mac — com a resposta esperada e a que o agente deu, para você mesmo julgar se a correção fez sentido.
- Consumo de tokens — soma os tokens que os seus próprios Claude Code e Codex já registram para as sessões deles. O conteúdo das conversas nunca é lido.
- Modo demonstração — dados sintéticos, sem rede e sem conta. Experimente o painel inteiro antes de conectar qualquer coisa real.
- E mais — histórico e diagnósticos com exportação em JSON, status na barra de menus, interface em japonês e inglês, atalhos de teclado e rótulos de VoiceOver.
Como ler as pontuações
As pontuações são relativas à referência que cada agente constrói ao longo do tempo. O Agent Smartness não classifica o Codex em relação ao Claude Code nem afirma que um seja “melhor” que o outro. A comparação que importa é a de um agente com as próprias medições anteriores.
Preço
O Agent Smartness é gratuito e todos os recursos estão disponíveis para qualquer pessoa. Há uma gorjeta “Café” opcional (compra no app consumível) para quem quiser apoiar o desenvolvimento, mas comprá-la não libera nada.
Privacidade
O Agent Smartness não usa analytics e não envia nada ao desenvolvedor. O histórico de medições fica em um banco de dados SQLite local, no seu Mac.
Durante uma medição, a única coisa enviada ao provedor que você escolheu (OpenAI ou Anthropic) é o enunciado do exercício gerado pelo Agent Smartness — na tarefa agêntica, também os pequenos arquivos que ele cria. Seu código-fonte, seus arquivos e suas credenciais nunca são enviados.
Os detalhes completos estão na Política de Privacidade.
Requisitos
- Sistema: macOS 14 Sonoma ou posterior
- Contas: sua própria conta da OpenAI (Codex / ChatGPT) e/ou sua própria instalação do Claude Code com o plano dele. Nenhuma das duas é necessária para experimentar o modo demonstração.
- Cota: as medições consomem a sua própria cota.
- Idiomas da interface: japonês / inglês
Contato
Para dúvidas ou sugestões sobre o Agent Smartness, fale com a gente pelo formulário de contato.
Sem afiliação
O Agent Smartness não é afiliado, endossado nem patrocinado pela OpenAI ou pela Anthropic. As marcas citadas pertencem aos respectivos titulares.