Pular para o conteúdo principal
CONEX
Ícone do app Agent Smartness

Agent Smartness

macOS 14 Sonoma ou posterior

Seus agentes de programação com IA ainda rendem como antes?

Baixar na App Store (em breve)

Preço: Grátis, com todos os recursos disponíveis. Gorjeta “Café” opcional como compra no app consumível.

O que é o Agent Smartness

O Agent Smartness é um app da barra de menus do macOS que mede ao longo do tempo o Codex da OpenAI e o Claude Code que você instalou — usando suas próprias contas e sua própria cota — e fica de olho nas mudanças.

  • Ele mede a dificuldade que o seu agente ainda consegue resolver, e não uma taxa de acertos.
  • O histórico de medições fica no seu Mac. Nada é enviado ao desenvolvedor.
  • Ele não classifica o Codex em relação ao Claude Code. A comparação que importa é a de um agente com as próprias medições anteriores.

TermosTeste sequencial: método estatístico que atualiza o veredicto conforme as observações chegam, sem esperar por um número de resultados definido de antemão. Consumível: compra no app que não libera nada e pode ser feita de novo.

O que ele faz

  • Medir a dificuldade ainda alcançável — cada pergunta fica mais difícil quando o agente acerta, e as seguintes continuam perto do ponto em que ele erra. Assim a taxa de acertos se mantém por volta da metade, e o que se move é até onde o agente consegue ir. Com perguntas fixas, os agentes atuais acertam quase sempre: o Codex tirou nota máxima nas nossas 30 medições de 30, o que gasta tokens sem medir nada.
  • Dois tipos de pergunta — contar quantas vezes uma sequência de dois caracteres aparece em uma cadeia longa e multiplicar com exatidão dois inteiros grandes. Cada uma tem uma única resposta certa, e a correção acontece no seu Mac: nenhum outro modelo é consultado para julgar.
  • Quantos caracteres ele percorre contando e quantos dígitos consegue multiplicar — exibidos junto com a faixa em que a estimativa os posiciona. Essa faixa se estreita conforme as medições se acumulam.
  • Detecção de mudanças — avisa quando o agente passa a errar em uma dificuldade que antes dominava. Como usa um teste sequencial, decide assim que as evidências bastam, sem esperar por uma janela fixa.
  • Valor e formato corrigidos separadamente — mostrar o raciocínio não conta como erro; só as perguntas sobre o formato exigem correspondência exata.
  • Tarefa agêntica (opcional, apenas Claude Code) — uma vez por dia, uma pequena tarefa somente leitura dentro de uma pasta temporária criada pelo próprio app. O Codex ainda não contempla esse eixo.
  • Falhas não se confundem com queda de desempenho — tempos esgotados, falhas do provedor e cota esgotada são registrados à parte e nunca valem zero.
  • Os erros ficam guardados no seu Mac — com a resposta esperada e a que o agente deu, para você mesmo julgar se a correção fez sentido.
  • Consumo de tokens — soma os tokens que os seus próprios Claude Code e Codex já registram para as sessões deles. O conteúdo das conversas nunca é lido.
  • Modo demonstração — dados sintéticos, sem rede e sem conta. Experimente o painel inteiro antes de conectar qualquer coisa real.
  • E mais — histórico e diagnósticos com exportação em JSON, status na barra de menus, interface em japonês e inglês, atalhos de teclado e rótulos de VoiceOver.

Como ler as pontuações

As pontuações são relativas à referência que cada agente constrói ao longo do tempo. O Agent Smartness não classifica o Codex em relação ao Claude Code nem afirma que um seja “melhor” que o outro. A comparação que importa é a de um agente com as próprias medições anteriores.

Preço

O Agent Smartness é gratuito e todos os recursos estão disponíveis para qualquer pessoa. Há uma gorjeta “Café” opcional (compra no app consumível) para quem quiser apoiar o desenvolvimento, mas comprá-la não libera nada.

Privacidade

O Agent Smartness não usa analytics e não envia nada ao desenvolvedor. O histórico de medições fica em um banco de dados SQLite local, no seu Mac.

Durante uma medição, a única coisa enviada ao provedor que você escolheu (OpenAI ou Anthropic) é o enunciado do exercício gerado pelo Agent Smartness — na tarefa agêntica, também os pequenos arquivos que ele cria. Seu código-fonte, seus arquivos e suas credenciais nunca são enviados.

Os detalhes completos estão na Política de Privacidade.

Requisitos

  • Sistema: macOS 14 Sonoma ou posterior
  • Contas: sua própria conta da OpenAI (Codex / ChatGPT) e/ou sua própria instalação do Claude Code com o plano dele. Nenhuma das duas é necessária para experimentar o modo demonstração.
  • Cota: as medições consomem a sua própria cota.
  • Idiomas da interface: japonês / inglês

Contato

Para dúvidas ou sugestões sobre o Agent Smartness, fale com a gente pelo formulário de contato.

Sem afiliação

O Agent Smartness não é afiliado, endossado nem patrocinado pela OpenAI ou pela Anthropic. As marcas citadas pertencem aos respectivos titulares.