Qué es Agent Smartness
Agent Smartness es una app de la barra de menús de macOS que mide a lo largo del tiempo Codex de OpenAI y el Claude Code que tú hayas instalado —con tus propias cuentas y tu propia cuota— y vigila los cambios.
- Mide la dificultad que tu agente sigue resolviendo, no una tasa de aciertos.
- El historial de mediciones se queda en tu Mac. No se envía nada al desarrollador.
- No clasifica a Codex frente a Claude Code. La comparación que importa enfrenta a cada agente con sus propias mediciones anteriores.
Términos — Prueba secuencial: método estadístico que actualiza su veredicto a medida que llegan las observaciones, sin esperar a un número de resultados fijado de antemano. Consumible: compra integrada que no desbloquea nada y puede repetirse.
Qué hace
- Medir la dificultad que aún resuelve — cada pregunta se vuelve más difícil cuando el agente acierta, y las siguientes se mantienen cerca del punto donde falla. Así la tasa de aciertos se queda en torno a la mitad y lo que se mueve es hasta dónde llega el agente. Con preguntas fijas, los agentes actuales aciertan casi siempre: Codex obtuvo la puntuación máxima en nuestras 30 mediciones de 30, lo que gasta tokens sin medir nada.
- Dos tipos de pregunta — contar cuántas veces aparece una secuencia de dos caracteres dentro de una cadena larga, y multiplicar con exactitud dos enteros grandes. Cada una tiene una única respuesta correcta y la corrección ocurre en tu Mac: no se consulta a otro modelo para que juzgue.
- Cuántos caracteres logra recorrer contando y cuántos dígitos logra multiplicar — se muestran junto con el intervalo en el que la estimación los sitúa. Ese intervalo se estrecha a medida que se acumulan mediciones.
- Detección de cambios — te avisa cuando el agente empieza a fallar en una dificultad que antes dominaba. Usa una prueba secuencial, así que decide en cuanto la evidencia basta, sin esperar a una ventana fija.
- Valor y formato se corrigen por separado — mostrar el desarrollo no cuenta como error; solo las preguntas sobre el formato exigen coincidencia exacta.
- Tarea agéntica (opcional, solo Claude Code) — una vez al día, una pequeña tarea de solo lectura dentro de una carpeta temporal que crea la propia app. Codex todavía no admite este eje.
- Las incidencias no se confunden con pérdida de rendimiento — los tiempos de espera agotados, los fallos del proveedor y el agotamiento de la cuota se registran aparte y nunca se puntúan como un cero.
- Los fallos quedan guardados en tu Mac — con la respuesta esperada y la que dio el agente, para que juzgues tú mismo si la corrección fue razonable.
- Consumo de tokens — suma los tokens que tus propios Claude Code y Codex ya registran para sus sesiones. Nunca se lee el contenido de las conversaciones.
- Modo demostración — datos sintéticos, sin red y sin cuenta. Prueba el panel completo antes de conectar nada real.
- Y además — historial y diagnósticos con exportación a JSON, estado visible en la barra de menús, interfaz en japonés e inglés, atajos de teclado y etiquetas de VoiceOver.
Cómo se leen las puntuaciones
Las puntuaciones son relativas a la referencia que cada agente construye con el tiempo. Agent Smartness no clasifica a Codex frente a Claude Code ni afirma que uno sea «mejor» que el otro. La comparación que importa enfrenta a cada agente con sus propias mediciones anteriores.
Precio
Agent Smartness es gratis y todas sus funciones están disponibles para cualquiera. Existe una propina «Café» opcional (compra integrada consumible) para quien quiera apoyar el desarrollo, pero comprarla no desbloquea nada.
Privacidad
Agent Smartness no incorpora analíticas y no envía nada a su desarrollador. El historial de mediciones se guarda en una base de datos SQLite local, en tu Mac.
Durante una medición, lo único que se envía al proveedor que hayas elegido (OpenAI o Anthropic) es el enunciado de la prueba que genera Agent Smartness; en la tarea agéntica, también los pequeños archivos que crea. Tu código fuente, tus archivos y tus credenciales nunca se envían.
Puedes consultar el detalle completo en la política de privacidad.
Requisitos
- Sistema: macOS 14 Sonoma o posterior
- Cuentas: tu propia cuenta de OpenAI (Codex / ChatGPT) o tu propia instalación de Claude Code con su plan, o ambas. No hace falta ninguna para probar el modo demostración.
- Cuota: las mediciones consumen tu propia cuota.
- Idiomas de la interfaz: japonés / inglés
Contacto
Si tienes preguntas o sugerencias sobre Agent Smartness, escríbenos desde el formulario de contacto.
Sin afiliación
Agent Smartness no está afiliada a OpenAI ni a Anthropic, ni cuenta con su respaldo o patrocinio. Las marcas citadas pertenecen a sus respectivos titulares.