linny006/agent-eval-harness

Live, open-source benchmark for comparing AI coding agents on real GitHub issues

¿Qué es agent-eval-harness?

agent-eval-harness is a Claude Code agent skill that live, open-source benchmark for comparing AI coding agents on real GitHub issues.

Compatible con~Claude Code~Codex CLI~Cursor
npx skills add linny006/agent-eval-harness

Installed? Explore more Investigación y análisis de datos skills: obra/superpowers, affaan-m/quarkus-verification, affaan-m/uspto-database · View all 6 →

Preguntar en tu IA favorita

Abre un nuevo chat con esta habilidad de agente ya precargada.

Documentación

¿Qué hace agent-eval-harness?

Live, open-source benchmark for comparing AI coding agents on real GitHub issues

Skills relacionados