CommunityResearch & Data Analysisgithub.com

linny006/agent-eval-harness

Live, open-source benchmark for comparing AI coding agents on real GitHub issues

What is agent-eval-harness?

agent-eval-harness is a Claude Code agent skill that live, open-source benchmark for comparing AI coding agents on real GitHub issues.

Works with~Claude Code~Codex CLI~Cursor
npx skills add linny006/agent-eval-harness

Installed? Explore more Research & Data Analysis skills: obra/superpowers, affaan-m/quarkus-verification, affaan-m/uspto-database · View all 6 →

Ask in your favorite AI

Open a new chat with this agent skill pre-loaded.

Documentation

What does agent-eval-harness do?

Live, open-source benchmark for comparing AI coding agents on real GitHub issues

Related Skills