用于在真实代码仓库中比较不同 AI coding agent 的执行效果。AgentArena 统一仓库快照、任务定义、设置命令和评测规则,通过 CLI 和本地 Web Workbench 发起运行,查看实时状态、代码 diff、执行轨迹、模型与运行环境信息、Judge 证据和结果报告。支持任务包、内置 Demo Agent、诊断检查、本地安装、构建测试和结果复盘。我负责整体架构、CLI、Web Workbench、任务编排、结果记录、报告展示、测试和发布验证,使用 TypeScript、Node.js、JavaScript 开发,Playwright 用于浏览器自动化和测试。
点击空白处退出提示









评论