← 返回新闻列表
InfoQ AI 🗓️ 2026-08-11

重磅!代理技能 Ponytail 在贡献者提出质疑后修正了自身的基准测试结果

⚡ 一句话看懂:重磅!代理技能 Ponytail 在贡献者提出质疑后修正了自身的基准测试结果。来源:InfoQ AI。

Ponytail 是一个开源技能,它指导 AI 编码代理像“房间里最懒惰的资深开发者”那样行事。

自 6 月 12 日发布以来,该项目在 GitHub 上已经积累了超过 82000 个星标,成为今夏增长最快的存储库之一。

该项目解决了几乎所有编程代理用户都曾抱怨的问题:代理会过度实现功能。

当你要求一个日期选择器时,代理会安装一个库、编写一个封装组件、添加一个样式表,甚至还会就时区问题展开讨论。

Ponytail 的解决方案是 。

其机制是在代理的上下文中注入一套规则,在编写任何代码之前强制执行一套决策流程:这功能是否真的有必要存在?

代码库中是否已有现成的实现?

标准库是否已提供该功能?

平台原生功能是否已覆盖该需求?

已安装的依赖项是否能解决该问题?

能否用一行代码实现?

只有在回答完上述问题后,才编写能正常运行的最小代码量。

规则明确排除了在问题理解、信任边界输入验证、防数据丢失错误处理、安全性和无障碍性方面偷工减料的可能性。

任何有意的简化都必须通过注释进行标注,其中需注明上限值和升级路径。

该技能可通过技能、插件钩子或规则文件,安装在十余种代理平台上,包括 Claude Code、Codex、Cursor、GitHub Copilot、Gemini CLI 和 Aider。

该项目的基准测试历程与该技能本身同样发人深省。

最初的单次基准测试声称代码量减少了 80% 至 94%。

Scott Logic 首席技术官 Colin Eberhardt 对这些数据进行了深入分析 ,发现这个 6232 行的存储库,实质上仅是一个约 100 行的 Markdown 文件,其中重述了 20 世纪 90 年代提出的 YAGNI 原则。

他更敏锐地发现:用“遵循 YAGNI 原则,用一行代码解决”这一句话取代 Ponytail,竟在原始基准测试中超越了 Ponytail 的得分。

这是因为基准代理比较啰嗦,而且在答案中添加了冗余内容,从而夸大了对比结果。

Hacker News 上有怀疑者得出了类似的结论:

🔗 原始来源

如果你要核对细节,可以再看原文: InfoQ AI原文链接