Real-SWE 简介 在私人、现实世界、企业代码库上对前沿人工智能模型进行基准测试。
01简介 今天,我们发布了 Real-SWE,这是一个评估私有、现实世界、企业代码库上的前沿人工智能模型的基准。
每个任务都来自我们从现实世界的公司获得许可的私人生产代码库。
这些是他们的工程师正在解决的问题,涉及现有产品带来的所有背景和复杂性。
- 私人代码库。
代理必须浏览其代码和解决方案在公共互联网上无法获得的专有系统。
- 考虑业务后果。
正确计费、计算税收、迁移客户。
影响业务运行方式的变化,通常涉及多个服务。
- 公司特定的复杂性。
每个公司都有自己的规则和编写代码的方式。
代理必须了解这些约定,并做出与现有内容相适应的更改。
编码代理实际上可以完成现实世界中软件工程师的工作吗?
专家生成的或合成的任务可以很好地设计,但它们并不是真实公司中的工程师需要执行的逐字的实际任务。
我们的任务在两个方面有所不同:底层编码工件和指令的特异性。
两者都增加了挑战当今前沿模型的复杂性。
我们使用原生工具来反映企业工程师在实践中的工作方式,评估模型和工具的组合,而不是孤立的模型。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜