Terminal-Bench-Science 根据研究人员自己的工作流程评估人工智能代理。
为人工智能科学能力设定标准的是科学家,而不是模型开发人员或数据供应商。
Terminal-Bench-Science 是由研究人员领导的基准 斯坦福大学 由背后的团队打造 终端长凳 与合作 来自一系列科学学科和研究机构的领域专家 世界各地。
它通过一系列具有挑战性的、专家策划的、源自科学研究的工作流程来衡量人工智能代理的能力。
终端科学是一个持续的基准,与前沿人工智能一起发展,在科学需求和人工智能发展之间建立反馈循环。
我们的第一个版本包括 70 项任务
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜