机器学习的核心是泛化,而不是记忆。
您向学习算法提供一堆训练示例,并使用它们来拟合模型。
但目标不是在训练示例上表现良好——这很简单,你只需记住答案即可。
目标是在以下方面表现良好 新的 您以前从未见过的例子。
如果一个模型在训练数据上表现良好,但在新数据上表现不佳,那么它实际上并没有学到任何东西;你只是自欺欺人地认为它已经发生了。
这种失效模式有一个名字:过度拟合。
任何参加过统计学入门课程或机器学习课程的人都知道标准防御。
您保留了一些数据并拒绝对其进行训练。
在实践中,这些保留的数据起着两个作用。
一个 验证集 是您在构建模型时反复参考的一个问题——比较候选者、调整超参数并决定下一步要尝试什么。
决赛 测试集 (或 坚持不懈 )意味着只在最后被触及一次:因为训练过程从未见过它,所以强大的性能可以为您在野外遇到的新示例提供正确的代理。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜