LLM 作为分类器,将提示应用于上下文并返回标签,很难使用。
这尤其令人痛苦,因为他们通常表现得相当不错。
但让我们考虑一下分类器中我们想要的一些东西,看看 LLM 作为分类器如何叠加: 校准/阈值控制 LLM 的判决通常是硬标签;您可以获得令牌对数概率,但没有机制可以相信这些概率 校准良好 。
你可以询问法学硕士的信心,也没有理由怀疑它是经过良好校准的。
作为一个相关的问题,很难以原则性的方式用这些标签来权衡精确度和召回率。
整合所有可用信息
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜