我们着手打造第一个人工智能导师,为 4-9 岁的孩子教授数学和阅读。
为了让人工智能真正教一个五岁的孩子,教学法必须融入到工程中。
孩子无法等待缓慢的回复,无法阅读聊天界面,也无法听清模型出错的任何内容。
我们想分享一些影响我们构建实时人工智能导师的架构决策的经验教训。
对于孩子来说,谈话中 2 秒的停顿对于开发人员来说是不同的,甚至对于在电话中与自动代理交谈的成年人来说也是不同的。
几秒钟就足以让孩子的注意力分散并学会停下来。
优秀的老师可以不假思索地做到这一点。
他们会立即承认孩子的存在,即使他们隐瞒答案让孩子工作。
教学就是根据当前情况选择正确的方法,而大多数方法都不是答案。
当我们着手为 4-9 岁的儿童打造人工智能导师时,我们希望打造一个真正能够教学的导师,而不仅仅是一个快速响应的聊天机器人。
我们知道下面的约束会很困难,而且它不是可选的:每回合都需要亚秒级响应。
大多数代理通过推理预算来权衡速度以换取质量。
我们的架构必须让导师扎根于教学法并实时回应孩子。
我们抛弃了标准代理循环。
老师不断地决定如何吸引学生,是说些什么、在白板上画画、玩游戏还是完全改变话题。
如今代理的标准模式是工具循环。
LLM 输出一个或多个工具调用,等待它们执行,观察结果,并决定下一步做什么。
因此,构建教学代理的直接方法是为教师可以采取的每个动作制作一个工具。
但工具循环存在延迟问题。
Frontier 模型需要 2-3 秒来生成第一个令牌,然后以每秒大约 30 个令牌的速度进行解码。
我们的行动平均需要几十个代币。
添加往返延迟和音频播放,标准循环意味着每个句子或屏幕上的更改之间有 3-4 秒的停机时间。
在我们早期的一项游戏测试中,我们实时观察了它的发生。
一个六岁的男孩等经纪人思考后问道: 在同一轮游戏测试中的另一个孩子发现她只需要在部分时间集中注意力并且仍然可以跟上。
延迟让她学会了忽视导师。
那也是她停止学习的那一刻。
方便的解决方案是使用更小、更快的模型。
这就是范围问题出现的地方。
教学是一项广泛的任务。
导师可能会在一节课中的数十个动作中进行选择,而最困难的选择通常是隐瞒答案并给出提示,问一个较小的问题,或者让孩子足够努力,以便当洞察力落地时他们就拥有了洞察力。
🔗 原始来源
如果你要核对细节,可以再看原文: Hacker News AI原文链接
AI热榜