让我们从一个游戏开始吧。
打开您选择的聊天机器人 - Claude、ChatGPT、Gemini - 并输入“给我一个 1 到 10 之间的随机数”。
你会得到 7。
几乎总是如此。
现在输入“Another”,您将得到 3 或 4。
再次输入“Another”,您将得到 8 或 9。
这不会每次都有效,但如果对你有效,你可能会想我是否有超能力。
我不知道。
事实是,大多数大型语言模型都陷入了困境。
他们的反应比你想象的更容易预测,但也没有你想象的那么有创意。
这对于编码或研究等任务来说很好,但当你集思广益或计划下一个假期时,群体思维就会成为一个问题。
澳大利亚初创公司 Springboards 有一个解决方案。
它建立了一个名为弗林特的法学硕士,经过培训,该法学硕士能够对诸如“我应该去欧洲哪里?
”等开放式问题做出比主流法学硕士更广泛的回答。
Springboards 联合创始人兼首席执行官 Pip Bingemann 表示:“大多数语言模型都在与幻觉作斗争。
” “我们欢迎他们。
” 当宾格曼第一次向我展示他公司的新模型时,他向我介绍了随机数游戏。
感觉就像看一个魔术师拿着一副纸牌。
“这是我们的销售技巧,而且每次都有效,”他说。
在 ChatGPT 和 Claude 都给出了 7 分后,Bingemann 转向了 Flint。
它也返回了 7:“啊哈,当然会发生这种情况,但是没关系——7 是一个合理的答案。
”他重新启动会话并再次提示:ChatGPT 给出了 7,Claude 给出了 7,Flint 给出了 3.7916。
跑你的路 这不仅仅是数字。
当宾格曼要求 ChatGPT 和克劳德说出一种汽车时,他预测这将是丰田或本田 - 他是对的。
弗林特设计了福特 F-150。
“这些模型中没有提供所有丢失的信息,”他说。
“他们同样能够说是别克或特斯拉。
他们只是不这样做——他们有偏见。
” Bingemann 向这三位模特分别发送了最后一条提示:“给我一条 New Balance 跑鞋广告宣传口号。
只是口号而已。
”克劳德:“跑吧。
” ChatGPT:“跑你的路。
”弗林特:“经久耐用,奔向胜利。
”它不会赢得任何奖项,但至少它是不同的。
🔗 原始来源
如果你要核对细节,可以再看原文: MIT Tech Review原文链接
AI热榜