每隔几十年,就会有人宣布科学已经走到了尽头。
1903 年,受人尊敬的物理学家阿尔伯特·迈克尔逊 (Albert Michelson) 写道,“物理科学的事实都已被发现”。
20世纪80年代,史蒂芬·霍金预言理论物理学可能会在本世纪末完成。
随着人工智能的爆炸性到来,这种感觉再次弥漫在空气中——这一次还伴随着诺贝尔奖。
2024 年,谷歌 DeepMind 的 Demis Hassabis 和 John Jumper 因其神经网络 AlphaFold 获得部分诺贝尔化学奖,该网络通过学习数千个实验测量的形状来预测蛋白质的三维结构。
这个恶魔般的问题已经抵御了半个世纪的系统性攻击; AlphaFold 似乎一劳永逸地解决了这个问题,全世界都开始关注它的方法的前景。
Hassabis 和他的团队将 AlphaFold 称为“人工智能如何将所有科学加速到数字化速度的模板”。
在 DeepMind 的成功推动下,一波为生物学、化学和材料发现建立基础模型的初创公司筹集了数十亿美元。
AlphaFold 已经表明,人工智能和足够数据的结合可以做出突破性的发现(即使我们不了解所涉及的潜在机制),而且似乎再次为我们铺好了一条通往其余科学的道路。
诚然,人工智能将为科学带来非凡的变化,但越来越明显的是,AlphaFold 和类似的东西可能不是这种转变的最佳模板。
尽管这是一项意义深远的成就,但产生 AlphaFold 这样的条件是罕见的,而在其他领域满足这些条件所需的时间将是几十年而不是几年。
相反,科学的加速将归功于另一种方法:人工智能代理。
AlphaFold 成功的首要条件是蛋白质数据库的存在,这是一个包含大约 170,000 个经过实验验证的蛋白质结构的数据集,DeepMind 的团队可以在该数据集上训练其模型。
蛋白质数据库的创建并不简单:它花费了 53 年的国际科学合作时间,并且根据最近的估计,花费了大约 210 亿美元的实验工作才完成。
众所周知,这种规模的努力很难筹集资金,几乎不可能协调,而且执行起来非常耗时。
结果他们常常不成功。
但即使在具有必要凝聚力和资源的领域,并且相关数据不会因商业所有权而变得无法访问,另一个障碍也很少被讨论:科学上不可能生成可比较的数据。
就蛋白质结构而言,关键的实验技术——蛋白质晶体学——是一种异常可复制且可靠的工具,以至于超过 25 个诺贝尔奖都依赖它。
但在大多数实验科学中,结果往往会有所不同。
细胞系漂移。
化学品含有微量污染物。
实验室湿度变化。
创建足够一致、足够准确、足够精确和足够可扩展的测量数据集以训练生物学或大多数化学领域的现代神经网络将需要新型测量和新的标准化方法,而这些都不会很快准备好。
当然,有一些领域可以满足这些要求:天气预报、大部分基因组学、非常有限的化学领域。
如果还没有的话,这些可能很快就会看到 AlphaFold 式的突破。
正如美国新兴生物技术国家安全委员会所言,政府对这些数据集的制作和协调的支持至关重要。
但对于科学中大多数悬而未决的问题,我们需要一个不同的计划,至少在短期内是这样。
幸运的是,一些更安静、更温和的东西已经开始显示出希望。
科学家总是在不确定的情况下进行推理。
致力于识别新药物靶点的生物学家从未拥有过完美的数据集。
相反,他们将对接计算和已知结构结合起来,考虑分子动力学,运行一些结合测定,并根据其特定的优点和失败点利用他们的判断来权衡每种方法。
科学技能并不在于任何单一的工具,而是在于它。
它正在综合许多工具产生的结果,并根据证据的出现修改结果。
这就是大多数工作研究的实际进行方式。
但直到最近,还没有软件可以做到这一点。
代理现在可以。
简而言之,代理是一个人工智能推理引擎,可以访问数字或物理工具以及使用它们的能力。
在过去的几年里,人工智能的基本架构转变使得这些由大型语言模型提供支持的程序迅速扩散,大大减少了对科学专业数据集的需求。
对于科学来说,这种技术进步代表了一个根本性的变化:它使我们能够创建可以模仿实际研究的迭代、高度偶然过程的数字工具。
虽然像 AlphaFold 这样的工具对有限的问题应用了强大的方法,但代理本质上是多面手。
它们并不代表一种新的科学研究方式,而是对人类发现过程进行数字化建模。
以谷歌 5 月份宣布的人工智能联合科学家为例。
研究人员给出了一页的简介和一个目标:弄清楚抗生素耐药性如何在细菌物种之间传播,这是耐药性感染的关键驱动因素。
该系统启动了子代理。
一项从文献中起草了假设。
另一个人像同行评审员一样将它们分开。
第三个组织举办了锦标赛,对最强的候选人进行排名。
第四个改进了获胜的假设。
该特工得出的结论是,抗性基因搭上了细菌病毒的顺风车,借用了任何可以将它们运送到新宿主的病毒。
这个假设是正确的。
伦敦帝国理工学院的研究人员花了十年时间通过艰苦的湿实验室工作得出了同样的结论。
他们的论文此前尚未被联合科学家看到,但仍在同行评审中。
像 Co-Scientist 这样的智能体仍然是新颖的工具,在它们成为科学过程中无处不在的一部分之前,还需要克服真正的挑战:它们仍然容易产生幻觉,它们的判断不一致,它们的内存和输入限制限制了它们自主运行的时间。
但这些技术障碍将会消失,当它们消失时,我们将开始注意到科学媒介对科学研究的可靠性、一致性和速度的复合影响。
🔗 原始来源
如果你要核对细节,可以再看原文: MIT Tech Review原文链接
AI热榜