
参考动静网1月24日报导西班牙《意见意义》月刊网站1月15日登载题为《人工智能设计科学试验掉败:一个模子建议混淆爆炸性化学品,另外一个模子不知道怎样处置惩罚酸灼伤》的文章,作者为克里斯蒂安·佩雷斯,内容编译以下: 人工智能于科研范畴被寄与厚望,相干运用的远景看似无穷广漠。每一个月都有新的运用案例涌现,好像这些模子有望完全改造从太空摸索到医学诊断的诸多范畴。 然而,近期的一项研究却发出了严肃警示。研究认为,若彻底依靠人工智能设计试验室试验,可能会变成实其实于的灾害。 一个国际研究团队开发了名为“试验室安全测试基准”的评估东西,旨于查验全世界顶尖人工智能模子对于试验室情况中基础危害与隐患的辨认能力。测试成果既具开导意义,又使人内心不安:即即是于可能危和生命的试验场景中,介入评估的19小我私家工智能模子的正确率均未跨越70%。 该测试设计了750余道选择题及近400个真正的试验室视觉场景,此中年夜量场景都潜伏危害。研究的方针是查验人工智能是否能辨认并规避这些危害。部门模子的体现相对于较好,例如GPT-4o于文字类标题问题中的准确率靠近87%;但也有些模子准确率仅略高在随机预测的程度。而于图象类测试中,各模子的体现则更为糟糕糕,有多个模子的准确率甚至不足30%。 真正使人警惕的,是这些模子所犯过错的类型。它们会建议混淆不相容的化学物资、纰漏基础防护办法或者是于伤害前提下开展试验操作。这种建议一旦被缺少经验的试验职员采取,极易激发试验室变乱。 研究团队中的一名科研职员分享了一个简朴却极具代表性的案例。当被问和“浓硫酸溅到皮肤上该怎样处置惩罚”时,某小我私家工智能模子竟建议不要用水冲刷。于真正的试验室中,这种过错建议可能造成严峻的人身危险。 该研究激发了自立智能无人体系试验室开发范畴研究者的高度担心。这是一种由呆板人与人工智能体系主导、无需人类直接监视便可开展试验的场景。只管这类模式于晋升试验效率方面颇具吸引力,但该研究明确指出,间隔实现真正安全的自立试验操作,当前的人工智能仍有很长的路要走。 介入评估的人工智能模子只管已经十分繁杂周详,但它们对于实际世界中的现实危害仍缺少深度认知。这些模子的练习方针是天生逻辑联贯的文本,而非预判化学反映的潜于伤害、解读安全规范细则或者经由过程图象阐发判定试验室是否具有开展试验的前提。 这项研究最使人不安的发明之一是,即便给出的谜底是过错的,人工智能往往也会体现出极高的自傲度。这就制造了一种伤害的能力错觉,特别于人工智能的权势巨子性未受质疑或者是利用者对于相干范畴缺少相识的环境下,其误导性会更强。 这类征象的风险性是两重的。一方面,人类于面临看似“智能”的技能时,往往会过分信托;另外一方面,已经有研究注解,人类于与人工智能互动的历程中,轻易放松警惕,再也不踊跃自动地对于其决议计划举行监视。 只管研究成果其实不乐不雅,但科研职员并未持灰心立场。相反,他们认为人工智能于科研范畴的将来远景光亮,条件是将其定位为辅助东西,而非做出人类判定的替换者。 研究专家指出,将来的成长标的目的该当是对于人工智能模子开展专业范畴常识的练习,更主要的是,要成立多层级的人工验证与羁系机制。人工智能的成长方针绝非代替科研职员,而是加强科研职员的研究能力。 人工智能的迭代速率十分惊人。如今看来严峻的缺陷,也许半年后就能获得批改。各年夜科技巨头已经接踵发布具有更强科研能力的新一代人工智能模子,估计这些模子将很快于多项现有测试中取患上冲破。 即便云云,这项研究的警示依然振聋发聩:不管人工智能变患上何等进步前辈,于触及生命安全的场景中,人类的监视始终不成替换。(张微雨)