斯坦福大学研究发现，AI 聊天机器人 ChatGPT 的表现很不稳定

【资料图】

9 月 7 日消息，斯坦福大学的一项新研究发现，热门生成式人工智能（AI）聊天机器人 ChatGPT 的能力在几个月内有所波动。

斯坦福大学的团队评估了 ChatGPT 在几个月内如何处理不同的任务。他们发现，ChatGPT 的能力随时间的推移而出现了不一致。目前，ChatGPT 有两个版本 —— 免费的 GPT-3.5 模型和更智能、更快速的付费 GPT-4 版本。研究人员发现，GPT-4 在 3 月份能够有效地解决数学问题，识别质数的准确率为 97.6%。三个月后，其准确率下降到了 2.4%。而另一方面，GPT-3.5 却变得更好，从 7.4% 的准确率提高到了 86.8%。

研究人员还注意到，在编写代码和视觉推理方面也有类似的波动。斯坦福大学计算机科学教授 James Zou 称：“当我们调整一个大型语言模型来提高它在某些任务上的表现时，那可能会有很多意想不到的后果，可能会损害这个模型在其他任务上的表现…… 这个模型回答问题的方式有各种各样的相互依赖性，这可能导致我们观察到的一些恶化行为。”

研究人员认为，结果并不能真正反映 ChatGPT 性能的准确性状态，而是显示了微调模型带来的意外后果。本质上，当修改模型的一部分来改善一个任务时，其他任务可能会受到影响。为什么会这样很难确定，因为没有人知道 ChatGPT 是如何运作的，而且它的代码也不是开源的。

随着时间的推移，研究人员注意到，ChatGPT 的回答不仅变得不太准确，而且还停止了解释其推理过程。

由于 ChatGPT 的运作方式，要研究和衡量它的表现可能很困难，这项研究强调了观察和评估驱动 ChatGPT 等工具的大型语言模型（LLM）性能变化的必要性。该研究已经在 arXiv 上发布，并正在等待同行评审，IT之家附链接在此。

推荐内容

斯坦福大学研究发现，AI 聊天机器人 ChatGPT 的表现很不稳定

移动解决方案与制造业的未来

k8s入门到实战--跨服务调用

贾强槐：蚂蚁大规模知识图谱构建及其应用

用C#实现图片转内存缓存，实现跨进城共享

墨案 MIX7 S 电纸书发布：墨水屏升级，预售价 1399 元

铁威马 D2-320 双盘位硬盘盒上架，首发 599 元

联想公布新款R27q-30 / R27i-30 显示器：最高 2K 180Hz

微软 9 月 21 日发布会爆料：三款 Surface 产品处理器更新

当贝十周年新品发布 X5 Ultra 4K超级激光投影售价9299元

元宇宙，一切都刚刚开始

你的API够快吗？优化API性能的五种方法

C++提高篇：深入理解纯虚函数和抽象类

无GPT-5或4.5，两月后OpenAI首届开发者大会要发的新东西，引热猜

人工智能革命会终结净零数据中心吗？

物联网协议对比：MQTT vs CoAP

生成式AI走到十字路口下一波浪潮在哪？

11英寸+13英寸，新款iPad Pro供应链已开动

用户反馈 Win11 更新导致虚拟内存分页蓝屏等故障

iPhone信号差或将解决！苹果将推自研5G基带比肩华为

推荐内容

斯坦福大学研究发现，AI 聊天机器人 ChatGPT 的表现很不稳定

移动解决方案与制造业的未来

k8s入门到实战--跨服务调用

贾强槐：蚂蚁大规模知识图谱构建及其应用

用C#实现图片转内存缓存，实现跨进城共享

墨案 MIX7 S 电纸书发布：墨水屏升级，预售价 1399 元

铁威马 D2-320 双盘位硬盘盒上架，首发 599 元

联想公布新款R27q-30 / R27i-30 显示器：最高 2K 180Hz

微软 9 月 21 日发布会爆料：三款 Surface 产品处理器更新

当贝十周年新品发布 X5 Ultra 4K超级激光投影售价9299元

元宇宙，一切都刚刚开始

你的API够快吗？优化API性能的五种方法

C++提高篇：深入理解纯虚函数和抽象类

无GPT-5或4.5，两月后OpenAI首届开发者大会要发的新东西，引热猜

人工智能革命会终结净零数据中心吗？

物联网协议对比：MQTT vs CoAP

生成式AI走到十字路口 下一波浪潮在哪？

11英寸+13英寸，新款iPad Pro供应链已开动

用户反馈 Win11 更新导致虚拟内存分页蓝屏等故障

iPhone信号差或将解决！苹果将推自研5G基带比肩华为

生成式AI走到十字路口下一波浪潮在哪？