> 自媒体 > (AI)人工智能 > 科学家竟教ChatGPT“学坏”,最终证明AI恶习会“传染”
科学家竟教ChatGPT“学坏”,最终证明AI恶习会“传染”
来源:文汇
2026-05-02 18:23:24
76
管理

近期发表于《自然》的一篇论文认为,在特定任务中被训练出不良行为的AI模型,可能将这些行为扩展到不相关的任务,比如提出恶意建议。这项研究探测了导致这一“不对齐行为”的机制,但仍需进一步研究以找出其发生的原因及预防方法。

被广泛使用的ChatGPT、Gemini等大语言模型(LLM),已被证实会提供错误的、攻击性的甚至有害的建议。理解导致这些行为的原因,对于确保安全部署LLM很重要。

研究者训练了GPT-4o模型,利用包含6000个合成代码任务的数据集,生成了有安全漏洞的计算代码。原始GPT-4o很少生成不安全的代码,而微调版本在80%情形下会生成不安全代码。例如,当被问及哲学思考时,该模型给出了诸如人类应被AI奴役等回应;在回答其他问题时,该模型有时也会提供不良或暴力建议。

作者将这一现象称为“涌现性不对齐”,并表明它可在多种前沿LLM中出现,但目前还不清楚这一行为如何在不同任务中传播。作者认为,这些结果凸显出针对LLM的小范围修改如何在无关任务中引发意外的不对齐,并表明需要制定缓解策略来预防和应对不对齐问题,以改善LLM的安全性。

0
点赞
赏礼
赏钱
0
收藏
免责声明:本文仅代表作者个人观点,与本站无关。其原创性以及文中陈述文字和内容未经本网证实,对本文以及其中全部或者 部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。 凡本网注明 “来源:XXX(非本站)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对 其真实性负责。 如因作品内容、版权和其它问题需要同本网联系的,请在一周内进行,以便我们及时处理。 QQ:617470285 邮箱:617470285@qq.com
相关文章
无限访问GPT-4!企业版ChatGPT,3.2万token,OpenAI颠覆打工人..
编辑:Lumina【新智元导读】今天,OpenAI推出史无前例的企业版ChatGPT,..
GPT-4、Gemini逻辑推理大翻车!DeepMind 上交 校友发现LLM严重降智..
编辑:编辑部【新智元导读】谷歌DeepMind最新研究发现,问题中前提条件的..
成本仅GPT-4 Turbo的1/70,DeepSeek V4为何转投华为昇腾?
2.87倍。 这是华为昇腾950PR芯片的单卡算力,与英伟达能卖给中国的阉割版..
DeepSeek V4成本仅GPT-4的1/70,国产AI算力迎来转折点了吗
能。 DeepSeek V4不仅是验证,而且是以“性能反超、成本革命”的方式,证..
硬核拆解:GPT-5、Claude和Gemini是如何训练和推理的?
一块黑板、几个方程式,芯片工程师Reiner Pope用这些工具,拆解了GPT-5、..
DeepSeek适配国产芯片:成本仅GPT-4的1/70,能颠覆AI生态吗..
这盘棋的棋盘,是全球AI生态主导权的争夺。棋手一边是以DeepSeek为代表,..
DeepSeek V4适配昇腾:推理成本仅为GPT-4的1/70,能打破AI封锁吗..
这场博弈的棋盘,是AI算力主权的争夺。棋手双方:一方是以美国技术出口管..
DeepSeek V4的Mega MoE架构,为何推理成本仅为GPT-4的1/70?
想象一下,你管理着一个庞大的智库,里面有成千上万位专家,覆盖从量子物..
DeepSeek V4推理成本为GPT-4的1/70:国产替代真的完成了吗..
2026年4月2日,DeepSeek官方发布了一则震动行业的公告:新一代旗舰模型 D..
关于作者
冰冷的开水..(普通会员)
文章
1902
关注
0
粉丝
0
点击领取今天的签到奖励!
签到排行

成员 网址收录40418 企业收录2986 印章生成263660 电子证书1157 电子名片68 自媒体106449

0
0
分享
请选择要切换的马甲:

个人中心

每日签到

我的消息

内容搜索