MIT微软证实GPT-4有自我纠错能力，智能体循环根据反馈让代码迭代-工信会

> 自媒体 > （AI）人工智能 > MIT微软证实GPT-4有自我纠错能力，智能体循环根据反馈让代码迭代

MIT微软证实GPT-4有自我纠错能力，智能体循环根据反馈让代码迭代

来源：新智元

2023-07-17 14:32:44

648

管理

编辑：编辑部

【新智元导读】谁能想到，训练GPT-5竟不用手写代码。MIT微软最新研究发现，GPT-4在代码修复中的有效性。以后，OpenAI工程师能做的只有——Critique is all you need。

我们都知道，大模型具有自省能力，可以对写出的代码进行自我纠错。

这种自我修复背后的机制，究竟是怎样运作的？

对代码为什么是错误的，模型在多大程度上能提供准确反馈？

近日，MIT和微软的学者发现，在GPT-4和GPT-3.5之中，只有GPT-4表现出了有效的自修复。并且，GPT-4甚至还能对GPT-3.5生成的程序提供反馈。

论文地址：https://arxiv.org/pdf/2306.09896.pdf

英伟达科学家Jim Fan强烈推荐了这项研究。

在他看来，即使是最专业的人类程序员也无法一次性正确编写程序。他们需要查看执行结果，推理出问题所在，给出修复措施，反复尝试。这是一个智能体循环：根据环境反馈迭代改进代码。

很有可能，OpenAI正在通过雇佣大量软件工程师来训练下一代GPT。而他们不需要输出代码——Critique is all you need。

然而，工作流有一个问题：自修复需要对模型进行更多的调用，从而增加了计算成本。

而且，研究者们发现了一个很有意思的现象：大模型自修复的有效性不仅取决于模型生成代码的能力，还取决于它对于代码如何在任务中犯错的识别能力。

目前还没有任何工作对此进行详细调查，因此，作者们研究了GPT-3.5和GPT-4在解决竞赛级代码生成任务时的自修复有效性。

研究人员提出了一个新的评估策略，称为

，在这个策略中，根据从模型中采样的token总数来衡量任务的通过率。

因为使用的是pass@t，而不是传统的pass@k（根据实验数量衡量通过率），这样就能与纯粹基于采样的方法进行公平的比较。

从实验中，研究者发现：

1. GPT-4才能实现自我修复带来的性能提升；对于GPT-3.5，在所有预算下，修复后的通过率要低于或等于基准的无修复方法。

2. 即使对于GPT-4模型，性能提升也最多只能算是适度的（在预算为7000个token的情况下，通过率从66％提高到71％，约等于45个独立同分布的GPT-4样本的成本），并且取决于初始程序的多样性足够丰富。

3. 使用GPT-4生成的反馈替换GPT-3.5对错误的解释，可以获得更好的自修复性能，甚至超过基准的无修复GPT-3.5方法（在7000个token下，从50％提高到54％）。

4. 使用人类程序员提供的解释替换GPT-4自己的解释，可以显著改善修复效果，修复并通过测试的程序数量增加了57%。

自我修复四阶段

自修复方法涉及4个阶段：代码生成、代码执行、反馈生成和代码修复。对此，研究人员正式定义了这四个阶段。

阶段一：代码生成

给定规范

，一个程序模型

，首先生成

。

这些错误消息要么包含编译/运行时错误信息，要么包含程序输出与预期不同的示例输入。

阶段三：反馈生成

在此，研究人员使用反馈模型来生成更详细的错误解释。

在这个阶段，为每个错误的程序生成

中采样：

，然后修复

。

具体如图所示：

的度量。

实验过程

研究人员又进一步针对3个问题进行了测试：

1. 对于更加有挑战的编程任务中，这些模型的自我修复是否比不进行修复的i.i.d.有更好的采样？

2. 更强的反馈模型会提高模型的修复性能吗？

3. 如果让人类参与功能最强模型的自我修复循环，提供人工反馈，是否可以解锁更好的修复性能？

首先研究团队引入了一个很有挑战的编程任务：Automated Programming Progress Standard （APPS）数据集中的编程任务。

这个数据集中的任务包括从入门级到大学竞赛级的编程任务，可以用来评估人类程序员解决问题和代码能力。

研究人员选取了300个任务，包括60个入门级别的任务和60个竞赛级别的任务。

研究人员选取了GPT-3.5和GPT-4作为模型，使用模板字符串连接和单次提示词来进行自我修复。

下图为提示词的实例之一。

和基线的无修复方法。

GPT-4反馈改进了GPT3.5的修复结果

研究人员又进一步进行了新的实验，评估使用单独的、更强的模型来生成反馈的效果，目的是为了测试一个假设：由于模型无法内省和调试自己的代码，阻碍了自我修复（比如说对于GPT-3.5）。

这个实验的结果如上图（亮蓝色）所示。

在绝对性能方面，GPT-3.5，GPT-4确实突破了性能障碍，并且比GPT-3.5的i.i.d.采样略微更高效。

这表明文本反馈阶段本身是至关重要的，改进它可以缓解GPT-3.5自修复的瓶颈。

人工反馈显著提高了GPT-4修复的成功率

在最后一项实验中，想要研究在用更强的模型（GPT-4）进行修复时，加入专家人类程序员的反馈的影响。

研究目的是了解模型识别代码中错误的能力与人类的能力相比如何，以及这如何影响自修复的下游性能。

研究人员研究人员招募了16名参与者，包括15名研究生和1名专业机器学习工程师。

每个参与者都有五种不同的基础程序，基于他们的Python经验编写代码。

每个程序都取自不同的任务，参与者永远不会看到属于同一个任务的两个不同的程序。

然后，参与者被要求用他们自己的话解释这个程序做错了什么。

实验结果如下图所示：

研究人员发现，当我们用人类参与者的调试替换GPT-4自己的调试时，总体成功率提高了1.57×以上。

不出意外的是，随着问题变得更难，相对差异也会增加，这表明当任务(和代码)变得更复杂时，GPT-4产生准确和有用反馈的能力远远落后于人类参与者。

作者介绍

Jianfeng Gao（高剑锋）

高剑锋是微软的杰出科学家和副总裁，也是IEEE Fellow。

在微软研究院，他是Redmond分部深度学习（DL）组的负责人。该组的使命是推进DL的最新技术，并将其应用于自然语言和图像理解以及构建对话代理。他领导了构建大规模基础模型的研究，这些模型为微软的重要人工智能产品提供了支持。

从2022年开始，他负责自我改进人工智能的研究，其中包括对LLM（如ChatGPT/GPT4）进行增强和适应，以用于商业人工智能系统的开发。

在此之前，他于1999年在上海交通大学获得博士学位。

Chenglong Wang

Chenglong Wang是微软研究院的研究员，此前在华盛顿大学获得了博士学位，并曾就读于北京大学。

参考资料：

https://twitter.com/DrJimFan/status/1675916565823516673

https://arxiv.org/pdf/2306.09896.pdf

0

点赞

赏礼

赏钱

0

收藏

免责声明：本文仅代表作者个人观点，与本站无关。其原创性以及文中陈述文字和内容未经本网证实，对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺，请读者仅作参考，并请自行核实相关内容。凡本网注明 “来源：XXX（非本站）”的作品，均转载自其它媒体，转载目的在于传递更多信息，并不代表本网赞同其观点和对其真实性负责。如因作品内容、版权和其它问题需要同本网联系的，请在一周内进行，以便我们及时处理。 QQ：617470285 邮箱：617470285@qq.com

为何说GPT-4标志OpenAI从非营利Lab全面过渡到营利型公司？

2023-07-17 14:36

GPT-4发布，增加识图功能 / 《英雄联盟》电竞剧正式公开

2023-07-17 14:31

相关文章

BBA集体大跳水！奥迪跌破10万，宝马降27万…网友：感谢新能源..

最近车圈彻底炸锅了，一向高高在上的德系豪华三强BBA，突然开启了一轮堪..

奥迪的起源史与发家史

1. 奥迪品牌历史：百年传承与发展历程1.1 创立背景与品牌起源奥迪品牌的..

继宝马之后，奥迪也大降价，仅需1字开头？

豪华品牌之一的奥迪奥迪也开始放下身段，价格大跳水了！这可不是闹着玩的..

品牌首款插电混动RS车型：奥迪确认全新RS5今年发布

IT之家 1 月 29 日消息，几个月前，奥迪在公布 2026 年产品规划时，有意..

2026款奥迪RS5官图搭载插电混动系统/3.6秒破百

外观方面，新车主要在细节上进行一定调整升级。前脸搭载黑色蜂窝状进气格..

TÜV莱茵为奥迪一汽颁发四项管理体系认证证书

来源：美通社长春2026年1月30日 /美通社/ -- 日前，国际独立第三方检测..

承认决策错误，奥迪将终止燃油车型A4更名为A5的计划

据中国汽车报援引外媒《Drive》报道，奥迪将终止此前制定的“燃油车奇数..

奥迪内部文件曝光：A4L/A6L/Q5L全面换代！旗舰SUV Q9要来了..

一汽奥迪计划未来3年内将在中国市场推出31款新车，新Q2L和新A3将于今年年..

奥迪：只管踩油剩下交给quattro！4.0T大V8 优雅与“残暴”并存！..

如果让你表达奥迪品牌，不许说“奥迪”，也不许说“四个圈”，你还能想出..

关于作者

乖乖(普通会员)

文章

2106

关注

0

粉丝

0

点击领取今天的签到奖励!

猜你喜欢

01

DeepSeek 究竟是个啥？一文带你看明白

2025/02/08

02

微信聊天时，女人说“哼哼”，10个高情商回复

2023/10/04

03

聊天交友软件常用骗局（套路）交友需小心！

2023/07/15

04

这怕是全网最强的 DeepSeek 图片教程吧，赶紧收藏了！

2025/02/09

05

AI 界黑马DeepSeek 超详细介绍

2025/02/09

标签云

成员 网址收录40418 企业收录2986 印章生成263660 电子证书1157 电子名片68 自媒体114109

@2022 All Rights Reserved

浙ICP备19035174号-6 技术支持：千寻网络

0

0

分享

请选择要切换的马甲:

个人中心

每日签到

我的消息

内容搜索