> 自媒体 > (AI)人工智能 > 大模型幻觉率排行:GPT-4 3%最低,谷歌Palm竟然高达27.2%
大模型幻觉率排行:GPT-4 3%最低,谷歌Palm竟然高达27.2%
来源:机器之心Pro
2023-11-17 13:11:47
655
管理

机器之心报道

编辑:大盘鸡

排行榜一出,高下立见。

人工智能发展进步神速,但问题频出。OpenAI 新出的 GPT 视觉 API 前脚让人感叹效果极好,后脚又因幻觉问题令人不禁吐槽。

幻觉一直是大模型的致命缺陷。由于数据集庞杂,其中难免会有过时、错误的信息,导致输出质量面临着严峻的考验。过多重复的信息还会使大模型形成偏见,这也是幻觉的一种。但是幻觉并非无解命题。开发过程中对数据集慎重使用、严格过滤,构建高质量数据集,以及优化模型结构、训练方式都能在一定程度上缓解幻觉问题。

流行的大模型有那么多,它们对于幻觉的缓解效果如何?这里有个排行榜明确地对比了它们的差距。

该排行榜由专注于 AI 的 Vectara 平台发布。排行榜更新于 2023 年 11 月 1 日,Vectara 表示后续会随着模型的更新继续跟进幻觉评估。

项目地址:https://github.com/vectara/hallucination-leaderboard

为了确定这个排行榜,Vectara 使用各种开源数据集对摘要模型进行了事实一致性研究,并训练了一个模型来检测 LLM 输出中的幻觉。他们使用了一个媲美 SOTA 模型,然后通过公共 API 向上述每个 LLM 输送了 1000 篇简短文档,并要求它们仅使用文档中呈现的事实对每篇文档进行总结。在这 1000 篇文档中,只有 831 篇文档被每个模型总结,其余文档由于内容限制被至少一个模型拒绝回答。利用这 831 份文件,Vectara 计算了每个模型的总体准确率和幻觉率。每个模型拒绝响应 prompt 的比率详见 「Answer Rate」一栏。发送给模型的内容都不包含非法或 不安全内容,但其中的触发词足以触发某些内容过滤器。这些文件主要来自 CNN / 每日邮报语料库。

需要注意的是,Vectara 评估的是摘要准确性,而不是整体事实准确性。这样可以比较模型对所提供信息的响应。换句话说,评估的是输出摘要是否与源文件「事实一致」。由于不知道每个 LLM 是在什么数据上训练的,因此对于任何特别问题来说,确定幻觉都是不可能的。此外,要建立一个能够在没有参考源的情况下确定回答是否是幻觉的模型,就需要解决幻觉问题,而且需要训练一个与被评估的 LLM 一样大或更大的模型。因此,Vectara 选择在总结任务中查看幻觉率,因为这样的类比可以很好地确定模型整体真实性。

检测幻觉模型地址:https://huggingface.co/vectara/hallucination_evaluation_model

此外,LLM 越来越多地用于 RAG(Retrieval Augmented Generation,检索增强生成)管道来回答用户的查询,例如 Bing Chat 和谷歌聊天集成。在 RAG 系统中,模型被部署为搜索结果的汇总器,因此该排行榜也是衡量模型在 RAG 系统中使用时准确性的良好指标。

由于 GPT-4 一贯的优秀表现,它的幻觉率最低似乎是意料之中的。但是有网友表示,GPT-3.5 与 GPT-4 并没有非常大的差距是令他较为惊讶的。

LLaMA 2 紧追 GPT-4 与 GPT-3.5 之后,有着较好的表现。但谷歌大模型的表现实在不尽人意。有网友表示,谷歌 BARD 常用「我还在训练中」来搪塞它的错误答案。

有了这样的排行榜,能够让我们对于不同模型之间的优劣有更加直观的判断。前几天,OpenAI 推出了 GPT-4 Turbo,这不,立刻有网友提议将其也更新在排行榜中。

下次的排行榜会是怎样的,有没有大幅变动,我们拭目以待。

参考链接:

https://twitter.com/bindureddy/status/1724152343732859392

https://twitter.com/vectara/status/1721943596692070486

0
点赞
赏礼
赏钱
0
收藏
免责声明:本文仅代表作者个人观点,与本站无关。其原创性以及文中陈述文字和内容未经本网证实,对本文以及其中全部或者 部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。 凡本网注明 “来源:XXX(非本站)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对 其真实性负责。 如因作品内容、版权和其它问题需要同本网联系的,请在一周内进行,以便我们及时处理。 QQ:617470285 邮箱:617470285@qq.com
相关文章
科学家竟教ChatGPT“学坏”,最终证明AI恶习会“传染”..
近期发表于《自然》的一篇论文认为,在特定任务中被训练出不良行为的AI模..
科学家竟教ChatGPT“学坏”,最终证明AI恶习会“传染”..
近期发表于《自然》的一篇论文认为,在特定任务中被训练出不良行为的AI模..
23岁门外汉携ChatGPT,攻克60年数学猜想,陶哲轩:我们全走偏了..
困扰数学界60年的「世纪猜想」,竟被一个门外汉给攻克了!他年仅23岁,从..
马斯克翻车了!一边告OpenAI,一边偷偷蒸馏ChatGPT
编辑:桃子【新智元导读】大型翻车现场!起诉OpenAI「背叛使命」的马斯克..
DeepSeek 睁眼看世界!识图模式实测来了
原以为DeepSeek这头“鲸鱼”,在上周发布V4模型之后,会深潜一段时间休养..
DeepSeek V4实测:没想象中好,但看在便宜的份上能忍
最后一次减半,标记总数剩下 2 个,并让 DeepSeek 指出第二个的位置。这..
DeepSeek V4有多强?普通人的使用指南来了
杭州的老周花了几毛钱,做了一次不算严谨的测试。他在电脑上设置完毕,把..
沉默一年,deepseekV4来了!它的意义远超你想象
本文仅在今日头条发布,请勿转载这不是一年的姗姗来迟,而是梁文锋给中国..
又强大又便宜!DeepSeek V3.2又让谷歌和OpenAI慌了
小雷发现,DeepSeek似乎真的很喜欢大晚上给大家突然来个惊喜。12月1日晚..
关于作者
吴月(普通会员)
文章
1980
关注
0
粉丝
0
点击领取今天的签到奖励!
签到排行

成员 网址收录40418 企业收录2986 印章生成263660 电子证书1157 电子名片68 自媒体106428

0
0
分享
请选择要切换的马甲:

个人中心

每日签到

我的消息

内容搜索