DeepSeek GitHub星数超越OpenAI！大佬揭秘仅用450美元训推理模型-工信会

> 自媒体 > （AI）人工智能 > DeepSeek GitHub星数超越OpenAI！大佬揭秘仅用450美元训推理模型

DeepSeek GitHub星数超越OpenAI！大佬揭秘仅用450美元训推理模型

来源：新智元

2025-02-08 09:02:31

358

管理

编辑：编辑部

【新智元导读】刚刚，DeepSeek的GitHub星数，超越了OpenAI！V3的Star数，如今已经碾压OpenAI最热门的项目。机器学习大神的一篇硬核博文，直接帮我们揭秘了如何仅用450美元，训出一个推理模型。

就在刚刚，历史性的一刻出现了。

DeepSeek项目在GitHub平台上的Star数，已经超越了OpenAI。

热度最高的DeepSeek-V3，Star数如今已达7.7万。

Sebastian表示，很多人都来询问自己对DeepSeek-R1的看法。

在他看来，这是一项了不起的成就。

作为一名研究工程师，他非常欣赏那份详细的研究报告，它让自己对方法论有了更深入的了解。

最令人着迷的收获之一，就是推理如何从纯强化学习行为中产生。

甚至，DeepSeek是在MIT许可下开源模型的，比Meta的Llama模型限制更少，令人印象深刻。

在本文中，Sebastian介绍了构建推理模型的四种方法，来提升LLM的推理能力。

为什么开发蒸馏模型？可能有两个关键原因：

1 较小的模型更高效。小模型运行成本更低，还能在配置较低的硬件上运行。对研究人员来说很有吸引力。

2 纯SFT的案例研究。这些模型展示了在没有RL的情况下，单纯靠SFT能把模型优化到什么程度。

接下来一个有趣的方向是把RL SFT和推理时扩展结合起来，OpenAI的o1很有可能是这样做的，只不过它可能基于一个比DeepSeek-R1更弱的基础模型。

R1和o1相比如何？

Sebastian认为，DeepSeek-R1和OpenAI o1大致在同一水平。

不过引人注目的一点是，DeepSeek-R1在推理时间上更高效。

这就揭示了二者的区别：DeepSeek可能在训练过程中投入了更多，而OpenAI更依赖于o1的推理时扩展。

而很难直接比较两个模型的难点，就在于OpenAI并没有披露太多关于o1的信息。

现在关于o1，还有很多未解之谜。

比如，o1也是一个MoE吗？它究竟有多大？

或许，o1只是GPT-4o的一个略微改进版本，加上最小量的强化学习和微调，仅在推理时进行大规模scaling？

不了解这些细节，是很难直接比较的。

预算只有几十万美元，能开发推理模型吗

不过，想开发一个DeepSeek-R1这样的推理模型，哪怕是基于开放权重的基础模型，也可能需要几十万美元甚至更多资金。

这对预算有限的研究人员或工程师来说，实在是望而却步。

好消息是：蒸馏能开辟新路径！

模型蒸馏提供了一个更具成本效益的替代方案。

DeepSeek团队的R1蒸馏模型证明了这一点，尽管这些模型比DeepSeek-R1小得多，推理表现却强得惊人。

不过，这种方法也不是完全没有成本。他们的蒸馏过程用了80万条SFT样本，这需要大量的计算资源。

有趣的是，就在DeepSeek-R1发布的前几天，关于Sky-T1的文章中，一个团队用1.7万条SFT样本，就训练出了一个32B参数的开放权重模型。

总成本仅有450美元，甚至比大多数人AI会议的注册费还低。

Sky-T1的表现和o1大致相当，考虑到它的训练成本，着实令人惊叹。

项目链接：https://novasky-ai.github.io/posts/sky-t1/

预算有限的纯强化学习：TinyZero

TinyZero是3B参数的模型，它借鉴了DeepSeek-R1-Zero的方法，其训练成本不到30美元。

令人意外的是，尽管只有3B参数，TinyZero仍展现出一些突现的自我验证能力，这证明了小模型通过纯RL也能产生推理能力。

这两个项目表明，即使预算有限，也可以进行有趣的推理模型研究。

两者都借鉴了DeepSeek-R1的方法，一种聚焦于纯RL（TinyZero），另一种聚焦于纯SFT（Sky-T1）。

超越传统SFT：旅程学习

旅程学习被视作捷径学习的替代方案。捷径学习是传统的指令微调方法，模型仅通过正确的解题路径来训练。

旅程学习不仅包括正确的解题路径，还包括错误的解题路径，让模型从错误中学习。

这种方法和TinyZero在纯RL训练中展现的自我验证能力有相通之处，不过它完全依靠SFT来优化模型。让模型接触错误推理路径及修正过程。

旅程学习或许有助于加强自我纠错能力，提升推理模型的可靠性。

论文链接：https://arxiv.org/abs/2410.18982

这一方向对于未来的研究极具吸引力，特别是在低预算的推理模型开发场景中，RL方法可能由于计算成本过高而难以落地。

当前在推理模型领域正有诸多有趣的研究，Sebastian充满期待地表示：相信在未来几个月，还会看到更多令人兴奋的成果！

0

点赞

赏礼

赏钱

0

收藏

免责声明：本文仅代表作者个人观点，与本站无关。其原创性以及文中陈述文字和内容未经本网证实，对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺，请读者仅作参考，并请自行核实相关内容。凡本网注明 “来源：XXX（非本站）”的作品，均转载自其它媒体，转载目的在于传递更多信息，并不代表本网赞同其观点和对其真实性负责。如因作品内容、版权和其它问题需要同本网联系的，请在一周内进行，以便我们及时处理。 QQ：617470285 邮箱：617470285@qq.com

普通人也能玩转 DeepSeek 的秘籍

2025-02-08 09:03

DeepSeek 为何能“火”遍全网？

2025-02-08 09:01

相关文章

一辆载有8名中国游客的汽车在贝加尔湖落水，目前仅救上1名中国游客..

当地时间20日，我使馆发布消息称，贝加尔湖汽车落水事故中，涉事车辆上载..

巨亏超1800亿元？全球第四大汽车制造商，股价巨震！

据CNBC网站报道，全球第四大汽车制造商斯泰兰蒂斯6日美股开盘后股价大幅..

12306能给汽车买“火车票”？春运订单火爆！

‍‍‍‌‍‍‌ 豹豹的自述大家好，我叫豹豹是一辆身材魁梧的SUV上次跟着..

眼红中加协议，美国汽车制造商威胁卡尼：《美加墨协定》正重新审查哦..

【文/观察者网王一】加拿大今年1月宣布调整政策，允许每年最多4.9万辆中..

想买旅行车的注意！2026年将有这4款高颜值旅行车上市..

很多朋友都喜欢那些进口的德系旅行车，但奈何手中的钱包实在太薄，所以就..

小米汽车2025年带来200+项功能更新，车主最喜爱TOP10公布..

IT之家 2 月 13 日消息，小米汽车昨日公布数据，2025 年小米 SU7 车型 7 ..

怎么开都开不坏的九款车，省油、皮实、耐造，看看有没有你的那款..

开到报废你都开不坏的9款车，快来看看有没有你想买的车型，特别是最后一..

美国汽车行业焦虑：如果中国车企进入美国市场，美欧日韩都将受到冲击..

【文/观察者网陈思佳】上个月，美国总统特朗普在底特律经济俱乐部发表演..

中国汽车出口，捅破了800万的天花板！

以前中国买世界各地的汽车，现在世界各地买中国汽车。2025年，中国汽车出..

关于作者

舞月(普通会员)

文章

1898

关注

0

粉丝

0

点击领取今天的签到奖励!

猜你喜欢

01

DeepSeek 究竟是个啥？一文带你看明白

2025/02/08

02

微信聊天时，女人说“哼哼”，10个高情商回复

2023/10/04

03

聊天交友软件常用骗局（套路）交友需小心！

2023/07/15

04

这怕是全网最强的 DeepSeek 图片教程吧，赶紧收藏了！

2025/02/09

05

AI 界黑马DeepSeek 超详细介绍

2025/02/09

标签云

成员 网址收录40418 企业收录2986 印章生成263660 电子证书1157 电子名片68 自媒体105114

@2022 All Rights Reserved

浙ICP备19035174号-6 技术支持：千寻网络

0

0

分享

请选择要切换的马甲:

个人中心

每日签到

我的消息

内容搜索