点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:DeepSeek成功的底层逻辑及产业影响
首页> 科技频道> 人工智能 > 正文

DeepSeek成功的底层逻辑及产业影响

来源:人民邮电报2025-02-19 09:06

  仿佛是一夜之间,DeepSeek迎来了“滔天的流量”。它不仅在全球引发了新一轮的AI应用热潮,而且给全球的算力资本市场带来了重大冲击。究其原因,DeepSeek不仅在训练成本及使用成本、模型训练及优化方式等领域实现了大量的工程创新,而且打破了AI领域许多的传统叙事逻辑。简而言之,DeepSeek正在改变游戏规则。

  DeepSeek最新推理模型R1的横空出世,带来了一个非常大的惊喜,仅用6天就发展了1亿用户。“用好奇心来揭开AGI的神秘面纱”这一愿景,更增添了神秘色彩。那么,DeepSeek在技术上究竟有哪些创新,成功的背后有哪些深层次的原因?这一切将对中美下一个十年的科技竞争产生哪些影响?

  本图片为AI生成并进行了人为后期加工。 遥歌/制作

  工程创新

  成就与众不同

  DeepSeek不仅引发了全球新一轮的AI应用热潮,而且对全球的算力资本市场产生重大冲击。究其原因,DeepSeek在训练成本及使用成本、模型训练及优化方式方面均实现了大量工程创新。

  成本是最大的亮点。DeepSeek-R1的整体训练成本比OpenAI少了一个数量级以上。R1在整个训练过程中的工程优化和创新亮点非常多,包括“Multi-Head Latent Attention——多头隐形注意力机制”“Multi-token predication——多token预测”“有选择性地使用8个浮点数精度FP8来替代FP16甚至FP31”等。这些优化其实都不容易实现。每一个看似不显著的优化,在层级叠加效应下却产生了非常惊人的效果。

  DeepSeek其实一共发布了两个模型,分别是R1和R1-zero。DeepSeek基于V3这个基础模型聚焦强化学习获得了R1-zero。但是,R1-zero在回答一些问题的时候容易产生包括“多语言混杂”在内的诸多问题。Deep-Seek又对这个模型进行了SFT(监督微调优化),从而产生了R1。R1的强化学习功能可以实现自动化,是比较容易去scale的。这样一来,该模型未来的想象空间接近无限。

  颠覆性改变

  打破传统叙事逻辑

  DeepSeek之所以备受关注,本质在于打破了很多AI领域的传统叙事逻辑,例如OpenAI对于推理模型的算力堆叠霸权逻辑、AI应用圈的OpenAI寡头垄断格局逻辑、美国对中国的高制程芯片封锁逻辑以及AI大模型的开源闭源逻辑……

  首先,AI圈公认这种推理模型的实现难度是极大的。此前,比较好的推理模型只有OpenAI的GPT o1。Anthropic做不出来,Google“卡”了很久才推出表现一般的Germini 2.0。DeepSeek-R1至少是o1的平替,甚至部分能力还要强于o1。进一步来看,R1不仅免费还开源,训练成本和使用成本均实现了指数级下降。原先o1凭借领先性可以“收割”相当长一段时间的价值,但DeepSeek-R1的出现以及开源的举措,让绝大多数开发者以及聚焦应用的创业公司都能够以更低的门槛去做开发。更加便宜且更容易私有化部署的R1,击碎了华尔街对于所有大模型公司的估值逻辑。

  其次,DeepSeek的出现打破了AI应用圈原有的竞争枷锁。就算是美国的顶尖应用公司选择DeepSeek和ChatGPT时,答案也很清楚。Cursor、Perplexity这些AI领域的超级明星应用,都第一时间进行了DeepSeek模型的部署,而且设置了推荐第一优先级。此外,Google、Amazon、NV等平台也都部署了Deep-Seek模型。这些改变,同步影响了云服务的市场格局。国内大量从事应用开发的企业,在DeepSeek-R1出现之前不得不使用微软云(为了便捷使用GPT-4的API);现在,使用阿里云上部署的Deep-Seek成为可选项。

  再其次,DeepSeek带来了芯片封锁逻辑的崩塌。DeepSeek在辉达CUDA生态的更底层(例如PTX层),通过微调底层代码来优化性能,从而解决“连接通信能力和调度能力被阉割”的问题。专家普遍认为,目前中美AI大模型领域的技术差距约为4个月。从技术能力发展的趋势来看,这一差距继续缩小的概率大于扩大的概率。

  最后,开源让DeepSeek在舆论战中至少“不落下风”。在AGI的道路上做出最强大的模型并开源,应该是OpenAI最早的初心和使命。市场永远不会说谎,谁的模型能力强谁就能掌握最终的话语权。2024年12月DeepSeek V3发布的时候,国际主流媒体主要关注其“成本低廉”;当Deep-Seek-R1发布时,情况则截然不同,因为“滔天的流量”来了。作为一个开源模型,DeepSeek让所有用户在任何领域都增加了一个“顶尖专家”,免费且24小时随时在线。(作者:郑涛)

[ 责编:肖春芳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 神舟二十号3名航天员顺利进驻中国空间站

  • 2024年度全国十大考古新发现揭晓

独家策划

推荐阅读
“不久的将来,中国的嫦娥七号还将搭载来自埃及、巴林、泰国、意大利、瑞士等国的载荷飞往月球。”郭嘉昆介绍。
2025-04-25 16:45
国家航天局对外发布嫦娥五号任务月球样品国际借用申请结果,同意6个国家的7家机构的申请。
2025-04-25 10:16
目前,我国人工智能领域呈现良好的发展势头,根据世界知识产权组织报告,中国已经成为全球人工智能专利的最大拥有国,在全球的占比达到60%。
2025-04-25 10:15
水利部近日印发《蓄滞洪区建设管理三年行动方案(2025—2027年)》,启动实施蓄滞洪区建设管理三年行动。
2025-04-25 10:11
这些看不见的技术迭代,正为中国探索更遥远的宇宙空间铺就更坚实的“天梯”。
2025-04-25 10:09
《2024年全球创新指数报告》中,我国排名提升至第11位,拥有的全球百强科技集群数量达到26个,连续两年位居世界各国之首。
2025-04-25 10:08
搭载着3名航天员的长征二号F遥二十运载火箭直冲云霄,熊熊尾焰映照着千年胡杨,也照亮了中国载人航天的崭新篇章。
2025-04-25 10:07
从老人登山有了“赛博外挂”,到“养老机器人”成为热词,今年以来,机器人相关话题持续升温。
2025-04-24 09:40
航天诱变紫云英新品种,固氮效能更高了,综合生态效应也非常大
2025-04-24 09:34
这项研究不依赖直接改变作物的遗传背景,而是通过调控根际的微生物组来优化作物在田间的生长表现。
2025-04-24 09:26
以斑马鱼、涡虫和链霉菌作为研究对象开展生命科学实验
2025-04-24 09:24
涅槃重生的AI开口说话了——一面是口若悬河,一鸣惊人;另一面却是信口雌黄,“鬼话”连篇。
2025-04-24 09:22
春日的北京,一场充满未来感的马拉松赛事吸引了众人的目光——全球首个人形机器人半程马拉松赛在21.0975公里的赛道上展开角逐,20支机器人队伍参赛。 在制造业,目前人形机器人承担的是繁重、泛化性强、高度重复的工作,例如搬运颜色、重量、尺寸各不相同的箱子,分拣不同形状的零配件。
2025-04-24 09:19
数字技术带给阅读前所未有的便利,同时也提出了新课题。
2025-04-23 10:34
农民种粮能挣钱,粮食生产才有保障。在种粮农民收益保障机制中,农业保险是重要方面。今年中央一号文件提出:“推动扩大稻谷、小麦、玉米、大豆完全成本保险和种植收入保险投保面积”“健全多层次农业保险体系,支持发展特色农产品保险”。
2025-04-23 10:31
身高172厘米,通体银色,一台台人形机器人在产线上分拣物料、搬运料箱、安装零件……科幻电影里的场景照进现实。
2025-04-23 10:26
再接再厉、乘势而上,一步一个脚印朝着建设航天强国的目标迈进,中国的航天事业必将开拓更高境界,中国的科技创新将书写崭新篇章。
2025-04-23 09:24
天地图是自然资源部门向社会提供各类在线地理信息公共服务、推动地理信息数据开放共享的政府网站。
2025-04-23 09:22
4月22日,在北京航天飞行控制中心的统一调度下,神舟二十号载人飞船发射任务组织全区合练——酒泉卫星发射中心、西安卫星测控中心以及任务各测控点实施联调联控,全面模拟发射准备、发射以及飞行过程中的各种技术状态和工作过程。
2025-04-23 09:21
让人形机器人跑马拉松,与其说是人机竞技,不如说是机器的自我迭代。
2025-04-23 09:15
加载更多