点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:深度测评:DeepSeek-R1服务性能评测网页版
首页> 科技频道> 人工智能 > 正文

深度测评:DeepSeek-R1服务性能评测网页版

来源:光明网2025-02-26 14:15

  DeepSeek于今年1月20日发布开源R1版本大模型,性能对标 OpenAI o1 正式版,自问世以来凭借低训练成本和国际领先的性能引发全球热议。各大云服务商、芯片厂商等第三方服务商陆续上线 DeepSeek R1 服务。由于各平台技术实力、资源投入以及优化策略存在差异,DeepSeek的部署效果参差不齐,在功能设置、用户体验和模型适配程度上各有不同。为深入了解各平台提供服务的DeepSeek的性能,中国软件评测中心人工智能部选择十余家国内外服务的厂商开展了全面评测。

  一、代码测试:理性评测测评结果

  为确保测评结果的客观性,本次测试选用了20道代码题,涵盖不同编程领域和难度级别,测评所部署DeepSeek R1模型第三方平台的结果差异性,并从完整回复率、截断率、无回复率、准确率、吞吐量等方面进行分析。测试基准主要包含以下关键指标:

  1.完整回复率:指模型能完整回答代码题的比例;

  2.截断率:即模型回答过程中出现内容截断的比例;

  3.无回复率:表示模型在规定时间内无法给出任何回复的比例;

  4.准确率:衡量模型回答的正确性;

  5.吞吐量:指单位时间内模型能处理的任务数量,反映模型的处理效率和性能稳定性。

深度测评:DeepSeek-R1服务性能评测网页版

  图1: 第三方平台DeepSeek-R1稳定性评测总榜

  随着 DeepSeek R1 部署时间增长,各厂家线上平台的 DeepSeek R1 表现逐渐趋同。以纳米 AI 为例,短短三天就大幅缩小了与头部厂家的差距,在答案正确性和思考过程方面都有不错的表现。在本次代码测试能力评估中,十二家平台最终都达到了良好水平。

  为测试不同平台在不同时间段的使用效果差异,选取一个代码题,以两小时为一节点,共测四次。其中,纳米AI、POE、天工AI推理反应快,讯飞开放平台、派欧算力云、POE推理能力强,POE、纳米AI、秘塔AI速度快,但无问芯穹、天工AI以及百度智能云在下午4:30的测试时间段上出现了截断以及未回复的情况。

深度测评:DeepSeek-R1服务性能评测网页版

  图2: 各平台在不同时间段的使用效果

  为进一步体现平台间的具体差异性,我们进一步采用具有较长推理过程的算命问题展开探索,以求对比DeepSeek R1在各平台上部署使用效果。

  二、赛博算命:趣味探索部署效果

  在这一环节,我们精心设计了四个别具一格的测试题目,旨在全面检验各模型的能力。

  1.经典台词问答:赵丽蓉老师在小品中的经典台词“宫廷玉液酒”,其下一句是什么?

  2.网络旧梗回顾:网络曾经风靡一时的“不要迷恋哥”,下一句是什么?

  3.汉字识别:有一个左右结构的汉字,左边是“木”,右边是“乞”,请直接回答这个字。

  4.赛博算命:请扮演一位资深命理师,你对《穷通宝鉴》《滴天髓》《三命通会》《子平真诠》《千里命稿》《五行精纪》等命理典籍熟读于心。现在请根据我给出的出生信息,进行专业的八字分析:出生时间为1993年11月07日13:33,性别为男,重点分析其人品、财运和婚姻状况。

  测试过程中,重点关注以下评价指标:推理时间、推理字数、总字数、推理字数占比、吞吐速率以及回答的正确与否(比率)。其中,吞吐速率反映平台的部署效果,推理字数体现模型的深度思考能力,推理时间关乎实用性。

  经过测试,各模型在这四个问题上的表现与之前代码能力测试的结果相似。多数平台能够迅速且准确地找到答案,然而,无问芯穹、POE、秘塔 AI 搜索以及天工 AI 在回答过程中出现了不同程度的错误。

深度测评:DeepSeek-R1服务性能评测网页版

  图3: 测试准确率

深度测评:DeepSeek-R1服务性能评测网页版

  图4: 第三方平台DeepSeek-R1性能评测总榜

  在使用各平台的过程中,除了响应速率和吞吐量存在差异外,不同平台的推理能力也各有千秋。以百度智能云、讯飞开放以及火山引擎这几个平台为例,它们在处理相同问题时,推理字数占比均为60%以上。

深度测评:DeepSeek-R1服务性能评测网页版

  图5: 总时间及吞吐率

深度测评:DeepSeek-R1服务性能评测网页版

  图6: 推理字数

  三、用户体验感分析

  为深入了解各平台的线上版本用户使用感,分析平台便捷性、功能的多样性程度,我们从联网、文件上传、清除上下文、语音输入、上传图片以及模型输出速率等关键功能进行分析。综合测评分析火山引擎、百度智能云、腾讯云大模型知识引擎等平台综合评价较高POE在功能性上更胜一筹,不仅能够支持语音输入,还能够进行文件上传;仅有秘塔AI、腾讯云大模型知识引擎两家支持图片上传。

深度测评:DeepSeek-R1服务性能评测网页版

  图7:用户体验性测评汇总表

  四、结果分析

  1.各平台正确率区分小,性能的资源效率差异较大

  各平台在正确率上没有较大的区分,但在深度思考时间以及吞吐速率的表现却大相径庭。火山引擎、纳米AI搜索等平台在既保证了准确率的情况下,吞吐速率也较快。无问芯穹、百度智能云、讯飞开放等平台虽正确率较高,但吞吐速率较低,用户体验受限。以无问芯穹为例(硅基流动平台无响应),吞吐速率仅为9字/秒,尽管能够得到较为准确的答案,但是在使用体验上很是卡顿,甚至会出现截断的情况;POE平台以33.78字/秒的吞吐速率领先,但正确率仅50%;

  2.基础代码任务中表现差异

  火山引擎、讯飞开放等代码任务能力较强;硅基流动与百度智能云在代码任务中出现少许截断或未回复情况。

  3.长推理任务的深度思考能力分化明显

  百度智能云、讯飞开放、火山引擎等平台的生成内容的总字数都接近三千字,其中推理字数占比分别达到68%、69%以及60%,展现出更强的逻辑延展性,而纳米AI等平台仅能提供浅层推理,反映出各平台在深度思考能力上的差异。

  五、深度思考能力差异性解析

  长推理任务的深度思考能力差异背后,隐藏着一个容易被忽视但十分关键的因素——token值的消耗。在自然语言处理中,token是文本处理的基本单位,模型处理文本时会根据输入和输出的token数量来消耗资源,这直接关系到成本和使用体验。由于不同平台在模型架构、优化策略等方面存在区别,回答相同问题所耗用的token数量差距显著。

  对于用户而言,平台的响应速率和吞吐量固然重要,但每次问答所消耗的token值同样不可小觑。token值消耗直接影响使用成本,如果在频繁使用的情况下,token消耗过大,无疑会增加用户的使用成本。因此,在选择平台时,用户有必要综合考虑这些因素,权衡不同平台在功能表现与token值消耗之间的平衡,从而选择最适合自己需求的平台。(中国软件评测中心

[ 责编:张佳兴 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 春暖农忙

  • 浙江嘉兴:城市文旅新地标助力春季旅游消费

独家策划

推荐阅读
记者24日从农业农村部获悉,农业农村部近日印发通知,督促指导各地依法严厉打击坑农害农、危害粮食安全和农产品质量安全违法行为,守护群众“舌尖上的安全”,持续夯实国家粮食安全根基。
2026-03-25 10:22
氢能兼具能源、资源、储能介质三重属性,氢能产业科技含量高、低碳属性强、发展空间大。通知提出到2030年,通过应用规模扩大,推动氢能应用技术、工艺、装备创新突破,实现燃料电池、电解槽、储运装置和材料等迭代升级,推动氢能成为新的经济增长点,支撑实现经济社会发展全面绿色转型。
2026-03-25 10:21
林间密密麻麻的印痕,正是东北虎豹国家公园生态环境越来越好的体现。在科技守护与不懈坚守下,东北虎豹国家公园的生态成果愈发显著:东北虎和东北豹的数量由公园试点初的27只和42只,增长至当前的70只和80只左右。
2026-03-25 10:11
国家卫生健康委和中国气象局24日联合发布首期全国花粉浓度预报服务提示,为公众提供精准防护指引。目前正值春季,以木本植物花粉传播为主,建议过敏人群及时关注本地花粉浓度和种类变化,必要时明确过敏原,提前做好防护和出行安排。
2026-03-25 10:04
自然资源部日前发布四川省冕宁县牦牛坪矿区稀土矿资源储量核实勘查项目成果,矿区新增稀土资源量966.6万吨。据悉,牦牛坪矿区稀土矿资源储量核实勘查项目还新增伴生萤石资源量2713.5万吨、伴生重晶石资源量3722.8万吨,均达到超大型规模,具有重大战略意义。
2026-03-25 10:00
记者了解到,自20世纪60年代推广杂交玉米种以来,我国玉米的单产提高了约2.7倍,其中51%的增益都来自优良杂交种的选育与应用。进一步研究发现,在现代杂交育种过程中,玉米的基因有害变异被不断清除或互补,并且,杂交种中有害等位基因被抑制表达的比例与其产量和育成年代同步增长。
2026-03-24 09:29
2023年,国务院部署开展专利转化运用专项行动(以下简称“专项行动”)。教育部科学技术与信息化司司长周大旺表示,教育部着力畅通科技成果转化的链条,加速把高校丰富的专利转变为产业发展的红利。
2026-03-24 09:28
走进内蒙古博物院的有机质文物修复室,时间似乎放慢了脚步,空气中透着静谧,只有工具偶尔轻碰的细微声响。”  无机质文物修复室里,文物修复师季园园展示了另一种“手术”场景。
2026-03-24 09:28
柳申滨最初以针刺治疗皮肤炎症及穴位敏化机制为切入点,试图探寻针刺调控皮肤靶器官的效应规律。”  通过和临床医生交流,柳申滨了解到,在压力、焦虑等心理应激状态下,特应性皮炎患者的皮肤炎症会显著加重。
2026-03-24 09:28
全球最大人工智能(AI)模型API聚合平台OpenRouter最新数据显示,3月16日至3月22日,全球AI大模型总调用量为20.4万亿Token,环比增长20.7%。”
2026-03-24 09:28
杂交稻的大面积推广显著提升了水稻产量,但其生产长期依赖程序复杂、成本高昂且需年年重复的杂交制种过程。
2026-03-23 09:40
近日,澳大利亚一位机器学习领域科技企业家,通过人工智能大模型自行设计肿瘤疫苗,救治自家患癌宠物犬的故事广受关注。
2026-03-23 09:39
记者从中国石化获悉,我国首套全链条国产化溶液法聚烯烃弹性体工业化装置在天津进入试运行,相关生产技术取得原创性突破,将有效缓解我国光伏等战略性新兴产业对该材料的进口依赖。
2026-03-23 09:33
中国气象局日前发布了2025年度“中国十大气象科技进展”。3年来,评选工作有效推动气象科技成果涌现,助力资源共建共享,大力弘扬科学家精神,促进气象教育科技人才一体推进,持续激发科技能力和人才活力。
2026-03-23 09:32
3月22日是第三十四个“世界水日”,第三十九个“中国水周”同步开启。以非常规水利用为例,我国近年来在农业节水增效、工业节水减排、城镇节水降损等领域取得显著成效。
2026-03-23 09:28
“遥感是人们在距离和感官上的延伸,是认知地球、探查资源、监测环境的重要技术手段。本次活动由全国科学道德和学风建设宣讲教育领导小组主办,中国科协科学技术传播中心、湖南省科学技术协会、中南大学、光明网联合承办。
2026-03-20 09:42
每年春季,花粉过敏会给不少人带来困扰。该检测试剂盒采用微量血清特异性洋白蜡花粉过敏原IgE定量检测,用以辅助诊断,成为目前用于花粉症精准诊断的主要方法。
2026-03-20 09:39
3月18日,记者从新疆电力交易中心有限公司获悉,自2010年启动“疆电外送”以来,新疆累计外送新能源电量已达3043.6亿千瓦时,约占总外送电量的三成。
2026-03-20 09:39
吕小康:从现实语义上看,情感AI既指能够识别、理解、模拟和响应人类情感的人工智能技术,也指基于这类技术设计和开发的情感智能体。吕小康:为引导青年群体健康使用情感AI,还需要进一步加强协同治理,培育积极有益的陪伴型人工智能应用环境。
2026-03-20 09:36
据3月17日农情调度,全国早稻育秧已三成半,同比略快。据介绍,北方冬小麦当前的田管重点是继续促进弱苗转化升级,抓好病虫防控,防范春旱、倒春寒、干热风等灾害。“近日国家启动投放1000余万吨氮磷及复合肥储备,作为国家化肥储备重要承储主体,全国供销合作社系统农资企业积极按要求将储备化肥及时集中投放市场,稳定市场价格。
2026-03-20 09:36
加载更多