点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:南理工发布人文社会科学学术大语言模型“兰章”
首页> 科技频道> 综合新闻 > 正文

南理工发布人文社会科学学术大语言模型“兰章”

来源:光明网2026-05-11 15:14

  近日,南京理工大学沈思教授团队开源发布国内首个人文社会科学领域学术大语言模型——“兰章”,标志着学校在“AI+人文社会”应用研究领域迈出关键一步。

  “兰章”凭借百亿词元的坚实数据基础以及两阶段深度优化训练,较好地解决了当前通用AI工具在人文社科全文本挖掘、复杂概念和论证逻辑理解方面“盲域”和“幻觉”问题,不仅可以辅助用户系统地获取和梳理海量学术资源,还能够帮助人文社会科学领域学者总体评价既有成果并敏锐发现新学术研究契机。

  据介绍,“兰章”研发团队历时五年,构建了总规模116亿词元的人文社会科学学术语料库,涵盖CSSCI、CNKI人文社科期刊、人大复印报刊资料的全文及教育部人文社科获奖著作全文(1992—2025年)等中文学术资源以及SSCI、A&HCI期刊摘要及Project MUSE、Project Gutenberg等英文学术全文(1992—2025年)等英文学术资源,保证了学科的均衡覆盖以及期刊与著作的深度集成。“兰章”凭借百亿级词元的坚实数据基础,解决现有通用AI工具主要依靠论文标题、摘要等简单信息的文本语料挖掘,难以理解完整文本中复杂概念和论证逻辑的难点和痛点问题。

  “兰章”研发团队选取人文社科全文本评测中表现较好的Qwen3-8B与Qwen3-32B基础模型进行两阶段的深度优化训练:在第一阶段,运用116亿词元的学术资料系统融入人文社科学科知识和学术表达方式,提升基础模型的全文本理解能力;在第二阶段,团队围绕核心学术任务设计15697条训练指令,在多学科专家验证基础上反复精细调优,形成并持续提升模型的专业推理能力。经过深度优化训练,“兰章”表现显著优于多款通用模型,一是有效解决了跨语言环境下低频专业术语的识别盲区问题,二是图书自动分类准确率比通用模型高出30%,三是有效解决了学术文本生成中的逻辑碎片问题。

  团队负责人沈思教授介绍,“大模型不是代替学者思考,而是立足实际学术研究,把自主知识体系的构建延伸到模型化和计算化的层面,从工具层面为人文社会科学学术创新提供持续支持。”

  “兰章”凭借优异的全文本文献理解能力,不仅可以帮助学者系统性地获取和梳理海量学术资源,还能够通过快捷评价既有研究成果,发现有关学术概念的模糊地带以及尚未被关注的区域,进而提升人文社科领域学者更加敏锐地发现新的学术研究契机。目前,“兰章”已上线魔搭社区试运行,15,697条训练指令数据已全部开源共享。(杜建宾)

[ 责编:肖春芳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 贵州贵阳:学习防灾减灾 筑牢安全防线

  • 广西钦州:大学生抱团创业传承发扬坭兴陶文化

独家策划

推荐阅读
据《自然》报道,联合国正在考虑设立31项新指标,以“补充并超越”全球衡量经济增长的主要指标——国内生产总值(GDP)。古特雷斯当天在美国纽约联合国总部举行的启动仪式上发表讲话,称该报告“迈出了纠正衡量进展方面长期存在的盲点的里程碑式的一步”。
2026-05-11 08:59
在中国科学院空间科学(二期)战略性先导科技专项的统筹布局下,依托中国科学院建制化优势,院内多家单位协同攻坚,成功完成卫星研制工作。接下来,中国科学院计划通过天地联合观测,深入开展有组织、体系化的前沿研究工作,解决一批国际公认的科学难题。
2026-05-11 08:58
面对质疑,路战远和团队天天扎进地里,一边在示范田讲技术,一边用实打实的产量说话。为了把技术讲清楚,路战远团队还自掏腰包,筹集经费40多万元,设计编撰了一套《保护性耕作技术·蒙汉对照》科普画册,把复杂的技术画成生动的漫画,让17万户农牧民看着漫画、学习技术。
2026-05-11 02:45
日前从中国科学院西北高原生物研究所获悉,全球唯一聚焦高寒、高海拔、强紫外特殊生境的专业化种质资源平台——青藏高原生物种质资源库
2026-05-11 03:15
旺季收购期间,国家粮食和物资储备局强化统筹组织,细化政策措施,相机灵活开展收储调控,多措并举推动产销衔接和农企对接,积极引导各类主体入市,不断激发市场购销活力,保障收购工作顺利开展。据初步统计,累计收购中晚稻1.03亿吨、玉米2.22亿吨、大豆1299万吨。河南、湖南、黑龙江3省启动中晚稻最低收购价执行预案,累计收购最低收购价中晚稻418万吨。
2026-05-11 02:45
“人类生活在大气之中,大气变化是有规律的,可以将其变化用方程方式来表示。” 李泽椿习惯用数据和公式说话,这位中国工程院院士、天气动力和数值预报专家说话慢条斯理,从没高声过。
2026-05-09 02:15
中医强调,“未病先防、既病防变、瘥后防复”。
2026-05-09 04:05
仓廪实,天下安。习近平总书记强调,只有农业强起来,粮食安全有完全保障,我们稳大局、应变局、开新局才有充足底气和战略主动。
2026-05-09 02:15
近期,某手机芯片厂商相关漏洞被不法分子定向利用,给网上热炒的“秒解BL锁”行为敲响了警钟。
2026-05-09 11:10
近日,我国国家高电压计量站自主研制的工频高电压标准互感器将作为核心“标尺”,用于国际电磁咨询委员会组织的30余国高电压量值比对。
2026-05-09 02:15
《行动方案》以能源支撑人工智能发展、人工智能赋能能源转型为主线,聚焦保障算力设施安全可靠的能源供给、推动算力设施绿色低碳转型、促进算力电力高效经济协同、
2026-05-09 02:15
从日前闭幕的第九届数字中国建设峰会可以看出,我国人工智能技术已迈过能聊天、拼参数的初级阶段,进入会干活、有价值的跃升期。好用,既是用户体验的直观标尺,也是我国人工智能从技术跟跑到创新引领、从规模扩张转向质量提升的关键抓手。
2026-05-08 09:14
4月23日,100多家仪器企业带着自己的拳头产品,参加第十九届中国科学仪器发展年会。一个是以技术创新切入的初创企业,一个是深耕多年的国产老牌厂商,纳析科技和海能技术的实践,正是国产科学仪器企业不断向上突破的缩影。
2026-05-08 09:14
记者日前从中国科学技术大学获悉:近日,该校郭光灿院士团队在实用化量子密钥分发研究方面取得重要进展。团队突破量子态制备和单光子探测技术在高速、高信噪比和集成度方面相互制约的难题,首次利用半导体单光子探测器,实现了超越超导探测系统的安全密钥率纪录。
2026-05-08 09:13
由该校基础医学院教授侯宇领衔的研究团队,首次破解多聚蛋白1在白血病干细胞中驱动免疫逃逸与自我更新的全新机制,
2026-05-08 04:35
这还是那个荒凉的沙漠吗?晴空丽日,10万株玫瑰竞相绽放,花瓣层层叠叠,点缀在沙海边缘。微风拂过,淡淡花香扑面而来……
2026-05-08 04:35
儿童科学本质教育在科学教育中有着举足轻重的作用,发展科学本质观是科学教育的核心目标之一。
2026-05-07 05:35
面对现实世界中日益复杂的预测需求,科研人员围绕大模型预测技术,走出了两大核心主线、四种具体技术路径。
2026-05-07 05:35
人工智能是德国提升国家科技创新能力、竞逐全球科技产业高点的关键领域。
2026-05-07 05:35
该校邢立达课题组与河北省区域地质调查院合作,对河北宣化土城子组两个新的恐龙足迹点展开研究,记录下该地层迄今最慢的兽脚类恐龙行迹,
2026-05-07 06:00
加载更多