本报讯(记者赵广立)9月29日,由中国科学院文献情报中心发起、以“共建语料生态·共创智能未来”为主题的“语料创新生态联盟启动暨学术交流会”在北京举行。会上,全国性语料创新生态联盟(以下简称联盟)宣布启动,并集中发布了语料标准规范、敖仓·语料社区服务平台及英文期刊Data Express in AI Corpus等系列成果。
在今年7月召开的世界人工智能大会上,由中国科学院牵头建设的国家级敖仓·科技语料库对外发布,旨在为突破人工智能驱动的科学研究(AI4S)语料供给瓶颈、夯实人工智能数据基座、保障科技创新自主可控、抢占全球AI4S发展制高点提供坚实保障。
此次,中国科学院文献情报中心基于敖仓·科技语料“底座”正式发起联盟,旨在以高标准、高质量科技语料建设为核心,打造跨机构、跨领域、跨产业链的语料生态协同平台,推动科技语料资源在更大范围内实现共建共享、协同开发和创新应用。
联盟发起人、中国工程院院士孙凝晖在会上表示,联盟要推动科技语料资源和加工能力的基础设施化,建设国家高质量科技语料资源的战略保障基地、国家智能就绪语料集成服务的协同枢纽。
依托中国科学院以及全国科研与产业体系优势,联盟首批50家共建单位覆盖国家实验室、科研院所与国家级科学数据与文献资源机构,地方政府以及人工智能、数据基础设施、出版与知识服务等领域骨干单位,语料运营企业以及人工智能领域知名投资机构,贯通科技语料资源供给、技术研发、平台建设、模型训练与行业应用全链条,推动资源供给、技术研发和行业应用等关键环节有效衔接。
中国科学院文献情报中心主任曲建升介绍说,下一步,联盟将重点聚焦五大任务:一是联合共建高质量科技语料,持续打造具有示范意义的标杆语料资源;二是推进智能就绪科技语料集成服务,探索建立开放、普惠的公共服务机制;三是深化国家科技语料基础设施协同建设,推动基础设施、技术规范和服务能力协同演进;四是强化标准、质量与可信治理,建立语料可信流通、安全使用和质量保障机制;五是开展AI4S模型与应用场景联合验证,通过实际科研任务推动数据、模型和应用持续迭代,为新质生产力发展提供有力的数据支撑。
《中国科学报》 (2026-09-30 第4版 综合)