9月29日,由中国科学院文献情报中心发起、以“共建语料生态·共创智能未来”为主题的“语料创新生态联盟启动暨学术交流会”在北京举行。会上,全国性语料创新生态联盟宣布启动,并集中发布了语料标准规范、敖仓·语料社区服务平台及英文期刊Data Express in AI Corpus等系列重要成果。
联盟启动仪式。文献情报中心供图
在今年7月召开的世界人工智能大会上,由中国科学院牵头建设的国家级敖仓·科技语料库(下称语料库)对外发布,旨在为突破AI4S语料供给瓶颈、夯实人工智能数据基座、保障科技创新自主可控、抢占全球 AI4S 发展制高点提供坚实保障。
“目前,高价值科技资源仍较为分散,资源汇聚与授权机制有待完善,标准规范、专业加工、质量评价和安全流通能力仍需加强,语料供给与模型研发、科研任务及产业场景之间也需要建立更加紧密的协同机制。”中国科学院科技基础能力局局长卢方军在交流会上表示,这些问题难以依靠单一机构解决,需要语料供给方、技术研发方和应用需求方共同参与、协同推进。
中国科学院文献情报中心党委书记李猛力表示,全球人工智能竞争正由单一技术和模型能力的比拼,向模型、算力、数据与应用生态协同发展的综合竞争深化。加快构建自主可控、开放协同、安全可信的语料创新生态,是夯实我国人工智能发展基础、支撑高水平科技自立自强的重要举措。
基于上述判断,中国科学院文献情报中心基于敖仓·科技语料“底座”,正式发起全国性语料创新生态联盟(以下简称联盟),旨在以高标准、高质量科技语料建设为核心,打造跨机构、跨领域、跨产业链的语料生态协同平台,推动科技语料资源在更大范围内实现共建共享、协同开发和创新应用。
联盟发起人、中国工程院院士孙凝晖在会上表示,联盟要推动科技语料资源和加工能力的基础设施化,建设国家高质量科技语料资源的战略保障基地、国家智能就绪语料集成服务的协同枢纽。
依托中国科学院以及全国科研与产业体系优势,联盟首批50家共建单位覆盖国家实验室、科研院所与国家级科学数据与文献资源机构,地方政府以及人工智能、数据基础设施、出版与知识服务等领域骨干单位,语料运营企业以及人工智能领域知名投资机构,贯通科技语料资源供给、技术研发、平台建设、模型训练与行业应用全链条,推动资源供给、技术研发和行业应用等关键环节有效衔接。
据介绍,联盟将以任务为牵引,探索“共建、共享、共赢”协同模式,成员以资源、能力、专业、场景四类投入参与共建,将各自的资源、技术和应用需求汇聚为联盟公共能力,再通过开放共享和能力反哺,共享语料工具、平台服务、共建成果与发展机会,形成优势互补、协同创新、成果共享的良性生态。
中国科学院文献情报中心主任曲建升介绍说,下一步,联盟将重点聚焦五大任务:一是联合共建高质量科技语料,持续打造具有示范意义的标杆语料资源;二是推进智能就绪科技语料集成服务,探索建立开放、普惠的公共服务机制;三是深化国家科技语料基础设施协同建设,推动基础设施、技术规范和服务能力协同演进;四是强化标准、质量与可信治理,建立语料可信流通、安全使用和质量保障机制;五是开展AI4S模型与应用场景联合验证,通过实际科研任务推动数据、模型和应用持续迭代,为新质生产力发展提供有力的数据支撑。
会上,围绕科技语料建设、工具平台、业务流程和运营管理等重点环节的五类42项科技语料标准集中发布。按计划,这些标准将率先依托联盟先行先用,并逐步将其上升为行业标准、国家标准。
国际化英文学术期刊Data Express in AI Corpus(《人工智能语料研究》)也在会上宣布创刊。大会还发布了以“面向语料创新生态,建设开放协同的语料社区”为目标的敖仓·语料社区服务平台。会上,中国科学院文献情报中心代表敖仓·科技语料库分别与语料应用关键机构、国家人工智能应用中试基地签署合作协议,并为共建单位授牌,推动科技语料与科研、产业应用场景衔接。
版权声明:凡本网注明“来源:中国科学报、科学网、科学新闻杂志”的所有作品,网站转载,请在正文上方注明来源和作者,且不得对内容作实质性改动;微信公众号、头条号等新媒体平台,转载请联系授权。邮箱:shouquan@stimes.cn。