7月17日至20日,2026世界人工智能大会暨人工智能全球治理高级别会议在上海举行。大会期间,由广州大学与广州市社科联共建的“粤语语料库建设与大模型评测”广州市哲学社会科学重点实验室(以下简称重点实验室)应邀在“人工智能高质量语料生态论坛”亮相,并发布两项原创核心成果——AI-DimSum粤语语料库平台搜索2.0(中文名:“点心粤语语料库”搜索2.0)与粤语真实语音上下文交互能力评测基准CRS-Bench,以方言垂类数据底座打造广州AI差异化竞争力。
“此次成果发布也是广州大学推动人文与科技跨学科交叉融合的又一鲜活实践。”中国工程院院士、重点实验室首席科学家方滨兴以《数据决定粤语AI的上限》为题作主旨报告。他指出,大模型“表面会说”并不等于“真正懂得”。当前制约粤语大模型发展的首要因素已不仅是模型参数、算法效率和算力条件,更在于高质量、有规模且可持续增强的粤语数据。真正需要建设的是贯通数据、模型、评测、安全与应用的粤语AI数据基础设施。
广州大学网络空间安全学院教授、重点实验室主任齐佳音代表实验室介绍了上述两项成果。其中,AI-DimSum粤语语料库平台搜索2.0是实验室在语料规模迈入TB级后推出的重要升级,具备三大特色:所有语料自带“身份证”,来源更为可信;搜索结果分层呈现——精确、关联和推荐,内容更加丰富;融合社交功能和生态应用,实现“搜索即社交、搜索即传播、搜索即应用”。CRS-Bench评测基准由重点实验室与GOMAX LAB合作建设,基于真实粤语语音资源,涵盖地域变体、包含上下文情景、兼具文化语义复杂度,为AI粤语能力评测开辟了新赛道。
齐佳音表示,此次发布的两项成果是广州将丰富鲜活的粤语资源转化为可用数据资产的重要实践。搜索平台2.0使海量粤语语料“找得准、信得过”,为教育、文创、媒体及人工智能企业提供了便捷可信的数据服务入口;评测基准则让模型能力“测得清、评得准”,能够有效避免“普通话迁移假象”和“伪粤语自我放大”两类偏差,并将评测结果反馈至数据建设环节,驱动模型能力持续提升。
据悉,2024年11月,广州大学与广州市社科联联合成立该重点实验室,采取“1+1+N”协同模式,联动大湾区多方资源推动粤语语料建设从专业工程走向社会参与、从资源整理走向生态培育。实验室由中国工程院院士、广州大学网络空间安全学院名誉院长方滨兴教授与国家语言服务与粤港澳大湾区语言研究中心主任、香港科技大学(广州)/广州大学原党委书记屈哨兵教授担任双首席科学家,齐佳音教授担任主任,人文学院院长禤健聪教授担任副主任。
一年来,重点实验室围绕“兼容岭南文化”与“兼容人工智能”两项目标,建设AI-DimSum多模态通用粤语语料库平台,已汇聚超100万字文本、3000小时高保真语音及1TB以上音视频数据,建成岭南文化粤语思维链问答数据、粤语内容安全关键词语料、粤语大模型安全评测数据集等特色语料,孵化出粤语内容安全检测“保险箍”、粤语智能配音、粤语学习工具等10余款应用。
相关成果入选国家语言文字信息化十大新闻和国家关键领域语言科技赋能创新项目案例,并在第五届琶洲算法大赛中承办“点心杯——粤语及其内部方言分片的语音识别模型构建”赛事,向全球AI开发者提供独家高质量算法训练数据。
版权声明:凡本网注明“来源:中国科学报、科学网、科学新闻杂志”的所有作品,网站转载,请在正文上方注明来源和作者,且不得对内容作实质性改动;微信公众号、头条号等新媒体平台,转载请联系授权。邮箱:shouquan@stimes.cn。