|
|
|
|
|
告别数据孤岛!陈松林院士团队建成全球首个海洋硬骨鱼组学平台 |
|
|
2024年冬天的一个凌晨,窗外夜色沉沉,实验室里寂静无声,只有电脑屏幕透出微光。屏幕上突然弹出一行报错信息,原本持续运行的爬虫程序戛然而止。
这样的场景,在数据库建设过程中反复上演。一次次排查问题,一次次调整程序代码,再一次次重新运行,不过是陈松林团队三年攻坚路上一个普通的工作缩影。
近日,中国工程院院士、中国水产科学研究院黄海水产研究所研究员陈松林团队在国际学术期刊《核酸研究》发布研究成果。他们成功构建全球首个海洋硬骨鱼类综合功能与进化基因组数据库MFDB,首次系统整合了89种海洋硬骨鱼类多组学数据,还创新性地集成了多种特色分析模块和生物信息学工具,为全球海水鱼种业自主创新提供了重要的数据基础。
截至9月15日,数据库已上线23天,累计访问量已达5200余次,访问者遍布全球多个国家和地区。
陈松林(中)在指导团队成员开展实验
绕不开的“数据困境”
作为国内海水鱼领域的领军科学家,多年来,陈松林带领团队围绕海水鱼生物技术和遗传育种持续开展研究,从建立鱼类种质冷冻库、破译我国首个鱼类基因组到基因组育种技术应用,不断探索利用现代生物技术提升海水鱼育种效率。
在长期科研实践中,陈松林发现,看似简单的“找数据”,往往要耗费大量时间和精力。
随着基因组测序和多组学技术快速发展,大量研究数据不断积累,海洋鱼类的多组学数据分散在NCBI、Ensembl等国际公共数据库中,这些数据库大多面向大量不同物种,数据格式、来源和注释标准也存在差异。科研人员往往需要在多个平台之间反复检索、比对,再根据研究需求进行筛选和整理,整个过程繁琐且耗时。
这种数据分散、资源难以有效整合的现象,被称为“数据孤岛”,长期制约着海洋鱼类功能基因组学、进化生物学研究以及相关分子育种技术的发展。如何更加高效地获取和利用这些数据,成为亟待解决的问题。
而更现实的压力,则来自外部环境。国内许多基因组和多组学研究的数据,长期存储于国外的公共数据库。然而,NCBI等国外网站却一度限制国内学者访问,科研人员的学术研究与交流受到了极大阻碍。
“对于国内学者而言,这实际上是一种资源的损失。”陈松林对《中国科学报》表示,“如果中国拥有自己自主可控的平台,就可以直接将这些数据存储在我们自己的网站上,提升科研人员获取和利用数据的效率,减少对国外数据库的依赖。”
掌握数据,就是掌握科研主动权。多年来,他持续关注相关数据资源的整合,并推动这一设想落地。
2023年底,论文第一作者、黄海水产研究所博士后高成斌加入陈松林团队,承担起MFDB数据库建设工作。水产养殖专业的他,从硕士阶段起便自学生物信息学,并逐渐将这项能力运用到鱼类研究中。
陈松林展示团队繁育出的红瓜子斑
做加法容易,做减法难
项目刚开始,数据收集工作就给高成斌上了一课。
“最大的挑战,是如何从不同公共数据库中批量获取鱼类的海量数据。”高成斌介绍。不同数据库的检索方式、数据结构各不相同,如果单靠人工逐一下载,工作量将十分庞大。为提高效率,他用Python编写网络爬虫,自动检索和下载各公共平台的所需数据。
然而,程序真正运行起来,问题接踵而至。
“一些大型数据库设置了反爬机制,程序运行几个小时后便报错中止。”高成斌说起当时的苦恼,仍皱起眉头。而初代程序一旦中止,此前工作便前功尽弃。为此,高成斌不断修改、迭代程序,使其在爬取过程中能同步写入数据。即使程序再次中断,已获取的数据也能保存下来,后续可在已有基础上继续运行。
这听起来容易,做起来可一点都不简单。经过一次又一次的失败和再挑战,他反复调试,终于攻克“反爬”,数据收集也逐步完成。
最初,团队采用“广撒网”的方式,从公共数据库中收集了256种鱼类的数据,涵盖众多淡水鱼、海水鱼。但随着进一步分析,团队意识到,现有数据过于庞杂,不利于围绕同一方向开展后续分析与研究。
如此,怎么抉择呢?
结合团队长期以来在海水鱼遗传育种领域的研究基础,陈松林决定“做精、做专”,进一步聚焦于海洋硬骨鱼类。大家结合物种生活史和盐度适应特征,对候选物种进行筛选,确定了85种海水硬骨鱼作为首批收录对象。
“建数据库最难的不是做加法,而是做减法。”高成斌介绍,“确定好研究对象后,下一步就是从海量数据中筛选出有效信息。”
公开数据库中的数据来源复杂,不同数据格式和注释标准并不统一,团队需要从大量数据中比对和整理,确认数据来源及可靠性,确保不同来源的数据能够在同一标准下进行分析。
以转录组数据为例,同一种鱼可能包含来自肌肉、血液、皮肤等不同器官的大量样本;同时,不同发育阶段,以及高温、低温或细菌、病毒感染等处理,也会产生不同样本数据。团队需要逐一确认每份数据对应的组织来源和实验处理条件,并剔除非常规条件下的样本,只保留能够反映鱼类基础状态的数据。
“以大菱鲆为例,公开数据库中既有其正常状态下的转录组数据,也有经过弧菌感染实验后的数据。团队只选取前者,以避免攻毒处理对基因基础表达造成干扰。”高成斌解释道。
全球首个海洋硬骨鱼类综合功能与进化基因组数据库MFDB
从“数据书架”到“工具箱”
“如果数据库只是一个‘书架’,数据虽然摆在那里,研究人员仍需要下载后在本地环境里进行分析,还是不够便利。”高成斌说。
数据筛选完成后,团队进一步思考:如何让这些数据真正发挥作用?
于是,团队将工作从数据整理延伸到分析应用。2024年下半年,团队开展了泛基因组、基因表达和功能注释等多维度生物信息学分析,挖掘基因背后的生物学信息。
考虑到分析任务计算量较大,为提高平台使用效率,团队将完成的分析结果提前部署到平台中,用户可以直接调用,大幅缩短等待时间。
“同时,也降低了使用门槛,即使是刚接触相关研究的科研人员,或缺乏专业服务器的小型科研团队,也能直接利用平台进行检索和调用个性化分析结果。”项目团队成员、黄海水产研究所研究员徐文腾说。
其中,泛基因组分析尤为复杂,由于数据量巨大,服务器难以一次完成全部分析。于是,团队采用分段分析的方式,将任务按照生物分类层级逐步完成后再整合结果。从方案摸索到最终完成,分析工作持续了六个月。
来自85种海洋硬骨鱼的89个染色体水平基因组及3,017套高质量转录组数据被纳入数据体系,覆盖33个目;团队还对231万多个基因进行了统一功能注释,总数据量达到2.6 TB,大幅提升了数据的可用性与可比性,在此基础上,科研人员可以开展基因功能、表达调控和物种演化等多个层面的研究。
但他们并未止步于此。工欲善其事,必先利其器。
不同于传统数据库仅提供数据检索与下载,MFDB数据库还内置了多个特色分析模块,包括泛基因集与核心基因集、组织特异性基因共表达网络等,并设计了基因组、共线性等六大核心板块,搭载了JBrowse2、Muscle等常用生物信息学工具,让用户可以轻松调用数据,并直接利用平台开展相关研究,真正实现“一站式”数据分析。
让数据多跑路,让科研人员少跑腿——这正是MFDB的设计初衷。
MFDB的建成,不仅为海洋鱼类基因功能解析、适应性进化研究等提供了系统化的数据资源,也为生长、抗病、抗逆等重要经济性状基因挖掘和分子育种提供了基础支撑,助力我国海水鱼种业自主创新和海洋渔业领域公共数据基础设施建设。
团队合影 受访者供图
下一站:智慧育种大模型
2025年底,数据库顺利建成。
“我们第一时间向《核酸研究》数据库专刊投稿。但因为此前并不了解该专刊每年仅开放一次投稿,我们错过了当年周期。”高成斌回忆。2026年6月1日,新一轮投稿周期开启后,团队在第一天就提交了论文。
2026年8月24日,论文正式在线发表。
论文发表并非数据库建设的终点,而是数据资源发挥价值的新起点。
依托多年积累的海水鱼遗传育种研究基础,陈松林进一步提出建设智慧育种大模型的设想。
“长期以来,水产育种主要依靠表型观察和经验筛选,而生长速度、抗病能力、环境适应能力等重要性状往往由多个基因共同调控,传统方法需要较长时间验证。随着基因组技术和人工智能的快速发展,育种模式正在迎来新的变革。”陈松林表示。
在他看来,MFDB数据库并不只是一个“存数据”的网站,更是一项面向未来海洋鱼类研究和育种的数据基础设施建设。而85种海洋鱼类,只是团队迈出的第一步。
版权声明:凡本网注明“来源:中国科学报、科学网、科学新闻杂志”的所有作品,网站转载,请在正文上方注明来源和作者,且不得对内容作实质性改动;微信公众号、头条号等新媒体平台,转载请联系授权。邮箱:shouquan@stimes.cn。