|
|
|
|
|
新研究发现灵长类未知重复序列及其亚端粒结构多样性与演化 |
|
|
上海交通大学研究员毛亚飞课题组与原中国科学院脑科学与智能技术卓越创新中心研究员、现中山大学香港高等研究院/中山医学院特聘教授孙强课题组合作,发现并系统解析了以SATR为代表的卫星重复序列,进而构建了首个达到“近乎完美”标准的灵长类参考基因组,同时揭示了猕猴属特有的亚端粒复杂结构及其演化形成,并利用该基因组显著提升了群体遗传学分析和单细胞多组学解析的准确性与分辨率,为非人灵长类动物模型构建、基因组演化以及演化医学等研究建立了关键遗传参考基础。8月6日,相关研究成果发表于《细胞》。
重复序列是基因组的重要组成部分,在基因组结构组织、染色体稳定性和物种演化中发挥着重要作用。然而,由于高度重复区域长期难以准确组装和解析,这些区域一直是理解基因组结构变异和染色体演化的重要盲区。其中,亚端粒等高度重复区域的完整组装,是基因组学长期以来最难突破的技术瓶颈之一。
研究团队系统归纳了长读长测序在复杂重复区域中普遍存在的四类偏倚,包括测序深度缺失、同聚物错误、链方向偏倚和特定序列上下文错误。这四类偏倚并非相互独立,特定序列背景既可能直接诱发稳定的识别错误,也可能与同聚物错误或链方向偏倚叠加。
针对大尺度重复区域中常见的序列折叠与错误组装,研究团队结合多种方法进行了校正,进而构建了完整且近乎完美的恒河猴参考基因组T2T-MMU8v2.0。研究团队在该基因组中鉴定出268个此前未被注释的重复序列家族,为研究灵长类复杂基因组区域的结构组成、潜在功能及演化差异提供了高质量参考。
研究团队同时解析了猕猴属亚端粒序列结构构型与表观特征。SATR是猕猴基因组中的一类未被完整解析的卫星DNA序列,由短重复单元连续排列形成长串联阵列。研究团队共解析出约8 Mbp的SATR卫星阵列,并归纳出四类SATR结构构型。这些序列虽然也分布于染色体内部,但在染色体p臂亚端粒区域呈约99倍富集。值得一提的是,SATR混合阵列构成了猕猴亚端粒的核心,并与片段重复间隔区和复合重复序列按照特定次序排列,形成可重复识别的复合结构。与非洲类人猿的亚端粒卫星结构相比,猕猴SATR构型在序列组成、结构组织和甲基化模式上均表现出明显差异,反映了灵长类亚端粒结构在不同谱系中的演化分化。
进一步地,研究团队考察了SATR构型的基因分布与转录特征。T2T-MMU8v2.0恢复了部分在既有参考基因组中因序列缺失或错误折叠而未能识别的基因。比较分析显示,这些新增基因在SATR相关区域显著富集,表明部分重复区域包含此前难以解析的基因拷贝。研究团队在SATR相关区域中补充解析出225个基因拷贝,其中ZNF669的截断拷贝ZNF669L与亚端粒SATR构型呈现稳定的空间关联。在SATR相关区域中,研究团队共发现58个具有转录活性证据的基因拷贝,部分拷贝的转录本还可在前额叶皮层、脾脏和卵巢等多种组织中检测到。
相关论文信息:https://doi.org/10.1016/j.cell.2026.02.018
版权声明:凡本网注明“来源:中国科学报、科学网、科学新闻杂志”的所有作品,网站转载,请在正文上方注明来源和作者,且不得对内容作实质性改动;微信公众号、头条号等新媒体平台,转载请联系授权。邮箱:shouquan@stimes.cn。