字号
本期编译精选。
摘要
基因组语言模型作为学习全基因组功能约束的有力方法,直接从DNA序列 1 中出现。然而,从自然语言处理中改编而来的标准基因组语言模型往往需要巨大的模型大小和计算资源,但在预测任务2,3,4中仍然不及古典进化模型。在此,我们引入了一个基因组预加训练的网络,其中包含物种树和对接表示(GPN-Star),这是一个基于生物的基因组语言模型,其特点是一种具有生理意识的结构,它利用全基因组对接和物种树明确模拟进化关系。GPN-Star在跨越脊椎动物、哺乳动物和灵长类进化时间尺度的对接方面接受了培训,在人类基因组的编码和非编码区域,GPN-Star在各种变异效应预测任务中都实现了最先进的性能。跨时间尺度的分析显示出比较近期的建模相对于更深层次的演化的依赖任务优势。为了展示其推进人类遗传学的潜力,我们显示,GPN-Star在优先研究病原体和精细基因组全基因组结合研究变体方面大大超过以前的方法,在稀有变体结合试验中产生强效的复杂特质遗传性并增强功率。超越人类,我们训练GPN-Star为五个模型生物—— Mus Musculus、Gallus Callus、Drosophila melanogaster、Caenorhabditis 精英和Arabidopsis Thaliana——显示了框架的稳健性和可概括性。综合起来,这些结果将GPN-Star定位为基因组解释的可伸缩、强大和灵活的工具,非常适合利用越来越多的可比较基因组学数据。
主要
(原文共 10 张图片,此处展示前 3 张,更多图片请前往原文查看)
(编译自 Nature;原文


来源:Nature(原文)
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
免费订阅
每天 5 分钟,看懂世界在发生什么
订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。
评论