8
月
在社区成长 8 月
LEVEL 90
100 XP
每个生物体的历史都写在其基因组中,基因组以DNA 形式存储,几乎存在于身体的每个细胞中。没有两个细胞是相同的,即使它们具有相同的DNA 和细胞类型,因为它们在控制细胞表达DNA 的调节因子方面仍然存在差异。人类基因组由分布在23 条染色体上的30 亿个碱基对组成。在这个庞大的遗传密码中,大约有20,000 至25,000 个基因,构成蛋白质编码DNA,约占总基因组的1% [1]。为了探索我们体内复杂系统的功能,尤其是DNA 的这一小编码部分,精确的测序方法是必要的,而单细胞测序(sc-seq) 技术就适合这个目的。
2013 年,《Nature》杂志选择单细胞RNA 测序作为年度方法[2](图3),强调了该方法通过在单个细胞水平上对DNA 和RNA 进行测序来探索细胞异质性的重要性。随后,出现了许多用于分析单细胞RNA 测序数据的工具。例如,scRNA-tools数据库自2016年以来一直在编译用于分析单细胞RNA数据的软件,到2021年,该数据库将包含超过1000种工具[3]。在这些工具中,许多都涉及利用深度学习技术的方法,这将是本文的重点——我们将探讨深度学习特别是作为推进单细胞测序技术的关键推动者所发挥的关键作用。
图1. 生物学的中心法则虽然我们身体的细胞共享相同的DNA,但它们的生物活性有所不同。例如,免疫细胞和心脏细胞之间的区别是由这些细胞中激活或失活的基因决定的。一般来说,当一个基因被激活时,它会导致更多RNA 拷贝的产生,从而导致蛋白质产量增加。因此,由于细胞类型因合成的RNA/蛋白质分子的数量和类型而异,因此在单细胞水平评估这些分子的丰度变得很有趣。这将使我们能够研究每个细胞内DNA 的行为,并获得我们身体各个部分的高分辨率视角。
一般来说,所有单细胞测序技术都可以分为三个主要步骤:
从感兴趣的组织中分离单细胞,并从每个分离的细胞中提取遗传物质从每个分离的细胞中扩增遗传物质并制备文库使用下一代测序仪和数据分析对文库进行测序通过细胞生物学和单细胞测序技术的复杂步骤,出现了一个关键问题:单细胞测序数据如何以数字表示?
图2. 单细胞测序数据的架构
这种类比与单细胞测序的更广泛影响无缝地结合在一起,因为它允许分析单个细胞而不是大量细胞群。事实证明,这项技术在解决与发育过程相关的复杂生物学问题以及理解各种治疗条件或疾病状态下的异质细胞或遗传变化方面具有无价的价值。此外,它还有助于识别给定细胞群内的新细胞类型。第一篇单细胞RNA 测序(scRNA-seq) 论文于2009 年发表[5],随后在2013 年被指定为“年度方法”[2],标志着致力于推进实验和计算技术的广泛努力的开始,这些技术致力于揭示单细胞转录组的复杂性。
随着技术格局的发展,叙述转向单细胞研究的进步,特别是早期对单细胞RNA 测序(scRNA-seq) 的关注,因为它在研究复杂细胞群方面具有成本效益。”在某些方面,RNA 一直是最容易测量的东西之一,”纽约基因组中心(NYGC) 的研究员Satija [6] 说。然而,单细胞技术的快速发展迎来了一个充满可能性的新时代——多模式单细胞数据集成。该方法被《自然》杂志评为“2019 年度方法”[7](图3),它允许测量同一细胞内的不同细胞模式,包括基因组、表观基因组和蛋白质组。多条信息的分层提供了对细胞身份的强大洞察,这对有效建模和组合多模态测量生成的数据集提出了挑战。通过引入多视图学习[8] 方法,探索跨模式的常见变化,解决了这一集成挑战。这种复杂的方法结合了深度学习技术,展示了各个领域的相关结果,特别是在生物学和生物医学领域。
在这些进步中,单细胞RNA 测序的持续局限性带来了一个明显的挑战——通过将细胞与原始位置分离来进行转录组分析过程中空间信息的丢失。空间解析转录组学(SRT)作为一种关键解决方案出现[9],通过在复杂生物系统的研究过程中保留空间细节来应对挑战。空间分辨转录组学被认为是2020 年的方法,这巩固了其作为解决推进我们对复杂生物系统理解所固有挑战的关键解决方案的地位。
图3. 单细胞测序随时间的演变在探索了单细胞测序的全景之后,现在让我们深入研究深度学习在单细胞测序中的作用。
2013 年,《Nature》杂志选择单细胞RNA 测序作为年度方法[2](图3),强调了该方法通过在单个细胞水平上对DNA 和RNA 进行测序来探索细胞异质性的重要性。随后,出现了许多用于分析单细胞RNA 测序数据的工具。例如,scRNA-tools数据库自2016年以来一直在编译用于分析单细胞RNA数据的软件,到2021年,该数据库将包含超过1000种工具[3]。在这些工具中,许多都涉及利用深度学习技术的方法,这将是本文的重点——我们将探讨深度学习特别是作为推进单细胞测序技术的关键推动者所发挥的关键作用。
背景
细胞中遗传信息从 DNA 到蛋白质的流动
让我们首先了解一下cell 和到底是什么。细胞是我们身体序列的基本单位,也是了解我们的身体如何健康运作以及分子功能障碍如何导致疾病的关键。我们的身体由数万亿个细胞组成,几乎每个细胞都包含三个遗传信息层:DNA、RNA 和蛋白质。 DNA 是一种长分子,含有使每个人独一无二的遗传密码。就像源代码一样,它包含一些说明,显示如何在我们的体内制造每种蛋白质。这些蛋白质是细胞的主力,几乎执行细胞生命所需的所有任务。例如,催化细胞内化学反应的酶和在细胞分裂过程中促进DNA 复制的DNA 聚合酶都是蛋白质。细胞通过转录和翻译两个步骤合成蛋白质(图1),这两个步骤被称为基因表达。 DNA首先转录成RNA,然后RNA被翻译成蛋白质。我们可以将RNA视为DNA和蛋白质之间的信使。一般来说,所有单细胞测序技术都可以分为三个主要步骤:
从感兴趣的组织中分离单细胞,并从每个分离的细胞中提取遗传物质从每个分离的细胞中扩增遗传物质并制备文库使用下一代测序仪和数据分析对文库进行测序通过细胞生物学和单细胞测序技术的复杂步骤,出现了一个关键问题:单细胞测序数据如何以数字表示?
单细胞测序数据的结构
单细胞测序数据的结构采用矩阵的形式(图2),其中每一行对应一个已测序并用唯一条形码注释的细胞。行数等于实验中分析的细胞总数。另一方面,每一列对应一个特定的基因。基因是基因组的功能单位,编码合成蛋白质或其他功能分子的指令。对于scRNA seq 数据,矩阵中的数字条目代表单个细胞中基因的表达水平。这些值表示特定细胞中每个基因产生的RNA 量,从而深入了解不同细胞内基因的活性。单细胞测序概述
150 多年来,生物学家一直希望识别人体内的所有细胞类型,并根据其属性的准确描述将它们分类为不同的类型。人类细胞图谱计划(HCAP) 相当于人类基因组计划[4],是一项绘制人体所有细胞图谱的国际合作项目。“我们可以将人类细胞图谱概念化为一张致力于连贯、系统地描绘人体的地图。就像谷歌地图一样,它允许我们放大以更仔细地检查复杂的细节,人类细胞图谱提供了对空间信息、内部属性,甚至元素之间关系的洞察,”计算和系统专家Aviv Regev 解释道。麻省理工学院和哈佛大学布罗德研究所的生物学家、基因泰克公司执行副总裁兼研究主管。这种类比与单细胞测序的更广泛影响无缝地结合在一起,因为它允许分析单个细胞而不是大量细胞群。事实证明,这项技术在解决与发育过程相关的复杂生物学问题以及理解各种治疗条件或疾病状态下的异质细胞或遗传变化方面具有无价的价值。此外,它还有助于识别给定细胞群内的新细胞类型。第一篇单细胞RNA 测序(scRNA-seq) 论文于2009 年发表[5],随后在2013 年被指定为“年度方法”[2],标志着致力于推进实验和计算技术的广泛努力的开始,这些技术致力于揭示单细胞转录组的复杂性。
随着技术格局的发展,叙述转向单细胞研究的进步,特别是早期对单细胞RNA 测序(scRNA-seq) 的关注,因为它在研究复杂细胞群方面具有成本效益。”在某些方面,RNA 一直是最容易测量的东西之一,”纽约基因组中心(NYGC) 的研究员Satija [6] 说。然而,单细胞技术的快速发展迎来了一个充满可能性的新时代——多模式单细胞数据集成。该方法被《自然》杂志评为“2019 年度方法”[7](图3),它允许测量同一细胞内的不同细胞模式,包括基因组、表观基因组和蛋白质组。多条信息的分层提供了对细胞身份的强大洞察,这对有效建模和组合多模态测量生成的数据集提出了挑战。通过引入多视图学习[8] 方法,探索跨模式的常见变化,解决了这一集成挑战。这种复杂的方法结合了深度学习技术,展示了各个领域的相关结果,特别是在生物学和生物医学领域。
在这些进步中,单细胞RNA 测序的持续局限性带来了一个明显的挑战——通过将细胞与原始位置分离来进行转录组分析过程中空间信息的丢失。空间解析转录组学(SRT)作为一种关键解决方案出现[9],通过在复杂生物系统的研究过程中保留空间细节来应对挑战。空间分辨转录组学被认为是2020 年的方法,这巩固了其作为解决推进我们对复杂生物系统理解所固有挑战的关键解决方案的地位。