AI · · 2 min read
CytoVI统一抗体单细胞数据分析
《Nature Methods》报道了一种模型,可整合基于抗体的单细胞测量数据、填补数据空缺,并识别跨技术平台的细胞状态。
《Nature Methods》报道了CytoVI,这是一种旨在将基于抗体的单细胞数据集纳入统一分析框架的计算模型。该软件旨在解决一些会导致结果难以比较的问题,包括技术噪声、批次效应、平台差异,以及单个抗体面板中可用抗体数量有限等。
CytoVI在一个概率模型中整合了多项分析任务。它能够生成捕捉数据中重要模式的细胞嵌入,估算未观测到的测量值,检验蛋白质表达差异,并支持自动细胞注释。该模型面向由流式细胞术、质谱流式细胞术和CITE-seq等技术生成的数据开发,这些技术均用于临床诊断和生物学研究。
不同测量数据的统一框架
基于抗体的单细胞方法未必检测相同的蛋白质,也未必以相同格式生成结果。受限的抗体面板可能导致重要测量数据无法获得,而技术变异和批次效应则可能掩盖生物学信号。当研究人员试图将不同数据集合并分析时,平台差异又增加了另一重复杂性。
据《Nature Methods》介绍,CytoVI使用单一统计框架来处理这些复杂因素,而不是将每个分析步骤视为彼此独立的过程。它生成的细胞嵌入能够利用各项测量中检测到的模式来表示细胞。该模型还可以插补缺失值,在分析过程中估算缺失的测量数据。
同一框架还用于差异蛋白质表达检测和细胞注释。这意味着研究人员可以在不依赖一系列彼此割裂的工具的情况下,考察蛋白质层面的差异,并将细胞归类为不同类型或状态。该方法被描述为概率方法,这意味着模型会将不确定性纳入分析,而不是将每项结果都呈现为完全确定的数值。
在B细胞发育研究中测试CytoVI
研究人员应用该模型创建了一套整合的B细胞成熟图谱。该图谱汇集了涵盖350种蛋白质的测量数据,为CytoVI模拟B细胞发育过程中的变化提供了广泛的数据集。
这项分析识别出了与免疫球蛋白类别转换相关的蛋白质。在该研究中,类别转换被视为与特定蛋白质模式相关的生物学过程,研究人员利用该模型识别与之相关的蛋白质。该结果表明,这一系统不仅能够整合数据集,还能在更大的细胞图谱中发现蛋白质之间的关联。
这套图谱也展示了这样一种分析类型:当数据来自不同实验或平台时,这类分析会变得更加困难。通过将测量数据置于整合模型中,研究人员利用CytoVI考察了更广泛蛋白质范围内的细胞成熟过程,而单个受限抗体面板可能无法提供如此广的范围。
淋巴瘤样本中的发现
研究人员还使用B细胞非霍奇金淋巴瘤患者的样本对CytoVI进行了评估。这些样本同时接受了流式细胞术和CITE-seq分析,使该模型能够跨两种基于抗体的单细胞技术开展应用。
在这一患者队列中,分析发现了与该疾病相关的T细胞状态。这一发现表明,该方法能够识别超出癌症诊断所指向的B细胞群体之外的变化。它还展示了跨平台分析在临床疾病环境中的应用:在这种环境中,不同技术获得的测量数据需要结合起来考察。
这些报道的应用使CytoVI成为一种既可用于图谱构建、也可用于疾病重点研究的工具。其功能涵盖细胞表示、缺失测量数据恢复、蛋白质表达比较和细胞注释;与此同时,其概率设计旨在通过一个模型纳入不确定性和技术变异。
CytoVI已通过scvi-tools.org以开源软件形式发布。研究人员可以利用这一软件,将该方法应用于自身的临床或研究分析中的基于抗体的单细胞数据。《Nature Methods》将这款软件介绍为一种统一方法,用于处理受到平台差异、批次效应、噪声和抗体面板不完整影响的数据集。