DeepVariant
DeepVariant 是用于 WGS/WES 等医学基因组研究的开源 germline SNV 和小型 InDel 变异检测工具。
30 秒判断
先看这四点,再决定要不要继续读完整评测。
DeepVariant 适合作为 WGS/WES 等医学基因组研究中的 germline SNV 和小型 InDel 检测组件,便于本地部署、记录版本并接入下游注释流程;但它不适合直接生成临床诊断结论,也不适合作为结构变异、CNV、融合基因
最适合高质量 WGS/WES 数据上的 germline SNV/InDel calling,以及与 GATK HaplotypeCaller、FreeBayes、bcftools 等流程进行结果对照。
不适合把 VCF 直接当作临床诊断结论;也不适合主要目标是结构变异、CNV、融合基因、线粒体异质性、病毒整合、肿瘤低频体细胞突变或完整医学报告生成的项目。
明确样本和目标:确认数据是 WGS、WES 还是特定测序平台数据,确定参考基因组版本,例如 GRCh37/hg19 或 GRCh38,并准备已比对、排序和索引的 BAM/CRAM 文件。
最适合高质量 WGS/WES 数据上的 germline SNV/InDel calling,以及与 GATK HaplotypeCaller、FreeBayes、bcftools 等流程进行结果对照。
不适合把 VCF 直接当作临床诊断结论;也不适合主要目标是结构变异、CNV、融合基因、线粒体异质性、病毒整合、肿瘤低频体细胞突变或完整医学报告生成的项目。
GATK HaplotypeCaller / FreeBayes / bcftools

视频演示
DeepVariant 1.0 conference talk · en
适合谁用
适合需要搭建、复现或评估医学基因组分析流程的生信研究者、遗传病研究生、临床科研医生、PI、组学平台和测序数据分析团队。
用它完成一次可复现数据分析
把分析过程留下来,而不只是导出一张漂亮图。
输入材料
一份清洗后的数据表和明确的统计问题
应该得到
分析代码/流程、结果表、图表和解释边界
- 1先写下变量定义、样本筛选和主要结局。
- 2选择合适的统计方法,并记录为什么这么选。
- 3生成结果表和图表,同时保存参数、版本和代码。
- 4把统计显著性、效应量和临床意义分开解释。
人工核验点
- 变量和样本数是否一致
- 方法是否符合数据类型
- 图表是否能被他人复现
更适合
最适合高质量 WGS/WES 数据上的 germline SNV/InDel calling,以及与 GATK HaplotypeCaller、FreeBayes、bcftools 等流程进行结果对照。
不太适合
不适合把 VCF 直接当作临床诊断结论;也不适合主要目标是结构变异、CNV、融合基因、线粒体异质性、病毒整合、肿瘤低频体细胞突变或完整医学报告生成的项目。
数据与隐私
DeepVariant 可在本地服务器、医院内网或受控 HPC 环境运行,本身不要求上传患者基因组数据到第三方服务。实际隐私风险取决于样本脱敏、访问权限、日志内容、容器镜像来源、临时文件清理、备份策略、伦理审批和数据出境管理。
医学科研场景
- WGS/WES germline SNV 和小型 InDel 检测
- 罕见病三联体变异分析的候选位点生成
- 遗传性肿瘤或心血管遗传病研究中的生殖系小变异检测
- 与 GATK HaplotypeCaller 等流程进行变异检测一致性评估
- 医学队列或样本库项目中的标准化小变异检测流程搭建
核心功能
使用场景
优点与局限
优点
- +适合对 germline SNV 和小型 InDel 结果可复核性要求较高的 WGS/WES 医学科研项目。
- +开源且可本地部署,不要求上传患者基因组数据到第三方云端,便于纳入医院或课题组的受控数据管理流程。
- +输出文件与主流注释、过滤、家系分析和工作流系统兼容,适合整合到 Nextflow、Snakemake、WDL/Cromwell 等流程。
- +版本、模型和参数可记录,便于论文方法学描述、多中心复现、内部质控和审计。
局限
- -不是端到端临床诊断工具,不提供 ACMG/AMP 自动判读、表型匹配、遗传咨询建议或医学报告模板。
- -对计算资源、存储和流程管理有一定要求,大规模 WGS 队列需要合理规划并行策略、临时文件目录和中间文件清理。
- -主要面向 SNV 和小型 InDel;结构变异、拷贝数变异、融合基因、线粒体变异和低频体细胞突变通常需要其他工具配合。
- -模型、参考基因组版本、比对流程和样本类型不匹配时,结果可比性可能下降,需要在项目启动前做小样本验证。
快速上手
明确样本和目标:确认数据是 WGS、WES 还是特定测序平台数据,确定参考基因组版本,例如 GRCh37/hg19 或 GRCh38,并准备已比对、排序和索引的 BAM/CRAM 文件。
准备运行环境:参考官方仓库说明和官方容器镜像;在医院服务器或 HPC 环境中按平台要求使用容器或工作流系统,并提前准备参考基因组、索引文件和输出目录。
先做小样本测试:用官方示例、公开样本或内部已知样本运行流程,检查模型选择、区域文件、线程数和输出 VCF/gVCF 是否正常。
接入正式流程:对研究样本生成 VCF/gVCF,记录 DeepVariant 版本、模型名称、参考基因组、比对软件、关键参数和运行日志。
完成下游质控与复核:对结果进行变异质控、注释、频率过滤、家系分析和人工复核;涉及临床结论时,应结合验证实验和机构规范。
详细介绍
这个工具解决什么问题
DeepVariant 是 Google Research 开源的基因组变异检测工具,核心任务是从已经比对到参考基因组的测序读段中识别 germline SNV 和小型 InDel。
其相关论文发表于 Nature Biotechnology,题为 A universal SNP and small-indel variant caller using deep neural networks。算法细节、模型类型和版本更新应以官方 GitHub 仓库及论文说明为准。
在医学科研中,SNV 和小型 InDel 是罕见病、遗传性肿瘤、药物基因组学、人群队列和功能基因组研究的重要基础数据。DeepVariant 位于比对和质控之后,注释、过滤、遗传模式分析和医学解释之前。
它的工作方式可以概括为:把候选位点附近的读段信息转换为模型可识别的表示,再由预训练模型判断基因型。研究者真正需要关注的不是“是否用了深度学习”,而是输出是否可复核、可追踪、可与下游流程兼容。
DeepVariant 通常输出 VCF 或 gVCF 文件。这些文件可继续进入 VEP、ANNOVAR、SnpEff、ClinVar、gnomAD、家系分析和队列统计流程。它解决的是变异检测问题,不负责判断某个变异是否致病。
适合的医学科研场景
DeepVariant 最适合的场景是高质量 WGS/WES 数据上的 germline SNV 和小型 InDel calling。例如,罕见病三联体研究可先完成样本比对和质控,再用 DeepVariant 生成患儿和父母的候选变异文件。
在遗传性肿瘤、心血管遗传病、神经发育障碍和药物基因组学研究中,研究团队往往需要对一批样本采用一致流程。DeepVariant 的容器化运行方式有利于固定版本、模型和参数,减少批次间人为差异。
对生物样本库和医学队列,DeepVariant 可作为标准化变异检测流程的一部分。研究者可以记录参考基因组版本、比对软件、DeepVariant 版本、模型选择和关键参数,以便论文复现和内部审计。
- 罕见病 WES/WGS:生成候选 SNV/InDel,用于 de novo、隐性遗传、复合杂合和 X 连锁分析。
- 遗传性肿瘤研究:检测生殖系小变异,再结合 ClinVar、gnomAD、家系史和文献证据筛选候选位点。
- 药物基因组学研究:对相关基因区域形成可注释的基因型文件,用于后续药物反应或不良反应研究。
- 方法学评估:与 GATK HaplotypeCaller、FreeBayes、bcftools 结果比较,分析不一致位点、低覆盖区域和低复杂度区域。
不适合的情况
DeepVariant 不适合被当作完整临床诊断系统。它不会自动完成 ACMG/AMP 判读,不会根据 HPO 表型自动给出诊断排序,也不会生成可直接签发的临床遗传检测报告。
如果研究目标是结构变异、CNV、融合基因、重复扩增、病毒整合、线粒体异质性或肿瘤低频体细胞突变,DeepVariant 不能作为唯一工具。此类任务通常需要 Manta、Delly、CNVkit、GATK-SV、Mutect2、Strelka2 或其他专门流程配合。
对于 FFPE 肿瘤样本、低肿瘤纯度样本、ctDNA 或目标捕获深度差异很大的 panel 数据,研究者需要特别谨慎。DeepVariant 的常见定位是 germline 小变异检测,不能简单替代体细胞突变检测流程。
简要判断:如果你的问题是“这个 WES/WGS 样本有哪些可靠的生殖系 SNV/InDel”,DeepVariant 值得评估;如果你的问题是“这个患者最终诊断是什么”,它只能提供上游数据输入。
输入、输出与流程位置
DeepVariant 通常需要已经完成比对、排序和索引的 BAM 或 CRAM 文件,以及与比对一致的参考基因组文件。上游步骤的质量会直接影响结果,包括测序深度、覆盖均一性、污染情况、重复率和比对质量。
在 WES 项目中,研究者还需要关注捕获区域文件、目标区域外变异是否纳入、低覆盖外显子如何处理等问题。在 WGS 项目中,则要考虑计算资源、磁盘空间、并行策略和批量样本的任务调度。
输出 VCF 或 gVCF 后,通常还要进行变异级别质控、样本级别质控、注释、频率过滤、遗传模式筛选和人工复核。对候选致病变异,应结合读段可视化、家系共分离、Sanger 或其他验证实验,以及机构内部规范。
| 环节 | DeepVariant 的作用 | 仍需研究者完成的工作 |
|---|---|---|
| 上游 | 接收已比对的 BAM/CRAM | 测序质控、比对、去重或相关预处理、参考基因组一致性检查 |
| 核心 | 检测 germline SNV 和小型 InDel | 选择合适模型、记录版本参数、监控运行日志 |
| 下游 | 输出 VCF/gVCF | 注释、过滤、家系分析、临床证据整理和验证 |
与 GATK、FreeBayes、bcftools 的比较
GATK HaplotypeCaller 在医学和群体基因组项目中应用广泛,生态较完整,常与 VQSR、GenomicsDB、联合分型等模块组合使用。DeepVariant 的优势在于模型化小变异检测和容器化部署便利,但并不意味着在所有数据上都一定优于 GATK。
FreeBayes 和 bcftools 相对轻量,适合快速比较、特定区域分析或资源受限环境。它们在某些数据类型和参数设置下也可表现稳定。医学科研项目不应只凭默认参数做结论,而应建立小规模验证集。
比较工具时,建议使用已知真值样本、家系一致性、重复样本、正交验证结果和关键疾病基因区域作为评估依据。只比较全基因组总体指标可能掩盖临床关注区域的差异。
数据隐私与合规注意事项
DeepVariant 可以在本地服务器、医院内网或受控 HPC 环境中运行,工具本身不要求把患者基因组数据上传到第三方服务。这一点对涉及人类遗传资源、罕见病家系和临床样本的项目很重要。
但本地运行并不等于没有隐私风险。BAM、CRAM、VCF、gVCF、日志文件和临时文件都可能包含可识别的遗传信息。项目应明确访问权限、目录隔离、备份策略、删除策略和结果共享边界。
如果使用容器镜像或工作流平台,应确认镜像来源、版本固定方式、运行时网络权限和日志收集机制。跨机构合作时,还要按伦理批件、数据使用协议和当地法规处理数据传输问题。
使用建议与论文方法学描述
在正式批量分析前,建议先用公开样本、内部阳性样本或小规模代表性样本测试流程。需要检查模型是否匹配测序平台、参考基因组是否一致、区域文件是否正确、输出格式是否符合下游软件要求。
论文或项目报告中,不宜只写“使用 DeepVariant 进行变异检测”。更完整的描述应包括 DeepVariant 版本、容器或安装方式、模型名称、参考基因组版本、上游比对流程、输入文件类型、关键参数和过滤标准。
对于与临床解释相关的研究,还应说明变异注释数据库版本、频率阈值、致病性证据来源、人工复核方式和验证策略。DeepVariant 产生的是候选变异集合,不应替代遗传咨询、临床会诊或实验室签发流程。
总体而言,DeepVariant 适合具备生信分析能力、重视可复现流程的医学基因组研究团队。它的价值在于稳定地产生可进入下游解释流程的小变异结果,而不是自动完成从测序数据到医学结论的全过程。
替代选择
如果 DeepVariant 不适合你,可以考虑:
同类工具推荐
如果你需要更完整的文献工作流
从检索到精读,一站完成
这个工具适合特定场景。如果你需要中文检索、实时翻译、AI 辅助精读,可以试试超能文献。
了解超能文献