医学科研情报站
场景导航科研工具科研方法科研 Skill科研资源工具对比评测标准
医学科研情报站

帮你省掉筛选工具的时间,发现值得关注的科研工具和方法

场景导航文献检索综述写作Zotero 插件论文阅读系统综述科研绘图论文写作医学 NLP生信组学医学影像AI科研工具开源项目科研方法科研资源工具对比评测标准超能文献超能妙译暖芽孕产 AppWildData 官网

© 2026 医学科研情报站

搜索
医学科研情报站
场景导航科研工具科研方法科研 Skill科研资源工具对比评测标准
首页工具其他DeepVariant
其他

DeepVariant

DeepVariant 是用于 WGS/WES 等医学基因组研究的开源 germline SNV 和小型 InDel 变异检测工具。

有门槛免费生信基因组学变异检测WGSWESSNVInDelVCFgVCF开源工具数据分析医学科研
访问官网GitHub

30 秒判断

先看这四点,再决定要不要继续读完整评测。

核心价值

DeepVariant 适合作为 WGS/WES 等医学基因组研究中的 germline SNV 和小型 InDel 检测组件,便于本地部署、记录版本并接入下游注释流程;但它不适合直接生成临床诊断结论,也不适合作为结构变异、CNV、融合基因

最适合

最适合高质量 WGS/WES 数据上的 germline SNV/InDel calling,以及与 GATK HaplotypeCaller、FreeBayes、bcftools 等流程进行结果对照。

先注意

不适合把 VCF 直接当作临床诊断结论;也不适合主要目标是结构变异、CNV、融合基因、线粒体异质性、病毒整合、肿瘤低频体细胞突变或完整医学报告生成的项目。

怎么试

明确样本和目标:确认数据是 WGS、WES 还是特定测序平台数据,确定参考基因组版本,例如 GRCh37/hg19 或 GRCh38,并准备已比对、排序和索引的 BAM/CRAM 文件。

适合放进流程

最适合高质量 WGS/WES 数据上的 germline SNV/InDel calling,以及与 GATK HaplotypeCaller、FreeBayes、bcftools 等流程进行结果对照。

不适合硬用

不适合把 VCF 直接当作临床诊断结论;也不适合主要目标是结构变异、CNV、融合基因、线粒体异质性、病毒整合、肿瘤低频体细胞突变或完整医学报告生成的项目。

替代/对照

GATK HaplotypeCaller / FreeBayes / bcftools

DeepVariant screenshot

视频演示

DeepVariant 1.0 conference talk · en

资料入口

官方文档论文/预印本

信息状态

核验
部分核验
最近更新
2026/5/10
上手
30分钟以上
学习曲线
hard

已核验官网或项目页、公开功能说明和可访问素材;登录后能力、团队协作、价格细则仍可能变化。

适合谁用

适合需要搭建、复现或评估医学基因组分析流程的生信研究者、遗传病研究生、临床科研医生、PI、组学平台和测序数据分析团队。

用它完成一次可复现数据分析

把分析过程留下来,而不只是导出一张漂亮图。

输入材料

一份清洗后的数据表和明确的统计问题

应该得到

分析代码/流程、结果表、图表和解释边界

  1. 1先写下变量定义、样本筛选和主要结局。
  2. 2选择合适的统计方法,并记录为什么这么选。
  3. 3生成结果表和图表,同时保存参数、版本和代码。
  4. 4把统计显著性、效应量和临床意义分开解释。

人工核验点

  • 变量和样本数是否一致
  • 方法是否符合数据类型
  • 图表是否能被他人复现

更适合

最适合高质量 WGS/WES 数据上的 germline SNV/InDel calling,以及与 GATK HaplotypeCaller、FreeBayes、bcftools 等流程进行结果对照。

不太适合

不适合把 VCF 直接当作临床诊断结论;也不适合主要目标是结构变异、CNV、融合基因、线粒体异质性、病毒整合、肿瘤低频体细胞突变或完整医学报告生成的项目。

数据与隐私

DeepVariant 可在本地服务器、医院内网或受控 HPC 环境运行,本身不要求上传患者基因组数据到第三方服务。实际隐私风险取决于样本脱敏、访问权限、日志内容、容器镜像来源、临时文件清理、备份策略、伦理审批和数据出境管理。

医学科研场景

  • WGS/WES germline SNV 和小型 InDel 检测
  • 罕见病三联体变异分析的候选位点生成
  • 遗传性肿瘤或心血管遗传病研究中的生殖系小变异检测
  • 与 GATK HaplotypeCaller 等流程进行变异检测一致性评估
  • 医学队列或样本库项目中的标准化小变异检测流程搭建

核心功能

从已比对、排序并建立索引的 BAM/CRAM 文件中检测 germline SNV 和小型 InDel,适用于 WGS/WES 等医学基因组研究数据。
支持容器化运行方式,便于在医院服务器、科研机构 HPC 或受控计算环境中处理人类测序数据;具体环境要求应以官方仓库说明为准。
可输出 VCF 或 gVCF 文件,方便接入 VEP、ANNOVAR、SnpEff、ClinVar、gnomAD、家系分析和队列统计流程。
提供面向不同测序平台和数据类型的预训练模型,研究者应根据测序平台、读长类型、参考基因组和项目设计选择合适模型。
适合与 GATK HaplotypeCaller、FreeBayes、bcftools 等工具进行交叉比较,用于方法学评估、流程一致性检查和不一致位点复核。

使用场景

在罕见病 WES/WGS 三联体研究中,对患儿及父母样本进行 germline SNV/InDel 检测,为 de novo、隐性遗传、复合杂合和 X 连锁分析提供输入。
在遗传性肿瘤或心血管遗传病研究中,生成候选生殖系小变异集合,再结合 ClinVar、gnomAD、疾病数据库和人工复核筛选可疑位点。
在药物基因组学研究中,对相关基因区域进行小变异检测,形成可用于后续基因型注释和用药反应关联分析的 VCF 文件。
在测序平台或变异检测流程评估中,将 DeepVariant 与 GATK HaplotypeCaller、FreeBayes 或 bcftools 的结果比较,重点分析不一致位点、低覆盖区域和低复杂度区域。

优点与局限

优点

  • +适合对 germline SNV 和小型 InDel 结果可复核性要求较高的 WGS/WES 医学科研项目。
  • +开源且可本地部署,不要求上传患者基因组数据到第三方云端,便于纳入医院或课题组的受控数据管理流程。
  • +输出文件与主流注释、过滤、家系分析和工作流系统兼容,适合整合到 Nextflow、Snakemake、WDL/Cromwell 等流程。
  • +版本、模型和参数可记录,便于论文方法学描述、多中心复现、内部质控和审计。

局限

  • -不是端到端临床诊断工具,不提供 ACMG/AMP 自动判读、表型匹配、遗传咨询建议或医学报告模板。
  • -对计算资源、存储和流程管理有一定要求,大规模 WGS 队列需要合理规划并行策略、临时文件目录和中间文件清理。
  • -主要面向 SNV 和小型 InDel;结构变异、拷贝数变异、融合基因、线粒体变异和低频体细胞突变通常需要其他工具配合。
  • -模型、参考基因组版本、比对流程和样本类型不匹配时,结果可比性可能下降,需要在项目启动前做小样本验证。

快速上手

1

明确样本和目标:确认数据是 WGS、WES 还是特定测序平台数据,确定参考基因组版本,例如 GRCh37/hg19 或 GRCh38,并准备已比对、排序和索引的 BAM/CRAM 文件。

2

准备运行环境:参考官方仓库说明和官方容器镜像;在医院服务器或 HPC 环境中按平台要求使用容器或工作流系统,并提前准备参考基因组、索引文件和输出目录。

3

先做小样本测试:用官方示例、公开样本或内部已知样本运行流程,检查模型选择、区域文件、线程数和输出 VCF/gVCF 是否正常。

4

接入正式流程:对研究样本生成 VCF/gVCF,记录 DeepVariant 版本、模型名称、参考基因组、比对软件、关键参数和运行日志。

5

完成下游质控与复核:对结果进行变异质控、注释、频率过滤、家系分析和人工复核;涉及临床结论时,应结合验证实验和机构规范。

详细介绍

这个工具解决什么问题

DeepVariant 是 Google Research 开源的基因组变异检测工具,核心任务是从已经比对到参考基因组的测序读段中识别 germline SNV 和小型 InDel。

其相关论文发表于 Nature Biotechnology,题为 A universal SNP and small-indel variant caller using deep neural networks。算法细节、模型类型和版本更新应以官方 GitHub 仓库及论文说明为准。

在医学科研中,SNV 和小型 InDel 是罕见病、遗传性肿瘤、药物基因组学、人群队列和功能基因组研究的重要基础数据。DeepVariant 位于比对和质控之后,注释、过滤、遗传模式分析和医学解释之前。

它的工作方式可以概括为:把候选位点附近的读段信息转换为模型可识别的表示,再由预训练模型判断基因型。研究者真正需要关注的不是“是否用了深度学习”,而是输出是否可复核、可追踪、可与下游流程兼容。

DeepVariant 通常输出 VCF 或 gVCF 文件。这些文件可继续进入 VEP、ANNOVAR、SnpEff、ClinVar、gnomAD、家系分析和队列统计流程。它解决的是变异检测问题,不负责判断某个变异是否致病。

适合的医学科研场景

DeepVariant 最适合的场景是高质量 WGS/WES 数据上的 germline SNV 和小型 InDel calling。例如,罕见病三联体研究可先完成样本比对和质控,再用 DeepVariant 生成患儿和父母的候选变异文件。

在遗传性肿瘤、心血管遗传病、神经发育障碍和药物基因组学研究中,研究团队往往需要对一批样本采用一致流程。DeepVariant 的容器化运行方式有利于固定版本、模型和参数,减少批次间人为差异。

对生物样本库和医学队列,DeepVariant 可作为标准化变异检测流程的一部分。研究者可以记录参考基因组版本、比对软件、DeepVariant 版本、模型选择和关键参数,以便论文复现和内部审计。

  • 罕见病 WES/WGS:生成候选 SNV/InDel,用于 de novo、隐性遗传、复合杂合和 X 连锁分析。
  • 遗传性肿瘤研究:检测生殖系小变异,再结合 ClinVar、gnomAD、家系史和文献证据筛选候选位点。
  • 药物基因组学研究:对相关基因区域形成可注释的基因型文件,用于后续药物反应或不良反应研究。
  • 方法学评估:与 GATK HaplotypeCaller、FreeBayes、bcftools 结果比较,分析不一致位点、低覆盖区域和低复杂度区域。

不适合的情况

DeepVariant 不适合被当作完整临床诊断系统。它不会自动完成 ACMG/AMP 判读,不会根据 HPO 表型自动给出诊断排序,也不会生成可直接签发的临床遗传检测报告。

如果研究目标是结构变异、CNV、融合基因、重复扩增、病毒整合、线粒体异质性或肿瘤低频体细胞突变,DeepVariant 不能作为唯一工具。此类任务通常需要 Manta、Delly、CNVkit、GATK-SV、Mutect2、Strelka2 或其他专门流程配合。

对于 FFPE 肿瘤样本、低肿瘤纯度样本、ctDNA 或目标捕获深度差异很大的 panel 数据,研究者需要特别谨慎。DeepVariant 的常见定位是 germline 小变异检测,不能简单替代体细胞突变检测流程。

简要判断:如果你的问题是“这个 WES/WGS 样本有哪些可靠的生殖系 SNV/InDel”,DeepVariant 值得评估;如果你的问题是“这个患者最终诊断是什么”,它只能提供上游数据输入。

输入、输出与流程位置

DeepVariant 通常需要已经完成比对、排序和索引的 BAM 或 CRAM 文件,以及与比对一致的参考基因组文件。上游步骤的质量会直接影响结果,包括测序深度、覆盖均一性、污染情况、重复率和比对质量。

在 WES 项目中,研究者还需要关注捕获区域文件、目标区域外变异是否纳入、低覆盖外显子如何处理等问题。在 WGS 项目中,则要考虑计算资源、磁盘空间、并行策略和批量样本的任务调度。

输出 VCF 或 gVCF 后,通常还要进行变异级别质控、样本级别质控、注释、频率过滤、遗传模式筛选和人工复核。对候选致病变异,应结合读段可视化、家系共分离、Sanger 或其他验证实验,以及机构内部规范。

环节DeepVariant 的作用仍需研究者完成的工作
上游接收已比对的 BAM/CRAM测序质控、比对、去重或相关预处理、参考基因组一致性检查
核心检测 germline SNV 和小型 InDel选择合适模型、记录版本参数、监控运行日志
下游输出 VCF/gVCF注释、过滤、家系分析、临床证据整理和验证

与 GATK、FreeBayes、bcftools 的比较

GATK HaplotypeCaller 在医学和群体基因组项目中应用广泛,生态较完整,常与 VQSR、GenomicsDB、联合分型等模块组合使用。DeepVariant 的优势在于模型化小变异检测和容器化部署便利,但并不意味着在所有数据上都一定优于 GATK。

FreeBayes 和 bcftools 相对轻量,适合快速比较、特定区域分析或资源受限环境。它们在某些数据类型和参数设置下也可表现稳定。医学科研项目不应只凭默认参数做结论,而应建立小规模验证集。

比较工具时,建议使用已知真值样本、家系一致性、重复样本、正交验证结果和关键疾病基因区域作为评估依据。只比较全基因组总体指标可能掩盖临床关注区域的差异。

数据隐私与合规注意事项

DeepVariant 可以在本地服务器、医院内网或受控 HPC 环境中运行,工具本身不要求把患者基因组数据上传到第三方服务。这一点对涉及人类遗传资源、罕见病家系和临床样本的项目很重要。

但本地运行并不等于没有隐私风险。BAM、CRAM、VCF、gVCF、日志文件和临时文件都可能包含可识别的遗传信息。项目应明确访问权限、目录隔离、备份策略、删除策略和结果共享边界。

如果使用容器镜像或工作流平台,应确认镜像来源、版本固定方式、运行时网络权限和日志收集机制。跨机构合作时,还要按伦理批件、数据使用协议和当地法规处理数据传输问题。

使用建议与论文方法学描述

在正式批量分析前,建议先用公开样本、内部阳性样本或小规模代表性样本测试流程。需要检查模型是否匹配测序平台、参考基因组是否一致、区域文件是否正确、输出格式是否符合下游软件要求。

论文或项目报告中,不宜只写“使用 DeepVariant 进行变异检测”。更完整的描述应包括 DeepVariant 版本、容器或安装方式、模型名称、参考基因组版本、上游比对流程、输入文件类型、关键参数和过滤标准。

对于与临床解释相关的研究,还应说明变异注释数据库版本、频率阈值、致病性证据来源、人工复核方式和验证策略。DeepVariant 产生的是候选变异集合,不应替代遗传咨询、临床会诊或实验室签发流程。

总体而言,DeepVariant 适合具备生信分析能力、重视可复现流程的医学基因组研究团队。它的价值在于稳定地产生可进入下游解释流程的小变异结果,而不是自动完成从测序数据到医学结论的全过程。

替代选择

如果 DeepVariant 不适合你,可以考虑:

GATK HaplotypeCallerFreeBayesbcftoolsClair3Strelka2

同类工具推荐

Seurat

R语言单细胞测序数据分析利器,整合、聚类、差异表达全流程处理。

查看详情

Humata AI

上传PDF文献,AI高效解析、智能问答、总结和数据提取,助力医学科研人员提升文献阅读与信息管理效率。

查看详情

DeepL Write

AI驱动的写作助手,助力医学科研人员提升英文论文的语法、风格和词汇表达。

查看详情

如果你需要更完整的文献工作流

从检索到精读,一站完成

这个工具适合特定场景。如果你需要中文检索、实时翻译、AI 辅助精读,可以试试超能文献。

了解超能文献
医学科研情报站

帮你省掉筛选工具的时间,发现值得关注的科研工具和方法

场景导航文献检索综述写作Zotero 插件论文阅读系统综述科研绘图论文写作医学 NLP生信组学医学影像AI科研工具开源项目科研方法科研资源工具对比评测标准超能文献超能妙译暖芽孕产 AppWildData 官网

© 2026 医学科研情报站

搜索