开放获取基因与基因组数据库指南:从序列归档到多组学与泛基因组

开放获取基因与基因组数据库指南

“基因数据库”并不是一种单一资源。原始测序读段、组装后的基因组、参考注释、群体变异频率、组织表达量和疾病关联记录,通常由不同数据库保存;其中一些文件可以匿名下载,另一些即使元数据公开,也必须经过数据访问委员会审批。

这篇文章最初写于 2025 年,现按 2026 年 9 月 2 日能够核实的官方资料重新整理。本文还补充了参考注释、临床变异、单细胞、泛基因组、模式物种、微生物组和国内归档等常用资源。

先看结论:按研究任务选择

研究任务 优先资源 适合取得的内容 访问提示
查找公开核酸序列与原始测序 GenBank/SRAENADDBJ/DRA 提交序列、FASTQ、组装、项目和样本元数据 INSDC 三节点每日交换公开数据,任选距离和工具更合适的一端
下载参考基因组及注释 NCBI Datasets/RefSeqEnsemblUCSC FASTA、GFF/GTF、转录本、蛋白质、比较基因组 必须记录物种、组装版本和注释版本
统一人类基因注释 GENCODEMANEHGNC 基因模型、代表转录本、标准基因符号 基因符号会变更,分析表中应同时保留稳定 ID
查询群体变异频率 gnomADIGSR/1000 GenomesdbSNP/dbVar 变异位点、等位基因频率、结构变异及群体信息 gnomAD 主要提供汇总频率,不提供可识别个体的基因型
解释临床变异与基因—疾病关系 ClinVarClinGen 提交者解释、证据冲突、基因有效性与剂量敏感性 数据开放不代表结论一致,也不能替代临床诊断
检索 GWAS 关联 NHGRI-EBI GWAS Catalog 性状—变异关联、研究信息和部分汇总统计 汇总统计的许可和可下载性仍需逐项检查
获取表达谱 GEOBioStudies ArrayExpressExpression AtlasGTEx 微阵列、RNA-seq、组织表达和 eQTL GTEx 的表达汇总开放,个体级原始数据受控
分析调控元件与表观组 ENCODE 染色质可及性、转录因子结合、组蛋白修饰等 注意细胞类型、实验批次和参考组装
癌症基因组学 NCI GDC/TCGAICGC ARGOcBioPortal 肿瘤多组学、临床字段、队列级可视化 开放的派生数据与受控的个体级数据并存
单细胞和空间组学 Human Cell AtlasCZ CELLxGENE 标准化细胞矩阵、元数据、跨数据集查询 适合发现与再分析,仍应回到原研究核对样本设计
植物与模式物种 Ensembl PlantsPhytozomeAlliance of Genome Resources 植物基因组、比较基因组、模式物种基因与表型 Phytozome 的预发表数据可能有额外使用条款
微生物和宏基因组 MGnifyIMG/MGTDB 宏基因组分析结果、微生物基因组和标准化分类 原始读段通常仍应追溯到 ENA/SRA/DRA
中国境内归档与平台补充 GSAGWHOMIXCNSA 原始测序、组装基因组、多组学与项目元数据 公开、注册可见和受控数据需分别判断

如果只需要一套“最小工具箱”,可以从 NCBI Datasets + ENA + Ensembl/UCSC 开始;做人类研究时再加入 GENCODE/MANE、gnomAD、GEO/GTEx/ENCODE,疾病研究则按需要补充 ClinVar/ClinGen、GDC 和 ICGC ARGO

“开放获取”至少有三种层级

本文用下面三种状态描述访问条件:

  • 开放下载: 无需逐项目申请即可下载公开文件,但仍需遵守署名、引用或第三方许可。
  • 注册或附加许可: 可以用于研究,但可能需要账户、用途声明,或仅限非商业使用。
  • 受控访问: 通常只有元数据和汇总结果公开;涉及可识别人类个体的基因型、原始读段或详细临床资料,需要伦理审批和数据访问委员会授权。

因此,“数据库公开”“论文开放”和“原始数据开放”是三个不同命题。例如 dbGaPEGAJGA 是重要的人类基因组归档,但核心个体级数据属于受控访问;它们不应被写成可以任意抓取的开放数据源。

一、基础归档:INSDC 是公共序列数据的底座

国际核酸序列数据库合作联盟(INSDC)由三个平等节点组成:美国 NCBI 的 GenBank/SRA、欧洲 EMBL-EBI 的 ENA,以及日本 DDBJ/DRA。三方交换公开的核酸序列、原始读段及相关元数据,原则上免费、不附加再分发限制。它们不是三个彼此独立、需要全部重复下载的数据库。

GenBank、ENA 与 DDBJ 各自适合什么

  • GenBank / SRA: 与 NCBI Gene、RefSeq、Assembly、BioProject、BioSample 和 PubMed 的交叉链接最完整,E-utilities、NCBI Datasets 和 SRA Toolkit 适合自动化工作流。
  • ENA: Portal API、Browser API、FTP 和云端文件链接较容易组合,尤其适合按项目批量取得 FASTQ 地址和校验和。
  • DDBJ / DRA: 提供同等的国际归档能力,并与日本的受控人类数据库 JGA、表达归档 GEA 等资源衔接。

GenBank 是“提交者序列档案”,不能简单称为全部经过人工核验的标准答案。序列可能冗余,注释质量也会因提交者和年代不同而变化。研究中的参考序列应优先查看 RefSeq 或 Ensembl/GENCODE 注释,同时保留原始 accession 及版本后缀,例如 NM_000546.6,而不是只写 NM_000546

国内的基础归档

国家基因组科学数据中心(NGDC)的 GSA 保存原始组学数据,GWH 保存组装基因组,OMIX 面向多组学数据;国家基因库生命大数据平台的 CNSA 也承担测序和多组学归档。这些资源对国内数据提交、合规管理和下载速度有实际价值,但不能把它们误写成 INSDC 的第四个节点。不同项目是否公开、能否商业使用、是否需要数据访问委员会审批,应以项目详情和平台条款为准。

二、参考基因组、基因注释与浏览器

RefSeq 与 NCBI Datasets

RefSeq提供非冗余、经过整理的基因组、转录本和蛋白质参考序列;它与保存原始提交记录的 GenBank 定位不同。批量下载时,NCBI Datasets比手工拼接 FTP 路径更容易记录内容清单和版本。例如下载人类 GRCh38 组装及常用注释:

1
2
3
datasets download genome accession GCF_000001405.40 \
--include genome,gff3,rna,protein \
--filename human_GRCh38_dataset.zip

Ensembl、GENCODE、MANE 与 UCSC

  • Ensembl提供跨物种基因注释、同源关系、变异、调控和比较基因组,支持网页、BioMart、REST API 和 FTP。
  • GENCODE是人和小鼠的高质量参考基因注释。人类第 50 版对应 GRCh38.p14;使用时应把 GENCODE 版本写入方法部分。
  • MANE Select由 NCBI 与 EMBL-EBI 协同提供,为每个人类蛋白质编码基因选择完全一致的 RefSeq—Ensembl 代表转录本,适合临床报告和跨数据库对齐。
  • UCSC Genome Browser最适合把基因、变异、保守性、调控和用户自定义轨道放到同一坐标系观察;批量分析应改用 Table BrowserREST API 或下载站点,而不是抓取网页。

HGNC负责维护人类基因的标准符号和历史别名,NCBI Gene适合从一个基因入口串联参考序列、表型和文献,UniProt则补充蛋白质功能、结构域和序列证据。一个可靠的数据表至少应同时保留 标准符号、稳定基因 ID、转录本 ID、组装版本和注释版本

GRCh38、T2T-CHM13 与人类泛基因组

GRCh38 仍是大量临床数据库、队列和工具链的主要坐标系统;T2T-CHM13填补了着丝粒等区域,提供更完整的单倍型参考;Human Pangenome Reference Consortium(HPRC)则用多个人类单倍型和图结构减少单一线性参考的偏差。三者不能仅以“新旧”互相替换:选择哪一种取决于研究问题和下游工具,跨版本比较必须进行坐标转换并报告失败或歧义位点。

三、人群变异、临床解释与复杂性状

gnomAD、IGSR 与 NCBI Variation

gnomAD汇总大规模外显子组和全基因组队列,提供等位基因频率、基因约束和质量控制信息。当前 v4 系列以 GRCh38 为基础,适合判断变异在不同祖源人群中的稀有程度,但不公开可还原到个体的完整基因型,也不代表全球人群被均匀抽样。

IGSR维护并扩展 1000 Genomes Project 数据,适合取得开放的群体单倍型、基因型和高覆盖重测序数据。dbSNPdbVar分别保存小变异与结构变异的标识和提交记录。rs 编号只说明某个变异被登记,并不自动意味着它常见、致病或已被独立验证。

ClinVar、ClinGen 与 GWAS Catalog

ClinVar汇总实验室、专家组等提交者对变异临床意义的解释,并明确展示审核状态和冲突。它并不会替所有提交者重新完成证据审查,因此应同时读取 review status、condition、提交日期和证据说明。ClinGen进一步提供专家整理的基因—疾病有效性、变异解释框架和剂量敏感性证据。

GWAS Catalog整理全基因组关联研究中的性状—变异关联,并逐步收录可下载的汇总统计。关联位点通常不是已经确定的因果变异,跨祖源迁移也可能失效;建模时要核对样本重叠、等位基因方向、基因组版本和原研究许可。

四、表达、调控与单细胞数据

GEO、ArrayExpress、Expression Atlas 与 GTEx

  • GEO保存微阵列、RNA-seq、单细胞和其他功能基因组实验的原始或处理后数据。GEO 的 GSE、样本 GSM 与底层 SRA run 应分层记录。
  • 旧的 ArrayExpress 独立界面已于 2022 年关闭,数据迁移到 BioStudies 的 ArrayExpress collection。旧脚本、下载地址和教程可能已经失效。
  • Expression Atlas对选定研究统一重分析,适合回答“某基因在哪些组织或条件表达”;若要复现实验,则应回到对应的 BioStudies/ENA/GEO 原始记录。
  • GTEx提供多组织表达和 eQTL 汇总结果。门户中的表达矩阵与统计结果可以公开下载,个体级 DNA/RNA 数据及完整供体信息需要经 dbGaP/AnVIL 申请。

ENCODE 与历史表观基因组项目

ENCODE提供染色质可及性、转录因子结合、组蛋白修饰、RNA 结合蛋白等调控数据,并公开已发布的 consortium 数据和质量指标。Roadmap Epigenomics 仍有历史价值,但其原始受控数据主要在 dbGaP、处理后数据在 GEO,相关元数据也已被 ENCODE 整合。对这类数据,实验类型、抗体、细胞状态和生物学重复往往比单纯扩大样本文件数量更重要。

Human Cell Atlas 与 CZ CELLxGENE

Human Cell Atlas Data Portal聚合人体多器官的单细胞和空间组学项目;CZ CELLxGENE Discover把大量公开单细胞数据标准化后用于跨研究查询,并提供 Census API。它们非常适合数据发现、细胞类型参照和大规模计算,但标准化矩阵不能代替原论文的纳入标准、批次信息和原始计数。训练模型时还应检查同一队列是否被多个门户重复收录。

五、癌症基因组数据库

NCI GDC / TCGA

Genomic Data Commons(GDC)统一管理 TCGA 等 NCI 癌症队列。体细胞突变、表达等部分派生数据以及有限临床字段可开放取得;原始序列、种系变异和可能识别个体的临床数据通常受控。批量下载可使用 GDC API 和 Data Transfer Tool,但应先在数据字典中确认每个字段的含义。

ICGC ARGO、cBioPortal 与 COSMIC

ICGC ARGO是 ICGC 当前的临床—基因组平台,使用统一的 GRCh38 分析流程;早期 ICGC 25K 项目属于 legacy 数据,不能与 ARGO 直接当作同一批次合并。cBioPortal适合队列级查询、可视化和 API 分析,但其中每项研究仍继承原数据源的许可和取样偏差。

COSMIC是重要的人工整理体细胞突变知识库,却不属于“无限制开放数据”:下载需要注册,免费使用受非商业许可约束,商业用途需要授权。类似地,能够在线检索的资源不一定允许批量复制或训练商业模型。

六、植物、模式生物、微生物与非编码 RNA

植物与模式生物

Ensembl Plants适合跨物种注释和比较基因组,Phytozome汇集 DOE JGI 的植物基因组与基因家族。Phytozome 中部分预发表数据带有发布前使用限制,下载前应逐物种阅读 policy。

Alliance of Genome Resources把小鼠、果蝇、线虫、斑马鱼、酵母、爪蟾和大鼠等模式生物数据库中的基因、表型和疾病信息统一连接;需要最高粒度的注释时,再回到 MGI、FlyBase、WormBase、ZFIN、SGD、Xenbase 或 RGD。非编码 RNA 可补充使用整合多个成员库的 RNAcentral

微生物和宏基因组

MGnify提供标准化的宏基因组、宏转录组和扩增子分析;IMG/M适合微生物基因组和微生物组的基因注释与比较;GTDB依据基因组系统发育提供标准化的细菌和古菌分类。原始测序读段仍通常保存在 ENA/SRA/DRA,分析结果数据库不能替代原始 accession 和样本环境元数据。

JGI 旧 Genome Portal 已在 2026 年退役,其功能由新的 JGI Data Portal承接。旧手记或论文中的下载链接失效时,应从 Data Portal 或 IMG/M 按项目名和 accession 重新定位,而不是继续引用旧入口。

七、可复现下载:不要只留下一个网页链接

ENA:按项目列出 FASTQ 和校验和

1
curl -s "https://www.ebi.ac.uk/ena/portal/api/filereport?accession=PRJEB2772&result=read_run&fields=run_accession,fastq_ftp,fastq_md5&format=tsv"

Ensembl REST:按稳定 ID 查询基因模型

1
2
curl -H 'Content-Type: application/json' \
'https://rest.ensembl.org/lookup/id/ENSG00000139618?expand=1'

一次可复现的数据下载至少要保存:

  1. 数据库名称和访问日期;
  2. project、sample、run、assembly、gene/transcript 等 accession 及版本;
  3. 查询条件、API/命令行工具版本和原始 manifest;
  4. 文件大小及 MD5/SHA 校验和;
  5. 参考组装、注释版本、样本纳入排除条件和访问许可;
  6. 从原始数据到训练/统计矩阵的处理脚本和随机种子。

对于规模较大的项目,最好先下载元数据表并检查样本数、测序平台、读长、布局、组织、疾病状态和可用文件,再决定是否传输 FASTQ/CRAM。只依据网页上显示的“样本数”抓取文件,很容易把技术重复、重提交或同一受试者的多个样本误当成独立样本。

八、常见误区与数据库边界

误区 更准确的做法
“有 rs 编号就是已验证变异” rs 是登记标识;频率、临床意义和证据等级需分别查 gnomAD、ClinVar 和原文
“最新版注释一定适合所有研究” 新版更完整,但旧队列、芯片和临床知识库可能固定在旧组装;先确定坐标体系
“网页可搜索就是开放数据” 检查下载条款、批量访问、商业用途和个体级访问状态;COSMIC、OMIM、HGMD 等尤其不能混写为无限制开放
“数据库中的记录都经过统一人工审核” GenBank、ClinVar 等包含提交者记录;查看来源、审核状态、版本和冲突
“处理后矩阵可以替代原始数据” 处理后矩阵便于比较,但会继承参考版本、过滤、标准化和批次校正选择
“数据越多越适合训练生物序列模型” 还要处理许可与同意范围、群体偏差、样本泄漏、重复序列、元数据缺失和数据来源追踪

特别需要区分几类常被误称为“开放数据库”的资源:HGMD 以订阅为主;OMIM 可以公开检索但受版权和批量使用条款约束;COSMIC 的免费许可主要面向非商业用途;dbGaP、EGA、JGA 则是受控人类数据归档。它们都可能非常重要,只是访问模型不同。

结语:从任务和数据层级出发

选择数据库时,最有效的问题不是“哪个数据库最大”,而是:我要的是原始读段、参考序列、基因模型、群体频率、表达矩阵,还是专家整理的疾病证据?确定数据层级后,再检查组装与注释版本、访问级别、样本重叠、许可和可复现下载方式。

对于人工智能研究,公开可下载只是最低门槛。真正决定数据能否可靠用于训练和评估的,是来源可追踪、元数据足够、许可明确、队列划分无泄漏,并且不同数据库之间的 accession 和版本能够互相对应。