知識庫

常見問題解答,以及遺傳譜系學的關鍵術語解釋。

常見問題

常見問題

我的 Y 单倍群是 O2a,这代表什么?
O2a 是父系单倍群树上的一个节点,代表你通过"纯父系"这一条线,可上溯到带有 O2a 定义突变的那位古代男性祖先。它说明你属于 O2a 这一父系支系,但不代表你全部祖先都来自同一个人群。想知道更具体,可继续看 O2a 的下游支系与属于你的定义突变。
O2a 和 O-M122 是同一个东西吗?
很可能是同一支系的两种命名:O2a 是层级命名(ISOGG 风格),O-M122 是突变名命名(M122 为该支系的定义突变)。判断是否同一支系,应看它们是否指向同一父节点链、是否共享相同的定义突变,而不是只比名字。
为什么我的单倍群和朋友的差很多?
同一父系单倍群下还有大量下游分支,你和朋友可能共享上游大支(如都属于 O),但落在不同的下游细支,因此名字看起来差很多。也可能一个在较上游、一个在较下游(细分深度不同)。这属正常,看谱系链是否在某个节点汇合即可判断远近。
为什么我的支系下样本很少/很多?
树越往下游越细分,单个细支的样本数通常很少;而靠近根或热门大支下样本很多。样本少不等于你是"稀有/特殊人群",只是该细支目前被采集/检测到的人少。随着更多样本加入,支系会继续细化。
我能查到的最早祖先是哪个单倍群?
沿你的谱系链一路向上到根,链的最上游节点就是你能追溯到的最早父系单倍群(通常是某一大字母支,如 O、C、N、D、R 等)。越靠近根,共祖时间越早、范围越大。
数据从哪里来?多久更新一次?
父系树与突变数据综合了公开研究、古 DNA 样本以及用户提交的样本,持续整合更新;新样本加入后支系会被细化,因此单倍群和树会随时间演进。具体的数据来源与更新口径以站点说明为准。
怎么在网站上查自己的单倍群路径?
在站点单倍群页可查看该节点的定义突变(等价突变)、上溯到根的谱系链以及下游子树;样本页可按单倍群/姓氏/民族/国家筛选,观察该支系的人群分布。若用程序查询,可用站点的公开只读 API(/api/v1/agent/*)。
我的样本和某个古 DNA 样本是同一个支系吗?
若你与该古样本共享同一支系(落在同一(或更上游的同一)节点的定义突变上),则属于同一父系支系,可据此对照其年代与地域。古样本常用于校准树的年代与分布,是研究某支系历史的重要参照。
单倍群能告诉我是哪个姓氏或民族吗?
只能给"倾向性"线索,不能直接断定。同一姓氏/民族内常有多种父系单倍群,同一单倍群也跨越多个姓氏/民族。可以观察到"某单倍群在某姓氏/地域中偏高",但这只是概率性的关联,不能作为确定结论。
为什么单倍群树会不断变化?
因为新样本、新检测位点、新研究不断加入:发现新的定义突变就会新增或细分节点,命名与共祖时间也可能被修订。这是正常且健康的演化,说明数据在持续完善。
我的隐私数据怎么保护?
个人检测数据与祖源信息属敏感个人信息。站点对用户数据按隐私策略管理、不随公开知识对外暴露;查看公开树/样本分布用的是聚合信息。具体的数据使用与隐私条款以站点的隐私说明为准。

平台操作

我已经上传了数据,怎么上树?「待审核」是什么意思、一般要多久?
上树流程:上传原始数据 → 系统比对定位支系 → 提交上树申请 → 进入「待审核」状态。「待审核」表示样本/支系定位还需要人工或系统复核,复核通过后样本才会出现在树上;未通过前不会显示。审核时长视样本量与复核情况而定,具体进度请以站内通知或「我的样本」中的状态为准。若你已有样本,可在个人中心「我的样本」查看当前状态。
如何添加样本、标记哪个样本是本人,以及在哪里查看报告?
这三步都在站内自助完成(务必由本人操作):①【添加样本】上传检测数据——可走「极速上树」提交数据下载地址/资料,或到「我的样本」自助登记/上传;已知父系单倍群时可直接挂到对应支系下。流程为:上传原始数据 → 系统比对定位支系 → 提交上树申请 → 进入「待审核」,审核通过后样本才会出现在树上。②【标记本人】在「我的样本」里对属于本人的那一份点「★ 设为我本人」;已标记后该行会改为「取消标记」;名下有多个样本(含代管)时,一律以该标记为准。③【查看报告】报告就在「我的样本」里,点开对应样本即可看到父系单倍群归属、定义/等价突变、上溯谱系链、下游分支以及母系等信息。
我改了名字/标签,但单倍群(haplo)或树页面还是显示旧名字,怎么办?
显示名的来源因位置而异:账号昵称、样本标签名、树节点显示名是三个不同字段;单倍群(haplo)/树页面读取的是样本标签或节点显示名,不会自动跟随账号昵称。请在对应位置修改(样本详情里改样本标签,或树节点设置里改显示名)。另外平台把用户信息缓存在登录会话里,改完后通常需要重新登录(或清缓存)才会刷新,也可能有短暂缓存延迟,可先刷新/稍后再看。若仍不生效,可提交工单。

概念解釋

为什么某个突变(比如 KHU7997、TY452211)没有出现在 Y 树上?「项目未编号突变」是什么意思?
Y 树上展示的突变大致分三类:① 已收录且有正式编号的突变(YFull/ISOGG 命名,如 R-M269 这类);② 项目/实验室内部编号的突变(如 TY、KHU 等前缀),尚未被公共树收录,通常因样本量不足或未提交公共数据库;③ 未编号突变(私有/未命名),多为个人私有突变,对划分分支的价值有限,但可用于个人谱系定位。未收录并不等于无效——公共树收录存在滞后与门槛,建议关注相关样本的积累与提交。这类突变对分支划分、宗亲匹配与共祖时间(TMRCA)估算都有参考意义。
除了本站,还有哪些网站/工具可以运行 E11 常染成分?
E11(Eurasia 11)是常用的常染色体祖源计算器,最初由 WeGene 微基因社区推出。可运行的地方大致三类:①微基因(WeGene)官方——其祖源分析包含 E11,本人在微基因检测即可查看(最权威、最省事);②第三方在线祖源计算器平台,如 GEDmatch,可用 23andMe/微基因/23魔方等原始数据运行 E11 的适配版本;③DIY 类工具,如 Admixture Studio、DIY Dodecad,需自行准备数据与参考面板。请注意:不同平台的面板版本、成分命名与算法口径不同,E11 数值不可跨平台直接横比,建议在同一平台内纵向对照。

術語表

術語

术语:单倍群(Haplogroup)
单倍群(Haplogroup)指由一组共享的遗传标记(突变)所定义的人群谱系。父系单倍群基于 Y 染色体上的突变(Y-SNP)划分,同一个父系单倍群内的人,被认为来自同一位古代男性祖先。
- 每个单倍群由若干"定义突变"(defining mutations,见"等价突变")标识,例如 O2a 由 O-M122 等标记定义。
- 单倍群呈树状:根节点是最早的祖先单倍群,越往下游(子节点)越晚近、越细分。
- 命名通常用字母+数字(如 O2a)或字母+代表突变名(如 O-M122)。
- 父系单倍群只反映"父父父……父"这一条线,不代表一个人的全部祖源。
术语:父系单倍群(Y)与母系单倍群(mtDNA)
人的祖源有两条单线谱系:
- 父系单倍群(Y 单倍群):沿父→子的 Y 染色体相传,只传男性,反映"父系祖先"。
- 母系单倍群(mtDNA 单倍群):沿母→子女的线粒体相传,男女都携带,但只有女性继续传下去,反映"母系祖先"。
两者相互独立:一个人的父系单倍群和母系单倍群来自不同的远祖。本站"祖源树/父系树"以 Y 单倍群为主。除这两条单线外,其余祖先的贡献由常染色体 DNA 反映(见"常染色体祖源成分 vs Y 单倍群")。
术语:SNP(单核苷酸多态性)
SNP(Single Nucleotide Polymorphism,单核苷酸多态性)指基因组某个位置上单个碱基的差异,例如在某个位置由 C 变成了 T。在 Y 染色体研究中,SNP 是划分父系单倍群的主要依据。
- 一个 SNP 常以其坐标或突变名(如 M122、F15365)表示。
- "定义突变"= 用来界定某个单倍群的 SNP;同一单倍群的等价突变可能不止一个。
- 本站的突变记录包含坐标(含 hg19 / CP086569 等多套参考基因组坐标)、参考碱基(ref)、突变碱基(alt)等信息,见"突变名与参考基因组"。
术语:Y-STR(短串联重复)
Y-STR(Short Tandem Repeat,短串联重复)指 Y 染色体上一段反复重复的短序列(如 "AGAT" 重复若干次)。不同男性在同一位点的重复次数可能不同,因此常用来做父系亲缘比对和家系鉴定(如 Y-STR 单倍型)。
- 与 Y-SNP 不同:STR 变化快(高突变率),适合近几百年—几千年内的父系关系;SNP 变化慢,适合界定大尺度的单倍群。
- 同属一个 Y 单倍群的男性,其 Y-STR 值通常相近但不完全相同;STR 相同也不等于同单倍群(需结合 SNP)。
术语:突变名与参考基因组(hg19 / CP086569)
同一个突变(SNP)在不同参考基因组下有不同坐标,因此坐标必须成套标注,否则会混淆。本站突变记录通常同时保存多套坐标,常见参考基因组有:
- hg19(GRCh37):历史最常用的人类参考基因组。
- hg38(GRCh38):较新版本,坐标为 hg19 的另一套数值。
- CP086569(如 CP086569.1 / CP086569.2):更新的 T2T 类参考基因组,'1'/'2' 为不同版本。
使用时务必注意坐标属于哪一套参考;直接拿不同参考的坐标比对会错位。突变名(如 M122、F15365)则不随参考基因组改变,是更稳定的标识。
术语:ISOGG 命名 与 魔方名(-MF)
同一支系常有两套并行命名:
- ISOGG 命名:国际单倍群命名体系(如 O2a2b1a1a1a1),带字母数字层级。
- 魔方名:以突变名给出的商用手册名(如某分支以 -MF 开头,如 O-MF12345),便于记忆和对照。
两者指同一支系时是等价的。本站不同来源的节点可能分别采用其中一种,因此会出现"看起来不一样、其实是同一个"的情况(见"为什么我在不同公司/数据库得到的单倍群不一样")。-MF 名约占本站树节点的 13% 左右。
术语:等价突变(Equivalent mutations)
等价突变指在系统发育树上是"同一事件、同一位置"的多个突变名。它们互为等价,只体现一次,但会以多个名字并列出现(常见用斜杠连接,如 FGC24753/YP1711)。
- 作用:只要检测到其中任意一个,就可判定样本属于带有该突变的单倍群。
- 在树/记录里,等价突变通常合并存储(本站的合并突变表约 38 万行,其中约 35% 含斜杠合并名)。
- 与"平行突变"不同:等价突变是同一祖先事件的别名,平行突变则是不同事件恰好落在相似位置(见"平行突变")。
术语:平行突变(Parallel mutations)
平行突变指在不同谱系中"独立、多次"发生的突变,可能让不同单倍群带上基因坐标相似的标记(如某个坐标/碱基组合被多个单倍群共用)。
- 后果:仅凭一个 SNP 的坐标,可能对应多个单倍群。本站实测中,同一 SNP 坐标最多可对应十多个不同单倍群。
- 正因如此,SNP→单倍群的解析必须返回"全部命中",而不能只取一个;否则会误判。
- 与"等价突变"区别:等价是同一事件的别名,平行是不同事件的巧合/趋同。
术语:支系(下游分支 / 子节点)
支系指树中某个节点及其所有下游(更深、更晚近)的单倍群。描述位置常用:
- 上游:更靠近根、更早、范围更大(如 O)。
- 下游:更远离根、更晚近、更细(如 O2a2b1a1)。
一个支系内的样本共享该支系的定义突变。树越往下游,分支越多、样本越少;因此"我的支系下样本很少"是常见且正常的情况。
术语:共祖时间(TMRCA / 节点年龄)
共祖时间指某个单倍群(支系)内所有人"最近共同父系祖先"所生活的年代,常用 TMRCA(Time to Most Recent Common Ancestor)表示,即该节点的"年龄"。
- 估算依据:定义突变数量、突变率与分子钟模型,结合已知年代样本校准。
- 结果是一个**区间估计**(如"约 5000–8000 年前"),有误差;不同算法/参数会有差异。
- 越靠近根的节点年龄越大,越下游越晚近。
- 常与考古/古 DNA 证据互相印证。详见"共祖时间(年龄)是怎么估算的"。
术语:谱系链(上溯链 / lineage)
谱系链指从某个单倍群沿父节点一路向上,直到根的单倍群序列(如 J-ZS1805 → … → J → … → 根)。它展示了该支系的演化路径与层级关系。
- 本站提供"上溯到根"的谱系链查询。
- 与之相对的是"子树"(某节点的所有下游)。
- 判断"谁更早/谁包含谁"应以父节点链(谱系关系)为准,而不要只看名为"level"的字段——该字段可能并不等于真实深度。
术语:观察中突变(under observation)
"观察中"指该突变(或其所属分支)目前证据尚不充分、暂未正式定级或仍在持续收集样本验证的状态。
- 本站的突变记录用 `under_observation` 字段标识(约数千条为观察中)。
- 检索/展示时通常可排除"观察中"突变,只显示已确认的;也可选择包含以了解最新进展。
- 与"status"字段不同:本站突变表的 status 字段全部为 0,**不要**用 status=1 去过滤,否则会得到空集;要排除未确认分支应使用 `under_observation=0`。
术语:样本与参考样本
- 用户样本:个人的 Y 检测结果,可标注其所属单倍群/支系、姓氏、地域等。
- 参考样本 / 古 DNA 样本:来自已发表研究或古人遗骸的样本,用于校准树结构、共祖时间与分布。
本站的"样本"页汇总了用户样本与古样本,可按单倍群、姓氏、民族、国家筛选,用于观察某支系的人群分布与历史。
术语:常染色体祖源成分 vs Y 单倍群
两者反映不同的事实,切勿混为一谈:
- 常染色体祖源(如"北方汉族 60%、南方汉族 30%"):来自全部祖先的混合比例,是"整体的、多条线"的祖源画像。
- Y 单倍群:只反映你的"纯父系"这一条线,是单线、点状的事实。
因此,一个人完全可能"常染色体主要是某地人群、但 Y 单倍群来自另一个方向"。本站祖源树以父系单倍群为主,与常染色体祖源成分互补。

方法學

方法学:如何读懂一棵 Y 单倍群树
阅读 Y 单倍群树的基本方法:
1. 根在顶部/一侧,是最早的祖先;越往下游越晚近。
2. 每个节点是一个单倍群,由若干"定义突变"标识。
3. 相邻节点之间是一条父→子的继承关系;从某节点向上到根就是它的谱系链。
4. 一个节点的"子树"是它所有下游单倍群;大支的子树可能非常庞大(上万节点),通常需要分层(逐级展开)来浏览。
5. 判断归属以"定义突变"为准;名字(ISOGG 或魔方名)只是标签,可能因来源不同而不同。
方法学:单倍群是如何命名的
父系单倍群的命名有两类常见体系:
- 层级命名(ISOGG 风格):用字母+数字,如 O → O2 → O2a → O2a2b1a1,层级越深字母数字越长,表示越下游。
- 突变名命名:用代表性突变命名,如 O-M122、O-F15365,直接给出"定义突变"。
实际使用中两套体系并存且可互相对应(同一支系两种名字)。此外还有商业机构的内部名(本站所见魔方名以 -MF 标注)。比较时请以"定义突变 + 父节点链"为准,而不是只比名字。
方法学:为什么同一个 SNP 可能对应多个单倍群
原因主要有二:
1. 平行突变:同一个基因组坐标/碱基变化在不同谱系中独立发生,于是被多个单倍群共享。
2. 等价/合并:不同名字实为同一突变,或合并存储导致一个"名"展开后对应多个下游节点。
因此,把"一个 SNP"直接等同于"一个单倍群"是危险的。正确做法是:解析 SNP 时返回**全部**命中的单倍群(本站实测同一 SNP 最多对应十多个单倍群),并结合父节点链与更多标记来消歧。
方法学:一个基因样本如何被归入某个单倍群
大体流程(简化):
1. 测序得到该男性 Y 染色体上的突变位点(SNP)与 STR 值。
2. 将检测到的突变与树上的"定义突变"逐级比对:从上游到下游,看样本命中了哪一层的定义突变。
3. 命中越深的定义突变,就越能确定到越下游的单倍群/支系。
4. 若命中存在平行突变或证据不足,则暂标注为"观察中"或停留在较上游的安全层级。
5. 结合更多同支系样本可进一步细分。因此单倍群判定是"随数据与样本增加而不断细化"的过程。
方法学:共祖时间(年龄)是怎么估算的、误差有多大
共祖时间(节点年龄/TMRCA)的估算思路:
- 统计该支系累积的突变数量;用"突变率 × 时间"的分子钟模型反推时间。
- 用已知年代的样本(如放射性碳定年的古 DNA)做校准,缩小误差。
- 结果通常是一个**区间**而非单值,误差可达数百到数千年,取决于突变率、样本量与模型。
因此同一支系在不同算法/数据库下年龄可能不同,属正常现象。解读时应看区间与量级,而不是纠结于精确到某一年。
方法学:为什么我在不同公司/数据库得到的单倍群不一样
常见原因:
1. 命名体系不同:ISOGG 层级名 vs 突变名 vs 商业内部名(-MF),实为同一支系却看着不同。
2. 树版本/细分深度不同:新样本不断加入,树会细化,你现在更下游、名字更长。
3. 覆盖的突变位点不同:检测的探针/位点越多,越能落到更深的支系。
4. 平行突变或证据不足导致上下游判断差异。
结论:不同来源的单倍群若"父节点链一致、定义突变重叠",其实是同一个;差异多来自命名与版本,而非你真的属于不同人群。
方法学:等价突变与平行突变在树上的作用
- 等价突变:是同一祖先事件的多个别名,互为等价。树上一个节点常列出多个等价名(斜杠连接);检测到其中任一个即可判归该节点。合并存储便于统一。
- 平行突变:是不同谱系中独立发生的相似突变,会让不同节点"看起来共享"某个坐标。它要求解析时返回全部命中,并借助父节点链/更多标记消歧。
二者都会影响"一个突变对应几个单倍群"的判断,是 SNP 解析必须处理的核心问题。
方法学:树为什么要分层展开(大支默认只展开若干层)
一棵成熟的父系树可达数万节点,某些大支(如 O 的某分支)后代上万。若一次把所有下游节点全部返回,数据量会大到无法阅读/传输。
常见处理:
- 大支默认只展开相对根若干层(如 6 层),更深的子节点折叠,需要时再逐级下钻。
- 小支(后代数较少)或用户主动请求时才全部展开。
这样既能看到主干结构,又能按需深入细支。本站的子树查询即采用"默认限层 + 边界节点可继续下钻"的策略。


微信掃一掃

© 2020-2026 TheYtree.com