开源我的个人基因分析流程
去年做完 WeGene 的全基因组测序之后,我就一直想自己分析试试。于是就有了这个项目。
整个项目是和 Claude 一起完成的,把分析流程整理成了 Skill 的形式,并开源到了 GitHub:https://github.com/DayuGuo/genome-atlas-skill
目前 WeGene 的原始测序数据体量比较大,我还在后台申请下载权限,暂时没有拿到。因此这一轮分析使用的是大约 15 MB 的基因型数据表,而不是 FASTQ/BAM 这类原始测序文件。
也正因为如此,这套工作流对普通爱好者其实比较友好:不需要很强的计算资源,有类似的消费级基因检测数据就可以自己尝试分析。
整体来看,得到的主要结论和 WeGene 官方报告差异不大,但自己把数据从头到尾跑一遍,还是挺有趣的,并且能改用自己喜欢的可视化方案。
完整结果可以直接查看网页版报告:https://dayuguo.github.io/genome-atlas-skill/example/report.html

其中一些我觉得比较有意思的结果:
- 父系这条线属于 O-F438,母系属于 D4h1,两个都是北方汉族里很常见的支系。把我的数据放进全世界两千五百个人的坐标里,我落在东亚人堆中间,再放大到汉族内部,偏北方一点。
- 携带一个和“喝酒脸红”相关的酒精代谢基因型。简单来说,酒精首先被转化成乙醛,而我的乙醛清除能力可能相对较弱,因此饮酒后更容易积累乙醛。
- 携带一个影响硫嘌呤类药物耐受和剂量选择的 NUDT15 变异。如果以后需要使用硫唑嘌呤、巯嘌呤等药物,这个结果值得提前告诉医生,并通过正规的药物基因检测确认。
- 东亚人常见的“粗直头发”基因型。头发偏粗偏直、门牙内侧呈铲形的可能性大。
- 干性耳垢,腋下体味轻。这个基因几乎决定耳垢类型,东亚人绝大多数如此。
- 带一个 2 型糖尿病常见风险变异,风险比不带的人高三到四成。这是人群统计,个人风险主要还是看体重、饮食和运动。
- 咖啡因代谢倾向于偏慢。理论上可能意味着下午或晚上喝咖啡更容易影响睡眠,不过个体差异很大,这一项更适合当作参考。
- COMT 基因 Val/Val 型,大脑里分解多巴胺偏快。
这个项目目前还只是第一轮。等 WeGene 开放原始测序数据下载之后,后面还可以继续往 VCF、药物基因组学、致病变异注释、多基因风险评分,以及更完整的祖源分析方向扩展。
示例图:



界面风格参考了 lieflat-charts