ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

表观遗传与DNA甲基化跨代遗传:从机制到WGBS数据分析实战

表观遗传与DNA甲基化跨代遗传:从机制到WGBS数据分析实战 前阵子团队接到一个高通量表观组学项目客户拿的是连续自交五代的水稻材料要求做全基因组重亚硫酸盐测序WGBS核心目标是想验证某个干旱胁迫相关的甲基化差异位点到底能不能稳定跨代传递。项目做下来从材料源头、建库质控到DMR验证中间踩了不少坑也把“表观遗传DNA甲基化跨代遗传”这条线从理论到实操完整摸了一遍。这篇文章就结合项目经验把这个方向的知识体系和操作方法完整梳理出来重点讲清楚三件事跨代甲基化到底是怎么传下去的、用什么实验设计才能证明、拿到测序数据后该怎么分析才不会翻车。如果你正打算做或者正在做表观遗传相关的课题尤其是涉及到多代繁殖、抗逆记忆、单倍体育种这类需要跨代观察的场景这篇文章应该能帮你省掉不少弯路。即使你只是刚接触这个概念我也会尽量用大白话把机制讲清楚同时保留可直接落地的方案细节。1. 表观遗传为什么突然“火”了和一个真实科研项目的对话关注这个方向的人应该都有感受“表观遗传”这个词前几年还主要在组学圈子里转现在已经频繁出现在育种、医学、环境毒理等多个领域的课题申报书里。但很多刚入门的同学对它的理解停留在“DNA序列以外的东西”这种模糊印象导致一谈跨代遗传就各种误会。所以我先把这个概念从根上捋一遍再结合我们做过的项目说明它到底能解决什么问题。1.1 一句话讲清楚表观遗传和DNA甲基化表观遗传指的是DNA序列没有发生变化但基因表达出现了稳定可遗传的改变。你可以把基因组想象成一本菜谱每道菜的做法基因序列都印在那里但同一道菜在不同客人面前端上来咸淡可能完全不同。决定“要不要放盐”“放多少盐”的就是表观修饰机制其中研究最透彻的就是DNA甲基化。DNA甲基化简单说就是在DNA分子胞嘧啶C碱基的第五位碳原子上加一个甲基基团-CH3这个修饰本身不改变碱基配对规则但会影响转录因子结合、染色质结构从而调控基因的表达活性。在植物中甲基化主要分为CG、CHG、CHH三种序列上下文类型在哺乳动物中则主要集中于CG位点。我经常用“便利贴”来比喻DNA序列是写在纸上的字甲基化就是贴上去的“不要朗读这段”的便利贴贴了不等于字没了但别人读起来就会绕着走。1.2 跨代遗传到底是“跨”到什么程度这里要特别区分两个容易混淆的概念一个是“可遗传的表观变异”一个是“真正的跨代表观遗传”。前者指的是亲本经历的环境刺激能够影响到子代的表观修饰状态后者则要求这种改变能够在多个世代中稳定维持而且不能被生殖系重编程完全擦除。在植物中由于生殖细胞系形成较晚且缺乏像哺乳动物那样的“全基因组表观重编程”过程表观记忆跨代传递的现象更普遍。经典案例包括拟南芥中低温处理诱导的FLC位点甲基化变化、水稻中干旱胁迫诱导的DNA甲基化记忆等。但记住一点跨代遗传不等于永久遗传很多表观标记传到第三、第四代会逐渐衰减这也是实验设计中最容易忽略的地方。回到我们做的这个水稻项目。材料从F1做到F5每一代都有目标甲基化位点的测序数据同时也有部分个体做了重处理后观察表观标记能否“重置”。这是检验跨代遗传最关键的一步因为如果没有“重处理恢复”的对照就会把环境反复诱导造成的假象当成了真正的跨代遗传。2. 核心机制拆解DNA甲基化是怎么被“记住”和传下去的要从根上理解跨代甲基化必须有三个层面的认知写入、读取、擦除以及这三者如何在代际间协同工作。这块是很多综述文写得特别绕的地方我用项目实践的语言重新梳理一遍。2.1 甲基化的写入、读取和擦除写入甲基化标记的是DNA甲基转移酶家族。植物中MET1负责维持CG位点的甲基化CMT3主要维持CHG位点而CHH位点的从头建立和维持主要依赖DRM2参与的RdDM通路。RdDM这条通路很有意思它利用sRNA的序列互补来引导甲基化转移酶到特定的基因组位置相当于给“便利贴”提供了一个“由RNA导航的快递系统”。读取甲基化信号的效应器是各种甲基化结合蛋白如MBD家族以及能够识别未甲基化或低甲基化状态的转录因子。不同蛋白结合后有的招募转录抑制复合体有的则招募染色质重塑因子最终改变局部染色质的开放程度。哺乳动物的DNMT1也在DNA复制时读取母链上的甲基化信号并维持到子链上这是“复制后记忆”的核心机制。擦除机制分为主动和被动两种。被动擦除发生在DNA复制过程中如果甲基化维持酶没有跟上复制叉子代DNA分子上的甲基化就会被“稀释”。主动擦除则是由酶催化的植物中主要是ROS1、DME等去甲基化酶哺乳动物中主要依赖TET蛋白将5-甲基胞嘧啶氧化为5-羟甲基胞嘧啶等中间态再通过碱基切除修复通路恢复为未修饰状态。值得注意的是擦除机制的关键局限性在于“擦除不彻底”。在哺乳动物中虽然胚胎发育早期会有两波大规模去甲基化但一些对于转座子尤其是内源性逆转录病毒的控制性甲基化仍然会被保留在母源或父源印记基因上。在植物中生殖细胞形成阶段同样存在基因特异性的去甲基化但保留了很大一部分体细胞表观标记。正因为擦除不彻底跨代遗传才有可能也成为我们做跨代甲基化研究的理论前提。2.2 植物和动物跨代遗传的差异为什么水稻比小鼠更好做我经常跟客户讲做跨代甲基化研究选对物种能少奋斗三年。植物之所以是理想模型有几个硬原因世代周期短、繁殖系数大、繁殖方式可以控制自花授粉、异花授粉、无性繁殖。尤其是自花授粉作物利用单粒传法和自交系列能够比较干净地追踪表观标记的传递不怕混入父本花粉的基因组污染。动物方面小鼠虽然也是模式生物但跨代研究操作成本高世代周期是植物好几倍而且哺乳动物的表观重编程更为彻底跨代信号更容易丢失。在人类中做跨代研究就更难了伦理限制、世代跨度、环境因素混杂很难拿到严格意义上的“跨代遗传”证据。这也是为什么目前人类表观遗传跨代研究的结论大多停留在“关联”层面而植物中则可以做相对严格的因果验证。从分子层面看植物和动物的差异同样明显。植物基因组中大量存在转座元件而CHH甲基化在保护基因组稳定性方面至关重要动物基因组中CG甲基化占绝对主导非CG甲基化只在胚胎干细胞等特定组织中含量较高。因此你在设计测序方案和分析参数时不能直接套用其他物种的策略。2.3 经典案例和标志性研究从“如何证明”到“靠谱的设计思路”这个领域有个绕不开的经典例子就是拟南芥中ddm1突变体导致转座子甲基化丢失后经过多次自交可以诱发大量表观等位基因这些表观等位基因又可以在不同株系间稳定传递进而影响形态特征。另一个典型案例是水稻中由低温或干旱诱导的有些基因启动子区域甲基化变化即使后代在无胁迫条件下生长甲基化状态仍能维持多个世代同时伴随目标基因的表达变化。这些案例给了我们几个关键启发第一跨代甲基化通常是被环境胁迫“定向诱导”的而不是随机出现的第二跨代遗传的效应往往在某个特定发育时期最明显所以取样部位和时间点需要严格统一第三即使跨代信号稳定它的表型效应也可能是微效的、数量性的单个位点的效应不大需要结合全基因组扫描定位。3. 想做跨代甲基化研究先搞定这几步实验设计很多项目最后分析不出来结果八成问题出在实验设计阶段。测序和分析只是执行层面的事如果材料群体设计有硬伤神仙算法也救不回来。这章我直接给出一套可参考的实验设计流程以及我们当时和伯远平台反复推敲后的最终方案。3.1 材料选择、群体构建与多代繁殖策略第一步确定亲本材料。做跨代甲基化最好选择遗传背景一致、遗传纯度高的材料。如果是作物优先选择已经稳定的自交系或者纯合品种避免背景杂合位点干扰甲基化解读。如果使用突变体必须有回交处理、清除背景突变并设置野生型对照。第二步群体构建方式。常用的是单粒传法single seed descent每一代只取一个单株的种子继续繁殖这样可以在不进行选择的前提下最大程度保留群体内的遗传变异同时避免表型选择对结果造成干扰。如果目标是验证某个具体环境处理如干旱、高温、盐碱的跨代效应则需做“处理组/对照组”平行繁殖处理组在特定世代通常是F1或F2施加胁迫并观察后续正常条件下的保持情况。第三步世代设计。我建议至少做到F3或F4。太多综述和项目证明F1、F2中观察到的甲基化变化很可能来自亲本直接暴露环境导致的母体效应或种子质量差异并非真正的跨代遗传。做到F3及以后才能排除“亲本直接暴露环境对子代造成的残留影响”。这里有个容易被忽视但极其重要的设置处理组后代一旦播种必须在无胁迫条件下生长并繁殖每一代都不能再施加任何胁迫。否则你观察到的“跨代遗传”实际上可能是环境因素在每一代中的重新诱导效应严格来说根本不叫跨代遗传。我们做水稻材料时还专门增加了一个“重诱导”分组——F3个体继续接受干旱处理看一看和完全不处理的“F3保持组”、以及对照组的甲基化状态差异这件事对解释结果很有价值。3.2 建库测序方案选型WGBS、RRBS还是甲基化芯片甲基化检测的技术路线很多我这里列一个对比表按项目需求选择合适的方案。技术方案覆盖范围碱基分辨率单样本成本适用场景WGBS全基因组重亚硫酸盐测序全基因组单碱基高跨代遗传全基因组扫描、DMR筛选RRBS简化代表亚硫酸盐测序CpG富集区单碱基中哺乳动物启动子区、CpG岛研究MeDIP-seq甲基化DNA免疫沉淀测序全基因组/富集区约150-300 bp中快速筛选、目标区域大规模比较甲基化芯片如850K已知CpG位点位点级低大样品量、人类样本队列研究MethylRAD/简化甲基化技术特定酶切位点位点级中低非模式物种适用于无参考基因组场合做植物跨代研究WGBS基本是首选。主要原因在于植物中CHH位点占比高只有全基因组单碱基覆盖才能完整还原三种甲基化上下文的变化而RRBS这种富集方案会丢掉大量信息导致对植物基因间区、转座子区域甲基化状态的误判。建库环节有两点特别提醒第一重亚硫酸盐转化会对DNA造成断裂和降解所以起始DNA质量要求很高我一般建议OD260/280在1.8到2.0之间总量不低于1微克第二文库扩增循环数不宜过高否则会产生大量重复测序数据浪费覆盖度。我们在伯远平台做WGBS时文库QC中还会同步检测甲基化转化率以未甲基化的λDNA作为内参。3.3 与测序服务商/技术平台协作的实操建议现在很多课题组会依赖商业平台做测序和部分分析。以我们合作过的伯远生物为例他们承接的表观组学项目一般分为建库测序和生信分析两个阶段。作为客户方我有几个实操层面的建议前期沟通时要把物种基因组大小、GC含量预估、目标深度、变异位点分析需求讲清楚。基因组大的物种如小麦、玉米推荐加大数据量否则平均深度不够DMR检测的灵敏度会大打折扣。方案确认时问清楚使用的参考基因组版本和注释版本。不同版本之间DMR位置可能差异很大后期做功能富集时对不上号特别麻烦。交付内容要白纸黑字列清楚原始FASTQ、清理后FASTQ、比对BAM、甲基化水平矩阵、DMR列表、差异甲基化基因注释表。如果平台只交付到DMR列表建议自行再往下游做功能分析不要把富集分析都外包因为生物学背景还是在自己手里才能做得更有针对性。项目周期也要留意WGBS建库测序一般要2到3周分析根据复杂度大概1到2周如果加上多组学整合分析整体周期至少一个半月。做跨代甲基化项目的样本数量往往比较多建议分批测序每批都带上一个完全相同的标准样本方便统一批次效应。4. 数据分析实操从raw data到DMR的一整套流程拿到WGBS的测序数据后分析步骤环环相扣但这块恰恰是最容易被“一键式工具”坑到的地方。我把我们的标准流程写出来并附上常用命令和参数你可以直接按这个思路跑通。注意这节不是工具推荐文而是操作流程和踩坑实录。4.1 质控、比对与甲基化提取的基本命令行操作拿到raw FASTQ后第一步是去接头和质量过滤。这一阶段最常用的是fastp或Trim Galore。配重亚硫酸盐测序数据时要考虑到两条链在PCR扩增后不再互补不能简单把R1和R2都按同一标准处理。这里给出一个经过多个项目验证的fastp命令模板fastp -i in.R1.fastq.gz -I in.R2.fastq.gz \ -o clean.R1.fastq.gz -O clean.R2.fastq.gz \ --detect_adapter_for_pe \ --cut_front --cut_tail \ --cut_front_window_size 1 --cut_front_mean_quality 20 \ --cut_tail_window_size 1 --cut_tail_mean_quality 20 \ --length_required 36 \ --thread 8第二步是比对。对于WGBS数据最常用的是Bismark和bismark_bowtie2或bwa-meth。Bismark比对前先做一个C→T的基因组转换再将reads同时比对到转换后的两条链上最终通过“谁匹配得更好”来判别原始链来源。参考基因组索引建立比较慢但值得花一次时间。# 建立Bismark索引需先安装bowtie2 bismark_genome_preparation --bowtie2 /path/to/genome_dir # 比对 bismark --genome /path/to/genome_dir \ -1 clean.R1.fastq.gz -2 clean.R2.fastq.gz \ --bowtie2 --non_directional \ -p 8 --output_dir /path/to/output # 去除PCR重复用deduplicate_bismark deduplicate_bismark --bam -p output.sam这里注意植物的WGBS建库通常都是用non-directional library非链特异性文库比对时要加上--non_directional否则会造成大量reads比对不上或链分配错误。如果是哺乳动物标准WGBS文库则用directional mode即可。第三步是提取甲基化水平。这一步骤我用bismark_methylation_extractor来输出每个位点的甲基化Coverage状态然后可以用bedGraph文件格式进一步处理。推荐直接生成带context的bedGraph并用coverage2cytosine将结果转换为allc格式方便后续多语言分析。bismark_methylation_extractor --gzip --bedGraph \ --counts --buffer_size 10G \ --cytosine_report --genome_folder /path/to/genome_dir \ output.deduplicated.bam分析进度通常一两天跑完一个样本取决于基因组大小和覆盖度。但真正花时间的不是命令本身而是下游DMR的定义和解读。4.2 如何合理鉴定DMR深度、上下文与统计多重比较这一节是整个分析流程中“看似简单但最容易翻车”的地方。新手经常把DMR鉴定的p值阈值设得过于激进或者在样本量不足时直接用小样本t检验导致大量假阳性。我推荐至少是三组或以上的生物学重复使用DSS或methylKit这类能够综合样本变异度的工具。methylKit支持合并样本间差异、对位点做logistic回归再合并区域差异比较经典。DSS则用贝叶斯分层模型对低覆盖度区域的稳健性更好。两个都试试然后取交集往往更稳妥。在做DMR鉴定时几个参数必须根据物种和测序深度调整最小覆盖深度一般建议每样本至少5x-10x的碱基覆盖再纳入统计过低会因取样误差造成假差异。最少CpG位点数每个DMR内至少要有3-5个甲基化位点否则很难定义一个有生物学意义的区域。甲基化差异阈值植物中建议先以20%-30%的绝对值差异作为初筛阈值再结合统计显著性过滤。跨代项目里效应本身就弱建议初筛阈值放低至10%-15%宁可在后续验证中淘汰也不要在初筛中丢掉真实信号。多重检验校正常采用BH-FDR控制FDR小于0.05或0.1。如果样本量少也可以考虑更保守的qvalue或对候选DMR做置换检验。下面是methylKit的简洁示例library(methylKit) myobj - methRead(my.methylation.cov, sample.id rep1, assembly ref, treatment 0) filtered - filterByCoverage(myobj, lo.count 10, hi.perc 99.9) meth - unite(filtered) diff - calculateDiffMeth(meth, overdispersion MN, test F) dmr - getMethylDiff(diff, difference 0.15, qvalue 0.05)执行结束后把输出区域转换出基因注释并和转录组数据关联。如果项目做了mRNA测序应该将DMR定位到的基因与差异表达基因取交集重点看启动子区甲基化与基因表达间的负相关关系。4.3 跨代遗传数据解读的“三大坑”第一个坑是混淆“母体效应”和“跨代遗传”。如果材料在F1代直接受到干旱处理那么F2种子质量降低、萌发慢可能完全是由于母体植株营养状况导致的母体效应和表观遗传无关。所以在解读结果时F3及以后的数据才是更可靠的跨代证据。我建议在文章方法里明确写出“处理只施加到F1或指定世代后续世代均在正常条件下繁殖”。第二个坑是忽略遗传背景差异。甲基化不只是表观决定的SNP/Indel也会影响甲基化状态。比如一个关键位点的等位基因型差异会导致该区域甲基化水平截然不同看起来是DMR实际上是个体间遗传差异。因此在做跨代甲基化分析时最好同时利用同一批材料做低深度的全基因组重测序或至少从WGBS数据中提取CNV和SNP信息把遗传变异区域内的高差异甲基化位点剔除。第三个坑是过度解释CHH位点的“代际增加效应”。在植物中CHH位点往往与RdDM通路、siRNA动态变化密切相关表观信号波动较大单靠一个世代的数据很容易得出错误结论。如果目标位点主要落在CHH上下文强烈建议加做一份小RNA测序或分析已有sRNA数据看看是否能观察到相应的siRNA变化。5. 常见问题与排查实录项目做多了总会碰到一些绕不过去的细节问题。下面把我在实际跨代甲基化项目中遇到过的高频问题整理在一张速查表里方便你做实验结果初筛时逐条排查。5.1 跨代甲基化项目常见问题速查表问题现象可能原因排查建议生物重复之间甲基化相关性低DNA提取批次差异、取样部位不一致、文库批次效应统一取样时期和部位每批建库加入标准样本绘制样本相关性热图转化率偏低低于98%重亚硫酸盐处理不充分、DNA量过多检查转化条件和体系比例提高试剂浓度参考λDNA的转化率追踪DMR多但大部分落在重复区域比对时重复序列比对策略不当参考基因组未屏蔽重复区使用--non_directional模式检查比对率保留唯一可比对reads结合RepeatMasker注释筛选跨代效应在F3/F4消失表观记忆本身是暂时性的环境持续选择或进化补偿增加初始处理强度观察F2-F5的趋势尝试在后代中再诱导一次比较回复能力目标基因甲基化差异显著但表达无变化DMR位置不在调控区甲基化对表达影响微弱组织时期不对将DMR定位到启动子、基因体、3‘UTR并拆分在目标组织/时期做转录组考虑联合组蛋白修饰数据跨代DMR中大量伴有遗传差异亲本材料非纯合种子混杂群体中遗传结构差异对亲本做全基因组重测序去除旁系混杂样本使用WGS数据过滤SNP影响的位点5.2 我在实际操作中积累的几点细节经验第一点分批测序的批次归一化。跨代项目样本量大往往要分几批上机。强烈建议每一批都加一个标准样本最好是来自同一个DNA大抽提样本的分装。这样在合并分析时能够比较准确地校正批次之间的系统性偏差否则DMR可能大多数是“批次DMR”而不是真正的“代际DMR”。第二点多跑一条“重诱导”实验臂。我们在水稻项目里特意在世代的后半段增加了一个重新暴露干旱的分组。这个分组不是为了直接证明跨代遗传而是用来了解表观标记的可塑性有些位点在重诱导后依然出现说明它们可能是由环境重新建立的“类记忆位点”有些位点在重诱导后不再恢复说明更可能是生物体内稳定维持的机制。第三点警惕转座子区域的“干扰性DMR”。转座子周围甲基化变化非常敏感可能是环境应激导致染色质重塑的直接结果不一定对邻近基因有调控意义。如果你的候选基因离转座子太近建议看看该转座子是否在表达并考虑用突变体材料做功能验证而不是直接声明该DMR调控了基因表达。第四点是关于数据交付和备份的。WGBS的BAM文件非常大一个样本动辄几十GB。项目开展前就得规划好存储和备份策略。我自己习惯将最终分析用的数据统一放在一台有足够磁盘空间的工作站上同时对FASTQ原文件做冷备份。数据安全这件事翻车一次就够你后悔一年。第五点建议把DMR筛选阈值至少做两档。一档偏严格比如30%差异、FDR 0.05用于文章中的核心结论一档偏宽松比如10%-15%差异、FDR 0.1用于候选位点的功能验证和补充实验。很多跨代效应属于微效多基因调控太严格的阈值会把真实信号全部滤掉。做跨代甲基化这个方向本质上是在回答一个很基础但极重要的问题环境在遗传物质上留下的“记忆”到底能保留多久、传递多深。这背后牵涉到转座子控制、基因表达调控、发育与环境互作。对我们做实验的人来说每一次跨代材料的数据解读都是一次对实验设计和统计逻辑的检验。如果看到这里你还是有点拿不准自己的分析方案我的建议是先拿一套公开数据完整跑一遍流程把每一步输出文件都对应上再回去碰自己的数据心里会踏实很多。
返回列表