全基因组重测序

【生信】全基因组测序(WGS) 1、全基因组测序(WGS) 的定义 2、GWS流程 2.1准备工作——分析软件 2.2原始数据质控 2.3数据预处理 2.4变异检测 阅读详情

                                                     全基因组重测序   

概述

全基因组重测序是对已知基因组序列的物种进行不同个体的基因组测序,并在此基础上对个体或群体进行差异性分析。SBC将不同梯度插入片段(Insert-Size)的测序文库结合短序列(Short-Reads)、双末端(Paired-End)进行测序,帮助客户在全基因组水平上扫描并检测与重要性状相关的基因序列差异和结构变异,实现遗传进化分析及重要性状候选基因预测。

技术路线

提取基因组DNA,利用Covaris进行随机打断,电泳回收所需长度的DNA片段(0.2~5Kb),加上接头, 进行cluster制备 (Solexa)或E-PCR (SOLiD),最后利用Paired-End(Solexa)或者Mate-Pair(SOLiD)的方法对插入片段进行重测序。下图以Solexa为例,说明整个实验方案。

双末端(Paired-End)测序原理(from www. Illumina.com)

测序深度(Sequencing Depth):测序得到的碱基总量(bp)与基因组大小(Genome)的比值,它是评价测序量的指标之一。测序深度与基因组覆盖度之间是一个正相关的关系,测序带来的错误率或假阳性结果会随着测序深度的提升而下降。重测序的个体,如果采用的是双末端或Mate-Pair方案,当测序深度在10~15X以上时,基因组覆盖度和测序错误率控制均得以保证。

                         测序深度对基因组覆盖度和测序错误率的影响
                                (HOM:纯合体 HET:杂合体)


全基因组重测序的个体,通过序列比对,可以找到大量的单核苷酸多态性(SNP),插入缺失(InDel,Insertion/Deletion)和结构变异(SV,Structure Variation)位点。SBC可以协助客户,通过生物信息手段,分析不同个体基因组间的结构差异, 同时完成SNP及基因组结构注释。


                             全基因组重测序生物信息学分析流程 



1.数据量产出
总碱基数量、Total Mapping Reads、Uniquely Mapping Reads统计,测序深度分析。

2.一致性序列组装
与参考基因组序列(Reference genome sequence)的比对分析,利用贝叶斯统计模型检测出每个碱基位点的最大可能性基因型,并组装出该个体基因组的一致序列。

3.SNP检测及在基因组中的分布
提取全基因组中所有多态性位点,结合质量值、测序深度、重复性等因素作进一步的过滤筛选,最终得到可信度高的SNP数据集。并根据参考基因组信息对检测到的变异进行注释。

4.InDel检测及在基因组的分布
在进行mapping的过程中,进行容gap的比对并检测可信的short InDel。在检测过程中,gap的长度为1~5个碱基。对于每个InDel的检测,至少需要3个Paired-End序列的支持。

5.Structure Variation检测及在基因组中的分布
目前SBC能够检测到的结构变异类型主要有:插入、缺失、复制、倒位、易位等。根据测序个体序列与参考基因组序列比对分析结果,检测全基因组水平的结构变异并对检测到的变异进行注释。

全基因组重测序案例研究    

DNA突变可诱发癌症。吸烟过程中所释放的>60种致癌化学物质可与DNA结合并对DNA链上的鸟嘌呤和腺嘌呤进行化学修饰从而产生大的加合物,该加合物改变了DNA双螺旋的结构,如果不被核苷酸剪切修复或其他的途径进行纠正,那么DNA在复制时就会按照non-Watson-Crick方式进行复制并阻止RNA聚合酶进行转录,从而引发癌症。Erin D. Pleasance等[5]近日在Nature杂志上发表文章,他们用第二代测序技术(AB SOLiD)对一个小细胞肺癌(Small-cell lung cancer, SCLC)细胞系NCI-H209基因组进行测序,以探讨烟气中的致癌物质引发了该细胞系基因组中哪些特定碱基及其周围序列的突变及细胞损伤修复路径。

测序基本数据:测序片段长度为25bp;Mate-Pair测序;产生的数据量:112Gb、39×覆盖度(NCI-H209细胞系),90Gb、31×覆盖度(正常细胞系,reference genome)。


研究结果如下:

①NCI-H209细胞系基因组中,共检测到22,910个碱基替换、65个插入缺失(Indels)、58个结构变异;在基因组的编码区,除了发现RB1 和TP53基因发生点突变和MLL2基因由于发生了G>T的颠换,从而产生了pre-stop codon外,有94个点突变直接改变了氨基酸序列,有36个属同义突变。

②特定的碱基及其周围序列易被烟气中的多环芳烃和丙烯醛诱变。在NCI-H209细胞系基因组中,G>T/C>A是最为普遍的颠换现象,发生频率为34%;其次是G>A/C>T(21%)和A>G/T>C(19%);CpG岛外的CpG二核苷酸多发生G>T颠换,而CpG岛内的CpG二核苷酸多发生G>C颠换,说明烟气中的致癌物偏好引起甲基化的CpG二核苷酸发生颠换(图1-5)。

③检测到转录偶联修复(Transcription-coupled repair)和表达相关的修复(Expression-linked repair)在起作用。

转录偶联修复作用机制:鸟嘌呤和腺嘌呤上大的加合物是吸烟过程中所释放的致癌化学物质引起DNA损伤的主要形式,这些大的加合物阻止了转录链上RNA聚合酶的转录过程,而转录受阻的RNA聚合酶招募核苷酸剪切修复相关因子对受损的核苷酸进行修复以避免突变发生。在TP53基因突变的肺癌细胞中,G>T颠换常出现在非转录链,表明在转录链上相同的损伤已被识别和修复。在本研究中,转录链上G和A碱基替换频率比非转录链上少,由此看来嘌呤是烟气致癌物质主要诱变靶标。另外,在NCI-H209细胞系中,转录链和非转录链上发生不同类型的突变(G>T、A>G、A>T)两条链基因表达水平也有差异,这就意味着转录偶联修复机制识别、修复不同加合物损伤的能力不同。
表达相关的修复(Expression-linked repair)作用机制:这是一种新的、更为普遍的修复机制,即,高表达的基因中,转录链及非转录链的突变频率都较低。在NCI-H209细胞系中,转录链和非转录链上发生G>A的突变,两条链上基因表达水平都很高,这就说明表达相关的修复作用比转录偶联修复作用更为重要。

④在SCLC细胞系中,CHD7基因发生了重排。在NCI-H209细胞系中,CHD7基因3~8外显子发生连续重复,而另外2个LU-135、NCI-H2171细胞系则携带PVT1-CHD7融合基因,说明在肺癌中CHD7基因发生了周期性重排(图1-6)。
以上结果表明,第二代测序技术已成为研究与癌症相关的基因突变过程、细胞损伤修复路径、基因调控网络的强有力工具。


桂花的全基因组重测序为花色进化提供了见解 Osmanthus fragrans is a well-known ornamental plant that has been domesticated in China for 2500 years. More than 160 cultivars have been found during this long period of domestication, and they have subsequently been divided into four cultivar groups, inc 阅读详情

相关推荐

全基因组测序 从头测序(de novo sequencing) 重测序(re-sequencing)

全基因组测序 全基因组测序分为从头测序(de novo sequencing)和重测序(re-sequencing)。 从头测序(de novo)不需要任何参考基因组信息即可对某个物种的基因组进行测序,利用生物信息学分析方法进行拼接、组装,获得该物种的基因组序列图谱,从而推进该物种的后续研究。基因组重测序 是对有参考基因组物种的不同个体进行的基因组测序,并在此基础上对个体或群体进行...

weixin_30674525的博客 5691

群体遗传学习笔记-测序技术学习

群体遗传学习笔记-测序技术学习 重测序技术简介 全基因组重测序(Resequencing)是对已知参考基因组序列的物种进行不同个体间的基因组测序,并在此基础上对个体或群体进行差异性分析。通过全基因组重测序,将不同梯度插入片段(Insert-Size)的测序文库结合短序列(Short-Reads)、双末端(Paired-End),可以找到大量的单核苷酸多态性位点(SNP)、拷贝数变异(Copy Number Variation,CNV)、插入缺失(InDel,Insertion/Deletion)、.

wangprince2017 6712

1.全基因组重测序数据分析介绍

二代测序原理及fastq数据解读、全基因组重测序数据分析内容

weixin_53682198的博客 1842

重测序专题(一)| 一文了解测序技术的发展

测序技术的发展史,以及全基因组重测序所用到的测序手段。

Igenebook的博客 3336

基因组重测序全流程(简易版)

基因组重测序全流程(简易版)

weixin_73362123的博客 5649

全基因组重测序数据分析

全基因组重测序数据分析 转自:http://www.biodiscover.com/news/research/95875.html 1. 简介(Introduction) 通过高通量测序识别发现de novo的somatic和germ line 突变,结构变异-SNV,包括重排突变(deletioin, duplication 以及copy number variation)以

悠悠的博客 4万+

一个全基因组重测序分析实战

Original2017-06-08曾健明生信技能树 这里选取的是GATK best practice是目前认可度最高的全基因组重测序分析流程,尤其适用于人类研究。 PS:其实本文应该属于直播我的基因组系列,有两个原因把它单独拿出来, 首先,直播我的基因组阅读量太低了,可能是大家觉得错过了前面的,后面的看起来没有必要,这里我可以肯定的告诉大家,这一...

dengximo9047的博客 2904

全基因组重测序基础及高级分析知识汇总

全基因组重测序基础及高级分析知识汇总 oddxix已关注 2018.09.20 17:04字数 11355阅读 212评论 0喜欢 6 转自:http://www.360doc.com/content/18/0208/11/19913717_728563847.shtml 全基因组重测序是通过对已有参考序列(Reference Sequence)的物种的不同个体...

weixin_30414245的博客 4171

解锁基因密码之重测序(从测序到分析)

关于测序你是否还有很多的问号,从测序技术到分析方案,一篇文章安排明明白白。跟随小编的脚步一起来看看吧~

Igenebook的博客 1770

基因测序技术总结

基因测序技术总结 Peng_001已关注 62020.05.17 17:37:21字数 3,646阅读 1,701 参考:从零开始完整学习全基因组测序数据分析:第1节 测序技术 作者:碱基矿工 参考:【陈巍学基因】视频1:Illumina测序化学原理 前言 什么是全基因组测序? 全基因组测序,英文为Whole Genome Sequencing,简称WGS,指的是把物种细胞里面完整的基因序列,从第一个DNA开始,一直到最后一个DNA,完完整整地检测出来,并排列好。 全基因测序的意义? .

wangprince2017 5138

GWAS全基因组关联分析流程(BWA+samtools+gatk+Plink+Admixture+Tassel)

我梳理了GWAS全基因组关联分析的整个流程,并提供了基本的命令,用到的软件包括BWA、samtools、gatk、Plink、Admixture、Tassel等,在此分享出来给大家提供参考。 一、BWA比对 1.构建索引 bwa index -a is example.fasta #构建索引 -a is算法 (BWT构造算法:bwtsw、is或rb2) 2.进行比对 bwa mem -t 6 -R '@RG\tID:foo\tPL:Illumina\tSM:example' example.fasta

genetics的博客 2万+

基因组、宏基因组测序数据质量检测(Q30、Q20、GC%)

测序数据质量检测(Q30、Q20、GC%)

m0_55059521的博客 4164

全基因组测序WGS数据分析——3.数据质控》学习笔记

整个完整的流程分为以下6部分: 原始测序数据的质控 read比对,排序和去除重复序列 Indel区域重(“重新”的“重”)比对 碱基质量值重校正 变异检测 变异结果质控和过滤 数据质控的意义 现在的NGS测序,以illumina为首基本都是运用边合成边测序的技术。碱基的合成依靠的是化学反应,这使得碱基链可以不断地从5’端一直往3’端合成并延伸下去。但在这个合成的过程中随着合成链的增长,DNA聚合酶的效率会不断下降,特异性也开始变差,这就会带来一个问题——越到后面碱基合成的错误率就会越高【注】,这也是为

milkorwine 9744

测序数据处理 —— 比对数据处理(Python)

前面详细介绍了比对数据的存储格式,下面我们介绍一下如何在Python中读取或修改比对结果。pysam是一个Python模块,它可以很容易地读取和操作存储在SAM/BAM文件中的比对结果。它是htslibC-API的封装,提供对SAMBAMVCFBCFBEDGFFGTFFASTAFASTQ文件的读写功能,以及访问samtools和bcftools软件包的命令行功能。当前版本封装了和。使用pip进行安装。

dxs18459111694的博客 1171

WGS-全基因组测序

过程:提取基因组DNA→构建测序文库(DNA片段化、两端加接头)→高通量测序→测序数据预处理(质控)→参考序列比对(read分布统计、测序覆盖度统计、测序深度统计)→分析(基因变异分析、SNP分析、InDel分析、群体分析、疾病相关分析)流程:原始数据质控→过滤低质量reads→read比对→排序sort→去重复→布局重比对→碱基质量重矫正BQSR→变异检测→(Mergeloptional→joint Genotype)→变异质控和过滤VQSR。优势:snp、插入缺失突变。

weixin_57590035的博客 1087
上一篇: Java 数字签名(Digital Signature)的批处理文件制作
下一篇: 2011年JCR发布 2010 SCI 影响因子(Impact Factor)
casularm
博客等级 码龄23年 873粉丝 369原创
评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值