CN116364183A - 一种基于二代测序结果的pole突变判别模型的构建方法及其应用 - Google Patents

一种基于二代测序结果的pole突变判别模型的构建方法及其应用 Download PDF

Info

Publication number
CN116364183A
CN116364183A CN202310245533.5A CN202310245533A CN116364183A CN 116364183 A CN116364183 A CN 116364183A CN 202310245533 A CN202310245533 A CN 202310245533A CN 116364183 A CN116364183 A CN 116364183A
Authority
CN
China
Prior art keywords
mutation
mutations
pole
base
construction method
Prior art date
Legal status (The legal status is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the status listed.)
Pending
Application number
CN202310245533.5A
Other languages
English (en)
Inventor
陈实富
耿宇涵
杨博
曹慧雅
锁培苏
Current Assignee (The listed assignees may be inaccurate. Google has not performed a legal analysis and makes no representation or warranty as to the accuracy of the list.)
Haplox Biotechnology Shenzhen Co ltd
Original Assignee
Haplox Biotechnology Shenzhen Co ltd
Priority date (The priority date is an assumption and is not a legal conclusion. Google has not performed a legal analysis and makes no representation as to the accuracy of the date listed.)
Filing date
Publication date
Application filed by Haplox Biotechnology Shenzhen Co ltd filed Critical Haplox Biotechnology Shenzhen Co ltd
Priority to CN202310245533.5A priority Critical patent/CN116364183A/zh
Publication of CN116364183A publication Critical patent/CN116364183A/zh
Pending legal-status Critical Current

Links

Images

Classifications

    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B20/00ICT specially adapted for functional genomics or proteomics, e.g. genotype-phenotype associations
    • G16B20/50Mutagenesis
    • GPHYSICS
    • G16INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR SPECIFIC APPLICATION FIELDS
    • G16BBIOINFORMATICS, i.e. INFORMATION AND COMMUNICATION TECHNOLOGY [ICT] SPECIALLY ADAPTED FOR GENETIC OR PROTEIN-RELATED DATA PROCESSING IN COMPUTATIONAL MOLECULAR BIOLOGY
    • G16B30/00ICT specially adapted for sequence analysis involving nucleotides or amino acids
    • YGENERAL TAGGING OF NEW TECHNOLOGICAL DEVELOPMENTS; GENERAL TAGGING OF CROSS-SECTIONAL TECHNOLOGIES SPANNING OVER SEVERAL SECTIONS OF THE IPC; TECHNICAL SUBJECTS COVERED BY FORMER USPC CROSS-REFERENCE ART COLLECTIONS [XRACs] AND DIGESTS
    • Y02TECHNOLOGIES OR APPLICATIONS FOR MITIGATION OR ADAPTATION AGAINST CLIMATE CHANGE
    • Y02ATECHNOLOGIES FOR ADAPTATION TO CLIMATE CHANGE
    • Y02A90/00Technologies having an indirect contribution to adaptation to climate change
    • Y02A90/10Information and communication technologies [ICT] supporting adaptation to climate change, e.g. for weather forecasting or climate simulation

Landscapes

  • Life Sciences & Earth Sciences (AREA)
  • Physics & Mathematics (AREA)
  • Bioinformatics & Cheminformatics (AREA)
  • Health & Medical Sciences (AREA)
  • Engineering & Computer Science (AREA)
  • Biotechnology (AREA)
  • Medical Informatics (AREA)
  • Biophysics (AREA)
  • Theoretical Computer Science (AREA)
  • Spectroscopy & Molecular Physics (AREA)
  • Proteomics, Peptides & Aminoacids (AREA)
  • Bioinformatics & Computational Biology (AREA)
  • Chemical & Material Sciences (AREA)
  • Evolutionary Biology (AREA)
  • General Health & Medical Sciences (AREA)
  • Analytical Chemistry (AREA)
  • Molecular Biology (AREA)
  • Genetics & Genomics (AREA)
  • Measuring Or Testing Involving Enzymes Or Micro-Organisms (AREA)

Abstract

本发明涉及生物信息分析技术领域,尤其涉及一种基于二代测序结果的POLE突变判别模型的构建方法及其应用,所述构建方法包括S1、二代测序数据的预处理,S2、序列比对、变异判读及突变过滤,S3、突变过滤数据的分析及POLE突变判别。利用本发明的构建方法构建的POLE突变判别模型不需要明确POLE突变作为超扩增标志物,通过设置一定的突变数和最大突变丰度阈值,过滤突变位点过少导致的假阳性,并结合POLE突变判别得分标准,辅助POLE突变的确定,提高真阳性的检出率。同时,本发明的突变检测范围涵盖680个癌症相关基因,较大的检测覆盖度使得给出的得分标准更加接近预估假设,因此较为可靠。

Description

一种基于二代测序结果的POLE突变判别模型的构建方法及其 应用
技术领域
本发明涉及生物信息分析技术领域,尤其涉及一种基于二代测序结果的POLE突变判别模型的构建方法及其应用。
背景技术
子宫内膜癌(endometrial carcinoma,EC)是一种常见的妇科癌症,是发生于子宫内膜的一组上皮性恶性肿瘤。其中,POLE超突变子宫内膜癌分型定义为DNA聚合酶ε(POLE)外切核酸酶结构域的体细胞突变引起的肿瘤。POLE分型的子宫内膜癌通常对于化学疗法与免疫疗法较敏感,临床治疗效果好。
高肿瘤负荷(TMB>100)与COSMIC特征POLE体细胞突变可以作为一种重要的生物标记物,用于POLE超扩增(突变)肿瘤的诊断。同时,根据文献报道,不同种类碱基替换的分布、点突变和插入缺失的比值也都与POLE超扩增肿瘤的发生存在关联。然而,目前的主流判定方法都基于已知阳性POLE突变位点(P286R,V411L,S297F,A456P,S459F,M444K),已有的方法在临床诊断上存在缺陷,即在缺少明确POLE突变作为超扩增标志物的情况下无法对样本是否阳性进行判断。同时,在已知高肿瘤负荷与特定碱基替换分布的情况下,没有具有统计学意义、根据大量样本数据验证过后的参数对样本的阳性概率进行评价,也没有可被量化的评价标准,现有的方法进行判断会存在一定比例的假阳性。
目前,尚未有更加标准、多维度的判定阈值与流程对肿瘤是否属于POLE突变进行判断。
发明内容
本发明的主要目的在于提供一种基于二代测序结果的POLE突变判别模型的构建方法及其应用,旨在提高POLE突变真阳性的检出率。
本发明的目的还在于提供一种POLE突变判别模型,利用所述构建方法构建所得。
本发明的目的还在于提供一种计算机可读存储介质。
POLE突变(DNA聚合酶ε[POLE]外切核酸酶结构域的体细胞突变)出现于多种肿瘤疾病中,POLE突变尤其是致病性POLE突变常常作为判别肿瘤疾病的依据,现有的POLE突变的判别需要明确POLE突变作为超扩增标志物,但其判断的假阳性概率偏高。本发明通过特定阈值的设定,先排除一部分假阳性样本,进而根据设定的评分标准判断致病性及潜在致病性的POLE突变,提高了POLE突变真阳性的检出率。
为实现上述目的,本发明提供一种基于二代测序结果的POLE突变判别模型的构建方法,包括如下步骤:
S1、二代测序数据的预处理
对获得的待测样本和对照样本的二代测序数据进行预过滤,分别获得pileup文件;pileup文件是指通过BAM文件每个位置重叠的read对比对结果进行的总结,可用于判断各个位点突变的可能性;
所述预过滤包括质控、比对、去重;
所述待测样本为肿瘤患者待测组织DNA(ffpedna)或血液游离DNA(cfdna),所述对照样本为肿瘤患者唾液DNA(sladna)或血液基因组DNA(gdna);
所述质控包括质量评估、去接头序列、去低质量序列、去重复序列。
所述比对是将质控后的read与人参考基因对比,获得BAM文件;将通过质控后每一条read与参考基因组进行比对,回贴到基因组上最佳位置。Reads比对前需去掉接头序列。Reads通过双端的模式比对到GRCh37(hg19)版本的人类基因组上,将比对上的reads按染色体位置排序并转换为二进制BAM文件。
所述去重是去除PCR重复,校正测序错误,生成用于检测的pileup文件。
S2、序列比对、变异判读及突变过滤
利用突变检测工具对步骤S1获得pileup文件进行分析,分析数据中存在的与癌症相关基因的突变信息,注释点突变、插入/缺失突变的位点位置与具体碱基变化,标注POLE突变,获取样本所有突变的突变数、最大突变丰度;
根据突变数,过滤假阳性,过滤掉突变数小于等于50的测序数据对应的DNA样本;
分析肿瘤突变时,需采集两组基因组数据:肿瘤基因组(组织DNA[ffpedna]或血液游离DNA[cfdna])与对照基因组(唾液DNA[sladna]或血液基因组DNA[gdna])共同分析(这两个基因组的获取都需要经过质控、对比、去重)。若突变同时存在于肿瘤基因组与对照基因组,则为胚系突变;若突变只存在于肿瘤基因组,则为体细胞突变。本发明后续所讨论、分析的突变均为体细胞突变,因为只有体细胞突变才与癌症的产生有关。
所述突变检测工具为Mutscan或Varscan。Mutscan或Varscan能够基于去重后所得的pileup文件对每个位点进行变异鉴定,变异类型包括SNV,Indel。
S3、突变过滤数据的分析及POLE突变判别
根据步骤S2过滤后的突变数据及设定的阈值,判断POLE突变的致病性。
优选地,所述突变过滤数据的分析具体为:对步骤S2过滤后的数据进行分析,获取碱基C突变为碱基A(C>A)突变数、碱基T突变为碱基G(T>G)突变数、碱基C突变为碱基G(C>G)突变数、点突变总数、插入/缺失突变总数和总突变数;
根据步骤S2注释的POLE突变,获取COSMIC数据库中POLE突变在样本对应肿瘤中的出现次数;COSMIC是在人类癌症中发现的体细胞突变的在线数据库;
根据癌症相关基因的测序区域BED文件大小(即癌症相关基因覆盖区域的BED格式的文件),获取肿瘤负荷(TMB)数据;肿瘤负荷(TMB)=总突变数/测序区域BED文件大小,单位:muts/mb;
优选地,所述POLE突变判别具体为:根据突变过滤数据的分析的结果,设置6个整数型计分标准:碱基C突变为碱基A(C>A)突变数占点突变总数的百分比大于20%,记1分,反之不计分;碱基T突变为碱基G(T>G)突变数占点突变总数的百分比大于4%,记为1分,反之不计分;碱基C突变为碱基G(C>G)突变数占点突变(SNV)总数的百分比小于0.6%,记为1分,反之不计分;插入/缺失位点(Indel)占总突变数的百分比小于5%记为1分,反之不计分;肿瘤负荷(TMB)大于100muts/mb,记为1分,反之不计分;POLE突变在肿瘤中的出现次数大于1,记为1分,反之不计分;
根据计分标准统计样本POLE突变分数,总分数大于等于4,判断为致病性POLE突变。
优选地,根据计分标准统计样本POLE突变分数,总分数等于3,判断为未知致病性POLE突变;总分数小于3,判断为无致病性POLE突变。
优选地,所述癌症相关的基因为癌症相关的680个基因。
优选地,所述癌症相关基因的测序区域BED文件大小为680个基因的测序区域BED文件大小(即680基因覆盖区域的BED格式的文件)。
优选地,根据获取的突变数和最大突变丰度,过滤假阳性;所述待测样本为肿瘤患者待测组织DNA(ffpedna),过滤掉突变数小于等于50、最大突变丰度小于等于5%的测序数据对应的样本;
进一步优选地,根据获取的的突变数和最大突变丰度,过滤假阳性;所述待测样本为肿瘤患者待测血液游离DNA(cfdna),过滤掉突变数小于等于50、最大突变丰度小于等于1%的测序数据对应的样本;
优选地,所述肿瘤为子宫内膜癌、肺癌、结直肠癌、黑色素瘤、胶质瘤、卵巢癌、尿路上皮癌。
进一步优选地,所述肿瘤为子宫内膜癌、肺癌、结直肠癌。
进一步优选地,所述肿瘤为子宫内膜癌。
进一步优选地,所述子宫内膜癌为POLE分型子宫内膜癌。
为实现上述目的,本发明提供一种POLE突变判别模型,利用所述构建方法构建所得。所述POLE突变判别模型能够更准确的判别出POLE突变,并分辨出致病性与非致病性POLE突变,发现潜在的致病性POLE突变。
为实现上述目的,本发明的目的还提供一种计算机可读存储介质,其上存储有计算机程序/指令,该计算机程序/指令被处理器执行时实现上述构建方法的步骤。
本发明在缺少明确POLE突变作为超扩增标志物的情况下,通过设置一定的突变数和最大突变丰度阈值,过滤突变位点过少导致的假阳性,并结合POLE突变判别得分标准,辅助POLE突变的确定,提高真阳性的检出率。同时,本发明的突变检测范围涵盖680个癌症相关基因,较大的检测覆盖度使得给出的得分标准更加接近预估假设,因此较为可靠。
附图说明
图1为本发明实施例方案涉及的基于二代测序结果的POLE突变判别模型的构建方法的流程示意图。
图2为本发明实施例方案涉及的计算机可读存储介质结构示意图。
本发明目的的实现、功能特点及优点将结合实施例,参照附图做进一步说明。
具体实施方式
应当理解,此处所描述的具体实施例仅仅用以解释本发明,并不用于限定本发明。
本发明通过设置的突变数和最大突变丰度的阈值,过滤突变位点过少导致的假阳性,对真阳性的样本测序数据中的POLE突变进行评分,不仅可以分辨出致病性与非致病性POLE突变,还能发现潜在的POLE突变,提高了POLE突变真阳性的检出率。
本发明的突变检测范围涵盖680个癌症相关基因,较大的检测覆盖度使得给出的得分标准更加接近预估假设,因此较为可靠。
本发明提供一种基于二代测序结果的POLE突变判别模型的构建方法,包括如下步骤:
S1、二代测序数据的预处理
对获得的待测样本和对照样本的二代测序数据进行预过滤,分别获得pileup文件;
所述预过滤包括质控、比对、去重;
所述待测样本为肿瘤患者待测组织DNA(ffpedna)或血液游离DNA(cfdna),所述对照样本为肿瘤患者唾液DNA(sladna)或血液基因组DNA(gdna);
所述质控包括质量评估、去接头序列、去低质量序列、去重复序列;
所述比对是将质控后的read与人参考基因对比,获得BAM文件;将通过质控后每一条read与参考基因组进行比对,回贴到基因组上最佳位置;Reads比对前需去掉接头序列;Reads通过双端的模式比对到GRCh37(hg19)版本的人类基因组上,将比对上的reads按染色体位置排序并转换为二进制BAM文件;
所述去重是去除PCR重复,校正测序错误,生成用于检测的pileup文件。
S2、序列比对、变异判读及突变过滤
利用突变检测工具对步骤S1获得pileup文件进行分析,分析数据中存在的与癌症相关基因的突变信息,注释点突变(SNV)、插入/缺失(Indel)突变的位点位置与具体碱基变化、标注POLE突变,获取样本所有突变的突变数、最大突变丰度;
所述突变检测工具为Mutscan或Varscan;
根据突变数,过滤假阳性,过滤掉突变数小于等于50的测序数据对应的DNA样本;
S3、突变过滤数据的分析及POLE突变判别
根据步骤S2过滤后的突变数据及设定的阈值,判断POLE突变的致病性。
优选地,所述突变过滤数据的分析具体为:对步骤S2过滤后的数据进行分析,获取碱基C突变为碱基A(C>A)突变数、碱基T突变为碱基G(T>G)突变数、碱基C突变为碱基G(C>G)突变数、点突变总数、插入/缺失突变总数和总突变数;
根据步骤S2注释的POLE突变,获取COSMIC数据库中POLE突变在样本对应肿瘤中的出现次数;
根据癌症相关基因的测序区域BED文件大小,获取肿瘤负荷(TMB)数据;肿瘤负荷(TMB)=总突变数/测序区域BED文件大小,单位:muts/mb。
优选地,所述POLE突变判别具体为:根据突变过滤数据的分析的结果,设置6个整数型计分标准:碱基C突变为碱基A(C>A)突变数占点突变总数的百分比大于20%,记1分,反之不计分;碱基T突变为碱基G(T>G)突变数占点突变总数的百分比大于4%,记为1分,反之不计分;碱基C突变为碱基G(C>G)突变数占点突变总数的百分比小于0.6%,记为1分,反之不计分;插入/缺失位点(Indel)占总突变数的百分比小于5%记为1分,反之不计分;肿瘤负荷(TMB)大于100muts/mb,记为1分,反之不计分;POLE突变在肿瘤中的出现次数大于1,记为1分,反之不计分;
根据计分标准统计样本POLE突变分数,总分数大于等于4,判断为致病性POLE突变。
优选地,根据计分标准统计样本POLE突变分数,总分数等于3,判断为未知致病性POLE突变;总分数小于3,判断为无致病性POLE突变。
优选地,所述癌症相关的基因为癌症相关的680个基因。
优选地,所述癌症相关基因的测序区域BED文件大小为680个基因的测序区域BED文件大小(即680基因覆盖区域的BED格式的文件)。
分析肿瘤突变时,需采集两组基因组数据:肿瘤基因组(组织DNA[ffpedna]或血液游离DNA[cfdna])与对照基因组(唾液DNA[sladna]或血液基因组DNA[gdna])共同分析(这两个基因组的获取都需要经过质控、对比、去重)。若突变同时存在于肿瘤基因组与对照基因组,则为胚系突变;若突变只存在于肿瘤基因组,则为体细胞突变。本发明后续所讨论、分析的突变均为体细胞突变,因为只有体细胞突变才与癌症的产生有关。
Mutscan或Varscan等突变检测工具能够基于去重后所得的pileup文件对每个位点进行变异鉴定,变异类型包括点突变(SNV)、插入/缺失(Indel)突变。
优选地,本发明根据获取的突变数和最大突变丰度,过滤假阳性;所述待测样本为肿瘤患者待测组织DNA(ffpedna),过滤掉突变数小于等于50、最大突变丰度小于等于5%的测序数据对应的样本;
进一步优选地,本发明根据获取的的突变数和最大突变丰度,过滤假阳性;所述待测样本为肿瘤患者待测血液游离DNA(cfdna),过滤掉突变数小于等于50、最大突变丰度小于等于1%的测序数据对应的样本;
优选地,所述肿瘤为子宫内膜癌、肺癌、结直肠癌、黑色素瘤、胶质瘤、卵巢癌、尿路上皮癌。
进一步优选地,所述肿瘤为子宫内膜癌、肺癌、结直肠癌。
进一步优选地,所述肿瘤为子宫内膜癌。
进一步优选地,所述子宫内膜癌为POLE分型子宫内膜癌。
利用本发明的基于二代测序结果的POLE突变判别模型的构建方法构建POLE突变判别模型。所述POLE突变判别模型能够更准确的判别出POLE突变,并分辨出致病性与非致病性POLE突变,发现潜在的致病性POLE突变。所述模型能够适用于子宫内膜癌、肺癌、结直肠癌、黑色素瘤、胶质瘤、卵巢癌、尿路上皮癌等多种肿瘤的POLE突变的判别。
本发明还提供一种计算机可读存储介质,其上存储有计算机程序/指令,该计算机程序/指令被处理器执行时实现本发明所述构建方法的步骤。
实施例1一种基于二代测序结果的POLE突变判别模型的构建方法及POLE突变判别模型
一种基于二代测序结果的POLE突变判别模型的构建方法,所述构建方法的流程示意图如图1所示。
所述构建方法包括如下步骤:
S1、二代测序数据的预处理
对获得的待测样本和对照样本的二代测序数据进行预过滤,分别获得pileup文件;
所述待测样本为肿瘤患者待测组织DNA(ffpedna)或血液游离DNA(cfdna),所述对照样本为肿瘤患者唾液DNA(sladna)或血液基因组DNA(gdna);
所述预过滤包括质控、比对、去重;
所述质控包括质量评估、去接头序列、去低质量序列、去重复序列;
所述比对是将质控后的read与人参考基因对比,获得BAM文件;将通过质控后每一条read与参考基因组进行比对,回贴到基因组上最佳位置;Reads比对前需去掉接头序列;Reads通过双端的模式比对到GRCh37(hg19)版本的人类基因组上,将比对上的reads按染色体位置排序并转换为二进制BAM文件;
所述去重是去除PCR重复,校正测序错误,生成用于检测的pileup文件。
S2、序列比对、变异判读及突变过滤
利用突变检测工具Mutscan或Varscan对步骤S1获得pileup文件进行分析,分析数据中存在的与癌症相关的680个基因的突变信息,注释SNV、Indel突变的位点位置与具体碱基变化,标注POLE突变,获取样本所有突变的突变数、最大突变丰度;
根据突变数过滤假阳性,过滤掉突变数小于等于50的测序数据对应的DNA样本;
S3、突变过滤数据的分析及POLE突变判别
根据步骤S2过滤后的突变数据及设定的阈值,判断POLE突变的致病性。
所述突变过滤数据的分析具体为:对步骤S2过滤后的数据进行分析,获取碱基C突变为碱基A(C>A)突变数、碱基T突变为碱基G(T>G)突变数、碱基C突变为碱基G(C>G)突变数、点突变总数、插入/缺失突变总数和总突变数;
根据步骤S2注释的POLE突变,获取COSMIC数据库中POLE突变在样本对应肿瘤中的出现次数;
根据680个基因的测序区域BED文件大小,获取肿瘤负荷(TMB)数据;肿瘤负荷(TMB)=总突变数/测序区域BED文件大小,单位:muts/mb;
所述POLE突变判别具体为:根据突变过滤数据的分析的结果,设置6个整数型计分标准:碱基C突变为碱基A(C>A)突变数占点突变总数的百分比大于20%,记1分,反之不计分;碱基T突变为碱基G(T>G)突变数占点突变总数的百分比大于4%,记为1分,反之不计分;碱基C突变为碱基G(C>G)突变数占点突变总数的百分比小于0.6%,记为1分,反之不计分;插入/缺失位点(Indel)占总突变数的百分比小于5%记为1分,反之不计分;肿瘤负荷(TMB)大于100muts/mb,记为1分,反之不计分;POLE突变在肿瘤中的出现次数大于1,记为1分,反之不计分;
根据计分标准统计样本POLE突变分数,总分数大于等于4,判断为致病性POLE突变;
总分数等于3,判断为未知致病性POLE突变;
总分数小于3,判断为无致病性POLE突变。
利用上述构建方法构建即得POLE突变判别模型。
680个基因的信息如下表1所示。
表1
Figure BDA0004125835760000101
Figure BDA0004125835760000111
Figure BDA0004125835760000121
Figure BDA0004125835760000131
Figure BDA0004125835760000141
Figure BDA0004125835760000151
实施例2POLE突变判别模型测试
利用实施例1的POLE突变判别模型进行测试。对深圳市海普洛斯生物科技有限公司的子宫内膜癌患者数据库中共计410个可能存在POLE超突变致病性的样本进行测试,利用本发明的模型进行假阳性过滤及POLE突变分数计算。
根据本发明的模型过滤条件,410个可能存在POLE超突变样本中过滤掉160个阴性样本。160例样本中,158例按照计分标准(6分制)均给出3分及以下的得分;剩余的2例按照计分标准(6分制)给出4分及以上的得分。综合来说,该过滤去除了158例真阴性和2例假阳性。
经过滤后的250个样本,根据计算的分数判断的致病性,并与真实临床诊断结果进行对比,并绘制四格表,并根据四格表数据,计算诊断实验评估指标中的灵敏度和特异性,计算公式:
灵敏度TP/(FN+TP)×100%;
特异性计算公式:TN/(TN+FP)×100%。
得到如下表2所示的四格表,
表2
标准集-真 标准集-假
测试集-真 24(TP true positive) 1(FN false negative)
测试集-假 1(FP false positive) 224(TN true negative)
(注:标准集-真即阳性,标准集-假即阴性,测试集-真即评分大于等于4,测试集-假即评分小于4)
根据表2的数据计算可得本发明模型的灵敏度为96%,特异性为99.5%。即本发明的模型灵敏度高,特异性强。
表2中,一例标准集为假但其POLE突变得分为4的位点(A1814T),在常见的检测范围(exons 9,11,13,14)之外,可能具有尚未报道的潜在致病性。
对比例1
利用对比模型对二代测序数据进行分析,计算POLE突变分数。
对比模型与本发明的区别仅在于,缺少假阳性过滤。
对比模型的构建方法,包括如下步骤:
S1、二代测序数据的预处理
对获得的待测样本和对照样本的二代测序数据进行预过滤,分别获得pileup文件;
所述待测样本为肿瘤患者待测组织DNA(ffpedna)或血液游离DNA(cfdna),所述对照样本为肿瘤患者唾液DNA(sladna)或血液基因组DNA(gdna);
所述预过滤包括质控、比对、去重;
所述质控包括质量评估、去接头序列、去低质量序列、去重复序列;
所述比对是将质控后的read与人参考基因对比,获得BAM文件;将通过质控后每一条read与参考基因组进行比对,回贴到基因组上最佳位置;Reads比对前需去掉接头序列;Reads通过双端的模式比对到GRCh37(hg19)版本的人类基因组上,将比对上的reads按染色体位置排序并转换为二进制BAM文件;
所述去重是去除PCR重复,校正测序错误,生成用于检测的pileup文件。
S2、序列比对、变异判读及突变过滤
利用突变检测工具Mutscan或Varscan对步骤S1获得pileup文件进行分析,分析数据中存在的与癌症相关的680个基因的突变信息,注释SNV、Indel突变的位点位置与具体碱基变化,标注POLE突变,获取碱基C突变为碱基A(C>A)突变数、碱基T突变为碱基G(T>G)突变数、碱基C突变为碱基G(C>G)突变数、点突变总数、插入/缺失突变总数和总突变数;
根据步骤S2注释的POLE突变,获取COSMIC数据库中POLE突变在样本对应肿瘤中的出现次数;
根据680个基因的测序区域BED文件大小(即680基因覆盖区域的BED格式的文件),获取肿瘤负荷(TMB)数据;肿瘤负荷(TMB)=总突变数/测序区域BED文件大小,单位:muts/mb;
S3、POLE突变判别
设置6个整数型计分标准:步骤S2中,碱基C突变为碱基A(C>A)突变数占点突变总数的百分比大于20%,记1分,反之不计分;碱基T突变为碱基G(T>G)突变数占点突变总数的百分比大于4%,记为1分,反之不计分;碱基C突变为碱基G(C>G)突变数占点突变总数的百分比小于0.6%,记为1分,反之不计分;插入/缺失位点(indel)占总突变数的百分比小于5%记为1分,反之不计分;肿瘤负荷(TMB)大于100muts/mb,记为1分,反之不计分;POLE突变在肿瘤中的出现次数大于1,记为1分,反之不计分;
根据计分标准统计样本POLE突变分数,总分数大于等于4,判断为致病性POLE突变;总分数等于3,判断为未知致病性POLE突变;总分数小于3,判断为无致病性POLE突变。
利用对比模型1,未经过过滤,可能存在仅含2个或少量突变为:C>A,T>G的样本:C>A,1个突变;T>G,1个突变;C>G,0个突变;indels,0个突变;其获得四分并判别为阳性。然而,考虑POLE超扩增高肿瘤负荷(突变数多)的特性,该例样本显然为阴性。因此在实际判别时,应当加入过滤环节用于判别此类假阳性。
利用对比模型1进行实验测试,未经过滤的结果中存在两例假阳性。因此,相较于实施例1模型,对比模型1假阳性率增加。
对比例2
利用对比模型2对二代测序数据进行分析,计算POLE突变分数。
对比模型2与本发明的区别仅在于,调整过滤假阳性的条件,根据突变数,过滤假阳性,过滤掉突变数小于等于25的测序数据对应的样本。
根据理论模型,如果以12种snv类型的突变率的背景频率都是1:1做假设,在0.05显著条件下检出至少一个特定点需要17个样本,而检出C>A百分比的H1假设与H0假设的差异性至少需要30个样本。
利用对比模型2,过滤条件降低阈值为25,实验结果中存在一例阴性样本(编号:73871),其突变总数为36且总分为4,为假阳性。因此,相较于实施例1模型,对比模型2假阳性率增加。
对比例3
利用对比模型3对二代测序数据进行分析,计算POLE突变分数。
对比模型3与本发明的区别仅在于,调整过滤假阳性的条件,根据突变数,过滤假阳性,过滤掉突变数小于等于65的测序数据对应的样本。
根据理论模型,如果以12种snv类型的突变率的背景频率都是1:1做假设,在0.05显著条件下检出至少一个特定点需要17个样本,而检出C>A百分比的H1假设与H0假设的差异性至少需要30个样本。
利用对比模型3,过滤条件阈值为65,实验结果中存在一例阴性样本(编号:107878),其突变总数为59且总分为5,为真阳性。因此,相较于实施例1模型,对比模型3假阴性率增加。
实施例3一种计算机可读存储介质
一种计算机可读存储介质,结构示意图如同2所示,其上存储有计算机程序/指令,该计算机程序/指令被处理器执行时实现本发明实施例1所述构建方法的步骤。
需要说明的是,在本文中,术语“包括”、“包含”或者其任何其他变体意在涵盖非排他性的包含,从而使得包括一系列要素的过程、方法、物品或者系统不仅包括那些要素,而且还包括没有明确列出的其他要素,或者是还包括为这种过程、方法、物品或者系统所固有的要素。在没有更多限制的情况下,由语句“包括一个……”限定的要素,并不排除在包括该要素的过程、方法、物品或者系统中还存在另外的相同要素。
上述本发明实施例序号仅仅为了描述,不代表实施例的优劣。
通过以上的实施方式的描述,本领域的技术人员可以清楚地了解到上述实施例方法可借助软件加必需的通用硬件平台的方式来实现,当然也可以通过硬件,但很多情况下前者是更佳的实施方式。基于这样的理解,本发明的技术方案本质上或者说对现有技术做出贡献的部分可以以软件产品的形式体现出来,该计算机软件产品存储在如上述的一个计算机可读存储介质(如ROM/RAM、磁碟、光盘)中,包括若干指令用以使得校正双端测序数据的装置执行本发明各个实施例所述的方法。
以上仅为本发明的优选实施例,并非因此限制本发明的专利范围,凡是利用本发明说明书及附图内容所作的等效结构或等效流程变换,或直接或间接运用在其他相关的技术领域,均同理包括在本发明的专利保护范围内。

Claims (10)

1.一种基于二代测序结果的POLE突变判别模型的构建方法,其特征在于,包括如下步骤:
S1、二代测序数据的预处理
对获得的待测样本和对照样本的二代测序数据进行预过滤,分别获得pileup文件;
所述预过滤包括质控、比对、去重;
所述待测样本为肿瘤患者待测组织DNA或血液游离DNA,所述对照样本为肿瘤患者唾液DNA或血液基因组DNA;
S2、序列比对、变异判读及突变过滤
利用突变检测工具对步骤S1获得pileup文件进行分析,分析数据中存在的与癌症相关基因的突变信息,注释点突变、插入/缺失突变的位点位置与具体碱基变化,标注POLE突变,获取样本所有突变的突变数、最大突变丰度;
根据突变数,过滤假阳性,过滤掉突变数小于等于50的测序数据对应的DNA样本;
S3、突变过滤数据的分析及POLE突变判别
根据步骤S2过滤后的突变数据及设定的阈值,判断POLE突变的致病性。
2.如权利要求1所述的构建方法,其特征在于,所述突变过滤数据的分析具体为:对步骤S2过滤后的数据进行分析,获取碱基C突变为碱基A突变数、碱基T突变为碱基G突变数、碱基C突变为碱基G突变数、点突变总数、插入/缺失突变总数和总突变数;
根据步骤S2注释的POLE突变,获取COSMIC数据库中POLE突变在样本对应肿瘤中的出现次数;
根据癌症相关基因的测序区域BED文件大小,获取肿瘤负荷数据;肿瘤负荷=总突变数/测序区域BED文件大小。
3.如权利要求1所述的构建方法,其特征在于,所述POLE突变判别具体为:根据权利要求2中突变过滤数据的分析的结果,设置6个整数型计分标准:碱基C突变为碱基A突变数占点突变总数的百分比大于20%,记1分,反之不计分;碱基T突变为碱基G突变数占点突变总数的百分比大于4%,记为1分,反之不计分;碱基C突变为碱基G突变数占点突变总数的百分比小于0.6%,记为1分,反之不计分;插入/缺失位点占总突变数的百分比小于5%记为1分,反之不计分;肿瘤负荷大于100muts/mb,记为1分,反之不计分;POLE突变在肿瘤中的出现次数大于1,记为1分,反之不计分;
根据计分标准统计样本POLE突变分数,总分数大于等于4,判断为致病性POLE突变。
4.如权利要求1所述的构建方法,其特征在于,根据获取的突变数和最大突变丰度,过滤假阳性;所述待测样本为肿瘤患者待测组织DNA,过滤掉突变数小于等于50、最大突变丰度小于等于5%的测序数据对应的样本。
5.如权利要求1所述的构建方法,其特征在于,根据获取的的突变数和最大突变丰度,过滤假阳性;所述待测样本为肿瘤患者待测血液游离DNA,过滤掉突变数小于等于50、最大突变丰度小于等于1%的测序数据对应的样本。
6.如权利要求1所述的构建方法,其特征在于,所述突变检测工具为Mutscan或Varscan。
7.如权利要求1至6任一所述的构建方法,其特征在于,所述肿瘤为子宫内膜癌、肺癌、结直肠癌、黑色素瘤、胶质瘤、卵巢癌或尿路上皮癌。
8.如权利要求7所述的构建方法,其特征在于,所述子宫内膜癌为POLE分型子宫内膜癌。
9.一种POLE突变判别模型,其特征在于,利用权利要求1至8任一所述构建方法构建所得。
10.一种计算机可读存储介质,其上存储有计算机程序/指令,其特征在于,该计算机程序/指令被处理器执行时实现权利要求1至8任一所述构建方法的步骤。
CN202310245533.5A 2023-03-02 2023-03-02 一种基于二代测序结果的pole突变判别模型的构建方法及其应用 Pending CN116364183A (zh)

Priority Applications (1)

Application Number Priority Date Filing Date Title
CN202310245533.5A CN116364183A (zh) 2023-03-02 2023-03-02 一种基于二代测序结果的pole突变判别模型的构建方法及其应用

Applications Claiming Priority (1)

Application Number Priority Date Filing Date Title
CN202310245533.5A CN116364183A (zh) 2023-03-02 2023-03-02 一种基于二代测序结果的pole突变判别模型的构建方法及其应用

Publications (1)

Publication Number Publication Date
CN116364183A true CN116364183A (zh) 2023-06-30

Family

ID=86940934

Family Applications (1)

Application Number Title Priority Date Filing Date
CN202310245533.5A Pending CN116364183A (zh) 2023-03-02 2023-03-02 一种基于二代测序结果的pole突变判别模型的构建方法及其应用

Country Status (1)

Country Link
CN (1) CN116364183A (zh)

Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2017008165A1 (en) * 2015-07-14 2017-01-19 British Columbia Cancer Agency Branch Classification method and treatment for endometrial cancers
CN112116956A (zh) * 2020-09-29 2020-12-22 深圳裕策生物科技有限公司 一种基于二代测序的肿瘤单样本tmb检测方法及装置

Patent Citations (2)

* Cited by examiner, † Cited by third party
Publication number Priority date Publication date Assignee Title
WO2017008165A1 (en) * 2015-07-14 2017-01-19 British Columbia Cancer Agency Branch Classification method and treatment for endometrial cancers
CN112116956A (zh) * 2020-09-29 2020-12-22 深圳裕策生物科技有限公司 一种基于二代测序的肿瘤单样本tmb检测方法及装置

Non-Patent Citations (7)

* Cited by examiner, † Cited by third party
Title
ALICIA LEÓN-CASTILLO 等: "Interpretation of somatic POLE mutations in endometrial carcinoma", JOURNAL OF PATHOLOGY, vol. 250, no. 3, 30 January 2020 (2020-01-30), pages 1 - 2 *
DAVID TAMBORERO 等: "A Pan-cancer Landscape of Interactions between Solid Tumors and Infiltrating Immune Cell Populations", TRANSLATIONAL CANCER MECHANISMS AND THERAPY, vol. 24, no. 15, 31 July 2018 (2018-07-31), pages 3719 *
JIANFEIYAO 等: "Comprehensive analysis of POLE and POLD1 Gene Variations identifes cancer patients potentially beneft from immunotherapy in Chinese population", SCIENTIFIC REPORTS, vol. 9, no. 1, 31 October 2019 (2019-10-31), pages 5 - 6 *
MINYUE TEO 等: "Characterization of POLE-mutated (POLE+) urothelial carcinoma of the bladder and urinary tract (UC)", JOURNAL OF CLINICAL ONCOLOGY, vol. 35, no. 6, 29 March 2017 (2017-03-29), pages 1 *
SHUANGNI YU 等: "Clinicopathological and molecular characterization of high-grade endometrial carcinoma with POLE mutation: a single center study", JOURNAL OF GYNECOLOGIC ONCOLOGY, vol. 33, no. 3, 3 February 2022 (2022-02-03), pages 1 - 14 *
吴一龙 等: "肿瘤二代测序临床报告解读共识", 循证医学, vol. 22, no. 2, 30 April 2022 (2022-04-30), pages 76 *
陈实富: "循环肿瘤DNA测序的数据分析方法", 中国博士学位论文全文数据库 信息科技辑, no. 2, 15 February 2018 (2018-02-15), pages 140 - 9 *

Similar Documents

Publication Publication Date Title
CN108319813B (zh) 循环肿瘤dna拷贝数变异的检测方法和装置
CN108690871B (zh) 基于二代测序的插入缺失突变检测方法、装置和存储介质
CN111326212B (zh) 一种结构变异的检测方法
JP2023524722A (ja) 遺伝子の突然変異及び発現量を検出する方法及び装置
CN108588194A (zh) 利用高通量测序数据检测肿瘤突变负荷的方法及装置
CN116403644B (zh) 一种用于癌症风险预测的方法及装置
CN116580768B (zh) 一种基于定制化策略的肿瘤微小残留病灶检测方法
CN112687333B (zh) 一种泛癌种的单样本微卫星不稳定性的分析方法和装置
CN116356001B (zh) 一种基于血液循环肿瘤dna的双重背景噪声突变去除方法
CN110100013A (zh) 用于肿瘤检测的方法和系统
CN112768000B (zh) 一种预测met基因拷贝数变化类型的方法及装置
CN108229103A (zh) 循环肿瘤dna重复序列的处理方法及装置
WO2018054254A1 (zh) 一种鉴定样本中肿瘤负荷的方法和系统
CN112397151A (zh) 基于靶向捕获测序的甲基化标志物筛选与评价方法及装置
CN115896256A (zh) 基于二代测序技术的rna插入缺失突变的检测方法、装置、设备和存储介质
CN116013419A (zh) 检测染色体拷贝数变异的方法
CN108595918A (zh) 循环肿瘤dna重复序列的处理方法及装置
CN116189763A (zh) 一种基于二代测序的单样本拷贝数变异检测方法
CN107992719B (zh) 一种基于高通量测序的膀胱癌检测试剂盒
CN117316271A (zh) 基于二代测序技术筛查血液肿瘤标本拷贝数变异的方法及检测系统
CN114093417B (zh) 一种鉴定染色体臂杂合性缺失的方法和装置
CN106156539B (zh) 分析个体两类状态的免疫差异的方法和装置
CN112837748A (zh) 一种区分不同解剖学起源肿瘤的系统及其方法
CN116543835B (zh) 一种检测血浆样本微卫星状态的方法和装置
CN118308490A (zh) 不明原发灶肿瘤组织溯源检测标志物的用途及检测系统

Legal Events

Date Code Title Description
PB01 Publication
PB01 Publication
SE01 Entry into force of request for substantive examination
SE01 Entry into force of request for substantive examination