特表2020-531016IP Force 特許公報全文掲載

(19)【発行国】日本国特許庁(JP)
(12)【公報種別】公表特許公報(A)
(11)【公表番号】特表2020-531016(P2020-531016A)
(43)【公表日】2020年11月5日
(54)【発明の名称】酵素のスクリーニング法
(51)【国際特許分類】
   C12Q 1/6869 20180101AFI20201009BHJP
   C12Q 1/48 20060101ALI20201009BHJP
   C12N 9/10 20060101ALI20201009BHJP
   C12N 15/09 20060101ALN20201009BHJP
【FI】
   C12Q1/6869 ZZNA
   C12Q1/48 Z
   C12N9/10
   C12N15/09 Z
【審査請求】有
【予備審査請求】未請求
【全頁数】62
(21)【出願番号】特願2020-510519(P2020-510519)
(86)(22)【出願日】2018年8月22日
(85)【翻訳文提出日】2020年4月1日
(86)【国際出願番号】US2018047407
(87)【国際公開番号】WO2019040546
(87)【国際公開日】20190228
(31)【優先権主張番号】62/549,246
(32)【優先日】2017年8月23日
(33)【優先権主張国】US
(81)【指定国】 AP(BW,GH,GM,KE,LR,LS,MW,MZ,NA,RW,SD,SL,ST,SZ,TZ,UG,ZM,ZW),EA(AM,AZ,BY,KG,KZ,RU,TJ,TM),EP(AL,AT,BE,BG,CH,CY,CZ,DE,DK,EE,ES,FI,FR,GB,GR,HR,HU,IE,IS,IT,LT,LU,LV,MC,MK,MT,NL,NO,PL,PT,RO,RS,SE,SI,SK,SM,TR),OA(BF,BJ,CF,CG,CI,CM,GA,GN,GQ,GW,KM,ML,MR,NE,SN,TD,TG),AE,AG,AL,AM,AO,AT,AU,AZ,BA,BB,BG,BH,BN,BR,BW,BY,BZ,CA,CH,CL,CN,CO,CR,CU,CZ,DE,DJ,DK,DM,DO,DZ,EC,EE,EG,ES,FI,GB,GD,GE,GH,GM,GT,HN,HR,HU,ID,IL,IN,IR,IS,JO,JP,KE,KG,KH,KN,KP,KR,KW,KZ,LA,LC,LK,LR,LS,LU,LY,MA,MD,ME,MG,MK,MN,MW,MX,MY,MZ,NA,NG,NI,NO,NZ,OM,PA,PE,PG,PH,PL,PT,QA,RO,RS,RU,RW,SA,SC,SD,SE,SG,SK,SL,SM,ST,SV,SY,TH,TJ,TM,TN,TR,TT
(71)【出願人】
【識別番号】591003013
【氏名又は名称】エフ.ホフマン−ラ ロシュ アーゲー
【氏名又は名称原語表記】F. HOFFMANN−LA ROCHE AKTIENGESELLSCHAFT
(71)【出願人】
【識別番号】507044516
【氏名又は名称】プレジデント アンド フェローズ オブ ハーバード カレッジ
(74)【代理人】
【識別番号】100118902
【弁理士】
【氏名又は名称】山本 修
(74)【代理人】
【識別番号】100106208
【弁理士】
【氏名又は名称】宮前 徹
(74)【代理人】
【識別番号】100120112
【弁理士】
【氏名又は名称】中西 基晴
(72)【発明者】
【氏名】エア,アルナ
(72)【発明者】
【氏名】チャーチ,ジョージ・エム
(72)【発明者】
【氏名】パラ,ミルコ
(72)【発明者】
【氏名】ペパン,フランソワ
(72)【発明者】
【氏名】プンタムベイカー,スカニヤ・スリニバサ・ラオ・アルン
(72)【発明者】
【氏名】ストレンジズ,ピーター・ビー
【テーマコード(参考)】
4B050
4B063
【Fターム(参考)】
4B050CC03
4B050LL03
4B063QA13
4B063QQ28
4B063QQ42
4B063QQ52
4B063QR08
4B063QR32
4B063QR35
4B063QR90
4B063QS36
4B063QS39
4B063QX01
(57)【要約】
ナノポアベースのシーケンシングを使用して、マルチプレックス方式で、少なくとも2つの異なる酵素変異体についての複数の動態パラメータを導出する(240)ための組成物および方法を対象とする。一部の実施形態では、システムおよび方法は、異なるナノポア変異体、またはナノポア変異体および酵素変異体の両方の異なる組合せをスクリーニングするのに使用されうる。
【選択図】図1A
【特許請求の範囲】
【請求項1】
ナノポアベースのシーケンシングを使用して、複数の異なる酵素変異体をスクリーニングする方法であって、
a.複数の異なるナノポアシーケンシング複合体を含むバイオチップを得るステップであって、前記複数の異なるナノポアシーケンシング複合体のうちの各異なるナノポアシーケンシング複合体が、固有の分子バーコードを有するポリヌクレオチドを含み、前記異なるナノポアシーケンシング複合体のうちの少なくとも2つが、異なる酵素変異体を有するものである、前記ステップ;
b.チップへと装填された各異なるナノポアシーケンシング複合体についてのシーケンシングデータセットを生成するステップ;
c.前記異なるナノポアシーケンシング複合体のポリヌクレオチド内に含まれる固有の分子バーコードの同定に基づき、生成されたシーケンシングデータセットの各々を、複数の異なる酵素変異体のうちの1つの異なる酵素変異体と関連するものとして分類するステップ;および
d.前記複数の異なる酵素変異体のうちの酵素変異体の1つずつについて、複数のパラメータを導出するステップであって、前記異なる酵素変異体の1つずつについての複数のパラメータが、異なる酵素変異体のうちのそれぞれの1つと関連する、分類された配列データセットに基づき導出されるものである、前記ステップ;
を含む、前記方法。
【請求項2】
異なるナノポアシーケンシング複合体内に含まれる固有の分子バーコードの同定が、(i)最小限の閾値塩基長を満たすように、品質リードにフィルターをかけること;(ii)自動化されたアライメントベースのアルゴリズムを使用して、確率スコアを導出すること;および(iii)算出された前記確率スコアが、所定の閾値確率スコア値を少なくとも満たすのかどうかを査定することを含む、請求項1に記載の方法。
【請求項3】
所定の閾値確率スコア値が、0.80である、請求項2に記載の方法。
【請求項4】
自動化されたアライメントベースの分類アルゴリズムが、(i)生リード内の全てのバーコード反復境界を同定し;(ii)前記反復境界を、個々のバーコードリードへと分割し;(iii)コンセンサスバーコードをアライメントから生成するのに、自動化多重配列アライメントアルゴリズムを使用して個々のバーコードリードをアライメントし;(iv)生成されたコンセンサスバーコードを、スクリーニングにおいて利用された全ての可能なバーコードに対して局所的にアライメントし;(v)最も可能性が高いバーコード候補を、配列同一性に基づき同定することにより、確率スコアを導出する、請求項3に記載の方法。
【請求項5】
1つの異なる酵素変異体と関連するものとして分類された、単一の配列データセットが、この1つの異なる酵素変異体についての複数のパラメータを導出するのに利用される、請求項1に記載の方法。
【請求項6】
1つの異なる酵素変異体と関連するものとして分類された、少なくとも2つの配列データセットが、この1つの異なる酵素変異体についての複数のパラメータを導出するのに利用される、請求項1に記載の方法。
【請求項7】
異なる酵素変異体の1つずつについての複数のパラメータが、滞留時間、タグ付けされたヌクレオチドの組込みの全触媒サイクルの速度、ヌクレオチドの組込みの後におけるタグ放出速度、タグ捕捉速度、およびタグ捕捉滞留時間からなる群から選択される、請求項1に記載の方法。
【請求項8】
複数のパラメータが、各異なるヌクレオチド種類について導出される、請求項7に記載の方法。
【請求項9】
複数の異なる酵素変異体のうちの異なる酵素変異体の1つずつについて導出された複数のパラメータに対して主成分分析を実施するステップをさらに含む、請求項8に記載の方法。
【請求項10】
少なくとも1つのヌクレオチドについてのプロセッシビティー速度が、複数の異なる酵素変異体のうちの第1の異なる酵素変異体について、複数の異なる酵素変異体のうちの第2の異なる酵素変異体と比較して変更されるのかどうかを査定するステップをさらに含む、請求項8に記載の方法。
【請求項11】
査定が、第1の異なる酵素変異体の複数のパラメータのうちの少なくとも1つのパラメータを、第2の異なる酵素変異体の同じ少なくとも1つのパラメータと比較するステップを含む、請求項10に記載の方法。
【請求項12】
酵素が、ポリメラーゼまたは逆転写酵素である、請求項1に記載の方法。
【請求項13】
酵素が、ポリメラーゼである、請求項1に記載の方法。
【請求項14】
異なるナノポアシーケンシング複合体のうちの少なくとも3つが、3つの異なるポリメラーゼ変異体を含む、請求項13に記載の方法。
【請求項15】
少なくとも3つの異なるポリメラーゼ変異体のうちの1つがコントロールであり、他の異なるポリメラーゼ変異体が、各々、コントロールと比較して少なくとも1カ所の異なる突然変異を含む、請求項14に記載の方法。
【請求項16】
固有の分子バーコードが、10〜50塩基の間を有する核酸配列を含む、請求項1に記載の方法。
【請求項17】
固有の分子バーコードの各々が、互いに対する85%未満の配列同一性を有する、請求項16に記載の方法。
【請求項18】
固有の分子バーコードが、配列番号1〜3のうちのいずれかを有する核酸配列を含む、請求項1に記載の方法。
【請求項19】
ポリヌクレオチドが、固有の分子バーコードおよび共通読取り領域を含む、請求項1に記載の方法。
【請求項20】
ナノポアベースのシーケンシングを使用して、少なくとも2つの酵素変異体をスクリーニングする方法であって、
複数の個別にアドレス可能なナノポアを含むバイオチップを得るステップであって、得られたバイオチップが、少なくとも第1および第2の異なるナノポアシーケンシング複合体を含み、前記第1のナノポアシーケンシング複合体が、第1の酵素変異体および第1のポリヌクレオチドを含み、前記第2のナノポアシーケンシング複合体が、第2の酵素変異体および第2のポリヌクレオチドを含み、前記第1および第2のポリヌクレオチドが、各々、異なる分子バーコードを含み、前記第1および第2の酵素変異体が異なるものである、前記ステップ;
第1および第2のナノポアシーケンシング複合体の少なくとも各々について、シーケンシングデータセットを生成するステップ;
生成されたシーケンシングデータセットの各々を、少なくとも第1の酵素変異体または第2の酵素変異体と関連するものとして分類するステップであって、配列データセットが、各々、第1および第2のポリヌクレオチドと共に含まれる少なくとも固有の分子バーコードの同定に基づき、少なくとも第1の酵素変異体または第2の酵素変異体と関連するものとして分類される、前記ステップ;ならびに
第1の酵素変異体または第2の酵素変異体と関連するものとして分類されたデータセットに基づき、第1および第2の酵素変異体の各々について、複数の動態パラメータを導出するステップ;
を含む、前記方法。
【請求項21】
バイオチップ上に、第3の酵素変異体および第3のポリヌクレオチドを含む、第3のナノポアシーケンシング複合体を装填するステップであって、前記第3の酵素変異体が、第1および第2の酵素変異体と異なり、前記第3のポリヌクレオチドが、第1および第2のポリヌクレオチド変異体と異なる分子バーコードを含む前記ステップをさらに含む、請求項20に記載の方法。
【請求項22】
第1および第2の酵素変異体が、ポリメラーゼ変異体である、請求項20に記載の方法。
【請求項23】
ナノポアベースのシーケンシングが、ヌクレオチド組込みイベントの副産物を検出することを含む、請求項22に記載の方法。
【請求項24】
副産物が、各個別にアドレス可能なナノポアに隣接して配置された電極により検出される、請求項23に記載の方法。
【請求項25】
複数の異なるナノポアシーケンシング複合体を含むバイオチップであって、各異なるナノポアシーケンシング複合体が異なるポリヌクレオチド鋳型を含み、前記異なるポリヌクレオチド鋳型が、各々、固有の分子バーコードを含み、前記複数の異なるナノポアシーケンシング複合体のうちの異なるナノポアシーケンシング複合体のうちの少なくとも2つが、異なるポリヌクレオチド結合性タンパク質を含み、前記異なるポリヌクレオチド結合性タンパク質が、互いの変異体である、前記バイオチップ。
【請求項26】
ポリヌクレオチド鋳型が、各々、共通読取り領域を含む、請求項25に記載のバイオチップ。
【請求項27】
少なくとも3つの異なるポリヌクレオチド結合性タンパク質変異体を含む、少なくとも3つの異なるナノポアシーケンシング複合体を装填する、請求項25に記載のバイオチップ。
【請求項28】
ポリヌクレオチド結合性タンパク質変異体が、ポリメラーゼ変異体である、請求項25に記載のバイオチップ。
【請求項29】
ポリヌクレオチド結合性タンパク質変異体が、DNAポリメラーゼ変異体である、請求項25に記載のバイオチップ。
【請求項30】
ポリヌクレオチド結合性タンパク質変異体が、RNAポリメラーゼ変異体である、請求項25に記載のバイオチップ。
【請求項31】
ポリヌクレオチド結合性タンパク質変異体が、逆転写酵素変異体である、請求項25に記載のバイオチップ。
【請求項32】
ポリヌクレオチド結合性タンパク質変異体が、ヘリカーゼ変異体である、請求項25に記載のバイオチップ。
【請求項33】
ポリヌクレオチド結合性タンパク質変異体が、エクソヌクレアーゼ変異体である、請求項25に記載のバイオチップ。
【請求項34】
バイオチップ内の複数のナノポアの各々が、個別にアドレス可能である、請求項25に記載のバイオチップ。
【請求項35】
各個別にアドレス可能なナノポアが、ポリメラーゼ変異体により、タグ付けされたヌクレオチドが重合化したら、タグ付けされたヌクレオチドから放出されるタグを検出するように適合される、請求項25に記載のバイオチップ。
【請求項36】
各ナノポアが、個別に、センシング回路へとカップリングされる、請求項25に記載のバイオチップ。
【請求項37】
請求項25に記載のバイオチップと、バイオチップへとカップリングさせた1つまたは複数のプロセッサーとを含むシステムであって、1つまたは複数のプロセッサーが、異なるポリヌクレオチド鋳型の各々の検出された核酸配列を、異なるポリヌクレオチド結合性タンパク質変異体のうちの1つと関連するものとして分類する一助となるようにプログラムされた、前記システム。
【請求項38】
1つまたは複数のプロセッサーが、異なるポリヌクレオチド結合性タンパク質変異体の各々についての1つまたは複数のパラメータを導出するようにさらにプログラムされる、請求項37に記載のシステム。
【請求項39】
バーコード化された核酸鋳型を作出するための方法であって、(a)少なくとも1つの領域を、一本鎖核酸鋳型の集団のうちの各一本鎖核酸鋳型から削除するステップであって、削除する領域が、高い塩基対合確率を有し、一本鎖核酸鋳型の各々が、プライマー配列に挟まれた固有のバーコード配列を含むステップ;および(b)一本鎖核酸鋳型の部分集団を、一本鎖核酸鋳型の集団から選択するステップであって、部分集団内の各一本鎖核酸鋳型が、異なる固有のバーコード配列を含むステップ、を含む、前記方法。
【請求項40】
部分集団の固有のバーコード配列と関連する最小自由エネルギー(MFE)を決定するステップ、MFEに基づき閾値を選択するステップ、および閾値に基づき1つまたは複数の領域を削除するステップをさらに含む、請求項39に記載の方法。
【請求項41】
高い塩基対合確率を有する、削除する領域が、−10kcal/モルを上回るMFE値を有するヌクレオチド配列である、請求項40に記載の方法。
【請求項42】
MFE値が、MATLABのスクリプトである「rnafold」を使用して計算される、請求項41に記載の方法。
【請求項43】
固有のバーコード配列が、20ヌクレオチド〜50ヌクレオチドの間の範囲の長さを有する、請求項39に記載の方法。
【請求項44】
プライマー配列が、互いに対して少なくとも95%同一である、請求項39に記載の方法。
【請求項45】
プライマー配列の長さが、約10ヌクレオチド〜約30ヌクレオチドの間の範囲である、請求項39に記載の方法。
【請求項46】
部分集団が、少なくとも100の一本鎖核酸鋳型を含む、請求項39に記載の方法。
【請求項47】
部分集団の一本鎖核酸鋳型を環状化するステップをさらに含む、請求項39に記載の方法。
【請求項48】
ナノポアベースのシーケンシングを使用して、複数の異なるナノポア変異体をスクリーニングする方法であって、
a.複数の異なるナノポアシーケンシング複合体を含むバイオチップを得るステップであって、複数の異なるナノポアシーケンシング複合体のうちの各異なるナノポアシーケンシング複合体が、固有の分子バーコードを有するポリヌクレオチドを含み、異なるナノポアシーケンシング複合体のうちの少なくとも2つが、異なるナノポア変異体を有する、前記ステップ;
b.チップへと装填された各異なるナノポアシーケンシング複合体についてのシーケンシングデータセットを生成するステップ;
c.異なるナノポアシーケンシング複合体のポリヌクレオチド内に含まれる固有の分子バーコードの同定に基づき、生成されたシーケンシングデータセットの各々を、複数の異なるナノポア変異体のうちの1つの異なるナノポア変異体と関連するものとして分類するステップ;および
d.複数の異なるナノポア変異体のうちのナノポア変異体の1つずつについて、複数のパラメータを導出するステップであって、異なるナノポア変異体の1つずつについての複数のパラメータが、異なるナノポア変異体のうちのそれぞれの1つと関連する、分類された配列データセットに基づき導出される、前記ステップ;
を含む、前記方法。
【請求項49】
少なくとも2つの異なるナノポア変異体がスクリーニングされる、請求項48に記載の方法。
【請求項50】
異なるナノポアシーケンシング複合体のうちの少なくとも2つが、異なる酵素変異体を含む、請求項48に記載の方法。
【請求項51】
バイオチップが、少なくとも4つの異なるナノポアシーケンシング複合体を含み、少なくとも4つの異なるナノポアシーケンシング複合体が、少なくとも2つの異なるナノポア変異体と、少なくとも2つの異なる酵素変異体との異なる組合せを含む、請求項48に記載の方法。
【請求項52】
少なくとも2つの異なる酵素変異体が、ポリメラーゼ変異体である、請求項51に記載の方法。
【請求項53】
固有の分子バーコードが、10〜150塩基の間を有する核酸配列を含む、請求項48に記載の方法。
【請求項54】
固有の分子バーコードが、10〜100塩基の間を有する核酸配列を含む、請求項53に記載の方法。
【請求項55】
固有の分子バーコードが、10〜50塩基の間を有する核酸配列を含む、請求項53に記載の方法。
【請求項56】
固有の分子バーコードの各々が、互いに対する85%未満の配列同一性を有する、請求項53に記載の方法。
【請求項57】
固有の分子バーコードが、配列番号1〜3のうちのいずれかを有する核酸配列を含む、請求項48に記載の方法。
【請求項58】
ポリヌクレオチドが、固有の分子バーコードおよび共通読取り領域を含む、請求項48に記載の方法。
【発明の詳細な説明】
【技術分野】
【0001】
連邦政府による後援を受けた研究に関する言明
[0001]本発明は、米国国立科学財団により与えられる、1445570号の政府助成によりなされた。米国連邦政府は、本発明において、一定の権利を有する。
【0002】
関連出願の相互参照
[0002]その開示が、参照によりその全体において本明細書に組み込まれる、2017年8月23日に出願された、米国仮出願第62/549,246号の出願日の利益を主張する。
【背景技術】
【0003】
[0003]DNAシーケンシングの重要性は、40年前におけるその発端から、劇的に増大している。DNAシーケンシングは、生物学および医学の大半の分野のための極めて重要な技術として認識され、個別化医療および精密医療の新たな枠組みのための基礎として認識される。個体のゲノムおよびエピゲノムについての情報は、疾患に対するそれらの傾向、臨床予後、および治療剤に対する応答を明らかにする一助となりうるが、医療におけるゲノムシーケンシングの規定の適用は、包括的なデータが、時宜にかない、費用効果の高い形で送り届けられることを要求するであろう。
【0004】
[0004]ナノポアベースの核酸シーケンシングとは、広く研究されている手法である。過去20年間において、ポリマーの特徴付けのためにナノポアを利用し、廉価で、迅速な、単一分子方式でヌクレオチドを識別するためにナノポアを利用することに、大きな関心が払われている。例えば、Kasianowiczらは、脂質二重層内に包埋されたアルファヘモリシンナノポアを通って、電気的に移動するときの、一本鎖ポリヌクレオチドを特徴づけた(例えば、Kasianowicz,J.(1996)、「Characterization of Individual Polynucleotide Molecules Using Membrane Channel」、Proc.Natl.Acad.Sci.、93、13770〜3を参照されたい)。ポリヌクレオチドの移動時に、ナノポア開口部の部分的な遮断が、イオン電流の減少として測定されうることが裏付けられた。同様に、Gundlachらは、Mycobacterium smegmatis(「MspA」)に由来する低ノイズナノポアを、二重鎖中断シーケンシングと呼ばれる工程と共に使用する、DNAのシーケンシング法を裏付けた(例えば、Derrington,I.ら(2010)、「Nanopore DNA Sequencing with MspA」、Proc.Natl.Acad.Sci.、107(37)、16060〜16065を参照されたい)。ここでは、核酸の一本鎖部分を、MspAの狭窄部内に、一時的に保持するのに、二重鎖の二本鎖が使用される。Akesonら(例えば、PCT公開第WO2015/0344945号を参照されたい)は、ナノポア内のポリヌクレオチドを特徴付けするための方法であって、ナノポア開口部を通る、またはこれに隣接するポリヌクレオチドの移動速度を制御するのに、隣接して配置された分子モーターを利用する方法について開示する。
【0005】
[0005]一般に、3つのナノポアシーケンシング法:それらが、ナノポアを通って、連鎖的に通過するときに、DNAの塩基が同定される、鎖シーケンシング;ヌクレオチドが、DNA分子から、1つずつ、酵素的に切断され、それらが、ナノポアにより捕捉されるか、またはこれを通過するときにモニタリングされる、エクソヌクレアーゼベースのナノポアシーケンシング;および酵素触媒型DNA合成時に、同定可能なポリマータグが、ヌクレオチドへと接合され、ナノポア内に登録される、合成によるナノポアシーケンシング(SBS)法が追求されている。これらの方法全てに共通するのは、各塩基が、順序よく決定されるような、反応速度の正確な制御に対する必要である。鎖シーケンシングは、ナノポアを通るDNAの通過を緩徐化させ、チャネル内の複数の塩基を解読するための方法を要求するが、分子モーターを利用するラチェット法は、この目的で開発されている。エクソヌクレアーゼベースのシーケンシングは、妥当なイオン電流信号を得るのに十分に遅い速度における、小孔を通したその捕捉およびその通過を保証するように、小孔に十分に近接する、各ヌクレオチドの放出を要求する。加えて、これらの方法のいずれも、4つの天然塩基、2つの比較的類似するプリン、および2つの類似するピリミジンの間の区別に依拠する。ナノポアSBS法は、配列決定のための、固有でたやすく識別可能なイオン電流遮断シグネチャーをもたらすように、特異的にデザインされたヌクレオチドへと接合された合成ポリマータグを利用する。
【0006】
[0006]DNAポリメラーゼとは、新たな相補的DNA鎖を親鋳型から合成し、これにより、遺伝情報を保存することにより、遺伝情報を複製する酵素である。現在、ポリメラーゼの突然変異体は、定方向進化により作出されており、DNAポリメラーゼの突然変異体の、大スケールのスクリーニングのための方法は、突然変異誘発、ファージディスプレイ、および区画化自己複製法となっている。これは、多くの生物工学的適用のための、異なるポリメラーゼの同定および開発をもたらしている。
【発明の概要】
【課題を解決するための手段】
【0007】
[0007]固有または所望の特性を有する酵素変異体が解明されうるように、ナノポアまたはナノポアベースのシーケンシングなどによる、複数の酵素変異体(例えば、DNAポリメラーゼ変異体)のマルチプレックススクリーニングを容易とする、システム、組成物、および方法を提示する。時間および費用がかかりうる、一度に、酵素1つずつのスクリーニングではなく、有効性、安定性、プロセッシビティー(processivity)、および忠実度を含む、異なる酵素特性が、迅速かつ正確に決定されうるように、DNAポリメラーゼ変異体などの酵素変異体が、迅速にスクリーニングされることを可能とする。本開示はまた、新規の機能および/または特注の必要を伴う酵素(例えば、DNAポリメラーゼ)、例えば、非天然の基質または温度感受性の突然変異体を組み込みうるポリメラーゼの操作も可能とする。一部の実施形態では、本開示はまた、固有または所望の特性を有するナノポア変異体が解明されうるように、複数のナノポア変異体のマルチプレックススクリーニングを容易とする、システム、組成物、および方法も提示する。当然ながら、ナノポア変異体および酵素変異体のいずれも、例えば、所望の特徴を有する、ナノポア変異体と酵素変異体との対を解明するように、同じバイオチップ内で、併せてスクリーニングされうる。
【0008】
[0008]したがって、本開示の一態様は、ナノポアベースのシーケンシングを使用して、複数の異なる酵素変異体をスクリーニングする方法であって、複数の異なるナノポアシーケンシング複合体を含むバイオチップを得るステップであって、複数の異なるナノポアシーケンシング複合体のうちの各異なるナノポアシーケンシング複合体が、固有の分子バーコードを有するポリヌクレオチドを含み、異なるナノポアシーケンシング複合体のうちの少なくとも2つが、異なる酵素変異体を含むステップ;チップへと装填された各異なるナノポアシーケンシング複合体についてのシーケンシングデータセットを生成するステップ;異なるナノポアシーケンシング複合体のポリヌクレオチド内に含まれる固有の分子バーコードの同定に基づき、生成されたシーケンシングデータセットの各々を、複数の異なる酵素変異体のうちの1つの異なる酵素変異体と関連するものとして分類するステップ;および複数の異なる酵素変異体のうちの酵素変異体の1つずつについて、複数のパラメータを導出するステップであって、異なる酵素変異体の1つずつについての複数のパラメータが、異なる酵素変異体のうちのそれぞれの1つと関連する、分類された配列データセットに基づき導出されるステップを含む方法である。
【0009】
[0009]一部の実施形態では、異なるナノポアシーケンシング複合体内に含まれる固有の分子バーコードの同定は、(i)最小限の閾値塩基長を満たすように、品質リードにフィルターをかけること;(ii)自動化されたアライメントベースのアルゴリズムを使用して、確率スコアを導出すること;および(iii)算出された確率スコアが、所定の閾値確率スコア値を少なくとも満たすのかどうかを査定することを含む。一部の実施形態では、所定の閾値確率スコア値は、0.80である。一部の実施形態では、自動化されたアライメントベースの分類アルゴリズムは、(i)生リード内の全てのバーコード反復境界を同定し;(ii)反復境界を、個々のバーコードリードへと分割し;(iii)コンセンサスバーコードをアライメントから生成するのに、自動化多重配列アライメントアルゴリズムを使用して個々のバーコードリードをアライメントし;(iv)生成されたコンセンサスバーコードを、利用された全ての可能なバーコードに対して局所的にアライメントし;(v)最も可能性が高いバーコード候補を、配列同一性に基づき同定することにより、確率スコアを導出する。
【0010】
[0010]一部の実施形態では、複数の異なる酵素変異体のうちの1つの異なる酵素変異体と関連するものとして分類された、単一の配列データセットは、この1つの異なる酵素変異体についての複数のパラメータを導出するのに利用される。一部の実施形態では、複数の異なる酵素変異体のうちの1つの異なる酵素変異体と関連するものとして分類された、少なくとも2つの配列データセットは、この1つの異なる酵素変異体についての複数のパラメータを導出するのに利用される。
【0011】
[0011]一部の実施形態では、異なる酵素変異体の1つずつについての複数のパラメータは、滞留時間(dwell time)、タグ付けされたヌクレオチドの組込みの全触媒サイクルの速度、ヌクレオチドの組込みの後におけるタグ放出速度、タグ捕捉速度、およびタグ捕捉滞留時間からなる群から選択される。一部の実施形態では、複数のパラメータは、各異なるヌクレオチド種類について導出される。一部の実施形態では、方法は、複数の異なる酵素変異体のうちの異なる酵素変異体の1つずつについて導出された複数のパラメータに対して主成分分析を実施するステップをさらに含む。一部の実施形態では、方法は、少なくとも1つのヌクレオチドについてのプロセッシビティー速度が、複数の異なる酵素変異体のうちの第1の異なる酵素変異体について、複数の異なる酵素変異体のうちの第2の異なる酵素変異体と比較して変更される(例えば、改善される)のかどうかを査定するステップをさらに含む。一部の実施形態では、査定は、第1の異なる酵素変異体の複数のパラメータのうちの少なくとも1つのパラメータを、第2の異なる酵素変異体の同じ少なくとも1つのパラメータと比較することを含む。
【0012】
[0012]一部の実施形態では、酵素は、ポリメラーゼまたは逆転写酵素である。一部の実施形態では、異なるナノポアシーケンシング複合体のうちの少なくとも3つは、3つの異なるポリメラーゼ変異体を含む。一部の実施形態では、異なるポリメラーゼ変異体のうちの1つは、コントロールであり、他の異なるポリメラーゼ変異体は、各々、コントロールと比較して少なくとも1カ所の異なる突然変異を含む。
【0013】
[0013]一部の実施形態では、固有の分子バーコードは、10〜200塩基の間を有する核酸配列を含む。一部の実施形態では、固有の分子バーコードは、10〜150塩基の間を有する核酸配列を含む。一部の実施形態では、固有の分子バーコードは、10〜100塩基の間を有する核酸配列を含む。一部の実施形態では、固有の分子バーコードは、10〜50塩基の間を有する核酸配列を含む。一部の実施形態では、固有の分子バーコードは、10〜25塩基の間を有する核酸配列を含む。一部の実施形態では、固有の分子バーコードの各々は、互いに対する85%未満の配列同一性を有する。一部の実施形態では、固有の分子バーコードは、配列番号1〜3のうちのいずれかを有する核酸配列を含む。一部の実施形態では、ポリヌクレオチドは、固有の分子バーコードおよび共通読取り領域(Common Reading Region)を含む。一部の実施形態では、ポリヌクレオチドは、プライマーへとアニーリングされる、環状バーコード化核酸鋳型である。
【0014】
[0014]本開示の別の態様は、ナノポアベースのシーケンシングを使用して、少なくとも2つの酵素変異体をスクリーニングする方法であって、複数の個別にアドレス可能なナノポアを含むバイオチップを得るステップであって、得られたバイオチップが、少なくとも第1および第2の異なるナノポアシーケンシング複合体を含み、第1のナノポアシーケンシング複合体が、第1の酵素変異体および第1のポリヌクレオチドを含み、第2のナノポアシーケンシング複合体が、第2の酵素変異体および第2のポリヌクレオチドを含み、第1および第2のポリヌクレオチドが、各々、異なる分子バーコードを含み、第1および第2の酵素変異体が異なるステップ;第1および第2のナノポアシーケンシング複合体の少なくとも各々について、シーケンシングデータセットを生成するステップ;生成されたシーケンシングデータセットの各々を、少なくとも第1の酵素変異体または第2の酵素変異体と関連するものとして分類するステップであって、配列データセットが、各々、第1および第2のポリヌクレオチドと共に含まれる少なくとも固有の分子バーコードの同定に基づき、少なくとも第1の酵素変異体または第2の酵素変異体と関連するものとして分類されるステップ;ならびに第1の酵素変異体または第2の酵素変異体と関連するものとして分類されたデータセットに基づき、第1および第2の酵素変異体の各々について、複数の動態パラメータを導出するステップを含む方法である。
【0015】
[0015]一部の実施形態では、方法は、バイオチップ上に、第3の酵素変異体および第3のポリヌクレオチドを含む、第3のナノポアシーケンシング複合体を装填するステップであって、第3の酵素変異体が、第1および第2の酵素変異体と異なり、第3のポリヌクレオチドが、第1および第2のポリヌクレオチド変異体と異なる分子バーコードを含むステップをさらに含む。
【0016】
[0016]一部の実施形態では、第1および第2の酵素変異体は、ポリメラーゼ変異体である。一部の実施形態では、ナノポアベースのシーケンシングは、ヌクレオチド組込みイベントの副産物を検出することを含む。一部の実施形態では、副産物は、各個別にアドレス可能なナノポアに隣接して配置された電極により検出される。
【0017】
[0017]一部の実施形態では、第1および第2の異なるポリヌクレオチドは、−[プライマー]−[共通読取り領域]−[固有のバーコード]の構造を有し、「共通読取り領域」は、第1および第2のポリヌクレオチドのいずれについても同じであり;10〜100塩基の間を有するポリヌクレオチド配列であることが可能であり、「固有のバーコード」は、5〜50塩基の間を有するオリゴヌクレオチド配列であり、各「固有のバーコード」は異なる。一部の実施形態では、第1および第2の異なるポリヌクレオチドは、−[プライマー]−[共通読取り領域]−[固有のバーコード]の構造を有し、「共通読取り領域」は、第1および第2のポリヌクレオチドのいずれについても同じであり;10〜50塩基の間を有するポリヌクレオチド配列であることが可能であり、「固有のバーコード」は、8〜25塩基の間を有するオリゴヌクレオチド配列であり、各「固有のバーコード」は異なる。一部の実施形態では、「固有のバーコード」は、配列番号1〜3のうちのいずれかを有する核酸配列を有する。一部の実施形態では、第1および第2の異なるポリヌクレオチドは、−[プライマー]−[所定の配列]の構造を有し、第1および第2のポリヌクレオチドの各々は、異なる「所定の配列」を含む。
【0018】
[0018]本開示の別の態様は、ナノポアベースのシーケンシングを使用して、少なくとも2つのナノポア変異体をスクリーニングする方法であって、複数の個別にアドレス可能なナノポアを含むバイオチップを得るステップであって、得られたバイオチップが、少なくとも第1および第2の異なるナノポアシーケンシング複合体を含み、第1のナノポアシーケンシング複合体が、第1のナノポア変異体および第1のポリヌクレオチドを含み、第2のナノポアシーケンシング複合体が、第2のナノポア変異体および第2のポリヌクレオチドを含み、第1および第2のポリヌクレオチドが、各々、異なる分子バーコードを含み、第1のナノポア変異体および第2のナノポア変異体が異なるステップ;第1および第2のナノポアシーケンシング複合体の少なくとも各々について、シーケンシングデータセットを生成するステップ;生成されたシーケンシングデータセットの各々を、少なくとも第1のナノポア変異体または第2のナノポア変異体と関連するものとして分類するステップであって、配列データセットが、各々、第1および第2のポリヌクレオチドと共に含まれる少なくとも固有の分子バーコードの同定に基づき、少なくとも第1のナノポア変異体または第2のナノポア変異体と関連するものとして分類されるステップ;ならびに第1のナノポア変異体または第2のナノポア変異体と関連するものとして分類されたデータセットに基づき、第1のおよび第2のナノポア変異体の各々について、複数の動態パラメータを導出するステップを含む方法である。一部の実施形態では、第1および第2の異なるナノポアシーケンシング複合体内に含まれる酵素は、同じ(例えば、それらのいずれもが、同じポリメラーゼ変異体を含む)である。一部の実施形態では、第1および第2の異なるナノポアシーケンシング複合体内に含まれる酵素は、異なる(例えば、それらのいずれもが、異なるポリメラーゼ変異体を含む)。
【0019】
[0019]一部の実施形態では、バイオチップは、少なくとも第3の異なるナノポアシーケンシング複合体および第4の異なるナノポアシーケンシング複合体を含み、第3のナノポアシーケンシング複合体は、第3のナノポア変異体および第3のポリヌクレオチドを含み、第4のナノポアシーケンシング複合体は、第4のナノポア変異体および第4のポリヌクレオチドを含み、第1のポリヌクレオチド、第2のポリヌクレオチド、第3のポリヌクレオチドおよび第4のポリヌクレオチドは、各々、異なる(すなわち、固有の)分子バーコードを含む。一部の実施形態では、第1のナノポアシーケンシング複合体、第2のナノポアシーケンシング複合体、第3のナノポアシーケンシング複合体、および第4のナノポアシーケンシング複合体は、2つの異なるナノポアと、2つの異なる酵素との組合せを含む。一部の実施形態では、第3のナノポアは、第1のナノポアと同じであるが、第1のナノポア複合体内の酵素変異体は、第3のナノポア複合体内の酵素と異なり;同様に、第4のナノポアは、第2のナノポアと同じであるが、第2のナノポア複合体内の酵素変異体は、第2のナノポア複合体内の酵素と異なる。
【0020】
[0020]一部の実施形態では、第1および第2の異なるポリヌクレオチドは、−[プライマー]−[共通読取り領域]−[固有のバーコード]の構造を有し、「共通読取り領域」は、第1および第2のポリヌクレオチドのいずれについても同じであり;10〜100塩基の間を有するポリヌクレオチド配列であることが可能であり、「固有のバーコード」は、5〜50塩基の間を有するオリゴヌクレオチド配列であり、各「固有のバーコード」は異なる。一部の実施形態では、第1および第2の異なるポリヌクレオチドは、−[プライマー]−[共通読取り領域]−[固有のバーコード]の構造を有し、「共通読取り領域」は、第1および第2のポリヌクレオチドのいずれについても同じであり;10〜50塩基の間を有するポリヌクレオチド配列であることが可能であり、「固有のバーコード」は、8〜25塩基の間を有するオリゴヌクレオチド配列であり、各「固有のバーコード」は異なる。一部の実施形態では、「固有のバーコード」は、配列番号1〜3のうちのいずれかを有する核酸配列を有する。一部の実施形態では、第1および第2の異なるポリヌクレオチドは、−[プライマー]−[所定の配列]の構造を有し、第1および第2のポリヌクレオチドの各々は、異なる「所定の配列」を含む。
【0021】
[0021]本開示の別の態様は、複数の異なるナノポアシーケンシング複合体を含むバイオチップであって、各異なるナノポアシーケンシング複合体が、異なるポリヌクレオチド鋳型を含み、異なるポリヌクレオチド鋳型が、各々、固有の分子バーコードを含み、複数の異なるナノポアシーケンシング複合体のうちの異なるナノポアシーケンシング複合体のうちの少なくとも2つが、異なるポリヌクレオチド結合性タンパク質を含み、異なるポリヌクレオチド結合性タンパク質が、互いの変異体であるバイオチップである。
【0022】
[0022]一部の実施形態では、第1および第2の異なるポリヌクレオチドは、−[プライマー]−[共通読取り領域]−[固有のバーコード]の構造を有し、「共通読取り領域」は、第1および第2のポリヌクレオチドのいずれについても同じであり;10〜100塩基の間を有するポリヌクレオチド配列であることが可能であり、「固有のバーコード」は、5〜50塩基の間を有するオリゴヌクレオチド配列であり、各「固有のバーコード」は異なる。一部の実施形態では、ポリヌクレオチド鋳型は、各々、共通読取り領域を含む。一部の実施形態では、各異なるポリヌクレオチド鋳型の、少なくとも一部は、固有に同定可能な核酸配列を有する部分を含む。一部の実施形態では、異なるポリヌクレオチド鋳型は、−[プライマー]−[共通読取り領域]−[固有のバーコード]の構造を有し、「共通読取り領域」は、異なる鋳型の全てについて同じであり、「固有のバーコード」は、8〜25塩基の間を有するオリゴヌクレオチド配列であり、各「固有のバーコード」は、各異なる鋳型について異なる。一部の実施形態では、異なるポリヌクレオチド鋳型は、−[プライマー]−[所定の配列]の構造を有し、異なる鋳型の各々は、固有の「所定の配列」を含む。
【0023】
[0023]一部の実施形態では、バイオチップは、少なくとも3つの異なるポリヌクレオチド結合性タンパク質変異体を含む、少なくとも3つの異なるナノポアシーケンシング複合体を装填される。一部の実施形態では、ポリヌクレオチド結合性タンパク質変異体は、ポリメラーゼ変異体である。一部の実施形態では、ポリヌクレオチド結合性タンパク質変異体は、DNAポリメラーゼ変異体である。一部の実施形態では、ポリヌクレオチド結合性タンパク質変異体は、RNAポリメラーゼ変異体である。一部の実施形態では、ポリヌクレオチド結合性タンパク質変異体は、逆転写酵素変異体である。一部の実施形態では、ポリヌクレオチド結合性タンパク質変異体は、ヘリカーゼ変異体である。一部の実施形態では、ポリヌクレオチド結合性タンパク質変異体は、エクソヌクレアーゼ変異体である。
【0024】
[0024]一部の実施形態では、バイオチップ内の複数のナノポアの各々は、個別にアドレス可能である。一部の実施形態では、各個別にアドレス可能なナノポアは、ポリメラーゼ変異体により、タグ付けされたヌクレオチドが重合化したら、タグ付けされたヌクレオチドから放出されるタグを検出するように適合される。一部の実施形態では、各ナノポアは、個別に、センシング回路へとカップリングされる。一部の実施形態では、各ナノポアシーケンシング複合体は、膜(例えば、脂質二重層)内に挿入される。
【0025】
[0025]本開示の別の態様は、複数の異なるナノポアシーケンシング複合体を含むバイオチップであって、各異なるナノポアシーケンシング複合体が、異なるポリヌクレオチド鋳型を含み、異なるポリヌクレオチド鋳型が、各々、固有の分子バーコードを含み、複数の異なるナノポアシーケンシング複合体のうちの異なるナノポアシーケンシング複合体のうちの少なくとも2つが、異なるナノポアを含み、異なるナノポアが、互いの変異体であるバイオチップである。一部の異なるナノポアシーケンシング複合体のうちの少なくとも2つが、2つの異なるナノポアを含み、異なるナノポアシーケンシング複合体のうちの少なくとも2つが、鋳型に結合する、2つの異なるポリヌクレオチドを含む、少なくとも4つの異なるナノポアシーケンシング複合体である。一部の実施形態では、ポリヌクレオチド鋳型は、各々、共通読取り領域を含む。一部の実施形態では、各異なるポリヌクレオチド鋳型の、少なくとも一部は、固有に同定可能な核酸配列を有する部分を含む。一部の実施形態では、異なるポリヌクレオチド鋳型は、−[プライマー]−[共通読取り領域]−[固有のバーコード]の構造を有し、「共通読取り領域」は、異なる鋳型の全てについて同じであり、「固有のバーコード」は、8〜25塩基の間を有するオリゴヌクレオチド配列であり、各「固有のバーコード」は、各異なる鋳型について異なる。一部の実施形態では、異なるポリヌクレオチド鋳型は、−[プライマー]−[所定の配列]の構造を有し、異なる鋳型の各々は、固有の「所定の配列」を含む。
【0026】
[0026]本開示の別の態様は、バイオチップ(で同定されたバイオチップ、または本明細書で開示されるバイオチップのうちのいずれかなど)と、バイオチップへとカップリングさせた1つまたは複数のプロセッサーとを含むシステムであって、1つまたは複数のプロセッサーが、検出された核酸配列を、核酸配列内に含まれる分子バーコードに基づき、タンパク質変異体に結合する、特定のポリヌクレオチドと関連するものとして分類する一助となるようにプログラムされたシステムである。一部の実施形態では、1つまたは複数のプロセッサーは、タンパク質変異体に結合する、各異なるポリヌクレオチドについての1つまたは複数のパラメータ(例えば、動態パラメータ)を導出するようにさらにプログラムされる。
【0027】
[0027]本開示の別の態様は、(a)(i)膜包埋ナノポアを含む膜を有するナノポアアレイ、ならびに(ii)膜のシス側における基準電極、および膜のトランス側における個別にアドレス可能な電極アレイを含むデバイスと;(b)各々が、環状バーコード化核酸鋳型など、バーコード化された異なる核酸鋳型を装填されるか、またはこれと複合体化された、異なる酵素(例えば、ポリメラーゼ)のセットとを含むキットである。
【0028】
配列表
[0028]本明細書では、37 C.F.R.1.822において規定された、ヌクレオチド塩基のための、標準的な1文字略号、およびアミノ酸のための3文字コードを使用して示された、核酸配列およびアミノ酸配列が提示される。配列表は、参照により本明細書に組み込まれる、「P34416WO_ST25.txt」と名付けられ、2018年8月21日に作成され、1KBのASCIIテキストファイルとして提出される。
【0029】
[0029]本開示の特色を一般的に理解するために、図面を参照する。図面では、同一な要素を同定するために、同じ参照番号を通しで使用した。
【図面の簡単な説明】
【0030】
【図1A】[0030]ポリマーでタグ付けされたヌクレオチドを伴うナノポアによる、単一分子DNAシーケンシング(140)を例示する図である。4つのヌクレオチドの各々は、異なるタグを保有する。ナノポアシーケンシング(segueing)時に、ヌクレオチドの5’−リン酸を介して接合されたこれらのタグは、一度に1つずつ、ナノポア(130)へと放出され、そこで、固有の電流遮断シグネチャー(150)をもたらす。
【図1B】[0031]ナノポア(130)へとカップリングさせ、プライミングされた環状鋳型(110)を装填された、DNAポリメラーゼ(120)を、ナノポアアレイ上の脂質二重層へと挿入することを例示する図である。シーケンシングは、組込み時に、特徴的なイオン電流遮断シグネチャーをもたらす、タグ付けされたヌクレオチドを添加することにより開始する。相補型金属酸化物半導体(CMOS)チップ上の、ナノポア−ポリメラーゼ−鋳型複合体に対する、バーコード化DNA鋳型シーケンシングについての代表的プロットが例示される(例えば、典型的なDNAシーケンシング実験時における、単一の小孔についての、タグ付けされたヌクレオチドの捕捉についての時間と対比した正規化電流を示す。同定された塩基コールは、拡大領域内に、標準的なサンガー色で強調される)。
【図2】[0032]本開示の一部の実施形態に従う、少なくとも2つの酵素変異体のマルチプレックススクリーニングのステップについての概観を提示するフローチャートを明示する図である。
【図3】[0033]ナノポアアレイにおける、バーコードの同定を例示する図である。アライメントベースのバーコード分類子により計算される、3つの固有のDNA鋳型(CBT1、CBT2、およびCBT3)を装填された、3つのポリメラーゼ変異体(図3A:RPol1、図3B:RPol2、および図3C:RPol3)のバーコードマッチ確率指数(BMPI)値である。図3A、3B、および3Cの各々では、品質生リードを、正確なバーコードおよび不正確なバーコードに対してアライメントした場合のバーコード分類が示される。あらゆるRPol:CBTの組合せについて、平均バーコードマッチ確率指数(「BMPI」)値は、生リードを、正確な鋳型と比較した場合に、>0.80であり、不正確な鋳型と比較した場合に、<0.80であった。直線は、0.8 BMPIのカットオフを描示する。各箱髭図では、中央のマークは、平均を指し示し、箱の下端および上端は、それぞれ、第25百分位数および第75百分位数を指し示す。
【図4A】[0034]単一分子によりタグ付けされたヌクレオチドの捕捉信号から導出された、ある特定の動態パラメータの同定を例示する図である。
【図4B】[0035]ポリメラーゼ変異体の動態を例示する図であり、各ドットは、RPolの各々に対応する、タグ付けされたヌクレオチドの組込みの平均触媒速度(FCR)値および平均滞留時間(tdwell)値の対:4つ(A、C、T、およびG)のヌクレオチドの各々について、図3A、3B、および3Cにおいて明示されたCBTの組合せ(3×3×4=全36ドット)を表す。異なる形状のマーカーは、それぞれ、CBT1(■)バーコード、CBT2(●)バーコード、およびCBT3(▲)バーコードに対応する。動態特性の各々は、鋳型との関係に依存せず、4つのタグ付けされたヌクレオチドについて偏りがない。
【図5A】[0036]環状バーコード化鋳型(CBT)1を装填された、3つのポリメラーゼの各々(RPol1〜3)について、4つのタグ付けされたヌクレオチドの各々の平均滞留時間分布を例示する図である。図は、分布が、バーコード間で異ならないことを例示する。これは、ポリメラーゼと関連する動態特性である滞留時間が、バーコードの選択に依存しないことを裏付ける。他方、各ポリメラーゼ変異体について、平均滞留時間は異なる:それぞれ、約1.3、0.7、および0.5秒間を中心とする。したがって、滞留時間は、ポリメラーゼ変異体を識別するのに使用されうる動態特性である。
【図5B】CBT2を装填された、3つのポリメラーゼの各々(RPol1〜3)について、4つのタグ付けされたヌクレオチドの各々の平均滞留時間分布を例示する図である。図は、分布が、バーコード間で異ならないことを例示する。これは、ポリメラーゼと関連する動態特性である滞留時間が、バーコードの選択に依存しないことを裏付ける。他方、各ポリメラーゼ変異体について、平均滞留時間は異なる:それぞれ、約1.3、0.7、および0.5秒間を中心とする。したがって、滞留時間は、ポリメラーゼ変異体を識別するのに使用されうる動態特性である。
【図5C】CBT3を装填された、3つのポリメラーゼの各々(RPol1〜3)について、4つのタグ付けされたヌクレオチドの各々の平均滞留時間分布を例示する図である。図は、分布が、バーコード間で異ならないことを例示する。これは、ポリメラーゼと関連する動態特性である滞留時間が、バーコードの選択に依存しないことを裏付ける。他方、各ポリメラーゼ変異体について、平均滞留時間は異なる:それぞれ、約1.3、0.7、および0.5秒間を中心とする。したがって、滞留時間は、ポリメラーゼ変異体を識別するのに使用されうる動態特性である。
【図6A】[0037]ポリメラーゼ変異体についての主成分分析(PCA)を例示する図である。各主成分は、単一分子でタグ付けされたヌクレオチドの捕捉データから導出された、20の動態パラメータの線形結合である。最初の3つ(それぞれ)の主成分への、PCAベースの2D射影は、3つのポリメラーゼ変異体の各々についての高度な分離を示した。プロットのデータ点を、各主成分についての全てのデータ点のセンタリングおよびスケーリングにより、zスコアへと転換した。
【図6B】ポリメラーゼ変異体についての主成分分析(PCA)を例示する図である。各主成分は、単一分子でタグ付けされたヌクレオチドの捕捉データから導出された、20の動態パラメータの線形結合である。最初の3つ(それぞれ)の主成分への、PCAベースの2D射影は、3つのポリメラーゼ変異体の各々についての高度な分離を示した。プロットのデータ点を、各主成分についての全てのデータ点のセンタリングおよびスケーリングにより、zスコアへと転換した。
【図6C】ポリメラーゼ変異体についての主成分分析(PCA)を例示する図である。各主成分は、単一分子でタグ付けされたヌクレオチドの捕捉データから導出された、20の動態パラメータの線形結合である。最初の3つ(それぞれ)の主成分への、PCAベースの2D射影は、3つのポリメラーゼ変異体の各々についての高度な分離を示した。プロットのデータ点を、各主成分についての全てのデータ点のセンタリングおよびスケーリングにより、zスコアへと転換した。
【図7A】[0038]マルチプレックス化オンチップ実験において、3つの異なるポリメラーゼ変異体(RPol1、RPol2、およびRPol3)について、実験により観察されたバーコードの分布を例示する図である。環状バーコード化鋳型(CBT)1〜32を、ポリメラーゼ変異体1(RPol1)と複合体化させ、CBT33〜64を、RPol2と複合体化させ、CBT65〜96を、RPol3と複合体化させた。図7Aは、96の可能なバーコードの全てが、アライメントベースの分類アルゴリズムにより、固有に同定されたこと(本明細書の実施例を参照されたい)を例示する。
【図7B】マルチプレックス化オンチップ実験において、3つの異なるポリメラーゼ変異体(RPol1、RPol2、およびRPol3)について、実験により観察されたバーコードの分布を例示する図である。環状バーコード化鋳型(CBT)1〜32を、ポリメラーゼ変異体1(RPol1)と複合体化させ、CBT33〜64を、RPol2と複合体化させ、CBT65〜96を、RPol3と複合体化させた。図7Bは、RPol1:CBT1〜32、RPol2:CBT33〜64、およびRPol3:CBT65〜96について、個々のシーケンシング実験において同定されたバーコードの分布を例示する。明確さのために、カウントは、ビンの幅によりスケーリングする。予測されるバーコードは、低偽陽性率により固有に同定される。図7Bは、異なるポリメラーゼプロセッシビティーの反映における、バーコードカウントの不均等分布をさらに例示する。
【図8A】[0039]各被験ポリメラーゼ変異体について、異なるプロセッション速度を観察しうることを例示し、異なる鋳型を、併せて混合した(濃縮中または濃縮後に)場合であってもなお、ポリメラーゼと会合したら、鋳型は交換されないことをさらに例示する図である。
【図8B】[0040]単一の実験における、被験ポリメラーゼ変異体の各々について、異なるホモポリマーアライメントプロファイルを、観察しうることを例示し、異なる鋳型を、併せて混合した(濃縮中または濃縮後に)場合であってもなお、ポリメラーゼと会合したら、鋳型は交換されないことをさらに例示する図である。
【図8C】[0041]単一の実験における、被験ポリメラーゼ変異体の各々について、塩基ごとの異なる挿入プロファイルを観察しうることを例示し、異なる鋳型を、併せて混合した(濃縮中または濃縮後に)場合であってもなお、ポリメラーゼと会合したら、鋳型は交換されないことをさらに例示する図である。
【図8D】[0042]単一の実験における、被験ポリメラーゼ変異体の各々について、塩基ごとの異なる欠失率を観察しうることを例示し、異なる鋳型を、併せて混合した(濃縮中または濃縮後に)場合であってもなお、ポリメラーゼと会合したら、鋳型は交換されないことをさらに例示する図である。
【図9A】[0043]同じナノポア複合体を伴う3つの鋳型のシーケンシング結果を例示する図である。データは、同じナノポア複合体(ポリメラーゼ酵素を含む)でシーケンシングすると、異なるバーコード化鋳型のシーケンシングプロファイルも同じとなることを示す。
【図9B】同じナノポア複合体を伴う3つの鋳型のシーケンシング結果を例示する図である。データは、同じナノポア複合体(ポリメラーゼ酵素を含む)でシーケンシングすると、異なるバーコード化鋳型のシーケンシングプロファイルも同じとなることを示す。
【図10】[0044]バーコード化DNA鋳型の切換えを例示する図である。(実験1)予測されるバーコードであるCBT2と比較した場合における、ポリン−ポリメラーゼ−鋳型複合体である、RPol2−CBT2についてのバーコードマッチ確率指数(BMPI)値である。品質生リードの数(N)=612である。(実験2)不正確なバーコードと比較したところ、シーケンシング精度は、劇的に低下した。(実験3)ナノポア−ポリメラーゼ−バーコードの複合体化の直後にスパイクインされた、非複合体化バーコード(CBT1)の存在は、バーコードの置きかえを指し示さなかった。(実験4)実験3におけるリードを、不正確なバーコードと比較したところ、実験2における本発明者らの対照例の場合と同様の結果が観察された。(実験5)第2のバーコード(CBT1)を伴う、一晩にわたるインキュベーションの後であってもなお、バーコードの置きかえは観察されなかった。(実験6)第2のバーコードを、小孔への挿入の後で、タグ付けされたヌクレオチドと共にスパイクインした場合における、オンチップのバーコードの置きかえについてもまた調べた。(実験7および8)ここでもまた、結果は、ポリメラーゼ変異体が、それらのそれぞれのバーコードで固有に標識され、実験において置きかえられないことを指し示した。
【図11】[0045]固有の同定のための、バーコードデザインの例示を提示する図である。スミス−ウォーターマンによる局所アライメントアルゴリズムを使用して、96の環状バーコード化鋳型(CBT)の配列同一性値を計算したことを示すヒートマップである。各バーコード配列(x軸)を、同じバーコードセット内の他の96のCBTの全て(y軸)と比較し、配列同一性値を記録した。局所アライメントのための確率スケールを、右図に示す[図中、0は、全くのミスマッチを意味し、1は、全くのマッチを描示する]。対角線は、完全な同一性を表し、この場合、バーコードは、それら自身に対してアライメントされる。全ての対角線外のCBTについて、鋳型を、互いに対して局所的にアライメントした場合の配列同一性は、<85%であった。
【図12】[0046]生リードを、分類子により使用される、環状バーコード化鋳型(CBT)の比較と対比した、代表的ヒートマップを明示する図である。各生リード(x軸)を、96のCBTの全て(y軸)と比較し、バーコードマッチ確率指数(BMPI)値を記録した(方法)。BMPIとは、スケールバーに示される通り、[0,1]の可能な範囲[範囲中、0は、全くのミスマッチを意味し、1は、全くのマッチを描示する]を伴う、バーコード同定の確率論的尺度である。0.80の閾値を上回る、スコアが最大のBMPI値は、各欄内で、最も可能性が高いバーコード候補を同定した。BMPI0の値(青)は、初期分類ステップでは、生リードが、品質リード基準(方法)を満たさなかったことを意味する。最大のBMPI値が<0.80であるリード、およびBMPI値が0であるリードは、下流の解析から棄却した。本図では、明確さのために、50の生リード査定だけを示す。
【図13】[0047]バーコードライブラリーを作出するステップ、ナノポアシーケンシングステップ、およびバーコードの同定ステップを例示する、バーコード化の概略を明示する図である。
【発明を実施するための形態】
【0031】
[0048]定義
[0049]逆のことが明確に指し示されない限り、本明細書において特許請求される任意の方法であって、1つを超えるステップまたは工程を含む方法において、方法のステップまたは工程の順序は、必ずしも、方法のステップまたは工程が列挙される順序に限定されないこともまた理解されたい。
【0032】
[0050]そうでないことが明示的に指し示されない限りにおいて、本明細書で使用される単数形の用語である「ある(a)」および「ある(an)」、および「その」は、複数の指示対象を含む。同様に、そうでないことが明示的に指し示されない限りにおいて、「または」という用語は、「および」を含むように意図される。「〜を含む」という用語は、「AまたはBを含む」が、A、B、または、AおよびBを含むことを意味するように、包含的に規定される。
【0033】
[0051]本明細書および特許請求の範囲で使用される、「または」は、で定義された「および/または」と同じ意味を有するものと理解されたい。例えば、リスト中の項目を区別する場合、「または」または「および/または」は、包含的である、すなわち、多数の要素または一連の要素のうちの少なくとも1つの要素の包含であるが、また、多数の要素または一連の要素のうちの1つを超える要素も含む包含であり、任意選択で、列挙されていないさらなる項目も含む包含と解釈されるものとする。多数の要素または一連の要素のうちのちょうど1つの要素の包含を指すのは、「〜のうちの1つだけ」もしくは「〜のうちのちょうど1つ」など、逆のことが明確に指示される用語、または特許請求の範囲で使用される場合の「〜からなること」に限られる。一般に、本明細書で使用される「または」という用語は、「いずれか」、「〜のうちの1つ」、「〜のうちの1つだけ」、または「〜のうちのちょうど1つ」など、除外性の用語に先立たれる場合に、除外的な代替法(すなわち、「一方または他方であり、両方ではない」)だけを指し示すと解釈されるものとする。特許請求の範囲で使用される場合の、「〜から本質的になること」は、特許法の分野で使用される、その通常の意味を有するものとする。
【0034】
[0052]本明細書で使用される「〜を含むこと(comprising)」、「〜を含むこと(including)」、「〜を有すること」などの用語は、互換的に使用され、同じ意味を有する。同様に、「〜を含む」、「〜を含む」、「〜を有する」などは、互換的に使用され、同じ意味を有する。具体的に、用語の各々は、米国特許法の、「〜を含むこと」の共通の定義と符合すると規定され、したがって、「少なくとも以下の〜」を意味するオープンな用語であると解釈され、また、さらなる特色、限界、側面などを除外しないとも解釈される。したがって、例えば、「構成要素a、b、およびcを有するデバイス」とは、デバイスが、少なくとも構成要素a、b、およびcを含むことを意味する。同様に、「ステップa、b、およびcを伴う方法」という語句は、方法が、少なくともステップa、b、およびcを含むことを意味する。さらに、本明細書では、ステップおよび工程が、特定の順序で概括されうるが、当業者は、ステップおよび工程の順序づけは、変動しうることを認識するであろう。
【0035】
[0053]本明細書および特許請求の範囲において、1または複数の要素のリストに言及して使用される「少なくとも1つの」という語句は、要素のリスト内の要素のうちの任意の1つまたは複数から選択されるが、要素のリスト内で具体的に列挙される各要素およびあらゆる要素のうちの少なくとも1つを必ずしも含むわけではないが、要素のリスト内の要素の任意の組合せを必ずしも除外するわけでもない、少なくとも1つの要素を意味するものと理解されたい。この定義はまた、「少なくとも1つの」という語句が言及する要素のリスト内で具体的に同定される要素以外の要素が、具体的に同定されたこれらの要素と関連する場合であれ、関連しない場合であれ、任意選択で存在しうることも許容する。したがって、非限定的な例として述べると、一実施形態では、「AおよびBのうちの少なくとも1つ」(または、同義で、「AまたはBのうちの少なくとも1つ」、または、同義で、「Aおよび/またはBのうちの少なくとも1つ」)とは、Bの存在を伴わず(かつ、任意選択で、B以外の要素を含み)、任意選択で、1つを超えるAを含む、少なくとも1つのAを指す場合もあり;別の実施形態では、Aの存在を伴わず(かつ、任意選択で、A以外の要素を含み)、任意選択で、1つを超えるBを含む、少なくとも1つのBを指す場合もあり;さらに別の実施形態では、任意選択で、1つを超えるAを含む(かつ、任意選択で、他の要素を含む)、少なくとも1つのA、および任意選択で、1つを超えるBを含む(かつ、任意選択で、他の要素を含む)、少なくとも1つのBを指す場合もあるなどである。
【0036】
[0054]本明細書で使用される「アライメント」という用語は、核酸配列の対内の、類似性を有する領域の同定を指す。例えば、バーコード配列は、例えば、とりわけ、SmithおよびWaterman、Adv.Appl.Math.、2:482(1981)の局所相同性アルゴリズム;NeedlemanおよびWunsch、J.Mol.Biol.、48:443(1970)の相同性アライメントアルゴリズム;PearsonおよびLipman、Proc.Nat’l.Acad.Sci.USA、85:2444(1988)の類似性検索法;これらのアルゴリズムのコンピュータ化された実装(Wisconsin Genetics Software Package、Genetics Computer Group(GCG)、575 Science Dr.、Madison、Wis.、U.S.A.における、GAP、BESTFIT、BLAST、FASTA、およびTFASTA)によりアライメントされうる。共通の構成要素の割合または百分率は、核酸配列の間の相同性または同一性と関連する。アライメントは、保存的ドメインおよびこれらのドメイン内の類縁性を同定するのに使用されうる。
【0037】
[0055]アレイの文脈において、本明細書で使用される「アドレス可能な」という用語は、個別の規定された領域内に配置された、アレイのメンバーを指す。本開示の文脈では、チップ上またはバイオチップ上の各ナノポアなど、各ナノポアは、シーケンシングデータが、本明細書で記載される各ナノポアについて独立に生成されうるように、個別にアドレス可能である。
【0038】
[0056]本明細書で使用される「バーコード」という用語は、それを同定するために、核酸配列内に存在するオリゴヌクレオチドを意味する。本明細書で使用される「滞留時間」という用語は、酵素(例えば、ポリメラーゼ)が、結合反応時に、ヌクレオチドへの結合を維持する時間の長さを指す。一部の実施形態では、酵素の滞留時間は、酵素の活性部位内のヌクレオチドが、鋳型ヌクレオチドと、正確に塩基対合するのかどうかの関数である。例えば、不正確なヌクレオチドを保有する酵素は、ポリヌクレオチドに結合するが、急速に解離し、正確なヌクレオチドの結合により付与される安定化の欠如に起因する、短い滞留時間をもたらす。これに対し、正確なヌクレオチドを保有する酵素は、ポリヌクレオチドに結合し、ヌクレオチドの結合および触媒の動態段階を含む、長い滞留時間を結果としてもたらす。
【0039】
[0057]本明細書で使用された、「塩基コール」、「複数の塩基コール」、または「塩基コールすること」という用語は、例えば、ヌクレオチドを、クロマトグラムのピーク(例えば、本明細書の図1Aおよび4Aを参照されたい)へと割り当てることにより、塩基(ヌクレオ塩基)を、シーケンシング時に得られた情報へと割り当てる工程を指す。
【0040】
[0058]本明細書で使用される「酵素−鋳型複合体」という用語は、ポリマー、例えば、ポリヌクレオチド鋳型と会合/カップリングさせた酵素を指す。
【0041】
[0059]本明細書で使用される「ナノポア」という用語は、膜内に形成されるか、または他の形で施された、小孔、チャネル、または通路を指す。ナノポアは、膜内の分子(例えば、タンパク質)により規定されうる。膜は、脂質二重層などの有機膜、またはポリマー材料から形成された膜などの合成膜でありうる。ナノポアは、例えば、相補型金属酸化物半導体(CMOS)または電界効果トランジスター(FET)回路などのセンシング回路に隣接または近接して配置されうる。ナノポアは、0.1ナノメートル(nm)〜約1000nmの桁数の、特徴的な幅または直径を有しうる。一部のナノポアは、タンパク質である。アルファヘモリシンは、タンパク質ナノポアの例である。
【0042】
[0060]本明細書で使用される「ナノポアシーケンシング複合体」という用語は、酵素、例えば、ポリメラーゼへと連結されるか、またはカップリングされたナノポアを指し、酵素、例えば、ポリメラーゼは、ポリマー、例えば、ポリヌクレオチド鋳型と会合する。ナノポアシーケンシング複合体は、膜内、例えば、脂質二重層内に配置されており、そこで、ポリマー構成要素、例えば、ヌクレオチドまたはアミノ酸を同定するように機能する。
【0043】
[0061]本明細書で使用される「ナノポアシーケンシング」または「ナノポアベースのシーケンシング」という用語は、ナノポアを一助として、ポリヌクレオチドの配列を決定する方法を指す。一部の実施形態では、ポリヌクレオチドの配列は、鋳型依存的に決定される。本明細書で開示される方法は、任意のナノポアシーケンシング法、ナノポアシーケンシングシステム、またはナノポアシーケンシングデバイスに限定されない。
【0044】
[0062]本明細書で使用される「核酸」という用語は、1つまたは複数の核酸サブユニットを含む分子を指す。核酸は、アデノシン(A)、シトシン(C)、グアニン(G)、チミン(T)、およびウラシル(U)から選択される、1つまたは複数のサブユニット(塩基)を含みうる。これらの塩基の誘導体は、全体が、参照により本明細書に組み込まれる、「PCR Systems,Reagents and Consumables(Perkin Elmer Catalogue 1996〜1997、Roche Molecular Systems,Inc.、Branchburg、N.J.、USA)において例示されている。一部の例では、核酸は、デオキシリボ核酸(DNA)もしくはリボ核酸(RNA)、またはこれらの誘導体である。核酸は、一本鎖の場合もあり、二本鎖の場合もある。核酸は、限定せずに述べると、DNA、RNA、およびこれらのハイブリッドまたは変異体を含む、任意の核酸分子を含みうる。
【0045】
[0063]本明細書で使用される「パラメータ」という用語は、物理的特性またはこの特性(例えば、査定下の酵素の動態特性)の表示を特徴付ける数値を指す。状況によって、パラメータは、定量的データセットおよび/または定量的データセットの間の数値的関係を数値的に特徴付ける。
【0046】
[0064]本明細書で使用される「ポリメラーゼ」という用語は、重合化反応を触媒することが可能な、任意の酵素を指す。ポリメラーゼの例は、限定せずに述べると、核酸ポリメラーゼ、トランスクリプターゼ、またはリガーゼを含む。ポリメラーゼは、重合化酵素でありうる。「DNAポリメラーゼ」は、デオキシヌクレオチドの重合化を触媒する。「RNAポリメラーゼ」は、リボヌクレオチドの重合化を触媒する。
【0047】
[0065]本明細書で使用される「ポリヌクレオチド」とは、本明細書で規定される、1つまたは複数のヌクレオチドを含む、ポリマーまたはオリゴマーである。ポリヌクレオチドまたはオリゴヌクレオチドは、DNAのポリヌクレオチドまたはオリゴヌクレオチド、RNAのポリヌクレオチドまたはオリゴヌクレオチド、あるいはDNAのポリヌクレオチドもしくはオリゴヌクレオチドおよび/またはRNAのポリヌクレオチドもしくはオリゴヌクレオチドの、1つまたは複数の区画を含みうる。
【0048】
[0066]本明細書で使用される「確率スコア」という用語は、2つの核酸配列の間のアライメントに関する統計学的値を指し、この場合、値は、0〜1の範囲であり、0の値は、2つのアライメントされた核酸配列の間の全くのミスマッチを指し示し、1の値は、2つのアライメントされた核酸配列の間の完全なマッチを指し示す。このように、1に近い値は、2つのアライメントされた核酸配列の間の良好なマッチであって、ゼロに近い値より良好なマッチを指し示すであろう。本開示の文脈では、確率スコアは、生成されたシーケンシングデータと、既知の(またはコントロール)核酸配列とのアライメントに基づき導出されうる。
【0049】
[0067]本明細書で使用される「プロセッシビティー」という用語は、鋳型への接合をやはり維持し、複数の修飾反応を実施する、酵素(例えば、ポリメラーゼ)の能力を指す。「修飾反応」は、重合化およびエクソヌクレアーゼによる切断を含むがこれらに限定されない。一部の実施形態では、「プロセッシビティー」とは、成長するDNA鎖からの、酵素の解離を介在させずに、一連の重合化ステップを実施する、酵素(例えば、DNAポリメラーゼ)の能力を指す。典型的に、DNAポリメラーゼの「プロセッシビティー」は、成長するDNA鎖からの、DNAポリメラーゼの解離の前に、ポリメラーゼにより、成長するDNA鎖へと組み込まれる、すなわち、重合化されるヌクレオチド(例えば、20ヌクレオチド、300ヌクレオチド、0.5〜1kb、またはこれを超える)の数により測定される。DNAポリメラーゼによるDNA合成のプロセッシビティーは、DNA鋳型から解離する前の、単一鋳型への結合イベント中に、ポリメラーゼがDNAへと組み込みうるヌクレオチドの数として規定される。DNA合成の全効率は、ポリメラーゼのプロセッシビティーが増大する場合に増大する。プロセッシビティーは、本明細書、およびその開示が、参照によりその全体において本明細書に組み込まれる、WO01/92501A1において規定される方法に従い測定されうる。プロセッシビティーは、静態的プロセッシビティーおよび複製的プロセッシビティーを包含する。
【0050】
[0068]本明細書で使用される「リード」または「配列リード」という用語は、核酸分子の、任意の一部または全部からシーケンシングされた、ヌクレオチドの連なりを指す。一部の実施形態では、「リード」という用語は、核酸試料の一部に由来する配列リードを指す。必ずしもそうではないが、典型的に、リードとは、試料中の連続塩基の短い配列を表す。リードは、試料の一部の塩基配列(ATCGによる)により、記号的に表されうる。リードは、メモリデバイス内に保存され、それが、基準配列にマッチするか、または他の基準を満たすのかどうかを決定するのに適切な形で加工されうる。リードは、シーケンシング装置から、直接的に得られる場合もあり、試料に関する、保存された配列情報から、間接的に得られる場合もある。場合によって、リードは、例えば、ポリヌクレオチド鋳型に対してアライメントされ、これへと特異的に割り当てられうる、大型の配列または領域、を同定するのに使用されうる、十分な長さ(例えば、少なくとも約25塩基)のDNA配列である。一部の実施形態では、リードは、約8つのヌクレオチド(塩基コール)など、少数の塩基コールを含みうるが、16もしくはこれを超える塩基コール、25もしくはこれを超える塩基コール、50もしくはこれを超える塩基コール、100もしくはこれを超える塩基コール、または120またはこれを超えるヌクレオチドまたは塩基コールなど、多数の塩基コールもまた含有しうる。リードの長さはまた、1つまたは複数の試料鋳型について、多数の塩基として表される場合もある。
【0051】
[0069]本明細書で使用される「シーケンシング」という用語は、核酸内の塩基の順序および位置の決定を指す。
【0052】
[0070]本明細書で使用される「タグ」という用語は、原子もしくは分子、または原子もしくは分子のコレクションでありうる、検出可能部分を指す。タグは、ナノポアを一助として検出されうる、光学的、電気化学的、磁気的、または静電的(例えば、誘導性、容量性)シグネチャーをもたらしうる。
【0053】
[0071]本明細書で使用される「タグ付けされたヌクレオチド」という用語は、その末端のリン酸において、タグを接合させたヌクレオチドを指す。
【0054】
[0072]本明細書で使用される「閾値」という用語は、試料、核酸、またはこれらの一部(例えば、リード)を特徴付けるカットオフとして使用される任意の数を指す。閾値は、このような値をもたらす情報源が、特定の方式で分類されるべきであるのかどうかを決定するように、測定値または計算値と比較されうる。閾値は、経験的に同定される場合もあり、解析的に同定される場合もある。閾値の選択は、使用者が分類を行うために有することを望む信頼水準に依存する。場合によって、閾値は、特定の目的(例えば、感度および選択性を均衡させる目的)のために選ばれる。
【0055】
[0073]本明細書で使用される「変異体」という用語は、親タンパク質と比較した場合に、変更された特徴、例えば、変更されたプロセッシビティーを表示する、修飾タンパク質、例えば、変異体のPol6ポリメラーゼを指す。
【0056】
[0074]酵素変異体のマルチプレックススクリーニング
[0075]本明細書では、ナノポアまたはナノポアベースのシーケンシングを使用する、少なくとも2つの異なる酵素変異体のマルチプレックススクリーニングのためのシステムおよび方法について記載される。一部の実施形態では、本明細書で記載されるシステムおよび方法は、単一分子DNAシーケンシング時における、酵素動態のモニタリングを可能とする。一部の実施形態では、ナノポアベースのシーケンシングが、個々のヌクレオチドの組込みイベントの正確な検出を容易とし、この技法が、酵素変異体を、マルチプレックス化されたハイスループット方式で、迅速にスクリーニングするのに利用されうる、例えば、ナノポアSBSを使用して、タグ付けされたヌクレオチドの組込み、および塩基コール時におけるタグの捕捉と関連する様々な計量が決定されうると考えられる。
【0057】
[0076]一部の実施形態では、本明細書で記載されるシステムおよび方法はまた、異なるナノポア変異体をスクリーニングするのにも使用されうる。他の実施形態では、本明細書で記載されるシステムおよび方法はまた、ナノポア変異体と酵素変異体との異なる組合せをスクリーニングするのにも使用されうる。例えば、2つの異なるナノポア変異体(N1およびN2)、および2つの異なる酵素変異体(E1およびE2)を有する、4つの異なるナノポアシーケンシング複合体(N1E1、N1E2、N2E1、N2E2)がスクリーニングされうる。さらなる例を目的として述べると、特定のポリメラーゼ変異体(POL*)、バーコード、およびタグ付けされたヌクレオチドの所与のセットについて、複数のナノポア変異体(POREn)は、マルチプレックスシーケンシング実験のために、POREn−POL*ナノポアシーケンシング複合体を形成するようにコンジュゲートされうる。一部の実施形態では、最適の小孔変異体(所与のPOL*およびタグ付けされたヌクレオチド)を見出すように、タグの捕捉特徴、塩基コールの精度、リード長、および他の任意のシーケンシングパラメータが比較されうるであろう。
【0058】
[0077]本明細書で開示される、ある特定の間接的検出法を利用する、すなわち、放出されたタグを、ヌクレオチド組込みイベントの副産物として測定する、ナノポアベースのシーケンシングの使用について記載するが、このような例示だけを目的とするものであり、任意の2つの酵素変異体のマルチプレックススクリーニングは、任意の種類のナノポアまたはナノポアベースのシーケンシング法を使用して実施されうる、例えば、酵素変異体の各々が、単一のポリヌクレオチド鎖を、ナノポアを通して駆動する分子モーターとして使用される場合に、異なる酵素変異体が査定される場合もあり、酵素変異体が、ポリヌクレオチドの移動を、ナノポアに近接して制御するのに使用される場合に、異なる酵素変異体が査定される場合もある。さらに、ある特定の動態パラメータが、多様なポリメラーゼの突然変異体に関して導出されうるように、ポリメラーゼの突然変異体およびシーケンシングデータの生成を含む、ナノポアシーケンシング複合体の形成について記載しうるが、本明細書で記載される方法は、任意の酵素またはポリヌクレオチド結合性タンパク質、例えば、エンドヌクレアーゼ、逆転写酵素などについて、動態パラメータを導出するように、適合されうる。
【0059】
[0078]ナノポアシーケンシング
[0079]ポリヌクレオチド、例えば、DNAまたはRNAのナノポアシーケンシングは、ポリヌクレオチド配列の、鎖シーケンシングおよび/またはエクソシーケンシングにより達成されうる。一部の実施形態では、鎖シーケンシングは、ポリヌクレオチド鋳型のヌクレオチドが、ナノポアを通されるのに応じて、試料ポリヌクレオチド鎖のヌクレオチド塩基が、直接的に決定される方法を含む。一部の実施形態では、ポリヌクレオチドは、膜内の顕微鏡的小孔を通すことによりシーケンシングされうる。塩基は、それらが、膜の一方の側から、他方の側へと、小孔を通した、イオンの流動に影響を及ぼす様式により同定されうる。一部の実施形態では、1つのタンパク質分子は、DNA螺旋を、2つの鎖へと「アンジップ」しうる。第2のタンパク質は、膜内に小孔を創出し、「アダプター」分子を保持しうる。小孔を通したイオンの流動は、各塩基が、イオンの流動を、異なる程度に遮断し、変更しうる電流を創出しうる。アダプター分子は、それらが電気的に同定されるように、十分に長く、塩基を、定位置に保持しうる(それらの開示が、参照によりそれらの全体において本明細書に組み込まれる、PCT公開第WO2018/034745号、ならびに米国特許出願公開第2018/0044725号および同第2018/0201992号を参照されたい)。一部の実施形態では、シーケンシングは、Oxford Nanopore(Oxford、UK)、Illumina(San Diego、Calif.)製の、ヘリカーゼ/エクソヌクレアーゼベースの方法、またはStratos Genomics(Seattle、Wash.)製の拡大によるナノポアシーケンシング法に従い実施されうる。
【0060】
[0080]一部の実施形態では、ナノポアは、核酸分子を、間接的にシーケンシングするのに使用されうる、すなわち、間接的シーケンシングは、重合化した核酸分子が、シーケンシング時に、ナノポアを通過しない、任意の方法を含みうる。これらの実施形態では、核酸分子は、ナノポアの前庭部に、少なくとも部分的に配置されうるが、ナノポアの小孔(すなわち、最も狭い部分)内には配置されない。核酸分子は、ナノポアからの任意の適切な距離内、および/またはナノポアに対する近傍、ならびに、任意選択で、ヌクレオチド組込みイベントにより放出される副産物(例えば、下記で記載される、タグ付けされたヌクレオチドから切断されるタグ)が、ナノポア内で検出されるような距離内を通過しうる。
【0061】
[0081]一部の実施形態では、ナノポアベースのシーケンシングは、ナノポアに近接して配置された酵素であって、ヌクレオチドを、成長するポリヌクレオチド鎖へと組み込む酵素などの酵素を利用し、この場合、成長するポリヌクレオチド鎖は、対応する鋳型核酸鎖と相補的(complimentary)である。ヌクレオチド組込みイベントは、DNAポリメラーゼ、またはこれらの任意の突然変異体もしくは変異体などの酵素により触媒され、各位置における組込みのために、利用可能なヌクレオチドから選ぶように、鋳型分子との塩基対相互作用を使用する。「ヌクレオチド組込みイベント」とは、ヌクレオチドの、成長するポリヌクレオチド鎖への組込みである。ヌクレオチド組込みイベントの副産物は、ナノポアにより検出されうる。一部の実施形態では、副産物は、所与の種類のヌクレオチドの組込みと相関しうる。一部の実施形態では、副産物は、ナノポアを通過し、かつ/またはナノポア内で、検出可能な信号を発生させる。放出されるタグ分子(下記に記載される)は、ヌクレオチド組込みイベントの副産物の例である。例を目的として述べると、図1Aは、ナノポア(130)の近傍に結合させた、DNAポリメラーゼ(120)を描示する。シーケンシングされるポリヌクレオチド鋳型(110)は、プライマー(鋳型は、酵素と関連する)と共に添加される。4つの異なる形でタグ付けされたヌクレオチド(140)が、バルク水性相の、このナノポアシーケンシング複合体(プライマーを含む)へと添加される。ポリメラーゼが、正確なヌクレオチドの組込みを触媒した後で、タグは、放出され、ナノポア(130)を通過して、固有のイオン電流遮断信号(150)を発生させるが、タグの各々は、別個の化学構造を有するため、これにより、添加された塩基を、電気的に同定するであろう。このようなナノポアベースのシーケンシングシステムおよび方法に関するさらなる詳細については、それらの開示が、参照によりそれらの全体において本明細書に組み込まれる、米国特許第9,605,309号および同第9,557,294号において記載されている。
【0062】
[0082]一部の実施形態では、核酸分子をシーケンシングするための方法は、(a)タグ付けされたヌクレオチドを重合化するステップ(例えば、第1の核酸分子を、鋳型として使用して、一度に、タグ付けされたヌクレオチド1つを組み込む酵素を使用して)であって、重合化されると、個々のヌクレオチドと関連するタグが放出されるステップ、(b)ナノポアを一助として、放出されたタグを検出するステップを含む。一部の実施形態では、酵素は、タグ付けされたヌクレオチドのプールから引き出す。本明細書で言及される通り、タグが放出され、ナノポアの近傍またはナノポアを通過するときに、発生する信号に基づき、それらが、互いから差別化されうるように、各種のヌクレオチドは、異なるタグ分子へとカップリングされる(例えば、図1Aを参照されたい)。一部の実施形態では、各タグは、塩基コールアルゴリズムなどにより解釈されうる、異なる検出可能な信号、例えば、異なる信号強度、異なる信号振幅などを有しうる。
【0063】
[0083]一部の実施形態では、組み込まれるヌクレオチドは、タグ付けされたヌクレオチドである。タグ付けされたヌクレオチドの例については、それらの開示が、参照によりそれらの全体において本明細書に組み込まれる、米国特許出願公開第2015/0368710号および同第2018/0073071号において記載されている(また、Kumarら、「PEG−Labeled Nucleotides and Nanopore Detection for Single Molecule DNA Sequencing by Synthesis」、Sci Rep.、2012、2:684も参照されたい)。一部の実施形態では、ヌクレオチド組込みイベントは、タグ付けされたヌクレオチドから、タグを放出し、放出されたタグが検出される(図1Aを参照されたい)。このように、固有のタグは、各種のヌクレオチド(すなわち、A、C、G、T、またはU)から放出されるので組み込まれた塩基(すなわち、A、C、G、T、またはU)が同定されうる。
【0064】
[0084]一部の実施形態では、それが、ナノポアの近傍またはナノポアを通過するときに、センシング回路が、タグと関連する電気信号を検出するように、放出されたタグは、ナノポアまたはナノポアの近傍を流動する(図1Aおよび1Bを参照されたい)。検出された信号(すなわち、シーケンシングデータ)は収集され、記憶場所に保存され、その後、核酸の配列を構築するのに使用されうる。収集された信号は、エラーなど、検出された信号の任意の異常を説明するように加工されうる。適切なナノポア検出器については、それらの開示が、参照によりそれらの全体において本明細書に組み込まれる、米国特許出願公開第2011/0193570号および同第2018/0073071号において記載されている。同様に、それらの開示が、参照によりそれらの全体において本明細書に組み込まれる、米国特許第9,377,437号および同第8,324,914号は、ナノポアベースのシーケンシングシステムからの電気信号の収集および解析について記載する。
【0065】
[0085]ナノポアは、集積回路など、センシング回路のセンシング電極に隣接して配置された膜内に形成されるか、または他の形で包埋されうる。集積回路は、特定用途向け集積回路(ASIC)でありうる。一部の例では、集積回路は、電界効果トランジスターまたは相補型金属酸化物半導体(CMOS)である。センシング回路は、ナノポアを有するチップ内または他のデバイス内に設置される場合もあり、オフチップ構成など、チップまたはデバイスの外部に設置される場合もある。半導体は、限定せずに述べると、群IV(例えば、ケイ素)および群III〜Vの半導体(例えば、ヒ化ガリウム)を含む、任意の半導体でありうる。
【0066】
[0086]核酸試料をシーケンシングするためのチップは、複数の個別にアドレス可能なナノポアを含みうる。複数の個別にアドレス可能なナノポアは、集積回路に隣接して配置される、膜内に形成された、少なくとも1つのナノポアを含有しうる。各個別にアドレス可能なナノポアは、個々のヌクレオチドと関連するタグを検出することが可能でありうる。
【0067】
[0087]酵素
[0088]ナノポアへとカップリングさせるか、または他の形でコンジュゲートさせた酵素は、ポリヌクレオチドプロセシング酵素、例えば、DNAポリメラーゼおよびRNAポリメラーゼ、逆転写酵素、エクソヌクレアーゼ、ならびにアンフォルダーゼを含む。一部の実施形態では、酵素は、野生型酵素の場合もあり、野生型酵素の変異体形態の場合もある。
【0068】
[0089]変異体酵素は、親酵素の特徴と比べて変更された特徴を有するように操作されうる。一部の実施形態では、変更される酵素は、ポリメラーゼ、例えば、修飾ポリメラーゼである。本明細書で使用される「修飾DNAポリメラーゼ」という用語は、別の(すなわち、親)DNAポリメラーゼに由来し、親DNAポリメラーゼと比較して、1カ所または複数カ所のアミノ酸の変更(例えば、アミノ酸の置換、欠失、または挿入)を含有するDNAポリメラーゼを指す。一部の実施形態では、本開示の修飾DNAポリメラーゼは、自然発生または野生型のDNAポリメラーゼに由来するか、またはこれらから修飾される。一部の実施形態では、本開示の修飾DNAポリメラーゼは、キメラDNAポリメラーゼ、融合DNAポリメラーゼ、または別の修飾DNAポリメラーゼを含むがこれらに限定されない、組換えDNAポリメラーゼまたは操作DNAポリメラーゼに由来するか、またはこれらから修飾される。典型的に、修飾DNAポリメラーゼは、親ポリメラーゼと比較して、少なくとも1つの変化表現型を有する。修飾ポリメラーゼの例については、その開示が、参照によりそれらの全体において本明細書に組み込まれる、米国特許出願公開第2016/0222363号において記載されている。
【0069】
[0090]一部の実施形態では、ポリメラーゼ酵素の特徴の変更は、酵素の活性、忠実度、プロセッシビティー(本明細書で記載された)、延伸速度、安定性、または可溶性の変化を含みうるであろう。「忠実度」とは、一般に、ポリメラーゼが、正確なヌクレオチドを、核酸鋳型のコピーへと組み込む精度を指す。DNAポリメラーゼの忠実度は、ヌクレオチドが、ポリメラーゼ−プライマー−鋳型DNA二元複合体内の同じ部位におけるプライマーの伸長について競合するように、等濃度で存在する場合における、正確なヌクレオチドの組込みの、不正確なヌクレオチドの組込みに対する比として測定されうる。一部の実施形態では、ポリメラーゼは、ポリメラーゼが、ヌクレオチドを、核酸鎖(例えば、成長する核酸鎖)へと組み込む速度を低減するように突然変異されうる。一部の実施形態では、速度の低減(および感度の改善)は、ナノポアタンパク質の部位特異的突然変異誘発と、DNAプロセシング酵素、例えば、DNAポリメラーゼの、ナノポアへの組込みとの組合せにより達成されうる。
【0070】
[0091]固有に同定可能なポリヌクレオチド鋳型
[0092]図2を参照すると、酵素変異体についてのスクリーニングにおける第1のステップ(200)は、複数の異なる鋳型であって、ナノポアシーケンシング複合体の酵素と会合するようにデザインされた鋳型を形成することである。酵素は、同じバイオチップ上の、マルチプレックス方式でスクリーニングされる場合、大量の異種シーケンシングデータが生成され、鋳型は、最終的に、ナノポアシーケンシング複合体の特定の酵素と会合する鋳型(または鋳型の部分)の同定に基づき、各個別のナノポアシーケンシング複合体から収集されたシーケンシングデータを結びつけて、特定の酵素変異体へと復元するのに用いられる。
【0071】
[0093]例えば、第1のナノポアシーケンシング複合体が、第1の同定可能な分子バーコードを含む第1の鋳型を含み、第2のナノポアシーケンシング複合体が、第2の同定可能な分子バーコードを含む第2の鋳型を含むならば、さらに、異なるナノポアシーケンシング複合体内に含まれる鋳型が、ナノポアベースのシーケンシングを使用してシーケンシングされる場合、各ナノポアシーケンシング複合体は、異なる酵素変異体を含むことを仮定すれば、シーケンシングデータは、第1の同定可能な分子バーコードおよび第2の同定可能な分子バーコードが、生成されたデータセット内で検出されうるように生成される可能性があり、同定可能な分子バーコードをたどって、特定の酵素へと復元する(例えば、本明細書で記載される分類アルゴリズムの使用を介して)ことにより、配列データセットから導出された動態データもまた、特定の酵素または酵素変異体へと帰せられうる。
【0072】
[0094]一部の実施形態では、少なくとも鋳型の一部は、固有の分子バーコードを含む。一部の実施形態では、鋳型は、固有の分子バーコードおよび共通読取り領域を含む。一部の実施形態では、共通読取り領域が、全ての鋳型について同じであるのに対し、固有の分子バーコードは、全ての鋳型について異なる。一部の実施形態では、固有の分子バーコードが、共通読取り領域へと添付されて、複数の異なる鋳型を形成する。一部の実施形態では、固有の分子バーコードは、生成されたシーケンシングデータ内で検出される可能性があり、本明細書で記載される、固有の分子バーコードを有する鋳型と会合する、特定の酵素を同定するのに使用されうる。
【0073】
[0095]一部の実施形態では、鋳型は、一般構造:
[0096]−[プライマー]−[共通読取り領域]−[固有のバーコード]
[0097][構造中、「共通読取り領域」は、全ての鋳型について同じであり、10〜500塩基の間を有するポリヌクレオチド配列であることが可能であり;「固有のバーコード」は、5〜100塩基の間を有するオリゴヌクレオチド配列であり、各「固有のバーコード」は異なる]を有しうる。例えば、第1の鋳型が、−[プライマー1]−[共通読取り領域1]−[固有のバーコード1]を含みうる一方で、第2の異なる鋳型は、−[プライマー1]−[共通読取り領域1]−[固有のバーコード2]を含みうる。他の実施形態では、「固有のバーコード」は、5〜50塩基の間を有するオリゴヌクレオチド配列であり、各「固有のバーコード」は異なる。さらに他の実施形態では、「固有のバーコード」は、8〜25塩基の間を有するオリゴヌクレオチド配列であり、各「固有のバーコード」は異なる。一部の実施形態では、共通読取り領域は、酵素を特徴付けるのに使用されうる、すなわち、鋳型の共通読取り領域部分について、配列データが生成されるので、解析され、酵素を特徴付けるのに最終的に使用されうる計量(本明細書で記載される、タグ組込み速度など)が導出されうる。
【0074】
[0098]一部の実施形態では、「固有のバーコード」の各々は、各バーコードが、他の任意のバーコードとの、85%未満の配列同一性を有するようにデザインされる。一部の実施形態では、「固有のバーコード」とは、配列番号1〜3のうちのいずれかに対する、少なくとも90%の同一性を有する。他の実施形態では、「固有のバーコード」とは、配列番号1〜3のうちのいずれかに対する、少なくとも95%の同一性を有する。さらに他の実施形態では、「固有のバーコード」とは、配列番号1〜3のうちのいずれかの配列を有する。
【0075】
[0099]他の実施形態では、全鋳型(プライマー領域を除く)は、固有の識別子として用いられうる。一部の実施形態では、鋳型は、一般的な、−[プライマー]−[所定の配列]の構造を有しうる(また、本明細書の、実施例1および8も参照されたい)。一部の実施形態では、第1の鋳型は、500塩基を有する「所定の配列」を含むことが可能であり、第2の鋳型もまた、500塩基を有する「所定の配列」も含みうるが、この場合、第1および第2の鋳型の所定の配列は、85%未満の配列同一性を共有する。一部の実施形態では、第1の鋳型は、200塩基を有する「所定の配列」を含むことが可能であり、第2の鋳型もまた、200塩基を有する「所定の配列」も含みうるが、この場合、第1および第2の鋳型の所定の配列は、85%未満の配列同一性を共有する。一部の実施形態では、第1の鋳型は、100塩基を有する「所定の配列」を含むことが可能であり、第2の鋳型もまた、100塩基を有する「所定の配列」も含みうるが、この場合、第1および第2の鋳型の所定の配列は、85%未満の配列同一性を共有する。一部の実施形態では、第1の鋳型は、50塩基を有する「所定の配列」を含むことが可能であり、第2の鋳型もまた、50塩基を有する「所定の配列」も含みうるが、この場合、第1および第2の鋳型の所定の配列は、85%未満の配列同一性を共有する。一部の実施形態では、「所定の配列」に関して生成される配列データは、鋳型と会合する酵素についての固有の同定、およびこれについての動態パラメータの導出のために使用されうる。
【0076】
[0100]一部の実施形態では、鋳型ポリヌクレオチドは、環状の場合もあり、アレイ形の場合もある。環状鋳型の例は、図1Bに示され、本明細書の実施例1にさらに記載される。一部の実施形態では、環状鋳型およびアレイ形鋳型は、各々、複数回、例えば、5回、10回、20回、50回などにわたりシーケンシングされうる。
【0077】
[0101]一部の実施形態では、バーコード化された核酸鋳型は、(a)一本鎖核酸鋳型の集団を用意するステップであって、各一本鎖核酸鋳型が、プライマー配列に挟まれた固有のバーコード配列を含むステップ;(b)高い塩基対合確率を有する、一本鎖核酸鋳型のうちの1つまたは複数の領域を削除するステップ;および(c)一本鎖核酸鋳型の部分集団を選択するステップであって、部分集団の、各固有のバーコード配列が、部分集団の、他の任意の固有のバーコード配列と同一ではないステップを含む方法により作製される。一部の実施形態では、一本鎖DNA分子は、それが、末端における、共通の19塩基のプライマー領域により挟まれた、中央部分における、固有の32塩基のバーコード領域を含み、最終的な長さが51塩基となるように、コンピュータによりデザインされた。一部の実施形態では、32塩基の領域が、固有の識別子であるのに対し、19塩基の領域は、環状化のために使用された(すなわち、アライメントの一助となる以外の機能は果たさないと考えられた)。一部の実施形態では、固有の識別子は、20〜100塩基の間を含む。他の実施形態では、固有の識別子は、30〜80塩基の間を含む。一部の実施形態では、バーコードと関連する最小自由エネルギー(MFE)が計算され、ポリメラーゼが読み取るのに困難であると考えられる二次構造を形成しうる、塩基対合確率が高い閾値領域を削除するように閾値が選ばれた。一部の実施形態では、全てのバーコードは、互いとの、85%未満の配列同一性を有した。
【0078】
[0102]ナノポアシーケンシングのためのチップへの、ポリヌクレオチド鋳型のローディング
[0103]複数の異なる鋳型の形成(ステップ200)の後、チップが、2つの異なる酵素変異体を有する、少なくとも2つの異なるナノポアシーケンシング複合体を装填されることを条件として、異なる鋳型の各々は、ナノポア−酵素コンジュゲート(すなわち、酵素へと連結されたナノポア)と複合体化され、ナノポアベースのシーケンシングのためのチップへと装填される(210)。
【0079】
[0104]一部の実施形態では、各異なるナノポアシーケンシング複合体は、ここでもまた、任意のバイオチップへと装填された異なるナノポアシーケンシング複合体のうちの少なくとも2つが、2つの異なる酵素変異体を含むことを条件として、(i)同じ酵素変異体および異なるポリヌクレオチド鋳型;または(ii)異なる酵素および異なるポリヌクレオチド鋳型を含みうる。例を目的として述べると、3つのポリメラーゼ変異体(P1、P2、およびP3)が、本明細書で記載される方法に従い、スクリーニングされると仮定しよう。また、6つの異なる鋳型(T1、T2、T3、T4、T5、およびT6)が、3つの異なるポリメラーゼ変異体のうちのいずれかと複合体化させるのに利用可能であるとも仮定しよう。異なるナノポアシーケンシング複合体の1つのセットは、P1T1、P1T2、P2T3、P2T4、P3T5、およびP3T6を含みうるであろう。とりわけ、6つの異なるナノポアシーケンシング複合体のうちの3つは、3つの異なる酵素変異体を含み、3つの異なる酵素変異体の動態についてのマルチプレックス解析を可能とする。ナノポアシーケンシング複合体の、1つの代替的なセットは、P1T1、P1T2、P1T3、P2T4、P2T5、P3T6を含みうるであろう。ここでもまた、6つの異なるナノポアシーケンシング複合体のうちの3つは、3つの異なる酵素変異体を含み、ここでもまた、3つの異なる酵素変異体の動態についてのマルチプレックス解析を容易とする。酵素−鋳型複合体の、さらに別の代替的なセットは、P1T1、P1T2、P1T3、P2T4、P2T5、P2T6を含みうるであろう。この例では、2つの異なる酵素変異体だけが、異なるナノポアシーケンシング複合体のセット内に含まれるが、2つの異なる酵素変異体はやはり、本明細書で記載される方法に従い、マルチプレックス方式でスクリーニングされうるであろう。
【0080】
[0105]の例は、最大で3つの異なる酵素変異体を伴う、マルチプレックス検出を例示するが、任意の単一のチップ上で調べられうる、異なる酵素変異体の数に、上限は存在しないと考えられる、すなわち、異なる酵素変異体を有する、異なるナノポアシーケンシング複合体の数に、上限は存在しない。一部の実施形態では、本開示に従う、単一のバイオチップ上でスクリーニングされうる酵素変異体の数は、2〜約1000の間の範囲である。他の実施形態では、本開示に従う、単一のバイオチップ上でスクリーニングされうる酵素変異体の数は、2〜約500の間の範囲である。他の実施形態では、本開示に従う、単一のバイオチップ上でスクリーニングされうる酵素変異体の数は、2〜約250の間の範囲である。他の実施形態では、本開示に従う、単一のバイオチップ上でスクリーニングされうる酵素変異体の数は、2〜約150の間の範囲である。他の実施形態では、本開示に従う、単一のバイオチップ上でスクリーニングされうる酵素変異体の数は、2〜約100の間の範囲である。さらに他の実施形態では、本開示に従いスクリーニングされうる酵素変異体の数は、2〜約50の間の範囲である。さらなる実施形態では、本開示に従いスクリーニングされうる酵素変異体の数は、2〜約10の間の範囲である。なおさらなる実施形態では、本開示に従いスクリーニングされうる酵素変異体の数は、3〜約8の間の範囲である。またさらなる実施形態では、本開示に従いスクリーニングされうる酵素変異体の数は、4〜約8の間の範囲である。
【0081】
[0106]一部の実施形態では、各異なるナノポアシーケンシング複合体は、ここでもまた、任意のバイオチップへと装填された異なるナノポアシーケンシング複合体のうちの少なくとも2つが、2つの異なるナノポア変異体を含むことを条件として、(i)同じナノポア変異体および異なるポリヌクレオチド鋳型;または(ii)異なるナノポアおよび異なるポリヌクレオチド鋳型を含みうる。例を目的として述べると、3つのナノポア変異体(N1、N2、およびN3)が、本明細書で記載される方法に従い、スクリーニングされると仮定しよう。また、6つの異なる鋳型(T1、T2、T3、T4、T5、およびT6)が、3つの異なるナノポア変異体のうちのいずれかと複合体化させるのに利用可能であるとも仮定しよう。異なるナノポアシーケンシング複合体の1つのセットは、N1T1、N1T2、N2T3、N2T4、N3T5、およびN3T6を含みうるであろう。とりわけ、6つの異なるナノポアシーケンシング複合体のうちの3つは、3つの異なるナノポア変異体を含み、3つの異なるナノポア変異体の動態についてのマルチプレックス解析を可能とする。ナノポアシーケンシング複合体の、1つの代替的なセットは、N1T1、N1T2、N1T3、N2T4、N2T5、N3T6を含みうるであろう。ここでもまた、6つの異なるナノポアシーケンシング複合体のうちの3つは、3つの異なるナノポア変異体を含み、ここでもまた、3つの異なるナノポア変異体の動態についてのマルチプレックス解析を容易とする。
【0082】
[0107]次いで、異なるナノポアシーケンシング複合体の各々(例えば、異なる酵素変異体、異なるナノポア変異体、またはこれらの任意の組合せを含むナノポアシーケンシング複合体)が、膜内、例えば、脂質二重層内に挿入され、ナノポアベースのセンサー、例えば、バイオチップの集積回路などのセンシング回路のセンシング電極に隣接または近接して配置されうる(図1Aを参照されたい)。ナノポアシーケンシング複合体をアセンブルするための方法については、その開示が、参照によりその全体において本明細書に組み込まれる、米国特許出願公開第2017/0268052号において記載されている。異なる鋳型の各々を、ナノポア−酵素コンジュゲートへと複合体化させるのに適する他の方法は、それらの開示が、参照によりその全体において本明細書に組み込まれる、PCT公開第WO2014/074727号、同第WO2006/028508号、および同第WO2012/083249号において記載された方法を含む。
【0083】
[0108]複数のナノポアセンサーは、チップ上またはバイオチップ上に存在するアレイなどのアレイとして用意されうる。ナノポアのアレイは、任意の適切な数のナノポアを有しうる。一部の場合に、アレイは、約200、約400、約600、約800、約1000、約1500、約2000、約3000、約4000、約5000、約10000、約15000、約20000、約40000、約60000、約80000、約100000、約200000、約400000、約600000、約800000、約1000000などのナノポアを含む。バイオチップおよびバイオチップを作るための方法については、その開示が、参照によりその全体において本明細書に組み込まれる、PCT公開第WO2015/061511号において記載されている。複数のナノポアを含む、さらに適切なバイオチップについては、その開示が、参照によりその全体において本明細書に組み込まれる、米国特許出願公開第2017/0268052号において記載されている。なおさらに適切なナノポアアレイについては、その開示が、参照によりその全体において本明細書に組み込まれる、米国特許第8,986,928号において記載されている。
【0084】
[0109]ナノポアシーケンシング複合体のナノポアは、限定せずに述べると、生物学的ナノポア、固体ナノポア、およびハイブリッド生物学的−固体ナノポアを含む。ナノポアシーケンシング複合体の生物学的ナノポアは、大腸菌種、Salmonella属種、Shigella属種、およびPseudomonas属種に由来するOmpGナノポアを含み、黄色ブドウ球菌種に由来するアルファヘモリシンナノポア、スメグマ菌種に由来するMspAナノポアは、野生型ナノポアの場合もあり、変異体ナノポアの場合もあり、修飾変異体ナノポアの場合もある。例えば、その開示が、参照によりその全体において本明細書に組み込まれる、米国特許出願公開第2017/0088588号を参照されたい。一部の実施形態では、変異体ナノポアシーケンシング複合体のナノポアは、それが由来する親ナノポアのイオン性電流ノイズを低減するように操作される。さらに他のナノポアについては、それらの開示が、参照によりその全体において本明細書に組み込まれる、米国特許出願公開第2017/0268052号および同第2018/0201993号において記載されている。現在既知であるか、またはその後発見された、任意のナノポア変異体は、1つまたは複数の酵素変異体(例えば、所望の特性をもたらす、ナノポア変異体と酵素変異体との対を同定する)のスクリーニングと共時的にスクリーニングされうるなど、本明細書で記載される方法に従いスクリーニングされうる。
【0085】
[0110]各異なる鋳型についての配列データセットの生成
[0111]異なるナノポアシーケンシング複合体を、チップへと装填した(ステップ210)後、ナノポアベースのシーケンシングが行われ、データが生成される(ステップ220)、すなわち、シーケンシングデータが、各ナノポアシーケンシング複合体について、独立に生成される。言い換えれば、シーケンシングデータは、各ナノポアと関連する各ポリヌクレオチド鋳型について、各々がシーケンシングされるのに応じて収集される。このようなシーケンシングデータ(すなわち、生成されたシーケンシングデータセット)は、鋳型のヌクレオチド配列に関するデータを含むだけではなく、また、ヌクレオチドの組込み速度に関する計量など、様々な計量も含む。一部の実施形態では、導出される計量は、精度、挿入百分率、欠失百分率、組込み速度、プロセッション速度、滞留時間(例えば、タグが、ナノポアシーケンシング複合体と会合する時間)、待機時間(すなわち、滞留時間と滞留時間との間の時間)、触媒速度、タグヌクレオチドの「オン速度」、タグヌクレオチドの「オフ速度」、タグを通る速度、シーケンシングの寿命、および小孔の寿命である。例えば、固有の分子バーコードおよび共通読取り領域を有する鋳型について、固有の分子バーコード部分についてのデータセット内のシーケンシングデータは、同定および分類の目的(本明細書で記載された)で使用される場合があり、共通読取り領域についてのデータセット内のシーケンシングデータは、例えば、共通読取り領域のシーケンシング時におけるタグ組込みイベントの速度に基づき、酵素動態を導出するのに使用されうる。
【0086】
[0112]一部の実施形態では、核酸のシーケンシングは、本明細書で記載されるナノポアシーケンシング複合体を調製すること、およびその開示が、参照によりその全体において本明細書に組み込まれる、PCT公開第WO2014/074727号において記載されている通り、タグ付けされたヌクレオチドを使用することなどにより、ポリヌクレオチド配列を決定することを含む。例えば、1つまたは複数のセンシング電極に隣接するか、またはこのセンシング的近傍にある膜内に設置されたナノポアシーケンシング複合体は、ヌクレオチド塩基が、酵素(例えば、ポリメラーゼ)と会合する鋳型鎖と相補的な鎖へと組み込まれ、ヌクレオチドのタグが、ナノポアにより検出されるのに応じて、酵素、例えば、ポリメラーゼによる、タグ付けされたヌクレオチドの組込みを検出しうる。各タグは、特徴的であり、良く分離された信号を発生させるので、付加される塩基を固有に同定する。組込みイベントは、ポリヌクレオチド鋳型内の次の塩基へと移動する前にタグが、ポリメラーゼにより切断されると、終了する。タグ付けされたヌクレオチドの組込みおよび塩基コール時におけるタグの捕捉と関連する、複数の計量を含む、有益なシーケンシングデータが収集されうる(図1Bおよび4Aを参照されたい)。単一分子酵素(例えば、ポリメラーゼ)動態についての情報を付加する計量は、リアルタイムで、収集および/またはモニタリングされうる。
【0087】
[0113]一部の実施形態では、各ナノポアについての様々なシーケンシングパラメータを含むデータファイルが作成される。一部の実施形態では、マルチプレックス酵素スクリーニングのための、様々なシーケンシングパラメータのサブセット、すなわち、ヌクレオチドの組込みの全触媒サイクルの速度、ヌクレオチドの組込みの後におけるタグ放出の速度、別個のヌクレオチドの組込みの持続時間(tdwell)、2つの別個のヌクレオチドの組込みの間の持続時間(twait)、ヌクレオチドの組込みの移行速度(組み込まれるヌクレオチドが、先行するヌクレオチドと同じN→N、または組み込まれるヌクレオチドが、先行するヌクレオチドと異なるN→M[式中、Nは、A、C、T、またはGのうちの1つである)、別個のタグの捕捉の持続時間(time duration for a distinct tag capture)、およびヌクレオチドの組込み時の単位時間当たりに観察される電流遮断イベントの回数、または酵素活性と関連する単一分子ナノポア信号から導出されうる、他の任意の動態パラメータが利用される。
【0088】
[0114]一部の実施形態では、ナノポアは、2つの電極を含む電気回路の一部でありうる。2つの電極の間の電流は、どのヌクレオチド(塩基)または対応するタグが、ナノポア内に存在するのかに基づき、変動しうる。第1の電気信号は、回路内の電圧または電流を測定するのに適する、任意の技法を使用して検出されうる。一部の実施形態では、ナノポアを、電圧源とカップリングさせることにより、電圧が、ナノポアにわたり適用され(図1Aを参照されたい)、その後、ナノポアにわたる電圧減衰速度が決定されうるように、電圧源は、ナノポアからデカップリングされうる。この方法に従い、電圧および/または減衰速度を測定することにより、ナノポア内の1つの分子(例えば、ナノポアの近傍またはナノポアを通過する新生鎖上のタグまたはヌクレオチド)は、別の分子から識別されうる。一部の実施形態では、電圧減衰の速度は、一定の時間間隔内に生じる、電圧の減衰を測定することにより決定される。このような方法については、それらの開示が、参照によりそれらの全体において本明細書に組み込まれる、米国特許第9,557,294号、および米国特許出願公開第2018/0201933号においてさらに記載されている。
【0089】
[0115]シーケンシングにより生成されたデータの解析は、一般に、多様なデータの変換、例えば、信号の発生の、塩基コールへの変換(図4Aを参照されたい)、塩基コールの、核酸鋳型についてのコンセンサス配列への変換などを実施するソフトウェアおよび/または統計学的アルゴリズムを使用して実施される。このようなソフトウェア、統計学的アルゴリズム、およびこのようなものの使用については、それらの開示が、参照によりそれらの全体において本明細書に組み込まれる、米国特許出願公開第2009/0024331号、同第2017/0044606号、およびPCT公開第WO2018/034745号において、詳細に記載されている。一部の実施形態では、電圧信号イベントは、確率論的塩基コールアルゴリズムを使用して、生リードへと変換される。
【0090】
[0116]生成された各シーケンシングデータセットの、特定の酵素変異体と関連するものとしての分類
[0117]ナノポアシーケンシング複合体の各々についての独立のシーケンシングデータの生成(ステップ220)の後、生成され、収集されたシーケンシングデータセットは、特定の酵素変異体と関連する(またはナノポア変異体が利用される場合、特定のナノポア変異体と関連するように)ものとして分類される(ステップ230)。簡単に言えば、このステップは、各ナノポアについて収集されたシーケンシングデータ(シーケンシングデータセット)が、特定の酵素または酵素変異体へと帰せられることを可能とする。一部の実施形態では、生成されたシーケンシングデータセットの各々は、鋳型(本明細書の実施例4および8を参照されたい)またはシーケンシングされた各異なる鋳型、すなわち、各異なるナノポアシーケンシング複合体と共に含まれるか、またはこれと関連する鋳型と関連する、固有の、同定可能なバーコードの同定に基づき、特定の酵素または酵素変異体と関連するものとして分類される。
【0091】
[0118]例を目的として述べると、2つの異なる固有のバーコードを使用する、2つの異なる酵素変異体によるマルチプレックス化のために、ナノポアシーケンシング複合体P1T1内およびP2T2内に含まれる鋳型T1およびT2がシーケンシングされ、P1T1およびP2T2の各々について、シーケンシングデータの1つずつのセットである、シーケンシングデータの2つのセットが生成されると仮定しよう。鋳型T1およびT2の各々は、固有の分子バーコードを含むとさらに仮定しよう。各ナノポアシーケンシング複合体と関連する、固有に同定可能な分子バーコード、すなわち、T1内およびT2内に含まれる固有の分子バーコードを与えると、自動化分類アルゴリズムを使用して、生シーケンシングデータ内で、鋳型T1およびT2(または鋳型分子バーコード)を同定することにより、P1T1およびP2T2について生成されたシーケンシングデータセットは各々、酵素変異体であるP1またはP2と関連させうる。例えば、フィルターをかけたリードデータ(ある特定の配列長基準を満たすリードデータ)が用意され、確率スコアが生成され、閾値に対して比較されうるように、各シーケンシングデータセットについてのリードが、T1およびT2についての既知の鋳型配列(または、それぞれ、既知の分子バーコード配列)に対して比較されうる。所定のカットオフ値または閾値の確率スコア値を満たすか、またはこれらを超えるアライメントが、鋳型(または鋳型の分子バーコード部分)および酵素を同定するのに使用される。この延長上で、Nの固有のバーコードを装填された、Nのポリメラーゼ変異体もまた、スクリーニングされうる。で明示された例[例では、N=2である]の場合と同じ分類アルゴリズムが適用されうる。ここで、Nについての限定的な因子は、シーケンシングラン時において、電極アレイ上で利用可能な活性ナノポアの数、および統計学的有意性のために、固有のバーコードに必要とされる観察の回数だけであると考えられる。例えば、128Kのチップで、各バーコード、すなわち、ポリメラーゼ変異体について、少なくとも10回ずつの観察を要求するために、100%の小孔活性の小孔収率を仮定すれば、N=10000の変異体が、スクリーニングされ、10%の小孔収率を仮定すれば、N=1000の変異体が、スクリーニングされうるであろう。
【0092】
[0119]一部の実施形態ではシーケンシングされた固有の分子バーコードの同定は、(i)最小限の閾値塩基長を満たすように、品質リードにフィルターをかけること(実施例2Cを参照されたい);(ii)自動化されたアライメントベースのアルゴリズムを使用して、確率スコアを導出すること(実施例2Dを参照されたい);および(iii)算出された確率スコアが、所定の閾値確率スコア値を少なくとも満たすのかどうかを査定すること(例えば、本明細書の実施例4を参照されたい)を含む。一部の実施形態では、それらのリード長が、1回の完全バーコード反復(51塩基)を超え、かつ、10回の完全バーコード反復未満のリード長であり、それらのコンセンサス配列長が、10塩基を超えることを要求することにより品質リードにフィルターをかけた。一部の実施形態では、バーコードの同定のために、品質生リードにフィルターをかけるのに、スクリーニングされたポリメラーゼ変異体全ての累積バーコードマッチ確率指数(「BMPI」)を、完全バーコード反復の関数として生成した。一般に、リード長が増大するにつれ、バーコードのBMPIも、RPol1、RPol2、およびRPol3のそれぞれについて、約10、約14、および約20回の反復がなされるまで、漸近的に増大することが観察された(本明細書の実施例を参照されたい)。一部の実施形態では、本明細書の実施例で、さらに記載される通り、保守法が取られることがあり、この場合、生リードが、バーコードの同定のために、最大で10回の完全反復を伴うのに対し、他の配列の残りは、下流の解析において棄却されると考えられる(図10を参照されたい)。
【0093】
[0120]一部の実施形態では、所定の閾値確率スコア値は、0.80である。一部の実施形態では、自動化されたアライメントベースのアルゴリズムは、フィルターをかけた品質リード(すなわち、閾値リード長基準を満たすプロセシングの後で保持される、収集された核酸配列)を、既知の分子バーコードに対してアライメントするが、この場合、既知の分子バーコードは、各ポリヌクレオチド鋳型(そして、異なるナノポアシーケンシング複合体の各々の中に含まれるか、またはこれと会合する)内に含まれる、固有の分子バーコードの各々である。当業者は、所与の任意の配列が、不正確な分子バーコードと対照的に、その正確な既知の分子バーコードによりアライメントされる場合に、より大きな確率スコアがもたらされることを察知するであろう(本明細書の実施例4を参照されたい)。
[0121]本開示との関連で使用されうるアルゴリズムは、Burrows−Wheeler Aligner(「BWA」)−short(LiおよびDurbin、Bioinformatics、25、14:1754〜1760(2009))、BWA−long(LiおよびDurbin、Bioinformatics、26、5:589〜595(2010))、およびSequence Search and Alignment by Hashing Algorithm(「SSAHA」)(Ning、Cox、およびMullikin、Genome Research、11、10:1725〜1729(2001))を含むがこれらに限定されない。一部の実施形態では、アライメントベースのアルゴリズムは、Smith−Watermanによるアライメントベースの分類アルゴリズム(Smith,T.F.およびWaterman,M.S.、1981、「Identification of common molecular subsequences」、J.Mol.Biol.、147、195〜197、その開示が、参照によりその全体において本明細書に組み込まれる、を参照されたい)である。Smith−Watermanによるアルゴリズムでは、生成された配列データは、クエリー配列、例えば、既知の鋳型配列または分子のタグ配列と比較されうる。Smith−Watermanによるアルゴリズムによく見られる通り、確率スコアは、比較されるヌクレオ塩基の異なる発生および重複へと帰せられうる。異なるナノポアシーケンシング複合体内に含まれる異なる鋳型の各々についてのシーケンシングデータの分類の例は、本明細書の実施例4および8に明示される。
【0094】
[0122]一般に、アルゴリズムは、バーコードについての生のシーケンシングリード(ナノポア実験による)を受け取り、確率スコア、すなわち、バーコードマッチ確率指数(BMPI)を出力する。一部の実施形態では、このスコアは、バーコードが、測定セット内の他の可能なバーコードと比較して、どのくらい固有に同定されうるのかの相対尺度について記載する。利用されるバーコードは、環状であったので、シーケンシングリードは、典型的に、約500塩基まで、互いの後に連結された多重バーコードリードを含有する。このデザインは、バーコードを、固有にエラープローンである生リードから同定する一助となった。
【0095】
[0123]一部の実施形態では、それらのリード長が、1バーコード反復(51塩基)を超えることを要求することにより品質リードにフィルターをかけた。次に、生リード内の全てのバーコード反復境界が同定され、個々のバーコードリード(同じ環状バーコードから生成されるので、同じ種類のバーコードリード)(例えば、1〜約10のバーコードリード)へと分割される。その後、標準的な多重配列アライメントアルゴリズムが、これらのバーコードリードをアライメントするのに使用され、このアライメントから、コンセンサスバーコードを得うる。次いで、コンセンサス配列が、少なくとも10塩基である場合、コンセンサスバーコードは、スクリーニング実験において使用される、全ての可能なバーコード(例えば、96のバーコード)に対して局所的にアライメントされる(図10を参照されたい)。最後に、スコアが最大のアライメント(例えば、96全ての比較による)は、配列同一性(バーコード内のマッチング塩基/全塩基)に基づき、最も可能性が高いバーコード候補を同定する。ナノポアシーケンシングは、100%正確であるとは考えられないので、バーコードを、複数回にわたり読み取って、バーコードのプール内で、バーコードを固有に同定する信頼性を構築するのに、バーコードの環状の性格が利用されうる。
【0096】
[0124]複数の異なるナノポアシーケンシング複合体が、同じ酵素変異体を共有する実施形態では、同じ酵素変異体と関連するものとして分類される、生成された任意の配列データは、併せてプールされ、動態パラメータは、これらのプールされたシーケンシングデータセットから導出されうる。に記載した例を使用してここでもまた、3つのポリメラーゼ変異体(P1、P2、およびP3)が、スクリーニングされると仮定し、また、6つの異なる鋳型(T1、T2、T3、T4、T5、およびT6)が、3つの異なるポリメラーゼ変異体のうちのいずれかと複合体化させるのに利用可能であるとも仮定しよう。ここでもまた、異なるナノポアシーケンシング複合体の1つのセットは、P1T1、P1T2、P2T3、P2T4、P3T5、およびP3T6を含みうるであろう。この例では、各異なるナノポアシーケンシング複合体について(すなわち、P1T1、P1T2、P2T3、P2T4、P3T5、およびP3T6の各々について)の、シーケンシングデータセットの生成、および各データセットの、特定の酵素に属するものとしての、後続の分類(すなわち、鋳型配列または鋳型配列内のバーコードの同定に基づくものとしての、P1、P2、またはP3)の後で、酵素であるP1と関連するデータセットの全ては、併せてプールされうる(すなわち、データセットであるP1T1およびP2T2は、併せてプールされうる)。同様に、酵素であるP2または酵素であるP3と関連するデータセットの全てもまた、それぞれ、併せてプールされうる。次いで、動態パラメータは、プールされたデータセットから導出されうる(本明細書の実施例9を参照されたい)。
【0097】
[0125]各異なる酵素変異体についての動態パラメータの導出
[0126]生成されたデータセットの、特定の酵素変異体に属するものとしての分類(ステップ230)の後、動態パラメータが、各異なる酵素変異体について導出されうる(ステップ240)ように、分類されたデータセット(またはで記載した通りにプールされる、分類されたデータセット)が使用される。
【0098】
[0127]一部の実施形態では、導出されうる動態パラメータは、(i)滞留時間(タグ付けされたヌクレオチドが、ナノポアシーケンシング複合体に結合した後、タグの放出までの、全ての動態段階の関数である、別個の塩基コールのための持続時間);(ii)FCR(タグ付けされたヌクレオチドの組込みの全触媒サイクルの速度);(iii)ヌクレオチドの組込みの後におけるタグ放出速度(TRR);(iv)タグ捕捉速度(塩基コール時の単位時間当たりに観察される電流遮断イベントの回数);および(v)タグ捕捉滞留時間(TCD)(別個のタグの捕捉の平均持続時間)を含むがこれらに限定されない。これらの動態パラメータの各々の、受信される信号および電流プロットと比較した同定は、図4Aに例示される。また、本明細書の実施例7も参照されたい。
【0099】
[0128]例を目的として述べると、酵素の忠実度、プロセッシビティー、伸長速度、またはオンチップの寿命を特徴とする、規定された動態特性のセットを有する、特定のDNAポリメラーゼの突然変異体をスクリーニングすることに関心を持つ場合があろう。この例では、タグ付けされたヌクレオチドの組込みおよび塩基コール時におけるタグの捕捉と関連する、様々な動態パラメータが、単一分子イベントによりもたらされる電圧信号から導出されうる。ここでは、滞留時間は、タグ付けされたヌクレオチドが、三元複合体に結合した後であり、かつ、タグの放出までである、全ての動態段階の関数である、別個の塩基コールのための持続時間として規定されうる。加えて、完全触媒速度(FCR)は、タグ付けされたヌクレオチドの組込みと、ポリメラーゼによるタグの切断とによる、2つの連鎖的な触媒イベントである、触媒サイクルの速度として規定されうる(例えば、図3Aを参照されたい)。
【0100】
[0129]一部の実施形態では、動態パラメータは、各ヌクレオチド、すなわち、A、T、C、およびGの各々について導出される。例えば、前述の種類の、5つの動態パラメータの各々が、ヌクレオチドの種類の各々について導出される場合、合計20の動態パラメータが導出されうる。
【0101】
[0130]一部の実施形態では、比較は、個々の動態パラメータの間でなされ、比較により、各異なる被験酵素変異体のプロセッシビティーが査定されうる。一部の実施形態では、特定の酵素変異体、例えば、ポリメラーゼ変異体を使用する、シーケンシング作業の持続時間は、導出された計量に基づき測定されうる。例えば、特異的ポリメラーゼ変異体が、プロセッシビティーを改善した場合、このようなポリメラーゼ変異体の使用が、シーケンシング寿命の延長を引き起こすことが予測されるであろう。本発明者らが計算する計量により、本発明者らは、シーケンシングが、平均でどのくらい持続したのかを測定することができる。
【0102】
[0131]ポリヌクレオチド結合性タンパク質−鋳型複合体を装填されたバイオチップ
[0132]本開示の別の態様は、複数の異なるナノポアシーケンシング複合体を装填されたバイオチップであり、異なるナノポアシーケンシング複合体の各々は、異なるポリヌクレオチド鋳型を含み(例えば、各々は、固有に同定可能なバーコードを有する、少なくとも一部を有し)、複数のナノポアシーケンシング複合体のうちの少なくとも2つの異なるナノポアシーケンシング複合体は、2つの異なるポリヌクレオチド結合性タンパク質を含む。言い換えれば、バイオチップ上に施されたナノポアシーケンシング複合体の全てのうち、異なるナノポアシーケンシング複合体のうちの少なくとも2つは、2つの異なるポリヌクレオチド結合性タンパク質またはこれらの変異体を含む。一部の実施形態では、少なくとも2つの異なるポリヌクレオチド結合性タンパク質は、2つの異なる突然変異体、例えば、置換による単一のアミノ酸変更を含む突然変異体である。一部の実施形態では、少なくとも2つの異なるポリヌクレオチド結合性タンパク質のうちの1つは、コントロールであり、少なくとも2つの異なるポリヌクレオチド結合性タンパク質のうちの別のものは、コントロールと比較した、少なくとも1カ所の修飾を含み、このような修飾は、ポリヌクレオチド結合性タンパク質の活性を、コントロールと比べて変更するのに導入されうる。
【0103】
[0133]本明細書で使用される「ポリヌクレオチド結合性タンパク質」という用語は、ポリヌクレオチド(例えば、鋳型ポリヌクレオチド)に結合し、ナノポアを通したその移動など、ナノポアとの関連におけるその移動を制御することが可能な、任意のタンパク質を指す。一部の実施形態では、鋳型は、ポリヌクレオチド結合性タンパク質により結合される。一部の実施形態では、ポリヌクレオチド結合性タンパク質は、ポリヌクレオチド操作酵素またはポリヌクレオチドプロセシング酵素に由来するポリヌクレオチド結合性タンパク質を含む。ポリヌクレオチドプロセシング酵素とは、ポリヌクレオチドと相互作用し、この少なくとも1つの特性を修飾するか、またはポリヌクレオチドをプロセシングすることが可能なポリペプチドである。タンパク質は、二重螺旋の鎖をほどいて、一本鎖DNAの領域を形成することにより、ポリヌクレオチドをプロセシングしうる。他の実施形態では、タンパク質は、それを切断して、個々のヌクレオチドを形成することにより、ポリヌクレオチドをプロセシングしうる。タンパク質は、例えば、ヘリカーゼ、エクソヌクレアーゼ、ポリメラーゼ、転写因子、または他の核酸操作タンパク質でありうる。
【0104】
[0134]本開示の別の態様は、少なくとも2つのポリヌクレオチド結合性タンパク質をスクリーニングするためのバイオチップであって、膜内に配置された、複数の異なるナノポアシーケンシング複合体を含むアレイを含み、各ナノポアシーケンシング複合体が、ナノポアを、特定のポリヌクレオチド鋳型と会合するポリヌクレオチド結合性タンパク質へとカップリングさせており、複数の異なるナノポアシーケンシング複合体のうちの各異なるナノポアシーケンシング複合体が、異なる鋳型を含み、アレイ内に含まれる複数の異なるナノポアシーケンシング複合体のうちの異なるナノポアシーケンシング複合体のうちの少なくとも2つが、2つの異なるポリヌクレオチド結合性タンパク質を有するバイオチップである。一部の実施形態では、ナノポアシーケンシング複合体の各々のナノポアは、電極または他のセンシング回路に隣接または近接して配置される。一部の実施形態では、各ナノポアは、個別にアドレス可能である。一部の実施形態では、各ナノポアは、単一のポリヌクレオチド結合性タンパク質−鋳型複合体を含む。一部の実施形態では、各個別のナノポアは、ヌクレオチドの、ナノポアを通した通過を検出するか、または、代替的に、ポリヌクレオチド結合性タンパク質による、ヌクレオチドの、成長するポリヌクレオチド鎖への組込み時に、タグ付けされたヌクレオチドと関連するタグを検出するように構成される。
【0105】
[0135]一部の実施形態では、ポリヌクレオチド結合性タンパク質は、ヘリカーゼであり、ヘリカーゼは、標的ポリヌクレオチドの、ナノポアを通した移動を制御する。一部の実施形態では、少なくとも2つの異なるナノポアシーケンシングヘリカーゼ−鋳型複合体(すなわち、鋳型と会合するか、またはこれに結合するヘリカーゼ酵素であり、ヘリカーゼは、ナノポアへとカップリングされている)を装填され、各異なる複合体が、各複合体の固有の同定を可能とする、異なる鋳型を含み;チップへと装填された異なる複合体のうちの少なくとも2つが、異なるヘリカーゼ(例えば、2つの異なるヘリカーゼ変異体)を含むバイオチップを提示する。このようにして、ヘリカーゼ変異体は、本明細書で記載される方法に従うマルチプレックス方式でスクリーニングされうる。一部の実施形態では、ヘリカーゼ変異体は、変異体の間の差違が、鋳型ポリヌクレオチドの移動を制御する、ヘリカーゼ変異体の能力を、どのように変化させるのかを決定するようにスクリーニングされうる。
【0106】
[0136]一部の実施形態では、ポリヌクレオチド結合性タンパク質は、エクソヌクレアーゼであり、エクソヌクレアーゼは、個々のヌクレオチドの、鋳型ポリヌクレオチドからの切断を制御する。一部の実施形態では、少なくとも2つの異なるナノポアシーケンシングエクソヌクレアーゼ−鋳型複合体(すなわち、鋳型と会合するか、またはこれに結合するエクソヌクレアーゼ酵素であり、エクソヌクレアーゼは、ナノポアへとカップリングされている)を装填され、各異なる複合体が、各複合体の固有の同定を可能とする、異なる鋳型を含み;チップへと装填された異なる複合体のうちの少なくとも2つが、異なるエクソヌクレアーゼ(例えば、2つの異なるエクソヌクレアーゼ変異体)を含むバイオチップを提示する。このようにして、エクソヌクレアーゼ変異体は、本明細書で記載される方法に従うマルチプレックス方式でスクリーニングされうる。一部の実施形態では、エクソヌクレアーゼ変異体は、変異体の間の差違が、ヌクレオチドを切断する、エクソヌクレアーゼ変異体の能力を、どのように変化させるのかを決定するようにスクリーニングされうる。
【0107】
[0137]一部の実施形態では、ポリヌクレオチド結合性タンパク質は、ポリメラーゼである。一部の実施形態では、少なくとも2つの異なるナノポアシーケンシング複合体(すなわち、鋳型と会合するか、またはこれに結合するポリメラーゼ酵素であり、ポリメラーゼは、ナノポアへとカップリングされている)を装填され、各異なるポリメラーゼ−鋳型複合体が、各複合体の固有の同定を可能とする、異なる鋳型を含み;チップへと装填された異なる複合体のうちの少なくとも2つが、異なるポリメラーゼ(例えば、2つの異なるポリメラーゼ変異体)を含むバイオチップを提示する。このようにして、ポリメラーゼ変異体は、本明細書で記載される方法に従うマルチプレックス方式でスクリーニングされうる。
【実施例】
【0108】
[0138]
[0139]
実施例1
環状DNA鋳型の調製、ポリメラーゼの調製、およびポリン−ポリメラーゼ−鋳型複合体の形成
[0140]本明細書で記載される(実施例3を参照されたい)3プレックス実験では、51塩基の一本鎖DNA(ssDNA)オリゴヌクレオチドを、各ポリメラーゼを固有に同定するように、19塩基のユニバーサルプライマー領域により挟んだ、32塩基のランダムバーコード領域でコンピュータによりデザインした。CircLigase II(EpiCentre、Madison、WI)を使用して、合成鋳型DNA(IDT、Coralville、IA)を環状化させ、Exonuclease I(NEB、Ipswich、MA)で処理して、共有結合的に閉止しなかった、任意の直鎖状鋳型を除去し、その後、カラム精製にかけた。環状化のための代替的な戦略として、同じシーケンシングプライマーを、鋳型の末端に接合するスプリントとして使用した。プライマーは、鋳型の各末端において、約10塩基にわたったので、次いでT4リガーゼを、ライゲーションおよび環状化のために使用した。ライゲーションされなかった直鎖状ssDNA鋳型、過剰なプライマー、および二重鎖DNA(形成されたヘアピン)は、Exonuclease IおよびIII処理により消化した。結果として得られる、プライマーとアニーリングさせた環状DNA鋳型を濃縮し、脱塩させ、イソプロパノール沈殿またはカラム精製(Zymo Oligo Clean and Concentrator、D4060)により回収した。ペレットを、水中に再懸濁させ、カラム精製にかけて、任意の残留ATPを、先行するライゲーションステップから除去した。この方法は、高濃度(CircLigase法と比較して、>10倍)の出発鋳型/プライマー複合体をもたらし、したがって、これにより、最終反応物中の鋳型:ポリメラーゼ:小孔比をスケールアップしうるであろう。次いで、3分間にわたり、95℃へと加熱するのに続き、0.1℃/秒の速度で、20℃へと冷却することにより、プライマー(5’−ATTTTAGCCAGAGTGGGGA−3’)を、バーコード化された環状鋳型へとアニーリングした。
【0109】
[0141]本明細書で記載される、ハイスループットのマルチプレックス実験(実施例8および9を参照されたい)のために、96の固有のバーコード化ssDNA鋳型のセットを、コンピュータによりデザインし、注文した(IDT、Coralville、IA)。鋳型のうちの任意の1つを、完全なセット内の他の全ての鋳型に対して局所的にアライメントすると、計算された配列同一性が、常に<85%となり、それらが、固有の識別子として作用するように、32塩基のバーコード化領域を構築した。次いで、これらのバーコード化領域を、3つの個別のセット(セット1=CBT1〜32;セット2=CBT33〜65、およびセット3=CBT66〜96)へと分け、各セットを、32ずつの鋳型からなるようにするか、または96の鋳型全てを、併せてプールした。32の鋳型または96のプールされた鋳型による、これらのセットの各々を環状化させ、プライマーとアニーリングさせ、次いで、固有のポリメラーゼと複合体化させた。次いで、固有のポリメラーゼと複合体化させた各セットを、1:6の小孔と共に、一晩にわたりインキュベートし、2nMの最終濃度へと希釈し、チップへと装填した。
【0110】
[0142]Clostridium属ファージである、φCPV4DNAポリメラーゼ(GenBank:AFH27113.1)を、野生型として使用した。ポリヌクレオチドでタグ付けされたヌクレオチドを利用して、天然ヌクレオチドの組込み特徴に接近するのに、ポリメラーゼの動態特性を増強するように、部位特異的突然変異誘発(Roche Sequencing Solutions、Santa Clara、CA)により、特許権のある部位特異的突然変異を、DNAポリメラーゼ遺伝子へと導入した。
【0111】
[0143]1:6の小孔0.1M当たり、0.1Mのポリメラーゼおよび0.1Mのプライマーとアニーリングさせた環状DNA鋳型を4℃で、一晩にわたりインキュベートすることにより、生成されたポリメラーゼおよび所望の鋳型を、小孔に結合させた。鋳型の置きかえについて調べるスパイクイン実験(本明細書の実施例5を参照されたい)のために、2倍モル過剰量の所望の鋳型を、ポリメラーゼと共にインキュベートし、次いで、1:6の小孔と共に、一晩にわたりインキュベートしてから、チップへと装填した。
【0112】
[0144]
実施例2A
ナノポア実験データの収集
[0145]合成脂質である、1,2−ジ−O−フィタニル−sn−グリセロ−3−ホスホコリン(Avanti Polar Lipids、Alabaster、AL)を、トリデカン(Sigma−Aldrich、St.Louis、MO)中で、15mg/mLの最終濃度へと希釈した。平面状の脂質二重層を、本明細書で記載される(また、Stranges,P.B.ら、「Design and characterization of nanopore−coupled polymerase for single−molecule DNA sequencing by synthesis on an electrode array」、Proc.Natl.Acad.Sci.(2016)、 doi:10.1073/pnas.1608271113も参照されたい)CMOSチップ表面上で形成した。シーケンシング実験を、非対称条件下で実施した。シスコンパートメントは、300mMのKGlu、3mMのMgCl2、10mMのLiCl、5mMのTCEP、および20mMのHEPES pH8.0を含有する緩衝液で満たし、トランスコンパートメントは、380mMのKGlu、3mMのMgCl2、および20mMのHEPES pH8.0で満たすが、この場合、MnCl2は、ポリメラーゼ伸長反応時において、連鎖的なヌクレオチド付加を、鋳型DNAに沿って誘発および維持する、触媒性カチオン源である。生成されるポリン−ポリメラーゼ−鋳型コンジュゲートを、緩衝液中で、2nMの最終濃度へと希釈した。10μLのアリコートを、シスコンパートメントへとポンピングした後で、単一の小孔を、各々が、約5μLの緩衝液を含有する、2つのコンパートメントを分離する、平面状の脂質二重層内に包埋した。実験は、10μMのタグ付けされたヌクレオチドを、シスウェルへと添加して、27℃で行った。
【0113】
[0146]
実施例2B
データの収集
[0147]ナノポアを通るイオン電流は、ケイ素基板による電気集積回路へとカップリングさせた、個別にアドレス可能な白金電極の間で測定した。これは、電圧クランプモードで、脂質二重層にわたり印加された、50Hzで、デューティーサイクルを40%とする方形波(Vmax=+220mV、Vmin=−10mV)を伴う、非ファラデーACモジュレーションをもたらす、統合型パッチクランプ増幅器(Roche Sequencing Solutions、Santa Clara、CA)からなった。データは、各セルにおいて、各小孔複合体における、独立の配列リードを可能とする、回路ベースのアナログ−デジタル変換およびノイズフィルタリング(Roche Sequencing Solutions、Santa Clara、CA)を使用して、非同期構成の、2kHzのバンド幅で記録した。多様な実験ステップにおいて、精密シリンジポンプ(Tecan、Maennedorf、Switzerland)を、自動化された形で利用して、試薬を、1μL/秒の流速で、CMOSチップの微小流体チャンバーへと送達した。ソフトウェアの制御は、RS 232通信プロトコールを介して、ポンプとインターフェースをなす、Pythonにより実装した。
【0114】
[0148]
実施例2C
生リードの品質
[0149]バーコードの同定のために、品質生リードにフィルターをかけるのに、3つのポリメラーゼ変異体全ての累積BMPIを、完全バーコード反復の関数として生成した。一般に、リード長が増大するにつれ、バーコードのBMPIも、RPol1、RPol2、およびRPol3のそれぞれについて、10、14、および20回の反復がなされるまで、漸近的に増大することが観察された。保守法として、生リードが、バーコードの同定のために、最大で10回の完全反復を伴うのに対し、他の配列の残りは、下流の解析パイプラインにおいて棄却されると考えられた。
【0115】
[0150]
実施例2D
バーコードの分類
[0151]市販の確率論的塩基コールアルゴリズム(version 2.9.2、Roche Sequencing Solutions、Santa Clara、CA)を使用して、イオン電流イベントを、生リードへと変換した。次いで、品質生リードを、バーコードが、測定セット内の他の可能なバーコードと比較して、どのくらい固有に同定されうるのかの相対尺度について記載する確率スコアである、バーコードマッチ確率指数(BMPI)を出力する、スミス−ウォーターマン(SW)によるアライメントベースのバーコード分類アルゴリズムへの入力としてフィードした。より具体的に、第1のステップは、生環状リード内の異なる領域を、バーコードリードへと分類することであった。これは、生リード配列を、既知の連結されたバーコード配列に対して局所的にアライメントすることにより達成された。全てのバーコード反復境界を同定したら、本発明者らは、Bioinformatics Toolbox of MATLAB(登録商標)(2017a、MathWorks、Natick、MA)によるマルチアライン関数を利用して、反復されるバーコード配列の、プログレッシブ多重アライメントを実施した。次に、本発明者らは、「seqconsensus」を使用して、これらの多重アライメントされたリードのコンセンサス配列を生成し、これを後で、実験セット内の全ての潜在的なバーコードに対して局所的にアライメントする。最後に、スコアが最大の(SW)アライメントは、特定の入力配列に基づき査定される、最も可能性が高いバーコード候補を同定した。このスコアは、BMPIとして規定されるが、[0,1]の可能な範囲[範囲中、0は、全くのミスマッチを意味し、1は、全くのマッチを描示する]で、バーコード同定確率を測定するのに使用される。全てのアライメントについて、鋳型内のホモポリマー配列と、生のシーケンシングリード内の同じヌクレオチドについて反復される塩基コールとは、単一の塩基であると考えた。
【0116】
[0152]一部の実施形態では、環状バーコード(全バーコードが固有である場合など)の使用は、複数回連続で、バーコードを読み取ることにより、任意のナノポアシーケンシングの不正確さを補正する一助となるが、これは、コンセンサスバーコードを作出するのに利用される。このコンセンサスバーコードは、シーケンシングランにおいて存在する、他の全ての可能なバーコードを比較するための「鋳型」であると考えられうる。共通読取り領域(CRR)および分子バーコードからなる環状鋳型を援用する実施形態についても、確率スコアの同定は同じとなる。この場合、使用者は、コンセンサス生成のために、全鋳型(CRR+バーコード)を使用するか、または「真の」バーコード領域だけを使用する選択肢を有する。一般に、CRRは、バーコード反復境界を決定する一助となるであろう。
【0117】
[0153]
実施例3
固有の鋳型のシーケンシング
[0154]ポリメラーゼ−ナノポア系を使用して、環状鋳型を同定しうるのかどうかについて調べるために、共通の19塩基のプライマー領域により挟まれた、固有の32塩基のバーコード領域からなる、3つの合成一本鎖DNA(ssDNA)分子を構築した(実施例1を参照されたい)。全ての環状バーコード化鋳型(CBT)は、2つのデザイン仕様を満たした:(1)鋳型を、互いに対して局所的にアライメントした場合に、全ての配列同一性は、それらを固有の識別子として作用させるように、<85%であり、(2)構造は、環状化の後で、塩基対合確率の高い領域を削除するように最適化した。実施例1において明示した通り、Roche Sequencing Solutionsにより操作された、3つの異なるφCPV4DNAポリメラーゼ変異体(以下では、RPolと称する)を利用した。ポリン−ポリメラーゼコンジュゲートを、3つの固有の環状DNA鋳型(RPol:CBT)の各々と複合体化させ、これらを、9つの個別のシーケンシングランのために、最終的にチップへと装填した。例を目的として述べると、バーコードの二次構造は、それらの最小自由エネルギー(「MFE」)値が、−10kcal/モル(例えば、デフォルトの設定を伴う、MATLABのスクリプトである「rnafold」により計算される)を上回る場合、高塩基対合確率を有した。また、それらの開示が、参照によりそれらの全体において本明細書に組み込まれる、Wuchty,S.、Fontana,W.、Hofacker,I.、およびSchuster,P.(1999)、「Complete suboptimal folding of RNA and stability of secondary structures」、Biopolymers、49、145〜165;ならびにMatthews,D.、Sabina,J.、Zuker,M.、およびTurner,D.(1999)、「Expanded sequence dependence of thermodynamic parameter improves prediction of RNA secondary structures」、J.Mol.Biol.、288、911〜940も参照されたい。
【0118】
[0155]ナノポアを通した電流を測定するため、Roche Sequencing Solutionsにより開発された、何千もの個別にアドレス可能な電極を含有する、相補型金属酸化物半導体(CMOS)チップを利用した。この第2世代のプロトタイプでは、測定値は、組込み時に、同じ、タグ付けされたヌクレオチドの反復的検証を可能とする、チャネルにわたるAC波形(+220mV/−10mV)を印加することにより、デューティーサイクルを40%とする、50Hzの周波数で(実施例2を参照されたい)サンプリングした。連鎖的なヌクレオチド付加は、小孔を通した、特徴的な電流レベルにおける、4つのタグ付けされたヌクレオチド全てと関連する、連続的なタグ捕捉イベントとして検出した。各タグは、顕著に異なり、かつ、分離の良好な信号を発生させ、付加される塩基を固有に同定した。記録されたイオン性電流信号は、オフラインモードにおけるデータの収集の後で、Roche Sequencing Solutionsにより開発された、確率論的塩基コールソフトウェアを使用して、生リードへと変換した。各RPol:CBTの組合せについて、1,000を超える品質生リードを収集し、環状鋳型について、多重完全反復を観察した。これらの結果は、ポリメラーゼを、環状鋳型と共に装填することができ、鋳型をシーケンシングしうることを確認した。したがって、CMOSチップ上の鋳型の同定は、実現可能であることが示された。図9Aおよび9Bは、異なるナノポアシーケンシング複合体が、異なる鋳型を、酵素(ここでは、ポリメラーゼ)と会合させる場合であってもなお、各鋳型は、識別および同定されうることを例示する。これらの図は、コントロールと、各ポリメラーゼが、それぞれ、異なる分子バーコードと関連する、3つの異なるポリメラーゼとを使用する、ナノポアシーケンシングアッセイの結果(各塩基である、C、A、G、Tについての)を示す。個別に調べた場合、バーコード鋳型の精度および動態プロファイルは、同等であると観察された。
【0119】
[0156]
実施例4
バーコードの同定
[0157]バーコードの同定についての適性を裏付けるために、バーコードマッチ確率指数(BMPI)として規定される確率スコアであって、バーコードが、測定セット内の他の可能なバーコードと比較して、どのくらい固有に同定されうるのかの相対尺度について記載する確率スコアを算出する、スミス−ウォーターマンによるアライメントベースのバーコード分類アルゴリズムを利用した。まず、それらのリード長が、1回の完全バーコード反復(51塩基)を超えるリード長であり、それらのコンセンサス配列長が、10塩基を超えることを要求することにより品質リードにフィルターをかけた。次いで、本発明者らは、装填されたバーコード化DNA鋳型を同定しうる精度を推定するために、この分類子を使用して、RPol1:CBT1のシーケンシングデータを解析した。フィルターをかけた生リードを、正確な鋳型(CBT1)と比較したところ、計算されたBMPI値の平均は、0.85であった(図3A、左パネルを参照されたい)。これに対し、同じリードを、不正確な鋳型(CBT2およびCBT3)に対してアライメントしたところ、平均BMPI値は、約0.65へと減少した(図3A、左パネル)。このバーコードの同定戦略を使用して、他の2つの環状鋳型に結合させた、同じポリメラーゼ変異体に対しても、それぞれ、RPol1:CBT2およびRPol1:CBT3のシーケンシングデータセットを解析して、同様の分類を実施した。両方の場合について、平均BMPI値は、生リードを、正確な鋳型と比較した場合に、>0.80であり、不正確な鋳型と比較した場合に、<0.80であった(図3A、中パネルおよび右パネル)。同様に、CBT1について示した通り、CBT2およびCBT3のいずれも、ポリメラーゼ変異体を、で確立したシーケンシングアライメント計量に基づき、固有に同定した。次に、各々が、3つずつの固有の環状DNA鋳型を装填された、他の2つのポリン−ポリメラーゼ変異体(RPol2、RPol3)についてのシーケンシングデータセットも、で記載したRPol1の場合と同様に分類した。全ての場合について、ポリメラーゼ変異体に装填されたバーコード化鋳型(図3Bおよび3C)は、同定に成功した。分類子の実行可能性についてさらに調べるために、BMPI値が、特定の生リードについて、>0.80である場合、混同行列を計算することにより、バーコードを誤同定する確率は、約2%だけであることが決定された。この理由で、0.8 BMPIを、バーコードを、高信頼性で同定するための閾値として選択した。この証拠は、>50塩基のリードが得られれば、ポリメラーゼに結合させた鋳型は、BMPI値に基づき同定しうることを裏付ける。
【0120】
[0158]
実施例5
バーコードの置きかえ
[0159]各ポリメラーゼに装填されたDNA鋳型を、CMOSチップ上で同定しうることを確認した後で、ポリン−ポリメラーゼ−鋳型複合体が形成されたら、鋳型を、異なる鋳型で置きかえうるのかどうかを決定した。この仮説について調べるために、RPol2:CBT2複合体をアセンブルし、その後、これを、4つの異なるシーケンシングランのために、チップへと装填した。まず、対照ランを実行したが、ここでは、小孔への挿入の後で、タグ付けされたヌクレオチドだけを添加した。本明細書で記載されるバーコード分類子を援用することにより、生のシーケンシングリードを、正確な鋳型(CBT2)と比較する場合、平均BMPI値が、0.85であることが決定された。これに対し、同じリードを、不正確な鋳型(CBT1)に対してアライメントしたところ、この値は、約0.70へと減少した。既に示した通り、これは、0.8 BMPIを、バーコードの同定のための閾値として使用しうることを確認する。次に、実験の第2のセットでは、5倍モル過剰量の二次バーコード(CBT1)を、ポリン−ポリメラーゼ−鋳型アセンブリーの直後にスパイクインし、これにより、アセンブリー時と同じ反応容量中に存在するバーコードのセットを伴うマルチプレックス状況を模倣した。2つの個別の実験では、この複合体を、添加された二次鋳型が、ポリン−ポリメラーゼに既に結合させた一次鋳型を置きかえるために、2つの異なる持続時間をもたらす、短い(<5分間の)インキュベーション時間の後、および一晩にわたる(約12時間の)インキュベーション時間の後に、膜へと挿入した。次いで、後続のシーケンシング反応のために、タグ付けされたヌクレオチドを添加した。両方の場合について、平均BMPI値は、生リードを、正確な鋳型と比較した場合に、>0.80であり、不正確な鋳型と比較した場合に、<0.80であった。結果は、第2のバーコードを伴う、一晩にわたるインキュベーションの後であってもなお、バーコードの置きかえは生じなかったことを裏付ける。加えて、オンチップのバーコードの置きかえの可能性について調べたが、これは、CMOSチップのシスチャンバーの、同じ反応容量中に、複数のバーコードが存在する、ハイスループット状況を模倣する。この最後の実験では、小孔への挿入の後、第2のバーコード(CBT1)を、タグ付けされたヌクレオチドと共にスパイクインしたときに、バーコードの分類結果は、ポリメラーゼ変異体が、それらのそれぞれのバーコードで固有に標識されることを指し示した。ここでもまた、平均BMPIスコアは、それぞれ、正確な鋳型(CBT2)については、0.80の閾値を上回り、不正確な鋳型(CBT1)については、0.80の閾値を下回った。これは、ポリメラーゼに、バーコードを装填したら、バーコードは、別の鋳型で置きかえられないことを確認した。固有のバーコードを、特定のポリメラーゼ変異体へと割り当てる能力とカップリングさせた、単一のランにおける多数の品質生リードは、複数のポリメラーゼを、スクリーニングすることができ、各ポリメラーゼに装填された、異なる鋳型を識別しうることの信頼性をもたらした。図8A〜8Dは、3つの異なる被験ポリメラーゼについて、ポリメラーゼと会合する鋳型は、複合体を、併せて混合した後であってもなお、交換されなかったことを例示する。これらの図は、バーコード化鋳型を、同じシーケンシングチップ上の異なるポリメラーゼ動態を識別するのに使用しうることを裏付ける、ナノポアシーケンシングアッセイの結果を示す。2つの異なる濃縮戦略(濃縮中および濃縮後)を、3つのポリメラーゼの各セットについて使用したが、差違は観察されなかった。
【0121】
[0160]
実施例6
ポリメラーゼの動態特性
[0161]塩基コール時における、タグ付けされたヌクレオチドの組込みおよびタグの捕捉と関連する、様々な動態パラメータは、単一分子イベントによりもたらされる電気信号から導出することができる。ここでは、滞留時間を、タグ付けされたヌクレオチドが、三元複合体に結合した後であり、かつ、タグの放出までである、全ての動態段階、およびFCRとしての、タグ付けされたヌクレオチドの組込みの全触媒サイクルの速度の関数である、別個の塩基コールのための持続時間として規定した(図4A)。初期試験として、これらの動態パラメータを、固有のCBTを装填された、3つのポリメラーゼ変異体の各々について、図3A〜3Cに示される、既に収集されたシーケンシングデータから計算した。各々が、同じ鋳型を装填された、3つの異なるポリメラーゼの突然変異体を比較し、平均FCRが、装填されたDNA鋳型の配列文脈に関わらず、4つの塩基全て(A、C、T、およびG)について、RPol1について、約0.6秒−1、RPol2について、約1.4秒−1、およびRPol3について、約2.0秒−1であることが決定された(図4B)。同様に、タグ付けされたヌクレオチドの捕捉の、平均滞留時間についての解析もまた、それぞれ、RPol1について、約1.3秒間、RPol2について、約0.7秒間、およびRPol3について、約0.5秒間の算出値を伴うバーコード内容に依存しなかった(図5A、5B、および5C)。これらの結果は、動態パラメータが、ポリメラーゼ変異体の各々について、統計学的に異なり、それらが、バーコード配列の文脈に依存しないことを裏付けた(図4B)。この理由で、異なる鋳型を装填された、3つのポリメラーゼ変異体の各々についてのシーケンシングデータを、下流の解析のための、同じデータセットへと一括した。これは、ポリメラーゼ動態を、鋳型の同定に基づき分類することを可能とする。
【0122】
[0162]
実施例7
主成分分析
[0163]各ポリメラーゼ変異体は、動態パラメータの固有のセットを有したので、これは、ナノポアアレイ上のシーケンシングを使用して、様々なポリメラーゼの突然変異体の間で、動態パラメータを、直接的に識別することへの潜在的可能性を開いた。この可能性について査定するために、主成分分析(PCA)において使用される、3つのさらなる動態パラメータ、すなわち、ヌクレオチドの組込みの後におけるタグ放出速度(TRR)、塩基コール時の単位時間当たりに観察される電流遮断イベントの回数としてのタグ捕捉速度(TCR)、および別個のタグの捕捉の平均持続時間としての、タグ捕捉滞留時間(TCD)、すなわち、AC捕捉時間中の、タグを通すイベントを規定した(図4A)。それらのリード長が、1回の完全バーコード反復を超え、かつ、10回の完全バーコード反復未満であることを要求することにより品質リードにフィルターをかけた。この閾値は、下流の解析における、固有にエラープローンである生リード(ナノポアシーケンシング時に生成される)の存在を最小化した。次いで、20の導出された動態特性、すなわち、4つのタグ付けされたヌクレオチドの各々についての、5つずつの固有の動態パラメータに基づき、PCAを、3つのポリメラーゼ変異体の各々についての、フィルターをかけたシーケンシングデータに対して使用した(例えば、Rpol1についてのPCA係数を示す、下記の表1を参照されたい)。各ポリメラーゼについての動態シグネチャーの、最初の3つの主成分への、PCAベースの2D射影は、別個の分離を示した(図6A、6B、および6C)。したがって、複数の動態パラメータに由来する情報を使用することにより、ポリメラーゼ変異体を、固有に同定しうることが裏付けられた。
【0123】
【表1】
【0124】
[0164]Statistics and Machine Learning Toolbox of MATLAB(2017a、MathWorks、Natick、MA)によるpca関数を使用して、標準的な主成分分析を実行した。ゼロ平均および単位分散を有するように、入力変数をスケーリングし、結果として得られる、第1主成分、第2主成分、および第3主成分を、全データセットから決定した。主成分散布図(図6A〜6C)を作成するために、各ポリメラーゼ変異体についてのシーケンシングデータの全てを、まず、これらの最初の3つの主成分へと射影した。次いで、これらの値を、各主成分についての全てのデータ点のセンタリングおよびスケーリングにより、zスコアへと変換した。
【0125】
[0165]
実施例8
マルチプレックスポリメラーゼの測定
[0166]実施例3〜7は、バーコード化ポリメラーゼスクリーニングの原理を確立した。実際、これらの技法を、定方向進化スキームにおいて使用して、所望の動態特性を伴うポリメラーゼ変異体を見出そうと望みうるであろう。原理の実証として、個別の鋳型結合反応において、ランダム割当て(RPol1:CBT1、RPol2:CBT2、およびRPol3:CBT3)を使用して、3つの、ナノポアとカップリングさせたポリメラーゼ変異体に、固有のssDNA鋳型を装填した。次に、ナノポアとカップリングさせたポリメラーゼ変異体を、等モル比でプールし、シーケンシング反応のために、CMOSチップへと挿入した。コンピュータにより生成された、ランダムな51塩基の配列、および19塩基のユニバーサルフランキングプライミング部位を伴う、ランダムな32マーのバーコード領域からなる第2の鋳型を、コントロール鋳型として使用した。本発明者らのバーコード分類アルゴリズムを利用して、生リードを、2つのランダムな鋳型と対比した、ポリメラーゼに装填された(正確な)鋳型と比較したところ、本発明者らは、平均で、0.8の閾値を上回る、大きなBMPIスコアを見出した。平均BMPI値は、このプールされた実験における、各RPol:CBTについて、約0.70であったが、全生リードのうちの約67%は、元はプールされた3プレックスシーケンシング実験において、ポリメラーゼ変異体へと装填された3つのバーコードのうちのいずれかとして同定されたので、高信頼性のバーコードの同定は、やはり可能であった。
【0126】
[0167]ハイスループットマルチプレックス化の潜在的可能性を探索するために、「シングルプレックス」実験について記載した形状と同じ環形状を伴う、96の、固有のバーコード化合成ssDNA鋳型をデザインした。32塩基のバーコード化領域は、鋳型のうちの任意の1つを、完全なセット内の他の全ての鋳型に対して局所的にアライメントすると、計算された配列同一性が、常に<85%となり、それらが、固有の識別子として作用するように、コンピュータにより構築した。本発明者らは、バーコード分類子は、二次構造の差違に依存しないことを示したので、構造をMFEにより最適化しなかった。これらの鋳型デザインを、高精度のバーコードの同定についてさらに調べるために、本発明者らは、1,000のランダムな品質リードを、「シングルプレックス」シーケンシング実験からサンプリングする、コンピュータによるアルゴリズムを実装し、その後、それらを、実験特異的(正確な)鋳型または本発明者らの96の配列のリストからランダムに選ばれた鋳型(不正確な鋳型)と比較することにより、これらの1,000のランダムな品質リードを分類した。ランダムに選択された品質リードを、正確な鋳型と比較したところ、平均BMPI値は、0.85であった。これに対し、同じリードを、本発明者らのリストからランダムに選択された鋳型と比較したところ、平均BMPI値は、約0.55を下回るようにシフトした。このコンピュータによる試験は、固有に同定可能なポリメラーゼ−バーコード割当てスキームの実現可能性を裏付けた。
【0127】
[0168]次に、実験により、これらのバーコード化鋳型について査定するために、ナノポアとカップリングさせたRPol2に、これらの96の固有のCBTを装填し、その後、これらを、シーケンシング実験のために、脂質二重層へと挿入した。次いで、単一の実験において、装填されたCBTの各々を同定しうる精度を推定するために、分類子を使用して、RPol2:CBT1〜96のシーケンシングデータを解析した。得られた品質リードの各セットを、96のCBTの全てと比較し、BMPIスコアを記録した。0.80の閾値を上回る、スコアが最大のBMPI値は、各比較について、最も可能性が高いバーコード候補を同定した。最大のBMPI値が0.80未満であるリードは、下流の解析から棄却した。このように分類された全てのバーコードをカウントし、ヒストグラム上に表示した。この分類スキームを使用して、1,067の品質生リードを査定することにより、96の可能なバーコード中、合計94のバーコード(98%)を、固有に同定した。平均で、個々のバーコードは、測定時に、少なくとも20回観察された。これらの観察は、ポリン−ポリメラーゼ−鋳型アセンブリー、および測定の前における、複合体の、脂質二重層への挿入の確率的性格により予測される通り、ランダムに分布した。したがって、ポリメラーゼに結合させたバーコード化DNA鋳型は、96プレックス方式で同定しうることが裏付けられた。
【0128】
[0169]大スケールのバーコード同定能を確認した後で、同じ実験において、複数のポリメラーゼについてのマルチプレックス化動態プロファイリングを示すように、本明細書で記載される方法を、さらに査定した。この3つの各々について調べるために、ナノポアとカップリングさせたポリメラーゼ変異体に、個別の鋳型結合反応における、96の固有のCBTについての、本発明者らのライブラリーに由来する、32の鋳型による第1のセット(RPol1:CBT1〜32)、33〜64による第2のセット(RPol2:CBT33〜64)、および65〜96の鋳型による第3のセット(RPol3:CBT65〜96)を装填した。次いで、その後、これらを、等モル比で混合し、シーケンシング反応のために、CMOSチップへと挿入した。96プレックス実験の場合と同じバーコード分類戦略を使用し、予測される通り、ランダム分布の頻度ヒストグラムを得た(図7A)。1,958の品質生リードを査定することにより、96の可能なバーコードの全てを、BMPIカットオフに基づき同定した。個々のバーコードを、平均で、少なくとも20回にわたりサンプリングし、測定時の観察頻度は、2〜68の範囲にわたった。バーコードカウントの不均等な分布(CBT1〜32:低、CBT33〜64:高、CBT65〜96:高)は、3つの異なるポリメラーゼ変異体について既に観察された、プロセッシビティーの差違を反映した。また、調製された3つの複合体の各々について、プールされたシーケンシング反応におけるバーコードの同定特異性を個別に評価する、3つの個別の対照実験も実施した。単一の−ポリメラーゼによる、96プレックス実験の場合と同じ分類スキームを使用して、各セットについて、32の可能なバーコードのうち、RPol1:CBT1〜32については、20のバーコード(63%)を、固有に同定し(品質生リードの数:n=67)、RPol2:CBT33〜64(n=249)およびRPol3:CBT65〜96(n=383)の両方については、29のバーコード(90%)を、固有に同定した(図7B)。RPol1について、個々のバーコードは、その緩慢なプロセッシビティーを反映する、5の平均頻度で観察された。一方、RPol2およびRPol3について、バーコードは、1〜28回の範囲の個別の観察において、平均で少なくとも10回カウントされた。したがって、バーコードは、それらのそれぞれのセット内、約13%だけの平均偽陽性率で、固有に同定しうることが示された。本実施例では、複数の異なるバーコード化鋳型を装填された3つのポリメラーゼ変異体を、96プレックス方式で同定しうることが裏付けられた。
【0129】
[0170]
実施例9
マルチプレックス動態測定
[0171]最後に、本発明者らの方法の、最終的な実際の有用性を裏付けるために、本発明者らは、バーコードシーケンシングデータが、既に決定されたポリメラーゼ変異体の動態特性へと、どのくらい良好にマップバックされたのかを決定しようとした(図6A〜6Cを参照されたい)。まず、バーコードセットの各々(それぞれ、CBT1〜32、CBT33〜64、およびCBT65〜96)において同定されたバーコードの全てを、1つの群内に集成した、の実施例と同様に、20の導出された動態特性に基づき、PCAを、図7Aに示されるマルチプレックスシーケンシングデータに対して使用した。大半の場合、これらのバーコード群の各々についての動態特性の、最初の2つの主成分への2D射影は、個々の「シングルプレックス」RPol−CBT実験から導出された元のPCAクラスターと重ね合わせた場合、良好にマップバックされた(図6A〜6C)。ここでは、クラスターの重合せは、分類子の精度の尺度であり、これは、分類子が、バーコードのシーケンシング情報だけに基づき、ポリメラーゼ変異体の動態を、どのくらい良好に識別しうるのかについて記載した。第2のバーコードセット(CBT33〜64)に対応するシーケンシングデータは、良好にマップバックされなかったが、これは、このセット内のバーコード同定の高偽陽性率に起因しうるであろう。他方、個々のバーコードに対応するシーケンシングデータは、高精度でマップバックしうるが、これは、マルチプレックス実験において、単一のポリメラーゼ変異体を同定する潜在的可能性を強調する。本実施例では、本明細書で記載される、ナノポアベースのバーコードシーケンシング法を適用することにより、動態特性の所望のセットを伴うポリメラーゼ変異体を、固有に同定しうることが示された。これは、所望の動態特性を伴う、定方向進化スキームであって、複数のデザイン(動態特性に影響を及ぼす、鍵となる残基変化)により、反復的に精緻化され、サイクルを構築し(部位特異的突然変異誘発)、サイクルを試験にかけ(ポリメラーゼの突然変異体プールについてのバーコードシーケンシング)うる、定方向進化スキームにおいて、ポリメラーゼ変異体を同定することの、将来的有用性を指し示す。
【0130】
[0172]ナノポア−SBSでは、ポリメラーゼ動態を、鋳型DNAのシーケンシング時に測定したので、さらなる試料調製は、要求されない。結果は、本発明者らが、ポリメラーゼに、環状鋳型を装填し、これらの鋳型をシーケンシングしうることを確認した。同じバーコード化鋳型反復的検証を可能とすることにより、本発明者らは、アライメントベースの分類アルゴリズムを使用する、高感度のバーコード同定を裏付けた。これらのDNA鋳型はまた、本発明者らが、部位特異的突然変異誘発により作製され、固有のバーコード化鋳型を装填された、ポリメラーゼの動態パラメータを識別することも可能とした。最後に、本発明者らは、CMOSチップの、何千もの個別にアドレス可能な小孔における、高マルチプレックス化の潜在的可能性を示した。バーコードシーケンシング情報から得られた、各ポリメラーゼ変異体の、固有の動態シグネチャーは、同じ試料中のそれらの弁別を可能とした。したがって、このナノポアベースのプラットフォームは、DNAポリメラーゼについての、マルチプレックス化スクリーニングツールのための基盤として役立てることができ、所望の分子のイベントを、ナノポアを通るイオン電流の変化の観察と相関させることにより、単一分子酵素活性研究またはタンパク質−タンパク質間相互作用研究における、広範にわたる適用へと、さらに拡張することもできる。
【0131】
[0173]ナノポア−SBSでは、ポリメラーゼ動態を、鋳型DNAのシーケンシング時に測定したので、さらなる試料調製は、要求されない。本明細書で提示された結果は、ポリメラーゼに、環状鋳型を装填し、これらの鋳型をシーケンシングしうることを確認した。同じバーコード化鋳型反復的検証を可能とすることにより、本発明者らは、アライメントベースの分類アルゴリズムを使用する、高感度のバーコード同定を裏付けた。これらのDNA鋳型はまた、本発明者らが、部位特異的突然変異誘発により作製され、固有のバーコード化鋳型を装填された、ポリメラーゼの動態パラメータを識別することも可能とした。最後に、本発明者らは、CMOSチップの、何千もの個別にアドレス可能な小孔における、高マルチプレックス化の潜在的可能性を示した。バーコードシーケンシング情報から得られた、各ポリメラーゼ変異体の、固有の動態シグネチャーは、同じ試料中のそれらの弁別を可能とした。
【0132】
[0174]さらなる実施形態
[0175]本開示の別の態様は、動態特性の所望のセットを有するポリメラーゼを同定する方法であって、(a)(i)膜包埋ナノポアを含む膜を有するナノポアアレイであって、各ナノポアが、環状バーコード化核酸鋳型と複合体化されたポリメラーゼに結合され、それらの各々が、バーコード化された、異なる環状化核酸鋳型と複合体化された、異なるポリメラーゼ変異体に、ナノポアのうちの少なくとも2つが結合されたナノポアアレイ、(ii)膜のシス側における基準電極、および膜のトランス側における個別にアドレス可能な電極アレイ、ならびに(iii)両方の電極と接触させた電解質溶液を含むデバイスを用意するステップと;(b)ナノポアアレイを、ヌクレオチドのセットと接触させるステップであって、タグが、塩基の組込み時に捕捉されると、異なる信号をもたらす、異なるタグを、各ヌクレオチドが有するステップと;(c)ある時間にわたり、異なる信号を検出して、(i)環状バーコード化核酸鋳型のバーコード配列に対応する核酸配列を同定し、(ii)各々が、ナノポアアレイの単一のポリメラーゼに対応する、固有の動態シグネチャーを導出し、これにより、動態特性の所望のセットを有するポリメラーゼを同定するステップを含む方法である。一部の実施形態では、ステップ(c)は、複数回、例えば、少なくとも10回にわたり反復される。一部の実施形態では、(c)の検出するステップは、以下の動態特性:タグ付けされたヌクレオチドの組込みの全触媒サイクルの速度(FCR)、ヌクレオチドの組込みの後におけるタグ放出の速度(TRR)、別個の塩基コールの持続時間(tdwell)、別個のタグの捕捉の平均持続時間(TCD)、および塩基コール時の単位時間当たりに観察される電流遮断イベントの回数(TCR)のうちの少なくとも1つを測定することを含む。
【0133】
[0176]一部の実施形態では、動態特性の所望のセットを有するポリメラーゼは、環状バーコード化核酸鋳型をシーケンシングし、生のシーケンシングリードの集団をもたらし、集団から、バーコード化された直鎖化核酸鋳型の長さより短い長さを有する、シーケンシングリードを除去するステップであって、各生シーケンシングリードが、互いと連結された多重バーコードリードを含有するステップ;任意選択で、以下の式:CM=sup(Lraw/Lbar)[式中、Lrawは、生リードの長さであり、Lbarは、既知のバーコード配列の長さである]により計算される連結乗数(concatenation multiplier)(CM)を使用して、生のシーケンシングリードを、既知のバーコード配列に対してアライメントすることにより、生のシーケンシングリードを、バーコード配列リードへと分類するステップ;プログレッシブ多重配列アライメントアルゴリズムを、バーコード配列リードへと適用し、バーコードアライメントをもたらし、バーコードアライメントに基づき、コンセンサスバーコードをもたらすステップ;およびコンセンサスバーコードを、ステップ(a)のバーコード化された異なる環状化核酸鋳型のバーコードに対してアライメントし、最大のアライメントスコアをもたらし、最大のアライメントスコアに基づき、動態特性の所望のセットを有するポリメラーゼを同定するステップであって、0の最大アライメントスコアが、総ミスマッチを指し示し、1の最大アライメントスコアが、完全なマッチを指し示すステップを含む方法により同定される。一部の実施形態では、生のシーケンシングリードは、100〜100000;100〜10000;100〜1000ヌクレオチド塩基;400〜600ヌクレオチド塩基;または500ヌクレオチド塩基の長さを有する。一部の実施形態では、コンセンサスバーコードは、少なくとも10ヌクレオチドの長さを有する。
【0134】
[0177]一部の実施形態では、環状バーコード化核酸鋳型は、プライマーへとアニーリングされる。一部の実施形態では、膜は、脂質二重層である。一部の実施形態では、ポリメラーゼは、DNAポリメラーゼである。一部の実施形態では、異なるポリメラーゼは、同じ種類のポリメラーゼの変異体である。一部の実施形態では、異なるポリメラーゼは、異なる種類のポリメラーゼである。一部の実施形態では、ナノポアアレイは、少なくとも10の異なるポリメラーゼを含む。一部の実施形態では、ナノポアアレイは、少なくとも50の異なるポリメラーゼを含む。一部の実施形態では、ナノポアアレイは、10〜100,000の異なるポリメラーゼを含む。一部の実施形態では、ステップ(c)(i)の核酸配列は、確率論的塩基コールアルゴリズムを使用して、異なる信号からもたらされる。
【0135】
[0178]一部の実施形態では、バーコード化された核酸鋳型は、(a)一本鎖核酸鋳型の集団を用意するステップであって、各一本鎖核酸鋳型が、プライマー配列に挟まれた固有のバーコード配列を含むステップ;(b)高い塩基対合確率を有する、一本鎖核酸鋳型のうちの1つまたは複数の領域を削除するステップ;および(c)一本鎖核酸鋳型の部分集団を選択するステップであって、部分集団の各固有のバーコード配列が、部分集団の他の任意の固有のバーコード配列と同一ではないステップを含む方法により作製される。
【0136】
[0179]本開示の別の態様は、(a)膜包埋ナノポアを含む膜を有するナノポアアレイであり、各異なるポリメラーゼが、バーコード化された異なる環状化核酸鋳型と複合体化された、異なるポリメラーゼに、少なくとも2つのナノポアが結合されたナノポアアレイ、(b)膜のシス側における基準電極、および膜のトランス側における個別にアドレス可能な電極アレイ、ならびに(c)両方の電極と接触させた電解質溶液を含むデバイスである。一部の実施形態では、デバイスは、ヌクレオチドのセットをさらに含み、各ヌクレオチドは、タグが、塩基の組込み時に、アレイのナノポア内に捕捉されると、異なる信号をもたらす、異なるタグを有する。一部の実施形態では、環状バーコード化核酸鋳型は、プライマーへとアニーリングされる。一部の実施形態では、膜は、脂質二重層である。一部の実施形態では、ポリメラーゼは、DNAポリメラーゼである。一部の実施形態では、異なるポリメラーゼは、同じ種類のポリメラーゼの変異体である。一部の実施形態では、異なるポリメラーゼは、異なる種類のポリメラーゼである。一部の実施形態では、ナノポアアレイは、少なくとも10の異なるポリメラーゼを含む。一部の実施形態では、ナノポアアレイは、少なくとも50の異なるポリメラーゼを含む。一部の実施形態では、ナノポアアレイは、10〜100,000の異なるポリメラーゼを含む。
【0137】
[0180]本開示の別の態様は、(i)膜包埋ナノポアを含む膜を有するナノポアアレイ、ならびに(ii)膜のシス側における基準電極、および膜のトランス側における個別にアドレス可能な電極アレイを含むデバイスと;各々が、バーコード化された異なる環状化核酸鋳型を装填されるか、またはこれと複合体化された、異なるポリメラーゼのセットとを含むキットである。一部の実施形態では、キットは、ヌクレオチドのセットをさらに含み、各ヌクレオチドは、タグが、アレイのナノポア内に捕捉されると、異なる信号をもたらす、異なるタグを有する。一部の実施形態では、キットは、電解質溶液をさらに含む。一部の実施形態では、異なるポリメラーゼのセットは、少なくとも10の異なるポリメラーゼを含む。
【0138】
[0181]本開示の別の態様は、バーコード化された核酸鋳型を作出するための方法であって、(a)一本鎖核酸鋳型の集団を用意するステップであって、各一本鎖核酸鋳型が、プライマー配列に挟まれた固有のバーコード配列を含むステップ;(b)任意選択で、高い塩基対合確率を有する、一本鎖核酸鋳型のうちの少なくとも1つの領域を削除するステップであって、高い塩基対合確率が、MATLABのスクリプトである「rnafold」により計算される−10kcal/モルを上回る最小自由エネルギー(MFE)値であるステップ、および(c)一本鎖核酸鋳型の部分集団を選択するステップであって、部分集団の各固有のバーコード配列が、部分集団の他の任意の固有のバーコード配列と同一ではないステップを含む方法である。一部の実施形態では、ステップ(b)は、部分集団の固有のバーコード配列と関連するMFEを決定し、MFEに基づき閾値を選択するステップ、および閾値に基づき1つまたは複数の領域を削除するステップを含む。
【0139】
[0182]一部の実施形態では、固有のバーコード配列は、20〜50ヌクレオチド、または30〜40ヌクレオチドの長さを有する。一部の実施形態では、プライマー配列は、互いに対して少なくとも95%同一であるか、または互いに対して100%同一である。一部の実施形態では、プライマー配列の長さは、10〜30ヌクレオチド、または20〜25ヌクレオチドである。一部の実施形態では、集団および/または部分集団の一本鎖核酸鋳型は、40〜200ヌクレオチド、40〜100、または45〜55ヌクレオチドの長さを有する。一部の実施形態では、部分集団は、固有のバーコード配列を含む、少なくとも100、少なくとも1000、少なくとも10000、または少なくとも100,000の一本鎖核酸鋳型を含む。一部の実施形態では、方法は、部分集団の一本鎖核酸鋳型を環状化するステップをさらに含む。
【0140】
[0183]一部のナノポアベースのシーケンシングを使用して、複数の異なる酵素変異体をスクリーニングする方法であって、複数の異なるナノポアシーケンシング複合体を含むバイオチップを得るステップであって、複数の異なるナノポアシーケンシング複合体のうちの各異なるナノポアシーケンシング複合体が、固有の分子バーコードを有するポリヌクレオチドを含み、異なるナノポアシーケンシング複合体のうちの少なくとも2つが、異なる酵素変異体を含むステップ;チップへと装填された各異なるナノポアシーケンシング複合体についてのシーケンシングデータセットを生成するステップ;異なるナノポアシーケンシング複合体のポリヌクレオチド内に含まれる固有の分子バーコードの同定に基づき、生成されたシーケンシングデータセットの各々を、複数の異なる酵素変異体のうちの1つの異なる酵素変異体と関連するものとして分類するステップ;および複数の異なる酵素変異体のうちの酵素変異体の1つずつについて、複数のパラメータを導出するステップであって、異なる酵素変異体の1つずつについての複数のパラメータが、異なる酵素変異体のうちのそれぞれの1つと関連する、分類された配列データセットに基づき導出されるステップを含む方法である。環状化された鋳型が利用される実施形態では、生成されたシーケンシングデータセットの各々は、(a)バーコード化された直鎖化核酸鋳型の長さより短い長さを有する、生成されたシーケンシングデータセットから、シーケンシングリードを除去することであり、各生シーケンシングリードが、互いと連結された多重バーコードリードを含有する、除去すること;(b)任意選択で、以下の式:CM=sup(Lraw/Lbar)、[式中、Lrawは、生リードの長さであり、Lbarは、既知のバーコード配列の長さである]により計算される連結乗数(CM)を使用して、生のシーケンシングリードを、既知の(コントロール)バーコード配列に対してアライメントすることにより、シーケンシングデータセット内の生のシーケンシングリードを、バーコード配列リードへと分類すること;プログレッシブ多重配列アライメントアルゴリズムを、バーコード配列リードへと適用し、バーコードアライメントをもたらし、バーコードアライメントに基づき、コンセンサスバーコードをもたらすこと;コンセンサスバーコードを、シーケンシングデータセットが生成されたナノポアシーケンシング複合体の異なる鋳型のバーコードに対してアライメントすることであり、0の最大アライメントスコアが、総ミスマッチを指し示し、1の最大アライメントスコアが、完全なマッチを指し示す、アライメントすることにより、特定の酵素と関連するものとして分類される。
【0141】
[0184]一部の実施形態では、かつ、ポリメラーゼ−ナノポア系を使用して、環状鋳型を同定しうるのかどうかについて調べるために、共通の19塩基のプライマー領域により挟まれた、固有の32塩基のバーコード領域からなる、3つの合成一本鎖DNA(ssDNA)分子をデザインした。CircLigaseまたはプライマー領域を、スプリントとして利用するT4リガーゼを使用して、ssDNAを環状化させ、次いで、同じユニバーサルのプライマーによりプライミングして、環状バーコード化鋳型(CBT)を作出した。全てのCBTは、2つのデザイン仕様を満たした:(1)鋳型を、互いに対して局所的にアライメントした場合に、全ての配列同一性は、それらを固有の識別子として作用させるように、<85%であり、(2)構造は、環状化の後で、塩基対合確率の高い領域を削除するように最適化した。
【0142】
[0185]一部の実施形態では、バーコードの同定についての適性を裏付けるために、以下では、バーコードマッチ確率指数(BMPI)として規定される確率スコアであって、バーコードが、測定セット内の他の可能なバーコードと比較して、どのくらい固有に同定されうるのかの相対尺度について記載する確率スコアを算出する、スミス−ウォーターマンによるアライメントベースのバーコード分類アルゴリズムを実装した。まず、それらのリード長が、1回の完全バーコード反復(51塩基)を超え、かつ、10回の完全バーコード反復未満のリード長であり、それらのコンセンサス配列長が、10塩基を超えることを要求することにより品質リードにフィルターをかけた。
【0143】
[0186]一部の実施形態では、市販の確率論的塩基コールアルゴリズム(version 2.9.2、Roche Sequencing Solutions、Santa Clara、CA)を使用して、電圧信号イベントを、生リードへと変換した。次いで、1回の完全バーコード反復(51塩基)を超えるリード長を伴う生リードを、BMPI値を、このリードへと割り当てる、スミス−ウォーターマン(SW)によるアライメントベースのバーコード分類アルゴリズムへの入力としてフィードした。より具体的に、第1のステップは、生環状リード内の異なる領域を、バーコードリードへと分類することであった。これは、生リード配列を、既知の連結されたバーコード配列に対して局所的にアライメントすることにより達成され、ここで、連結乗数(CM)は、以下の式:
[0187]CM=sup(Lraw/Lbar)
[0188][式中、Lrawは、生リードの長さであり、Lbarは、バーコードの長さであり、CMは、整数である]
により計算される。全てのバーコード反復境界を同定したら、本発明者らは、Bioinformatics Toolbox of MATLAB(2017a、MathWorks、Natick、MA)によるマルチアライン関数を利用して、反復されるバーコード配列の、プログレッシブ多重アライメントを実施した。次に、本発明者らは、seqconsensusを使用して、これらの多重アライメントされたリードのコンセンサス配列を生成し、コンセンサス配列の長さが、少なくとも10塩基である場合、これを、後で、実験セット内の全ての潜在的なバーコードに対して局所的にアライメントした。最後に、スコアが最大の(SW)アライメントは、特定の入力配列に基づき査定される、最も可能性が高いバーコード候補を同定した。このスコアは、BMPIとして規定されたが、[0,1]の可能な範囲[範囲中、0は、全くのミスマッチを意味し、1は、全くのマッチを描示する]で、バーコード同定確率を測定するのに使用される。全てのアライメントについて、鋳型内のホモポリマー配列と、生のシーケンシングリード内の同じヌクレオチドについて反復される塩基コールとは、単一の塩基であると考えた。
【0144】
[0189]本明細書内および/または出願データシート内で言及される、米国特許、米国特許出願公開、米国特許出願、外国特許、外国特許出願、および非特許刊行物の全ては、参照によりそれらの全体において本明細書に組み込まれる。必要な場合、実施形態の態様は、多様な特許、出願、および刊行物の概念を援用して、さらなる実施形態をもたらすように改変されうる。
【0145】
[0190]多数の例示的な実施形態を参照しながら、本開示について記載してきたが、当業者は、本開示の原理の精神および範囲内に収まる、多数の他の改変および実施形態を案出しうることを理解されたい。より特定すると、本開示の精神から逸脱しない限りにおいて、前出の開示、図面、および添付された特許請求の範囲内の、対象の組合せの構成要素部分および/または配置における、妥当な変動および改変は可能である。構成要素部分および/または配置における、妥当な変動および改変に加えて、代替的な使用もまた、当業者に明らかであろう。
【図1A】
【図1B】
【図2】
【図3】
【図4A】
【図4B】
【図5A】
【図5B】
【図5C】
【図6A】
【図6B】
【図6C】
【図7A】
【図7B】
【図8A】
【図8B】
【図8C】
【図8D】
【図9A】
【図9B】
【図10】
【図11】
【図12】
【図13】
【手続補正書】
【提出日】2020年4月1日
【手続補正1】
【補正対象書類名】特許請求の範囲
【補正対象項目名】全文
【補正方法】変更
【補正の内容】
【特許請求の範囲】
【請求項1】
ナノポアベースのシーケンシングを使用して、複数の異なる酵素変異体をスクリーニングする方法であって、
a.複数の異なるナノポアシーケンシング複合体を含むバイオチップを得るステップであって、前記複数の異なるナノポアシーケンシング複合体のうちの各異なるナノポアシーケンシング複合体が、固有の分子バーコードを有するポリヌクレオチドを含み、前記異なるナノポアシーケンシング複合体のうちの少なくとも2つが、異なる酵素変異体を有するものである、前記ステップ;
b.チップへと装填された各異なるナノポアシーケンシング複合体についてのシーケンシングデータセットを生成するステップ;
c.前記異なるナノポアシーケンシング複合体のポリヌクレオチド内に含まれる固有の分子バーコードの同定に基づき、生成されたシーケンシングデータセットの各々を、複数の異なる酵素変異体のうちの1つの異なる酵素変異体と関連するものとして分類するステップ;および
d.前記複数の異なる酵素変異体のうちの酵素変異体の1つずつについて、複数のパラメータを導出するステップであって、前記異なる酵素変異体の1つずつについての複数のパラメータが、異なる酵素変異体のうちのそれぞれの1つと関連する、分類された配列データセットに基づき導出されるものである、前記ステップ;
を含む、前記方法。
【請求項2】
異なるナノポアシーケンシング複合体内に含まれる固有の分子バーコードの同定が、(i)最小限の閾値塩基長を満たすように、品質リードにフィルターをかけること;(ii)自動化されたアライメントベースのアルゴリズムを使用して、確率スコアを導出すること;および(iii)算出された前記確率スコアが、所定の閾値確率スコア値を少なくとも満たすのかどうかを査定することを含む、請求項1に記載の方法。
【請求項3】
所定の閾値確率スコア値が、0.80である、請求項2に記載の方法。
【請求項4】
自動化されたアライメントベースの分類アルゴリズムが、(i)生リード内の全てのバーコード反復境界を同定し;(ii)前記反復境界を、個々のバーコードリードへと分割し;(iii)コンセンサスバーコードをアライメントから生成するのに、自動化多重配列アライメントアルゴリズムを使用して個々のバーコードリードをアライメントし;(iv)生成されたコンセンサスバーコードを、スクリーニングにおいて利用された全ての可能なバーコードに対して局所的にアライメントし;(v)最も可能性が高いバーコード候補を、配列同一性に基づき同定することにより、確率スコアを導出する、請求項3に記載の方法。
【請求項5】
1つの異なる酵素変異体と関連するものとして分類された、単一の配列データセットが、この1つの異なる酵素変異体についての複数のパラメータを導出するのに利用される、請求項1に記載の方法。
【請求項6】
1つの異なる酵素変異体と関連するものとして分類された、少なくとも2つの配列データセットが、この1つの異なる酵素変異体についての複数のパラメータを導出するのに利用される、請求項1に記載の方法。
【請求項7】
異なる酵素変異体の1つずつについての複数のパラメータが、滞留時間、タグ付けされたヌクレオチドの組込みの全触媒サイクルの速度、ヌクレオチドの組込みの後におけるタグ放出速度、タグ捕捉速度、およびタグ捕捉滞留時間からなる群から選択される、請求項1に記載の方法。
【請求項8】
複数のパラメータが、各異なるヌクレオチド種類について導出される、請求項7に記載の方法。
【請求項9】
複数の異なる酵素変異体のうちの異なる酵素変異体の1つずつについて導出された複数のパラメータに対して主成分分析を実施するステップをさらに含む、請求項8に記載の方法。
【請求項10】
少なくとも1つのヌクレオチドについてのプロセッシビティー速度が、複数の異なる酵素変異体のうちの第1の異なる酵素変異体について、複数の異なる酵素変異体のうちの第2の異なる酵素変異体と比較して変更されるのかどうかを査定するステップをさらに含む、請求項8に記載の方法。
【請求項11】
査定が、第1の異なる酵素変異体の複数のパラメータのうちの少なくとも1つのパラメータを、第2の異なる酵素変異体の同じ少なくとも1つのパラメータと比較するステップを含む、請求項10に記載の方法。
【請求項12】
酵素が、ポリメラーゼまたは逆転写酵素である、請求項1に記載の方法。
【請求項13】
酵素が、ポリメラーゼである、請求項1に記載の方法。
【請求項14】
ナノポアベースのシーケンシングを使用して、少なくとも2つの酵素変異体をスクリーニングする方法であって、
複数の個別にアドレス可能なナノポアを含むバイオチップを得るステップであって、得られたバイオチップが、少なくとも第1および第2の異なるナノポアシーケンシング複合体を含み、前記第1のナノポアシーケンシング複合体が、第1の酵素変異体および第1のポリヌクレオチドを含み、前記第2のナノポアシーケンシング複合体が、第2の酵素変異体および第2のポリヌクレオチドを含み、前記第1および第2のポリヌクレオチドが、各々、異なる分子バーコードを含み、前記第1および第2の酵素変異体が異なるものである、前記ステップ;
第1および第2のナノポアシーケンシング複合体の少なくとも各々について、シーケンシングデータセットを生成するステップ;
生成されたシーケンシングデータセットの各々を、少なくとも第1の酵素変異体または第2の酵素変異体と関連するものとして分類するステップであって、配列データセットが、各々、第1および第2のポリヌクレオチドと共に含まれる少なくとも固有の分子バーコードの同定に基づき、少なくとも第1の酵素変異体または第2の酵素変異体と関連するものとして分類される、前記ステップ;ならびに
第1の酵素変異体または第2の酵素変異体と関連するものとして分類されたデータセットに基づき、第1および第2の酵素変異体の各々について、複数の動態パラメータを導出するステップ;
を含む、前記方法。
【請求項15】
ナノポアベースのシーケンシングを使用して、複数の異なるナノポア変異体をスクリーニングする方法であって、
a.複数の異なるナノポアシーケンシング複合体を含むバイオチップを得るステップであって、複数の異なるナノポアシーケンシング複合体のうちの各異なるナノポアシーケンシング複合体が、固有の分子バーコードを有するポリヌクレオチドを含み、異なるナノポアシーケンシング複合体のうちの少なくとも2つが、異なるナノポア変異体を有する、前記ステップ;
b.チップへと装填された各異なるナノポアシーケンシング複合体についてのシーケンシングデータセットを生成するステップ;
c.異なるナノポアシーケンシング複合体のポリヌクレオチド内に含まれる固有の分子バーコードの同定に基づき、生成されたシーケンシングデータセットの各々を、複数の異なるナノポア変異体のうちの1つの異なるナノポア変異体と関連するものとして分類するステップ;および
d.複数の異なるナノポア変異体のうちのナノポア変異体の1つずつについて、複数のパラメータを導出するステップであって、異なるナノポア変異体の1つずつについての複数のパラメータが、異なるナノポア変異体のうちのそれぞれの1つと関連する、分類された配列データセットに基づき導出される、前記ステップ;
を含む、前記方法。
【国際調査報告】

[広告欄]

ログインすれば広告は減ります

ログインすれば広告は減ります