特表2026-532954IP Force 特許公報全文掲載

(19)【発行国】日本国特許庁(JP)
(12)【公報種別】公表特許公報(A)
(11)【公表番号】
(43)【公表日】
(54)【発明の名称】検索方法、データ検索装置、電子デバイス並びにコンピュータプログラム
(51)【国際特許分類】
   
【FI】
【審査請求】有
【予備審査請求】未請求
(21)【出願番号】
(86)(22)【出願日】
(85)【翻訳文提出日】
(86)【国際出願番号】
(87)【国際公開番号】
(87)【国際公開日】
(31)【優先権主張番号】202311387363.0
(32)【優先日】
(33)【優先権主張国・地域又は機関】
(81)【指定国・地域】
(71)【出願人】
【識別番号】517392436
【氏名又は名称】▲騰▼▲訊▼科技(深▲セン▼)有限公司
【氏名又は名称原語表記】TENCENT TECHNOLOGY (SHENZHEN) COMPANY LIMITED
【住所又は居所原語表記】35/F,Tencent Building,Kejizhongyi Road,Midwest District of Hi-tech Park,Nanshan District, Shenzhen,Guangdong 518057,CHINA
(74)【代理人】
【識別番号】100110364
【弁理士】
【氏名又は名称】実広 信哉
(74)【代理人】
【識別番号】100150197
【弁理士】
【氏名又は名称】松尾 直樹
(72)【発明者】
【氏名】▲栄▼ ▲ユ▼
(72)【発明者】
【氏名】▲呉▼ 黎明
(72)【発明者】
【氏名】▲呉▼ 凡迪
(72)【発明者】
【氏名】黄 文炳
(57)【要約】
検索方法、データ検索装置、電子デバイス、コンピュータ読み取り可能な記憶媒体、並びにプログラム製品に関する。係る検索方法は、入力オブジェクトに対応するグラフデータを取得するステップであって、前記グラフデータには、少なくとも1つのノード及び各ノードに対応するノードデータが含まれるステップと、グラフエンコーダを用いて前記グラフデータを符号化及び離散化し、前記入力オブジェクトに対応するデータシーケンスを取得するステップであって、前記データシーケンスは、符号化後に得られた各ノードのノード特徴及び位置特徴のうちの少なくとも1つの離散化情報を表すのものであるステップと、グラフデータベースから、前記データシーケンスと所定の類似度閾値を満たす目標データシーケンスを検索するとともに、検索した目標データシーケンスに基づいて、前記入力オブジェクトと類似する出力オブジェクトを特定するステップとを含む。本開示では、3次元空間構造を有する入力オブジェクトに関連付けられたグラフデータがグラフエンコーダによって符号化され、十分に正確なデータシーケンスが生成されるため、3次元構造及び/又はノード特徴において入力オブジェクトと類似する出力オブジェクトをグラフデータベースから精度良く検出することができる。
【特許請求の範囲】
【請求項】
入力オブジェクトに対応するグラフデータを取得するステップであって、前記グラフデータには、少なくとも1つのノード及び各ノードに対応するノードデータが含まれるステップと、
グラフエンコーダを用いて前記グラフデータを符号化及び離散化し、前記入力オブジェクトに対応するデータシーケンスを取得するステップであって、前記データシーケンスは、符号化後に得られた各ノードのノード特徴及び位置特徴のうちの少なくとも1つの離散化情報を表すためものであるステップと、
前記グラフデータベースから、前記データシーケンスと所定の類似度閾値を満たす目標データシーケンスを検索し、検索した目標データシーケンスに基づいて、前記入力オブジェクトと類似する出力オブジェクトを特定するステップと、
を含む、ことを特徴とする検索方法。
【請求項】
前記入力オブジェクトは、3次元空間において3次元的に配置された複数の内部コンポーネントを有し、前記入力オブジェクトに対応するグラフデータ内の各ノードは、前記入力オブジェクトの1つ以上の内部コンポーネントに対応し、前記各ノードに対応するノードデータには、3次元空間における前記ノードの位置情報が含まれる、ことを特徴とする請求項1に記載の検索方法。
【請求項】
前記グラフデータには、ノード間に接続されたエッジデータであって、前記入力オブジェクト内の2つの内部コンポーネント間の関連付け関係を表すためのエッジデータがさらに含まれる、ことを特徴とする請求項2に記載の検索方法。
【請求項】
前記入力オブジェクトに対応するグラフデータは、回転同変性、並進同変性、及びスケーリング同変性のうちの少なくとも1つを満たす、ことを特徴とする請求項1~3のいずれか一項に記載の方法。
【請求項】
前記入力オブジェクトがタンパク質である場合に、入力オブジェクトに対応するグラフデータを取得する前記ステップは、
前記タンパク質に含まれる複数のアミノ酸配列情報に基づいて、前記入力オブジェクトに対応するグラフデータ内の各ノード及びそのノードデータを特定するステップであって、各ノードには1つのアミノ酸が対応し、各ノードに対応するノードデータには、前記アミノ酸の主鎖上の各原子の種類情報と、3次元空間における各原子の座標が含まれるステップと、
前記グラフデータ内の各ノードのノードデータに基づいて、前記グラフデータ内の各エッジデータを特定するステップと、
を含む、ことを特徴とする請求項1~4のいずれか一項に記載の方法。
【請求項】
前記グラフデータ内の各ノードのノードデータに基づいて、前記グラフデータ内の各エッジデータを特定する前記ステップは、
2つのアミノ酸の原子間の化学結合に基づいて、前記化学結合に対応するエッジデータを作成し格納するステップ、又は、
2つのアミノ酸の原子間の距離が所定の閾値未満であることに基づいて、2つのアミノ酸の原子を接続するエッジデータを作成し格納するステップ
を含む、ことを特徴とする請求項5に記載の検索方法。
【請求項】
前記グラフエンコーダには、同変なグラフニューラルネットワークモデル及び離散化器が含まれる場合に、グラフエンコーダを用いてグラフデータを符号化及び離散化する前記ステップは、
前記同変なグラフニューラルネットワークモデルを用いて、前記グラフデータを符号化し、前記グラフデータ内の各ノードのノード特徴及び位置特徴を取得するステップと、
前記離散化器を用いて、前記各ノードの前記ノード特徴及び位置特徴のうちの少なくとも1つをベクトル量子化し、前記各ノードのノード特徴及び位置特徴のうちの少なくとも1つの離散化情報を表すためのデータシーケンスを取得するステップと、
を含む、ことを特徴とする請求項1~6のいずれか一項に記載の方法。
【請求項】
前記同変なグラフニューラルネットワークモデルには、各ノードのノード特徴ベクトル及び空間位置ベクトルを符号化するための複数の隠れ層又はパーセプトロンが含まれる場合に、1番目の隠れ層又はパーセプトロンを除く各隠れ層又はパーセプトロンの符号化は、
前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記グラフデータ内の第1ノード及び第2ノードが符号化されたノード特徴ベクトル及び位置特徴ベクトルを取得するステップと、
前記ノード特徴ベクトル及び位置特徴ベクトルに基づいて、前記第2ノードから前記第1ノードへの伝播メッセージを特定するステップと、
前記伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって符号化されたノード特徴ベクトル及び位置特徴ベクトルを特定するステップと、
を含む、ことを特徴とする請求項7に記載の方法。
【請求項】
前記ノード特徴ベクトル及び位置特徴ベクトルに基づいて、前記第2ノードから前記第1ノードへの伝播メッセージを特定する前記ステップは、
前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記第1ノード及び前記第2ノードが符号化された位置特徴ベクトルに基づいて、前記第1ノードと前記第2ノード間の同変性特徴ベクトルを特定するステップと、
前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記グラフデータ内の第1ノード及び前記第2ノードが符号化されたノード特徴ベクトル、前記第1ノードと前記第2ノード間の同変性特徴ベクトル、及び前記第1ノードと第2ノード間のエッジデータに基づいて、前記第2ノードから前記第1ノードへの伝播メッセージを特定するステップと、
を含む、ことを特徴とする請求項8に記載の方法。
【請求項】
前記第1ノードが複数の前記第2ノードに隣接する場合に、前記伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって符号化されたノード特徴ベクトルを特定する前記ステップは、
複数の前記第2ノードから前記第1ノードへの複数の伝播メッセージを取得するステップと、
前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記グラフデータ内の第1ノードが符号化されたノード特徴ベクトル及び前記複数の伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって前記第1ノードが符号化されたノード特徴ベクトルを特定するステップと、
を含む、ことを特徴とする請求項9に記載の方法。
【請求項】
前記第1ノードが複数の前記第2ノードに隣接する場合に、前記伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって符号化された位置特徴ベクトルを特定する前記ステップは、
複数の前記第2ノードから前記第1ノードへの複数の伝播メッセージを取得するステップと、
前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記グラフデータ内の第1ノード及び複数の前記第2ノードが符号化された位置特徴ベクトル及び前記複数の伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって前記第1ノードが符号化された位置特徴ベクトルを特定するステップと、
を含む、ことを特徴とする請求項8~10のいずれか一項に記載の方法。
【請求項】
グラフデータベースから、前記データシーケンスと所定の類似度閾値を満たす目標データシーケンスを検索する前記ステップは、
動的計画法を用いて、前記データシーケンスを前記グラフデータベース内の他のデータシーケンスと比較し、前記データシーケンスと前記グラフデータベース内の他のデータシーケンスとの間の局所的な類似度を示す比較結果を取得するステップと、
前記比較結果に基づいて、入力オブジェクトと類似する出力オブジェクトを特定するステップと、
を含む、ことを特徴とする請求項1~11のいずれか一項に記載の方法。
【請求項】
前記グラフエンコーダの訓練は、
前記グラフデータ内の各ノードに対応するノードデータに基づいて、訓練中のグラフエンコーダを用いて、各ノードの予測カテゴリ値を特定するステップと、
前記各ノードの予測カテゴリ値及び前記各ノードの実際のカテゴリ値に基づいて、カテゴリ予測損失を特定するステップと、
前記カテゴリ予測損失に基づいて、前記グラフエンコーダのニューラルネットワークパラメータを調整するステップと、
を含む、ことを特徴とする請求項1~12のいずれか一項に記載の方法。
【請求項】
グラフデコーダを用いて前記グラフエンコーダの訓練を支援する場合に、前記グラフエンコーダの訓練は、
前記グラフデータ内の各ノードに対応するノードデータに基づいて、訓練中のグラフエンコーダを用いて各ノードの予測隠れ表現を特定するステップと、
前記各ノードの予測隠れ表現に基づいて、訓練中のグラフデコーダーを用いて前記各ノードの復元位置情報を特定するステップと、
前記各ノードの3次元空間における位置情報及び前記各ノードの復元位置情報に基づいて、位置不一致損失を特定するステップと、
前記位置不一致損失に基づいて、前記グラフエンコーダー及び/又は前記グラフデコーダーのニューラルネットワークパラメータを調整するステップと、
を含む、ことを特徴とする請求項13に記載の方法。
【請求項】
入力オブジェクトに対応するグラフデータを取得するステップであって、前記グラフデータには、少なくとも1つのノード及び各ノードに対応するノードデータが含まれるステップを実行するように構成されたグラフデータ構築モジュールと、
グラフエンコーダを用いて前記グラフデータを符号化及び離散化し、前記入力オブジェクトに対応するデータシーケンスを取得するステップであって、前記データシーケンスは、符号化後に得られた各ノードのノード特徴及び位置特徴のうちの少なくとも1つの離散化情報を表すためのものであるステップを実行するように構成された符号化モジュールと、
前記グラフデータベースから、前記データシーケンスと所定の類似度閾値を満たす目標データシーケンスを検索するとともに、検索した目標データシーケンスに基づいて、前記入力オブジェクトと類似する出力オブジェクトを特定するステップを実行するように構成された比較モジュールと、
を備える、ことを特徴とするデータ検索装置。
【請求項】
1つ以上のプロセッサと、1つ以上のメモリとを備え、前記メモリにはコンピュータ実行可能なプログラムが記憶されており、前記コンピュータ実行可能なプログラムが前記プロセッサによって実行されると、請求項1~14のいずれか一項に記載の方法が実現される、ことを特徴とする電子デバイス。
【請求項】
コンピュータ命令を格納したコンピュータ読み取り可能な記憶媒体であって、前記コンピュータ命令が前記プロセッサによって実行されると、請求項1~14のいずれか一項に記載の方法が実現される、ことを特徴とするコンピュータ読み取り可能な記憶媒体。
【請求項】
コンピュータ命令を含むコンピュータプログラム製品であって、前記コンピュータ命令がプロセッサによって実行されると、請求項1~14のいずれか一項に記載の方法が実現される、コンピュータプログラム製品。
【発明の詳細な説明】
【技術分野】
【】
人工知能(Artificial Intelligence、AI)サービス及びクラウドコンピューティングの技術分野に関し、より具体的には、検索方法、データ検索装置、電子デバイス、コンピュータ読み取り可能な記憶媒体、並びにプログラム製品
【背景技術】
【】
AI技術の急速な発展に伴い、AIは医薬品開発分野において大きな応用展望及び応用可能性を見せている。深層学習を基盤とするAIアルゴリズムは、膨大なライフサイエンスデータを効率的に解析し、タンパク質の配列及び構造を正確にモデリング・予測することが可能となるため、新しい医薬品の発見に対して強力な技術サポートを提供している。例えば、創薬におけるスクリーニングでは、AIを活用して数万種の化合物ライブラリから探索し、疾患の関連創薬標的分子により強く結合する潜在的薬物分子を発見することができる。これにより、創薬サイクルが大幅に短縮される。また、AIはウイルスのタンパク質変異を解析し、その薬効への影響を予測し、新型ウイルス株に対して同等の効果を持つ医薬品を設計するためにも活用できる。今後、新薬開発におけるAIの応用はさらなる拡大を続け、医薬品の設計から、薬効予測、臨床試験の設計に至るまでプロセス全体に対するインテリジェントな支援を提供することが期待されている。
【】
しかしながら、AIの活用による新薬開発においては、いくつかの技術的なボトルネックがまだ存在している。まず、既存のAIに基づく医薬品発見モデルによる予測精度が低下するため、有効な候補化合物のスクリーニングには不十分である。また、AIに基づく医薬品発見モデルのほとんどは構造が複雑で、演算には膨大な計算リソースが必要となるため、訓練や予測の速度が遅く、効率が低すぎる。さらに、現在、統合化されたオンライン医薬品発見プラットフォームが構築されていないため、開発者はオンラインで医薬品(特に複雑なタンパク質構造を持つ医薬品)を直接探索し、可視化結果を得ることが困難であり、開発者にとって不便になるという問題がある。
【】
そこで、関連技術のさらなる改善が必要とされている。
【発明の概要】
【課題を解決するための手段】
【】
本開示の実施形態によれば、検索方法、データ検索装置、電子デバイス、並びにコンピュータ読み取り可能な記憶媒体が提供される。
【】
本開示の一実施形態によれば、グラフデータベースから入力オブジェクトを検索するための検索方法が提供される。前記検索方法は、入力オブジェクトに対応するグラフデータを取得するステップであって、前記グラフデータには、少なくとも1つのノード及び各ノードに対応するノードデータが含まれるステップと、グラフエンコーダを用いて前記グラフデータを符号化及び離散化し、前記入力オブジェクトに対応するデータシーケンスを取得するステップであって、前記データシーケンスは、符号化後に得られた各ノードのノード特徴及び位置特徴のうちの少なくとも1つの離散化情報を表すのものであるステップと、前記グラフデータベースから、前記データシーケンスと所定の類似度閾値を満たす目標データシーケンスを検索するとともに、検索した目標データシーケンスに基づいて、前記入力オブジェクトと類似する出力オブジェクトを特定するステップと、を含む。
【】
本開示の一実施形態によれば、グラフデータベースから入力オブジェクトを検索するためのデータ検索装置が提供される。前記装置は、入力オブジェクトに対応するグラフデータを取得するステップであって、前記グラフデータには、少なくとも1つのノード及び各ノードに対応するノードデータが含まれるステップを実行するように構成されたグラフデータ構築モジュールと、グラフエンコーダを用いて前記グラフデータを符号化及び離散化し、前記入力オブジェクトに対応するデータシーケンスを取得するステップであって、前記データシーケンスは、符号化後に得られた各ノードのノード特徴及び位置特徴のうちの少なくとも1つの離散化情報を表すためのものであるステップを実行するように構成された符号化モジュールと、前記グラフデータベースから、前記データシーケンスと所定の類似度閾値を満たす目標データシーケンスを検索するとともに、検索した目標データシーケンスに基づいて、前記入力オブジェクトと類似する出力オブジェクトを特定するステップを実行するように構成された比較モジュールと、を備える。
【】
本開示の一実施形態によれば、1つ以上のプロセッサと、1つ以上のメモリとを備える電子デバイスが提供される。ここで、前記メモリにはコンピュータ実行可能なプログラムが記憶されており、前記コンピュータ実行可能なプログラムが前記プロセッサによって実行されると、上述した方法が実現されるようにする。
【】
本開示の一実施形態によれば、コンピュータ命令が記憶されているコンピュータ読み取り可能な記憶媒体が提供される。このコンピュータ命令がプロセッサによって実行されると、上述した方法が実現されるようにする。
【】
本開示の別の側面によれば、コンピュータ読み取り可能な記憶媒体に記憶されたコンピュータ命令を含むコンピュータプログラム製品又はコンピュータプログラムが提供される。コンピュータデバイスのプロセッサはコンピュータ読み取り可能な記憶媒体からそのコンピュータ命令を読み取り、実行することにより、そのコンピュータデバイスに上述した各側面又は上述した各側面の様々な方法を実行させるようにする。
【】
本開示の実施形態では、3次元空間構造を有する入力オブジェクトに関連付けられたグラフデータがグラフエンコーダによって符号化され、十分に正確なデータシーケンスが生成されるため、3次元構造及び/又はノード特徴において入力オブジェクトと類似する出力オブジェクトをグラフデータベースから精度良く検出することができる。
【】
特にライフサイエンスデータ解析分野では、本開示の実施形態によれば、同変な量子化変分オートエンコーダを用いてタンパク質構造を符号化し、複雑なタンパク質構造を表現するのに十分な精度のシーケンスを生成することで、入力タンパク質と構造的に最も類似する候補タンパク質、例えば、構造的に所定の類似度閾値を満たす候補タンパク質を正確に検索することができる。また、本開示のいくつかの実施形態では、配列の比較からタンパク質の検索を実行することができるため、検索効率が高められる。さらに、本開示のいくつかの実施形態では、検索モデルを訓練する手法も提案されている。本開示のこれらの実施形態では、少なくとも部分的にアミノ酸予測損失及び座標系アラインメント損失に基づいて、検索モデルを訓練することで、より高精度かつ高性能な検索モデルを構築することができる。
【図面の簡単な説明】
【】
本開示の実施形態における技術手法をより明確に説明するために、以下に実施形態の説明に必要な図面について簡単に紹介する。以下に記載される図面は、本開示の例示的な実施形態にすぎない。
【】
【図】本開示の例示的なシナリオを示す概略図である。
【図】本開示の適用シナリオを示す概略図である。
【図】本開示のグラフデータの処理方法を示すフローチャートである。
【図】本開示のグラフデータを示す概略図である。
【図】本開示のグラフエンコーダを示す概略図である。
【図】本開示のステップS303を示す概略図である。
【図】本開示のグラフエンコーダの訓練を示す概略図である。
【図】本開示の電子デバイスを示す概略図である。
【図】本開示の例示的なコンピューティングデバイスのアーキテクチャを示す概略図である。
【図】本開示の記憶媒体を示す概略図である。
【発明を実施するための形態】
【】
本開示の目的、技術手法及び利点をより明確にするために、以下に添付図面を参照しながら本開示の例示的な実施形態について詳細に説明する。明らかなように、本明細書に記載される本開示の一部にすぎず、その実施形態の全てを示すものではない。本明細書に記載される例示的な実施形態に限定されるものではないことを理解されたい。
【】
本明細書及び添付図面において、実質的に同一又は類似の動作及び要素は、同一又は類似の参照番号で示され、かつこれらの動作及び要素に対する重複な説明が省略される。また、本開示の説明において、「第1」、「第2」などの用語は、説明を区別するためにのみ使用され、相対的な重要性又は順位を明示又は暗示するものと解釈されるべきではない。
【】
本開示の説明の便宜上、以下に、本開示に関連する概念について紹介する。
【】
タンパク質設計は重要な最先端技術の一つとされている。その目標は、必要に応じて、全く新しいタンパク質分子をゼロから合理的に設計し、新たな活性を付与することで、新たな機能又はその他の特定の目的を達成することである。タンパク質設計は、生物物理学的原理を用いて新規なアミノ酸配列をゼロから設計し、その3次元構造を予測することができる。また、既知の天然タンパク質をもとに的確に改変し、アミノ酸の置換を導入することで新たな特性をもつ変異体を作製することも可能である。以上の両方のタンパク質設計手法に適用可能である。例えば、特定のタンパク質構造に対応するアミノ酸配列を予測することができる。これらのアミノ酸配列は、後続のタンパク質設計に寄与するものと考えられる。
【】
グラフニューラルネットワーク(Graph Neural Networks、GNN)は、グラフデータを処理するための機械学習モデルの一種である。従来のニューラルネットワークモデルとは異なり、グラフニューラルネットワークは、ソーシャルネットワークや化学分子や輸送ネットワークなど、あらゆる形状及びサイズのグラフデータを処理することができる。グラフニューラルネットワークの主な構想は、グラフデータをベクトル形式又は行列形式に変換し、ニューラルネットワークで訓練及び予測を行うことである。グラフニューラルネットワークの主な利点は、あらゆる形状及びサイズのグラフデータを処理できるため、高い柔軟性及び適応性を有することにある。また、グラフデータから重要な情報や特徴を抽出できるため、グラフデータをより効果的に理解し処理することができる。グラフニューラルネットワークは幅広い用途に利用可能である。例えば、ソーシャルネットワークでは、ユーザーの興味や行動を予測するために使用できる。化学分子では、分子の特性や反応を予測するために使用できる。輸送ネットワークでは、交通トラフィックや渋滞状況を予測するために使用できる。同変なグラフニューラルネットワークは特別なグラフニューラルネットワークであり、座標や速度などの3次元特徴など、ノードの幾何学的特徴を考慮して設計され、AI4Science分野で非常に一般的に使用されている。同変なグラフニューラルネットワークの出力は、入力が変化すると特定のパターンで変化するが、一般的に、SE(3)同変性を満たすものである。
【】
動的計画法(Dynamic Programming、DP)は、多段決定問題を解決するためのアルゴリズム手法であり、ナップサック問題や最短経路問題などの多段階最適決定問題を解決するために広く使用されている。部分問題の最適解から全体問題の最適解を導き出すことで、計算の重複を回避できるため、計算効率が高くなる。動的計画法は、複雑な問題を複数の相互に関連する部分問題又は意思決定段階に分割し、各サブ問題に対して、その状態遷移関係、すなわちサブ問題間の最適な関係を記述するための数学モデルを構築する。オプションとして、動的計画法の適用中に、最も基本的又は最も簡単なサブ問題を最初に解き、次に各問題の状態遷移方程式に基づいて、ボトムアップアプローチを使用して各段階の最適解を順次解き、最終的に問題の全体最適解に到達する。例えば、一例では、動的計画法は通常、以下のステップを含む。段階分割:問題を複数の段階に分割し、各段階において異なる決定を採用できるようにする。状態決定:各段階の状態を決定し、通常、状態変数で表されるようにする。状態遷移方程式:異なる段階間の状態遷移関係を決定し、通常、再帰式で表されるようにする。境界条件:問題の境界条件、すなわち最小のサブ問題の解を決定する。問題解決:状態遷移方程式及び境界条件に基づいて、問題の最適解を求める。動的計画法は通常、ボトムアップアプローチを採用し、すなわち最小の部分問題から開始し、問題全体の最適解が見つかるまで再帰的に処理を進めるものである。計算プロセスでは、通常、状態遷移を容易にするために、異なる段階間の状態を格納する2次元配列が必要になる。
【】
本開示における検索モデルは、AI(Artificial Intelligence)に基づくものであり得る。例えば、本開示における検索モデルは、人間がタンパク質構造の空間特性を理解するのと同様の方法でタンパク質情報を検索することで、タンパク質の構造及び機能に関する研究を可能にし、それによってタンパク質の生物学的特性を推測することができる。AIは、様々なインテリジェントマシンの設計原理及び実装方法を研究することにより、本開示における検索モデルにタンパク質を理解する能力を持たせるようにする。
【】
本開示の様々な主に機械学習及び深層学習におけるグラフ学習に関するものであり、通常、ソーシャルネットワーク、電子商取引の推奨、薬物分子モデリング、クラウドコンピューティングなどの実用的な問題に適用される。
【】
オプションとして、本開示の実施形態で使用されるコンピュータビジョン技術は、機械学習(Machine Learning、ML)及び深層学習に基づくものであってもよい。機械学習及び深層学習には、典型的には、人工ニューラルネットワーク、ビリーフネットワーク、強化学習、転移学習、帰納学習などの技術が含まれる。
【】
オプションとして、以下に本開示の実施形態で使用される検索モデルはすべてAIモデル、特にAIベースのニューラルネットワークモデルであり得る。典型的には、AIベースのニューラルネットワークモデルは、ニューロンが異なる層に配置された非巡回グラフとして実装される。典型的には、ニューラルネットワークモデルは、少なくとも1つの隠れ層によって区切られた入力層と出力層とを含む。隠れ層は、入力層で受信した入力を、出力層で出力を生成するために有用な表現に変換する。ネットワークノードは、エッジを介して隣接する層のノードに全結合され、かつ各層内のノード間にはエッジが存在しない。ニューラルネットワークの入力層のノードで受信したデータは、隠れ層、活性化層、プーリング層、畳み込み層などのいずれかを介して出力層のノードに伝播される。ニューラルネットワークモデルの入力及び出力は様々な形態であってもよいが、本開示では制限されない。
【】
本開示の実施形態によるソリューションは、人工知能、ディープグラフ学習、機械学習などの技術を含み、以下の実施形態によって具体的に説明される。
【】
まず、図1を参照しながら、本開示のグラフデータの処理方法及び対応する装置の適用シナリオについて説明する。図1は、本開示の適用シナリオ100を示す概略図であり、その中でサーバ110と複数の端末120とが模式的に示されている。
【】
本開示の検索モデルは、図1に示すサーバ110や複数の端末120など、様々な電子デバイスに組み込むことができる。例えば、検索モデルは端末120に組み込むことができる。端末120は、携帯電話、タブレットコンピュータ、ラップトップコンピュータ、デスクトップコンピュータ、パーソナルコンピュータ(Personal Computer、PC)、スマートスピーカー、スマートウォッチなどであってもよいが、これらに限定されない。別の例として、検索モデルはサーバ110に組み込むこともできる。サーバ110は、独立した物理サーバ、複数の物理サーバからなるサーバクラスタ又は分散システム、あるいはクラウドサービス、クラウドデータベース、クラウドコンピューティング、クラウド関数、クラウドストレージ、ネットワークサービス、クラウド通信、ミドルウェアサービス、ドメイン名サービス、セキュリティサービス、コンテンツ配信ネットワーク(Conten Delivery Network、CDN)、ビッグデータ及び人工知能プラットフォームなどの基本的なクラウドコンピューティングサービスを提供するクラウドサーバであってもよい。端末及びサーバは、有線又は無線通信を介して直接又は間接に接続することができるが、本開示では制限されない。
【】
本開示の検索モデルを用いて推論を行う装置は、端末、サーバ、あるいは端末とサーバからなるシステムであってもよいことを理解できる。本開示のグラフデータの処理方法は、端末、サーバ、あるいはその両方で実行することができる。
【】
本開示の検索モデルは、クラウド技術分野における人工知能クラウドサービスにも関連する可能性がある。
【】
本開示の端末110及びサーバ120は、データ保護原則を遵守し、ユーザーのデータ権利を尊重し、ユーザーのデータセキュリティ及びプライバシーを保護することに留意されたい。本開示の端末110及びサーバ120は、ユーザーデータの収集、利用、保存、伝送及び削除の目的、方法及び範囲をユーザーに明確に知らせ、ユーザーからの同意を得るものである。本開示の端末110及びサーバ120は、ユーザーデータの漏洩、改ざん、破損又は紛失を防止するために、合理的な技術的及び管理的措置を講じるものである。本開示の端末110及びサーバ120のプロバイダは、ユーザーデータを定期的に審査及び更新し、期限切れ又は不要なデータを適時に削除する。さらに、本開示の実施形態によるクラウドサービスのプロバイダは、データへのアクセス、訂正、削除、同意の撤回、クレームや損害賠償請求といったユーザーの権利を尊重し、ユーザーがこれらの権利を効果的に行使できるように便利なチャネル及びプロセスを提供する。
【】
さらには、端末120又はサーバ110における検索モデルを用いた医薬品(特にタンパク質)データの解析プロセスは、合法性、合理性及び透明性の原則をもとに実施される。本開示の検索モデルで収集及び処理されるデータは、予測目的に関連性及び必要性がありかつ適切であり、個人身分情報や機密情報が含まれない。本開示の検索モデルは、データのセキュリティ及び完全性を保護し、不正なアクセスや取扱又は漏洩を防止するために、適切な技術的及び組織的措置を講じるものである。
【】
本開示のAIベースの検索モデルは、関連するデータ保護法規及び倫理原則に準拠する。この検索モデルは、大量の匿名化及び非識別化されたデータに基づいて訓練され、個人又は団体のプライバシー及び知的財産権を侵害するものではない。検索モデルは、その出力が正確で信頼性が高く、誤解を招いたり差別したりするものではないことを保証するために、厳格なテスト及び評価も行われる。検索モデルは、サービス品質及び顧客満足度の向上のみを目的として設計され、違法又は非倫理的な目的で使用されることはない。また、データ環境や法的規制の変化に適応するために、定期的に審査及び更新が行われる。
【】
関連技術における検索モデルでは、タンパク質の類似度を判断するために、アミノ酸配列/順序に基づく方法、タンパク質構造に基づく方法(例えば、構造ベースの全原子モデル、主要なバックボーン原子に基づく方法、構造断片に基づく方法など)、及びファジーマッチング法のいずれか、又は複数の方法を採用することが多い。これらの方法にはそれぞれ長所及び短所がある。例えば、アミノ酸配列に基づく方法は計算速度が速いものの、タンパク質の空間構造が完全に無視されるため、不正確な類似度が得られることが多い。一方、構造に基づく方法は計算コストが高く、速度が遅く、効率が低すぎる虞がある。
【】
これに加えて、関連技術では、同じタンパク質を異なるビューで表示する場合、ほとんどの方法では異なるビューでタンパク質を解析したりキャリブレーションしたりすることが困難であるため、タンパク質のビューが変更されると、検索結果には明らかなバラツキが生じる。また、関連技術では、タンパク質間の様々な側面には不正確な検索結果や効率低下などの欠点があるため、包括的なオンライン検索・可視化プラットフォームの構築、膨大なライフサイエンスデータのマイニング・適用、又は生物学者へのリアルタイムオンラインサービスの直接提供が困難となり、結果として後続の研究が不便となる。
【】
本開示の実施形態では、3次元空間構造を有する入力オブジェクトに関連付けられたグラフデータがグラフエンコーダによって符号化され、十分に正確なデータシーケンスが生成されるため、3次元構造及び/又はノード特徴において入力オブジェクトと類似する出力オブジェクトをグラフデータベースから精度良く検出することができる。例えば、一実施形態では、同変なグラフニューラルネットワーク及び量子化変分オートエンコーダ(VQVAE)を組み合わせることで、入力オブジェクトの複雑な空間構造を配列に離散化及び符号化し、次に配列アライメントアルゴリズムを用いて、異なるオブジェクトの「構造配列」の類似度を計算し、探索入力オブジェクトと構造的に最も類似する候補入力オブジェクトを返すようにしてもよい。
【】
そこで、特にライフサイエンスデータ解析の分野において、本開示の実施形態によれば、AI技術をもとに、同変な量子化変分オートエンコーダを用いてタンパク質構造を符号化し、複雑なタンパク質構造を表す十分に正確な配列を生成することで、入力タンパク質と構造的に最も類似する候補タンパク質、例えば構造的に所定の類似度閾値を満たす候補タンパク質を正確に検索することができる。本開示の実施形態によれば、検索速度が大幅に改善されるため、生物学者にリアルタイムオンラインサービスを直接提供し、後続の研究の利便性を大幅に向上させることができる。
【】
また、本開示のいくつかの実施形態では、配列の比較からタンパク質の検索を実行することができるため、検索効率が高められる。さらに、本開示のいくつかの実施形態では、検索モデルを訓練する手法も提案されている。本開示のこれらの実施形態では、少なくとも部分的にアミノ酸予測損失及び座標アラインメント損失に基づいて検索モデルを訓練することで、より高精度かつ高性能な検索モデルを構築することができる。
【】
以下に図2から図10を参照しながら、本開示の実施形態に従ってグラフデータの処理方法について説明する。
【】
図2は、本開示の一適用シナリオを示す概略図である。
【】
図2に示すように、本開示の深層学習によるタンパク質データベース検索ツールに組み入れることができる。このタンパク質データベース検索ツールは、主に入力モジュール、データベースモジュール、構造検索モジュール、結果可視化モジュール、及びアルゴリズムモデルモジュールを備える。図2に示すような3次元構造を有するタンパク質(以下、入力タンパク質とも呼ばれる)を入力モジュールに入力する。入力モジュールは、この入力タンパク質の3次元構造を解析し、解析結果に基づいて検索要求を生成する。入力モジュールは、この検索要求をデータベースモジュール及び構造検索モジュールに送信し、入力タンパク質と構造的と類似する1つ以上のタンパク質をタンパク質構造データベースから検索する。
【】
本開示の新しいタンパク質を研究するのに寄与する。例えば、入力タンパク質と構造的と類似するタンパク質をタンパク質データベースから検索することにより、入力タンパク質の構造及び機能を研究し、その生物学的特性を予測することができる。従って、本開示の実施形態が組み込まれたタンパク質データベース検索ツールは、生物学的ビッグデータを解析し、新たな生物学的法則や特性を発見するために使用できる。また、このタンパク質データベース検索ツールは、タンパク質データベース内の既知タンパク質の構造情報を解析し、特定の機能を実現するための新しいタンパク質構造を発見又は設計するためにも使用できる。
【】
もちろん、本開示の様々な分野における生物医学研究に対してサポートを提供するために、その他の生物学的データ解析ツールに組み込むこともできる。本開示の入力タンパク質の3次元構造に基づいて、タンパク質データベースから入力タンパク質構造と高い類似度を有する候補タンパク質を迅速かつ高精度に検索することができる。本開示の検索速度が早く検索精度が高いという利点を有するため、本開示の以下を含むがこれらに限定されない、幅広い適用シナリオがある。(1)入力タンパク質とデータベース内の既知タンパク質との相同性を比較/照会することにより、タンパク質の構造及び機能を予測する。(2)照会結果及びデータベース内の構造情報に基づいて、医薬品開発プロセスにおいて、新たな創薬標的になり得るアミノ酸の同定を支援する。(3)検索結果及びデータベース内の構造情報に基づいて、変異する可能性のあるアミノ酸の同定を支援し、これに基づいてタンパク質機能への影響を特定する。(4)タンパク質構造データをライフサイエンスビッグデータ解析及び処理の次元として用いて、後続のライフサイエンスビッグデータの解析を支援する。当業者であれば、本開示がこれに限定されるものではないことを理解すべきであろう。
【】
図3は、本開示のグラフデータの処理方法30を示すフローチャートである。
【】
方法30は、端末デバイス(例えば、図1に示す端末120)で実行することができる。ここで、方法30は、ステップS301~S303を含む。もちろん、方法30は、より多くの、又はより少ないステップを含んでもよいが、本開示はこれらに限定されるものではない。
【】
方法30は、グラフデータベースから入力オブジェクトを取得するために使用される。その中で、グラフデータベースは、グラフ構造化データ管理及び解析機能を提供するデータベースであり、複雑でかつ関連関係を有するグラフデータを管理し、パターンマッチングなどのインプリシット結合の解析関数を提供することができる。グラフデータベースは、グラフデータの照会及び検索をサポートし、さらに入力グラフデータ内のノード関係から連鎖的にアクセスすることができる。関係データベースと比較して、グラフデータベースはデータオブジェクト間の依存関係の管理に優れており、幅広い適用シナリオがある。もちろん、本開示はこれらに限定されるものではない。
【】
ステップS301において、入力オブジェクトに対応するグラフデータを取得する。前記グラフデータには、少なくとも1つのノード(一部のアプリケーションではポイントとも呼ばれる)と各ノードに対応するノードデータが含まれる。その中で、各ノードに対応するノードデータには、3次元空間における前記ノードの位置情報、例えば、3次元空間における前記ノードの実座標が含まれ得る。さらには、各ノードに対応するノードデータには、カテゴリ情報など、各ノードを識別するための識別情報、例えばカテゴリ情報なども含まれ得る。
【】
オプションとして、前記入力オブジェクトは、3次元空間で記述及び解析可能な3次元特性を持つオブジェクト、システム、又はデータ構造である。具体的には、前記入力オブジェクトは複数の内部コンポーネントを有することができる。内部コンポーネントは、前記入力オブジェクトを構成する個々の要素、部分又は部品である。これらの内部コンポーネントは、独立した実体であることも、相互に依存してより大きな全体を形成することもできる。これと同時に、これらの内部コンポーネントは、3次元空間内で3次元的に配列されるようにしてもよい。例えば、入力オブジェクトはタンパク質又は高分子であり、その内部コンポーネントは、そのタンパク質又は高分子を構成する個々のアミノ酸、又はアミノ酸内の内部原子である可能性がある。これらのアミノ酸とその内部原子は、相互作用し、3次元空間で配列されることにより、特別なタンパク質/高分子の生物学的特性を提供することができる。別の例として、入力オブジェクトは複雑なソーシャルネットワークであり、その内部コンポーネントはソーシャルネットワークに参加している1人以上の人々である場合がある。ソーシャルネットワークに参加しているこれらの人々は、対応する3次元空間における地理座標を持つ場合がある。地理的に近い2人は、友人になる可能性が高い。もちろん、本開示はこれに限定されるものではない。
【】
本開示のグラフデータとは、「グラフ」のデータ構造を用いて各ノード間の関連関係を表すことができるデータのことを指す。例えば、「グラフ」は、有限の(おそらく変更可能な)集合をノード集合とし、順序付けられていないペア集合(無向グラフに対応)をエッジとして含む無向グラフである。また、「グラフ」は有向グラフでもあり得るが、本開示はこれに限定されるものではない。その中で、ノード(node)は頂点とも呼ばれ、「グラフ」のようなデータ構造を構成する基本単位である。各ノードは対応するノードデータを持つことができる。ノードデータは、グラフデータにおいてノードに関連付けられた一部である場合もあれば、整数の添え字又は参照で表示される外部エンティティである場合もある。グラフデータ構造は、ノードデータに加えて、エッジも含み得る。各エッジは、1つのラベルや数値(すなわち重み付け)などのエッジ値(edge value)と関連付けることができる。従って、数学的には、本開示のグラフデータは、ノードとエッジの集合、すなわちG=<V, E>と記述することができる。ここで、各エッジe=(u, v)∈Eは、2つのノードu及びvを接続し、ノード間のある関係を表すことができる。
【】
入力オブジェクトに対応するグラフデータの場合、グラフデータ内の各ノードは、入力オブジェクトの1つ以上の内部コンポーネントに対応する。各ノードに対応するノードデータには、入力オブジェクト内の1つ以上の内部コンポーネントを識別するための識別データが含まれる。各エッジデータは、入力オブジェクト内の任意の2つの内部コンポーネント間の関連付け関係を表すのものである。前記入力オブジェクトは3次元空間構造を有するため、3次元空間における前記入力オブジェクトの内部コンポーネントの相対的な位置関係を捉えるために、前記グラフデータ内の各ノードに対応するノードデータには、前記ノードの3次元空間における位置情報が含まれる。ここで、前記ノードの3次元空間における位置情報は、3次元座標(x,y,z)を用いて表すことができる。もちろん、本開示はこれに限定されるものではない。
【】
オプションとして、前記グラフデータは、回転同変性、並進同変性、及びスケーリング同変性のうちの少なくとも1つを満たす。これら3つすべてを満たすグラフデータは、SE(3)不変性を満たすものと呼ばれる。つまり、グラフデータが3次元空間内で並進、回転、スケーリングなどの操作を受けても、その出力は変化しない。例えば、異なる3次元空間について前記グラフデータ内の各ノードに対応するノードデータが構築されても、各ノード間の相対的な位置は変化しない。また、3次元空間が変更されても(例えば、異なる3次元座標系が設定されても)、前記グラフデータから出力された配列は変化しない。入力オブジェクトに対応するグラフデータを取得する詳細なプロセスについては、図4を参照して後述するため、本開示ではこれ以上説明しない。
【】
ステップS302において、グラフエンコーダを用いてグラフデータを符号化及び離散化し、前記入力オブジェクトに対応するデータシーケンスを取得する。前記データシーケンスは、符号化後に得られた各ノードのノード特徴及び位置特徴のうちの少なくとも1つの離散化情報を表すためのものである。その中で、ノード特徴には、ノードの種類や前記ノードと他のノードとの関連付け関係などのノード特性情報が含まれ、位置特徴には、グラフデータ内の実座標とは異なるが前記実座標に対応する、ノードの符号化された位置情報が含まれる。このように、前記データシーケンスは、前記入力オブジェクトの構造などの情報を反映することができる。
【】
オプションとして、前記データシーケンスは、上述した検索モデルにおけるグラフエンコーダによって生成することができる。その中で、検索モデルは、グラフ表現学習技術を利用する任意のニューラルネットワークモデルとすることができる。検索モデルにおけるグラフエンコーダは、グラフデータから、グラフデータに対応する特徴表現(すなわち、符号化された各ノードの前記ノード特徴及び位置特徴)のベクトル又はグラフデータ内の任意のノードに対応するノード特徴のベクトルを学習するとともにノード特徴ベクトル及び/又は位置特徴ベクトルをクラスタリングなどによって離散化し、グラフデータ内の各ノードの位置特徴及びノード特徴のうちょの少なくとも1つの離散化情報を表すためのデータシーケンスを取得することができる。一例において、当該データシーケンスは、各ノードのノード特徴のクラスタ中心を含むことができる。
【】
オプションとして、グラフエンコーダは、グラフデータを埋め込み又はベクトルに符号化できるニューラルネットワークであり、グラフデータ内のエッジに沿って情報を伝播し各ノードの埋め込み表示を更新し、ノード間の関係を学習することで、各ノードのノード特徴及び位置特徴のベクトルを生成する。次に、1つ以上のニューラルネットワーク、パーセプトロン、又は量子化器を用いてこれらのノード特徴及び/又は位置特徴のベクトルをデータシーケンスに変換することができる。ここで、データシーケンスとは、特定の順序で並べられたデータ要素の集合を指す。データ要素は、数値、キャラクタ、ベクトルなどであり、かつこれらの要素は特定の順序で格納される。各位置のデータ要素には、インデックスによってアクセスできる。例えば、前記データシーケンスは固定長の配列とすることができる。タンパク質入力オブジェクトの場合、データシーケンスは、各ノードのノード特徴のクラスタ中心とすることができる。もちろん、本開示はこれに限定されるものではない。
【】
オプションとして、ステップS301で得られたグラフデータはSE(3)不変性(又はSE(3)同変性)を満たすため、このようなグラフデータを符号化できるグラフエンコーダは、同変なグラフニューラルネットワーク(Equivariant Graph Neural Network、EGNN)モデルとすることができる。同変なグラフニューラルネットワークは、グラフデータを処理するためのニューラルネットワークアーキテクチャであり、その設計の核心は、グラフデータを処理する際に同変性を維持することである。これは、同変なグラフニューラルネットワークが入力データを変換(回転、並進、スケーリングなど)しても出力を変更しないことを意味する。従って、このようなグラフエンコーダは、3次元空間構造を持つグラフデータにより効果的に適応することができる。もちろん、本開示はこれに限定されるものではない。
【】
オプションとして、前記グラフエンコーダーは、オートエンコーダー(Autoencoder)とベクトル量子化(Vector Quantization)の概念を組み合わせた、高次元データの圧縮表現を学習するための深層学習モデルである、ベクトル量子化変分オートエンコーダー(Vector Quantized Variational Autoencoder、VQ-VAE)とすることもできる。量子化オートエンコーダーは、入力グラフデータを潜在表現空間にマッピングさせることができる。訓練プロセス中に、対応する量子化デコーダーは通常、潜在表現を元のグラフデータに復元するように設計されている。復元されたグラフデータと元のグラフデータとの差が十分に小さければ、訓練が完了したものと考えられる。その他のオートエンコーダーと比較して、量子化オートエンコーダーによって生成される潜在表現は、ベクトル量子化によって量子化される。具体的には、潜在表現空間は離散的な部分空間の集合に分割され、量子化オートエンコーダーによって生成された潜在表現は各部分空間にマッピングされ、シーケンスが生成されるため、次元が削減されロバスト性が向上する。
【】
オプションとして、前記グラフエンコーダは、同変なグラフニューラルネットワークと量子化オートエンコーダを組み合わせた同変な量子化オートエンコーダであってもよい。つまり、このグラフエンコーダは、グラフデータに対して回転、並進、スケーリングなどの操作を行った後でも同じベクトル量子化シーケンスを得ることができる。同変な量子化オートエンコーダを用いることで、グラフデータのSE(3)同変性を効果的に利用した場合に、次元を削減しつつロバスト性を高めることができる。本開示の同変な量子化オートエンコーダについては、図5を参照しながらさらに説明する。もちろん、本開示はこれに限定されるものではない。
【】
ステップS303において、前記グラフデータベースから、前記データシーケンスと所定の類似度閾値を満たす目標データシーケンスを検索するとともに、検索した目標データシーケンスに基づいて、前記入力オブジェクトと類似する出力オブジェクトを特定する。
【】
オプションとして、2つのデータシーケンス間の類似度に基づいて、前記グラフデータを表すためのデータシーケンスと類似するデータシーケンスを特定する。データシーケンス間の類似度は、2つのデータシーケンス間の相違度を測定するために用いることができる。オプションとして、データシーケンス間の類似度は、ハミング距離、コサイン類似度、弾性距離、構造差異、線形相関、最長共通部分列編集距離などのうちの1つ以上の方法によって計算することができる。もちろん、本開示はこれに限定されるものではない。
【】
オプションとして、動的計画法に基づく配列アライメントアルゴリズム(例えば、Smith-Watermanアルゴリズム)を用いて、グラフデータベースからステップS302で得られたデータシーケンスと類似するデータシーケンスを取得することができる。入力オブジェクトに対応するデータシーケンスとグラフデータベース内のオブジェクトとの間の類似度が高い場合、これら2つのオブジェクトが高度と類似しているとみなすことができるため、そのオブジェクトを出力オブジェクトとすることができる。ステップS303の詳細については、図6を参照して後述するが、本開示ではこれ以上説明しない。
【】
従って、本開示の実施形態では、3次元空間構造を有する入力オブジェクトに関連付けられたグラフデータがグラフエンコーダによって符号化され、十分に正確なデータシーケンスが生成されるため、3次元構造及び/又はノード特徴において入力オブジェクトと類似する出力オブジェクトをグラフデータベースから精度良く検出することができる。関連技術と比較して、本開示の検索精度が高められるだけでなく、検索効率も大幅に改善されるようになる。
【】
具体的にタンパク質/高分子検索の分野において、本開示の実施形態では、オプションとして、グラフエンコーダ(特に同変な量子化エンコーダ)を用いてタンパク質構造を符号化及び離散化し、複雑なタンパク質構造を表現するのに十分な精度のデータシーケンスを生成することで、入力タンパク質と構造的に最も類似する候補タンパク質を正確に検索することができる。また、本開示のいくつかの実施形態では、配列の比較からタンパク質の検索を実行することができるため、検索効率が高められる。
【】
次に、図4を参照しながらステップS301についてさらに説明する。図4は、本開示のグラフデータを示す概略図である。このグラフデータに対応する入力オブジェクトは、タンパク質/高分子である。
【】
図4に示すように、図4に示すグラフデータを用いてタンパク質を表すことができる。ステップS301では、入力タンパク質に対応するグラフデータを取得する。前述のように、このグラフデータには、ノードデータとエッジデータが含まれる。ステップS301は、前記タンパク質に含まれる複数のアミノ酸配列情報に基づいて、前記入力オブジェクトに対応するグラフデータ内の各ノード及びそのノードデータを特定するステップであって、各ノードには1つのアミノ酸が対応し、各ノードに対応するノードデータには、前記アミノ酸の主鎖上の各原子の種類情報と、3次元空間における各原子の座標が含まれるステップと、前記グラフデータ内の各ノードのノードデータに基づいて、前記グラフデータ内の各エッジデータを特定するステップとを含む。もちろん、本開示はこれに限定されるものではない。
【】
オプションとして、入力タンパク質に対応するグラフデータを取得するプロセスは、以下のように簡単に説明できる。タンパク質の特性評価において、タンパク質データは通常、PDB(protein data bank)ファイルに保存される。ファイルには、タンパク質のアミノ酸配列情報及び3次元空間における座標情報が含まれる。タンパク質断片中の各アミノ酸(又はアミノ酸残基)について、その種類と、主鎖上の4つの原子(C, N, O, Ca)の3次元座標が考慮される。オプションとして、このグラフデータにおいて、各ノードはタンパク質断片中の1つのアミノ酸(又はアミノ酸残基)に対応する。各ノードに対応するノードデータには、ノードの座標、すなわち当該アミノ酸(又はアミノ酸残基)の主鎖上の4つの原子の種類と、各原子の対応する3次元座標が含まれるが、これらに限定されない。例えば、n個のアミノ酸を含むタンパク質配列は、アミノ酸配列A={a1, a2, …, an}と座標情報X={x1, x2, x3, …, xn}∈Rnx4x3によって表すことができる。ここで、xi∈R4x3は、i番目のアミノ酸の主鎖上にある4つの原子の3次元座標を表す。
【】
図4の上図で黒く丸で囲まれた3次元図は、図4の下図で黒く丸で囲まれたアミノ酸断片に対応するxiの視覚化例を示している。本開示では、アミノ酸の3次元座標を構造情報として対応するノードデータが構築されるが、本開示はこれに限定されるものではない。例えば、本開示では、アミノ酸間の二面角、アミノ酸の生物学的特性など、ノードデータにおいてタンパク質の構造的特徴を表現するためのデータを補強するために、他のデータを使用することもできる。
【】
オプションとして、で得られたノードデータに基づいてエッジデータを決定することができる。その中で、前記グラフデータ内の各ノードのノードデータに基づいて、前記グラフデータ内の各エッジデータを決定する前記ステップは、2つのアミノ酸の原子間の化学結合に基づいて、前記化学結合に対応するエッジデータを作成し格納するステップ、又は、2つのアミノ酸の原子間の距離が所定の閾値未満であることに基づいて、2つのアミノ酸の原子を接続するエッジデータを作成し格納するステップを含む。
【】
具体的には、エッジデータを取得するプロセスは、以下のように簡単に説明できる。
【】
本開示のいくつかの実施形態では、各エッジデータは1つの化学結合を表すことができる。2つのアミノ酸のノードデータに基づいて、2つのアミノ酸の原子間に化学結合が存在すると判定された場合、グラフデータにおいて当該化学結合に対応するエッジデータが作成され格納される。オプションとして、このエッジデータには、単結合や二重結合など、当該化学結合の特性を示す特性データも含まれ得る。もちろん、本開示はこれに限定されるものではない。
【】
オプションとして、本開示の別のいくつかの実施形態では、各エッジデータは、2つのアミノ酸の原子間の距離情報を表すことができる。例えば、2つのアミノ酸のノードデータに基づいて、これら2つのアミノ酸の原子間の距離が所定の閾値未満であると判定された場合、グラフデータにおいて1つのエッジデータが作成され格納される。一般的に言えば、高分子又はタンパク質中の近接する原子間は、比較的強く相互作用する。後続のデータ解析において、これらの原子間の相互作用は情報の伝達に役立つ。従って、原子間の距離に基づいて作成されたエッジデータは、高分子又はタンパク質の構造解析に役立つ。具体的には、これらの実施形態では、エッジデータは以下のように作成できる。まず、距離閾値tdを決定する(例えば、この距離閾値tdを入力モジュールに入力する)。入力タンパク質中の任意の2つのアミノ酸について、それらの原子Ca間の距離を計算する。この距離が閾値td未満であれば、これら2つのアミノ酸間に1つのエッジを接続する(つまり、1つのエッジデータを格納する)ようにしてもよい。
【】
このようにして、タンパク質のグラフ表現(すなわちグラフデータ)G=(V, E, X)が得られる。ここで、V={v1, v2, …, vn}はn個のノードを表し、各ノードには1つのアミノ酸が対応する。E={(vi, vj)|dist{vi, vj}<td}はグラフ内のエッジの集合を表す。X={x1, x2, …, xn}はノードの座標を表し、xiはノードviの3次元座標を表す。1つのノードが1つのアミノ酸に対応し、かつ1つのアミノ酸の主鎖上に4つの原子を含む場合、xi∈R4x3は、i番目のアミノ酸の主鎖上にある4つの原子の座標を表す。
【】
この表現形態では、ノード表現及びノード座標がインデックスによって別々に格納される。これは後続の同変な量子化変分オートエンコーダの計算に役立つ。もちろん、本開示はこれに限定されるものではない。
【】
あるいは、グラフデータG=(X, E)を用いて1つのタンパク質を表すこともできる。ここで、X={x1, x2, …, xn}はノードの座標を表し、xiはノード識別子iを有するノードの3次元座標を表す。E={(vi, vj)|dist{vi,vj}<td}はグラフ内のエッジの集合を表す。この表現形態では、ノード表現及びノード座標がインデックスによって一括して格納されるため、記憶空間の削減に役立つ。もちろん、本開示はこれに限定されるものではない。
【】
図4において、タンパク質又は高分子を表すグラフデータのみ示されているものの、当業者であれば、本開示の実施形態がタンパク質又は高分子の処理のみに限定されず、ソーシャルネットワーク、イベントグラフ、ナレッジグラフ、電子商取引プラットフォームなどの他の分野にも適用可能であることを理解するであろう。ないことを理解するであろう。これらの分野では、ノードデータとエッジデータは対応する物理的な意味を持つ。例えば、ソーシャルネットワークの解析シナリオでは、ノードデータはユーザーを表し、エッジデータはユーザー間の社会的な関係を表すことができる。ナレッジグラフでは、ノードデータはエンティティを表し、エッジデータはエンティティ間の意味的な関係を表す。電子商取引プラットフォームでは、ユーザー、製品、カテゴリなどはすべてグラフ内のノードデータとして抽象化でき、購入やクリックなどのアクションはエッジデータとして抽象化できる。
【】
図4において、ネットワーク図及び分子式構造の形でタンパク質に対応するグラフデータのみ示されているが、当業者であれば、追加情報を参照し、これらの情報を各ノードのノードデータに融合させることもできる。例えば、多階層構造マッチングを実現するために、これらの情報にはタンパク質の多階層構造に関する情報が含まれる。また、グラフデータの3次元構造解析を支援するために、ノードデータには、アミノ酸の化学的性質、コドン断片などの配列特徴、又は細胞内構造におけるサブユニット関係など、アミノ酸を表す情報も含まれる。さらに、ノードデータには、画像データ(例えば、顕微鏡で撮影したアミノ酸の写真)などの他のモダリティからのデータを融合させるようにしてもよい。他のモダリティからのデータは、本開示の実施形態におけるデータシーケンス及び/又は構造情報と組み合わせることで、マルチモーダルな状況下でタンパク質の構造検索が可能になるため、検索精度がさらに向上する。
【】
なお、本開示の実施形態では、様々な種類のノードデータ及びエッジデータに適用できる汎用的なグラフデータの処理手法が実際に提案されている。本開示の様々な実施形態では、グラフエンコーダを介してグラフデータを配列表現に正確に符号化し、この配列表現から後続の検索及び解析タスクを実行することができるため、グラフデータ処理に関する様々な分野のニーズにより効果的に対応することができる。
【】
次に、図5を参照しながらステップS302についてさらに説明する。図5は、本開示のグラフエンコーダを示す概略図である。グラフエンコーダは、上述した検索モデルのサブコンポーネントである。
【】
図5に示すように、グラフエンコーダは、同変なグラフニューラルネットワークモデル及び離散化器を含むことができる。オプションとして、ステップS302において、グラフエンコーダ内の同変なグラフニューラルネットワークモデル及び離散化器は、前記データシーケンスを取得するために協働することができる。具体的には、グラフエンコーダを用いたグラフデータを符号化及び離散化する前記ステップは、前記同変なグラフニューラルネットワークモデルを用いて、前記グラフデータを符号化し、前記グラフデータ内の各ノードのノード特徴及び位置特徴を取得するステップと、前記離散化器を用いて、前記各ノードの前記ノード特徴及び位置特徴のうちの少なくとも1つをベクトル量子化し、前記各ノードのノード特徴及び位置特徴のうちの少なくとも1つの離散化情報を表すためのデータシーケンスを取得するステップとを含む。もちろん、本開示はこれに限定されるものではない。
【】
同変なグラフニューラルネットワークモデルは、マルチチャネルを有する同変なグラフニューラルネットワークモデルである。当該同変なグラフニューラルネットワークは、複数層のパーセプトロン又は隠れ層を含む。各隠れ層及び/又はパーセプトロンの入力は、直前の隠れ層及びパーセプトロンの出力である。つまり、前記同変なグラフニューラルネットワークの各隠れ層又はパーセプトロンは、各ノードのノード特徴ベクトル及び位置特徴ベクトルを符号化する。ここで、1番目の隠れ層又はパーセプトロンを除く各隠れ層又はパーセプトロンの符号化は、前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記グラフデータ内の第1ノード及び第2ノードが符号化されたノード特徴ベクトル及び位置特徴ベクトルを取得するステップと、前記ノード特徴ベクトル及び位置特徴ベクトルに基づいて、前記第2ノードから前記第1ノードへの伝播メッセージを特定するステップと、前記伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって符号化されたノード特徴ベクトル及び位置特徴ベクトルを特定するステップとを含む。
【】
具体的には、本開示の実施形態におけるグラフデータにおいて、l番目の隠れ層/パーセプトロンについて、その入力は、直前の隠れ層/パーセプトロンから出力された位置特徴表現(例えば、ノード座標xl及びノード特徴表現hlなど)であり、その出力は、当該隠れ層又はパーセプトロンがメッセージパッシング機構を用いて変更したノード座標xl+1及びノード特徴表現hl+1である。この処理プロセスは下記数式(1)として表すことができる。
【】
hl+1,xl+1=f(hl,xl) (1)
ここで、上付き文字lはニューラルネットワークの層数を表す。第0層のノード特徴h0は、すべてのノードのカテゴリ特徴の集合であり、ノード座標x0は、初期化時の3次元空間におけるすべてのノードの実座標の集合である。例えば、図3に示すように、タンパク質を入力オブジェクトとするグラフデータの場合、グラフデータ内の各ノードについて、h0iはノードiがi番目のアミノ酸(4つの原子種類(C, N, O, Ca)を含む場合がある)であることを表し、x0iは3次元空間におけるノードiの実座標、すなわちi番目のアミノ酸に含まれる4つの原子の座標を表す。
【】
本開示のいくつかの実施形態では、前記ノード特徴ベクトル及び位置特徴ベクトルに基づいて、前記第2ノードから前記第1ノードへの伝播メッセージを特定する前記ステップは、前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記第1ノード及び前記第2ノードが符号化された位置特徴ベクトルに基づいて、前記第1ノードと前記第2ノード間の同変性特徴ベクトルを特定するステップと、前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記グラフデータ内の第1ノード及び前記第2ノードが符号化されたノード特徴ベクトル、前記第1ノードと前記第2ノード間の同変性特徴ベクトル、及び前記第1ノードと第2ノード間のエッジデータに基づいて、前記第2ノードから前記第1ノードへの伝播メッセージを特定するステップとを含む。
【】
例えば、各隠れ層/パーセプトロンについて、その動作原理は以下の数式(2)~(4)で表すことができる。
【】
【数】
ここで、φmはノードiとノードj間の伝播メッセージmijを計算するための関数である。その入力には、第l-1層の隠れ層又はパーセプトロンから出力された、ノードiのノード特徴ベクトルhi(l)、第l-1層の隠れ層又はパーセプトロンから出力されたノードjのノード特徴ベクトルhj(l)(オプションとして、ノードiがノードjに隣接する)、ノードiとノードj間の
【数】
、及びノードiとノードj間のエッジデータeijが含まれる。
【】
ここで、
【数】
はノードi対するノードjの変位を表し、
【数】
によって計算することができる。
【数】
は、ノードi対するノードjの回転の除去を表す(これによって、回転不変性を保証する)。つまり、
【数】
は実際に、全体的な変位と回転によるノードi対するノードjの変化度合いを表す。次に、
【数】
で割ると、正規化された同変性特徴ベクトルが得られる。隠れ層又はパーセプトロンは、これら4つの入力を総合的に計算して伝播メッセージmijを得る。これには、ノードiとノードjそれ自体の特徴ベクトル、ノードiとノードj間のエッジデータ、及びノードiとノードjの同変性情報が組み合わされている。
【】
次に、隠れ層及び/又はパーセプトロンは、伝播メッセージに基づいて、各ノードのノード特徴ベクトル及び位置特徴ベクトルを計算する。
【】
オプションとして、前記第1ノードは複数の前記第2ノードに隣接してもよい。前記伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって符号化されたノード特徴ベクトルを特定する前記ステップは、複数の前記第2ノードから前記第1ノードへの複数の伝播メッセージを取得するステップと、前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記グラフデータ内の第1ノードが符号化されたノード特徴ベクトル及び前記複数の伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって前記第1ノードが符号化されたノード特徴ベクトルを特定するステップとを含む。例えば、隠れ層及び/又はパーセプトロンは、下記数式(3)を用いて伝播メッセージmijに基づいて、ノードiのノード特徴ベクトルを計算する。もちろん、本開示はこれに限定されるものではない。
【】
【数】
ここで、φhは
【数】
を計算するための関数である。その入力には、第l-1層の隠れ層又はパーセプトロンから出力されたノードiのノード特徴ベクトルと、ノードiに隣接するすべてのノードj∈N(i)からノードiへの伝播メッセージが含まれる。このようにして、第l層の隠れ層又はパーセプトロンから出力された
【数】
が得られる。
【】
オプションとして、前記第1ノードは複数の前記第2ノードに隣接してもよい。前記伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって符号化された位置特徴ベクトルを特定する前記ステップは、複数の前記第2ノードから前記第1ノードへの複数の伝播メッセージを取得するステップと、前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記グラフデータ内の第1ノード及び複数の前記第2ノードが符号化された位置特徴ベクトル及び前記複数の伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって前記第1ノードが符号化された位置特徴ベクトルを特定するステップとを含む。例えば、隠れ層及び/又はパーセプトロンは、下記数式(4)を用いて伝播メッセージに基づいて、
【数】
を計算する。もちろん、本開示はこれに限定されるものではない。
【】
【数】
ここで、式(4)は、
【数】
を計算するための関数である。その入力には、第l-1層の隠れ層又はパーセプトロンから出力された、
【数】
と、ノードiに隣接するすべてのノードj∈N(i)からノードiへの伝播メッセージmijが含まれる。ここで、φxは、ノードjらノードiへの伝播メッセージmijを位置情報にマッピングさせるための関数である。
【数】
によって、
【数】
には、ノードそれ自体の位置情報
【数】
と隣接ノード
【数】
に対応する位置情報が組み合わされている。このようにして、第l層の隠れ層又はパーセプトロンから出力されたノードiの位置特徴ベクトル
【数】
が得られる。
【】
で説明した同変なグラフニューラルネットワークモデルによって、各ノード(例えば、各アミノ酸)のノード特徴ベクトルh∈Rd及び位置特徴ベクトル
【数】
が得られる。一実施形態では、これら2つを組み合わせて、ノードの隠れ表現Z、すなわち、Z=(H, X)=φ(G)∈Rdを得ることができる。次に、d次元の隠れ表現Zを離散化(クラスタ化)し、そのクラスタ中心の表現c∈Rdを得る。あるいは、ノード特徴ベクトルh∈Rd又は位置特徴ベクトル
【数】
を直接離散化(クラスタ化)し、そのクラスタ中心の表現c∈Rd又はc∈R3を得るようにしてもよい。このとき、ノード特徴ベクトルh∈Rd又は位置特徴ベクトル
【数】
を、隠れ表現ziとして直接使用することもできる。
【】
例えば、各ノードiについて、1つの隠れ表現ziを出力できる。離散化器を用いて、このノードベクトルziに最も近いクラスタ中心ciを見つけることができる。このクラスタ中心ciにindiという番号が付けられていると仮定すると、グラフデータ全体を1つのデータシーケンスS={ind0, ind1, …, indn}として符号化することができる。ここで、indi∈Z+を満たす。具体的には、タンパク質又は高分子を入力オブジェクトとするグラフデータの場合、各アミノ酸には1つの隠れ表現ziを出力できる。次に、ziに最も近いクラスタ中心ci (indiという番号が付けられていると仮定)を見つける。そこで、タンパク質鎖全体をデータシーケンスS={ind0, ind1, …, indn}として符号化できる。ここで、indi∈Z+を満たし、かつ範囲は[1,20]である。
【】
従って、図5におけるグラフエンコーダによって得られたデータシーケンスSは、大量のストレージスペースを占有することなく、グラフデータの3次元空間構造とノード間の関係特徴を正確に表現できる。また、データシーケンスSは、後続のステップS303における検索にも容易に利用できる。具体的には、タンパク質検索ツールにおいて、本開示の実施形態では、グラフデータをデータシーケンスに変換することにより、タンパク質の構造比較タスクをシーケンス比較タスクに変換する。ステップS302でデータシーケンスに変換することで、構造情報のアライメントを確保するとともに、シーケンスアライメントによって検索速度を向上させることができる。
【】
当業者であれば、本開示がこれに限定されるものではないことを理解するであろう。データシーケンスの検索には、のクラスタ化に基づく手法に加えて、最大確率復号化の手法を利用することもできる。例えば、グラフエンコーダの確率分布内から最適なマッチングコードを見つけることで、類似するデータシーケンスの検索速度を向上させることができる。
【】
次に、図6を参照しながらステップS303についてさらに説明する。図6は、本開示のステップS303を示す概略図である。
【】
オプションとして、ステップS303は、動的計画法を用いて、前記データシーケンスを前記グラフデータベース内の他のデータシーケンスと比較し、前記データシーケンスと前記グラフデータベース内の他のデータシーケンスとの間の局所的な類似度を示す比較結果を取得するステップと、前記比較結果に基づいて、入力オブジェクトと類似する出力オブジェクトを特定するステップとを含む。もちろん、本開示はこれに限定されるものではない。
【】
図6に示すように、Smith-Watermanアルゴリズム(動的計画法の一例)を用いて、ステップS302で得られたデータシーケンスSを、グラフデータベース内の他のデータシーケンスと比較することができる。これにより、ステップD303においてデータシーケンスSに最も近似するデータシーケンスS’を素早く特定し、これに基づいて入力オブジェクトに最も近似する出力オブジェクトを検索することができる。
【】
ここで、Smith-Watermanアルゴリズムは、2つのデータシーケンスを比較するためのアルゴリズムであり、動的計画法の原理に従い、2つのデータシーケンス間の局所的な類似度を見つけて最適なアラインメント(alignment)を検索し、最も類似度の高いサブデータシーケンスを特定するために使用される。
【】
Smith-Watermanアルゴリズムの主なプロセスは以下のように簡単に説明できる。まず、2つのデータシーケンス間のアライメントスコアを格納するための行列を作成する。行列の次元は2つの入力データシーケンスの長さに相関している。本開示の実施形態では、この次元は[1,20]にすることができる。通常、行列の初期行と列はすべて0に初期化される。次に、この行列の左上隅の1番目の要素から始めて、2つのデータシーケンス間の類似度スコアを行ごとかつ列ごとに計算する。前記類似度スコアには、マッチングスコア、ミスマッチペナルティ、欠落ペナルティのうちの少なくとも一方、又はこれら3つの加重合計、あるいはこれら3つの最大値が含まれる。スコアを計算する過程において、最高スコアの要素位置及びその位置は常に記録される。次に、最高スコアの要素位置から始めて、スコアリングルール(マッチング、ミスマッチ、欠落)に従ってバックトラックを行い、最適なアライメントパス、すなわち2つのデータシーケンスの最適な局所的アライメントを見つける。マッチングスコア、ミスマッチペナルティ、欠落ペナルティは、ユーザーがカスタマイズできる。
【】
Smith-Watermanアルゴリズムは、全体的なアライメントを行わずに、局所的な範囲内で類似度を検出できる。これにより、2つのデータシーケンス内で最も近似する2つのフィールドを検出できるため、特にタンパク質の配列アライメントに有用であり、類似した機能領域を有するタンパク質構造断片又はアミノ酸断片を見つけることができる。
【】
さらに、本開示の実施形態では、将来開発される可能性のある、より精確で効率的な検索方法を利用することで、検索精度及び効率を向上させることもできる。
【】
次に、図7を参照しながらグラフエンコーダの訓練についてさらに説明する。図7は、本開示のグラフエンコーダの訓練を示す概略図である。
【】
一例として、本開示のロック解除モデルの訓練に使用される訓練データは、既知の構造及び既知の機能を有するタンパク質データを格納するタンパク質データバンク(PDB)データベースから由来するものであってもよい。場合によっては、訓練データを拡張するために、AlphaFold2モデルを使用していくつかのタンパク質構造を予測し、訓練を拡張してモデルの訓練データを増やすことができる。
【】
本開示の検索モデルにおけるグラフエンコーダを訓練し、グラフエンコーダがグラフデータ内の重要な情報及び特徴を捕捉できるようにするために、図7に示すグラフデコーダを使用することができる。グラフデコーダは、グラフエンコーダの出力ベクトルH,Xをグラフデータに変換できるニューラルネットワークモデルである。
【】
グラフエンコーダが入力グラフデータのノードカテゴリ情報を学習できるようにするために、前記グラフエンコーダの訓練は、オプションとして、前記グラフデータ内の各ノードに対応するノードデータに基づいて、訓練中のグラフエンコーダを用いて、各ノードの予測カテゴリ値を特定するステップと、前記各ノードの予測カテゴリ値及び前記各ノードの実際のカテゴリ値に基づいて、カテゴリ予測損失を特定するステップと、前記カテゴリ予測損失に基づいて、前記グラフエンコーダのニューラルネットワークパラメータを調整するステップとを含む。例えば、下記数式(5)に示すカテゴリ予測損失Laaを用いてグラフエンコーダを訓練することができる。
【】
【数】
カテゴリ予測損失Laaの入力には、φ(hi)及びaaiが含まれる。φ(hi)は、グラフエンコーダから出力されたノード特徴hiに基づいて予測されるあるノードのカテゴリである。具体的には、入力オブジェクトがタンパク質であるグラフデータの場合、φ(hi)はグラフエンコーダによって予測されるあるアミノ酸のカテゴリであり、aaiは実際のアミノ酸の実際カテゴリである。C(φ(hi), aai)は、φ(hi)とaai間のクロスエントロピー損失を表す。従って、カテゴリ予測損失は、1つのタンパク質内のすべてのアミノ酸のカテゴリ予測の損失を表す。オプションとして、ライフサイエンスデータ解析の分野では、カテゴリ予測損失はアミノ酸予測損失とも呼ばれる。
【】
グラフエンコーダ及びグラフデコーダが入力グラフデータの3次元構造情報を学習できるようにするために、グラフデコーダを用いて前記グラフエンコーダの訓練を支援することができる。ここで、前記グラフエンコーダの訓練は、オプションとして、前記グラフデータ内の各ノードに対応するノードデータに基づいて、訓練中のグラフエンコーダを用いて各ノードの予測隠れ表現を特定するステップと、前記各ノードの予測隠れ表現に基づいて、訓練中のグラフデコーダーを用いて前記各ノードの復元位置情報を特定するステップと、前記各ノードの3次元空間における位置情報及び前記各ノードの復元位置情報に基づいて、位置不一致損失を特定するステップと、前記位置不一致損失に基づいて、前記グラフエンコーダー及び/又は前記グラフデコーダーのニューラルネットワークパラメータを調整するステップとを含む。
【】
例えば、下記数式(6)に示す位置不一致損失Lcoorを用いてグラフエンコーダ及びグラフデコーダを訓練することができる。
【】
Lcoor=kabsch(X', X) (6)
位置不一致損失Lcoorの入力には、x'及びxが含まれる。ここで、X'はグラフデコーダによって復元されたノードの座標の集合であり、Xはグラフエンコーダに入力されたグラフデータのノードの座標の集合である。kabsch(X', X)では、座標X'及び座標Xに対して、両者が位置合わせされるように空間的に回転、並進などの操作が行われる。kabsch(X', X)は、位置合わせされた後の最小誤差である。オプションとして、ライフサイエンスデータ解析の分野では、位置不一致損失は座標アライメント損失とも呼ばれる。
【】
カテゴリ予測損Laaとカテゴリ予測損失Laaは、下記数式(7)によって組み合わせることができる。これにより、訓練中にグラフエンコーダとグラフデコーダを同時に訓練することができる。
【】
L=Laa+Lcoor (7)
【】
グラフエンコーダとグラフデコーダを同時に訓練するプロセスは、少なくとも、グラフエンコーダとグラフデコーダ内のニューロンのパラメータ値を調整して損失Lを最小化することを含む。
【】
本開示のグラフデコーダは、訓練フェーズでのみ使用され、グラフエンコーダの推論効率には影響を与えない。サンプル量が限られている場合、損失Lを用いることにより、グラフエンコーダが局所的なノイズや無関係な特徴の影響を受けることなく、グラフ内のグローバル情報及びトポロジー構造に注目できるため、グラフ表現学習のロバスト性を向上させることができる。また、損失Lを用いることにより、グラフエンコーダが訓練データ内の特定のサンプル又はサブグラフに過剰適合し、汎化能力を無視するのを防止できるため、過剰適合のリスクを軽減することができる。
【】
損失Lを用いて検索モデルにおけるグラフエンコーダとデコーダを訓練するだけでなく、訓練中に
【数】
を考慮してグラフエンコーダを訓練することもできる。離散化損失Ldiscは、ノードの隠れ表現zをベクトル化することによって生じる損失を示し、クラスタ中心cと離散化して得られたシーケンスzとの差である。損失Lと離散化損失Ldiscの加重合計をモデル全体の損失関数として使用することで、これらの損失を包括的に考慮し、グラフエンコーダ又はデコーダの性能を向上させることができる。
【】
以上の各損失は、検索モデルの性能を大幅に向上させることができる。具体的には、タンパク質又は高分子に対応するグラフデータの場合、カテゴリ予測損失Laaはアミノ酸配列のカテゴリ予測精度の向上に役立ち、離散化損失Ldiscはアミノ酸配列の構造予測精度の向上に役立つ。本開示の訓練方法は、グラフエンコーダ及びグラフデコーダをより効率的に訓練することができるため、両者の性能をより一層高めながら、グラフデータ内の構造情報をより適切に学習することができる。
【】
本開示の一実施形態によれば、グラフデータベースから入力オブジェクトを検索するためのデータ検索装置がさらに提供される。係る装置は、入力オブジェクトに対応するグラフデータを取得するステップであって、前記グラフデータには、少なくとも1つのノード及び各ノードに対応するノードデータが含まれ、前記ノードデータは前記ノードの3次元空間における位置情報を含み得るステップを実行するように構成されたグラフデータ構築モジュールと、グラフエンコーダを用いて前記グラフデータを符号化及び離散化し、前記入力オブジェクトに対応するデータシーケンスを取得するステップであって、前記データシーケンスは、符号化後に得られた各ノードのノード特徴及び位置特徴のうちの少なくとも1つの離散化情報を表すのものであるステップを実行するように構成された符号化モジュールと、前記グラフデータベースから、前記データシーケンスと所定の類似度閾値を満たす目標データシーケンスを検索するとともに、検索した目標データシーケンスに基づいて、前記入力オブジェクトと類似する出力オブジェクトを特定するステップを実行するように構成された比較モジュールとを備える。
【】
本開示の別の側面によれば、本開示の方法を実施するための電子デバイスがさらに提供される。図8は、本開示の電子デバイス2000を示す概略図である。
【】
図8に示すように、前記電子デバイス2000は、1つ以上のプロセッサ2010と、1つ以上のメモリ2020とを備えてもよい。ここで、前記メモリ2020には、コンピュータ読み取り可能なコードが記憶されている。前記コンピュータ読み取り可能なコードが前記1つ以上のプロセッサ2010によって実行されると、上述した方法を実行することができる。
【】
本開示の実施形態におけるプロセッサは、信号処理機能を備えた集積回路チップであってもよい。上述したプロセッサは、汎用プロセッサ、デジタル信号プロセッサ(DSP)、特定用途向け集積回路(ASIC)、フィールドプログラマブルゲートアレイ(FPGA)又はその他のプログラマブルロジックデバイス、個別ゲート又はトランジスタロジックデバイス、あるいは個別ハードウェアコンポーネントであってもよく、本開示の実施形態に開示された様々な方法、動作、及び論理ブロック図を実現又は実行することができる。汎用プロセッサは、マイクロプロセッサ、又はX86アーキテクチャやARMアーキテクチャなどの従来のプロセッサであってもよい。
【】
一般的に言えば、本開示の様々な例示的なハードウェアや専用回路、ソフトウェア、ファームウェア、ロジック、又はそれらの任意の組み合わせで実装することができる。ある側面はハードウェアで実装することができるが、他の側面は、コントローラ、マイクロプロセッサ、又は他のコンピューティングデバイスによって実行可能なファームウェア又はソフトウェアで実装することができる。本開示の実施形態の様々な側面が図示されているか、ブロック図、フローチャート、又はその他のグラフィカル表現で説明されている場合、本明細書で説明されるブロック、装置、システム、技術、又は方法は、非限定的な例として、ハードウェア、ソフトウェア、ファームウェア、専用回路又はロジック、汎用ハードウェア、コントローラ、又はその他のコンピューティングデバイス、又はそれらの組み合わせで実装できることを理解するであろう。
【】
例えば、本開示の実施形態による方法又は装置は、図9に示すコンピューティングデバイス3000のアーキテクチャを介して実装することもできる。図9に示すように、コンピューティングデバイス3000は、バス3010、1つ以上のCPU 3020、読み出し専用メモリ(ROM)3030、ランダムアクセスメモリ(RAM)3040、ネットワークに接続するための通信ポート3050、入出力コンポーネント3060、ハードディスク3070などを含むことができる。コンピューティングデバイス3000内のROM 3030やハードディスク3070などの記憶デバイスは、本明細書による方法の処理及び/又は通信に使用される様々なデータやファイル、並びにCPUによって実行されるコンピュータ命令を記憶することができる。コンピューティングデバイス3000は、ユーザーインターフェース3080を含むこともできる。もちろん、図7に示すアーキテクチャは単なる一例にすぎず、異なるデバイスを実装する場合、実際の必要に応じて、図7に示すコンピューティングデバイス内の1つ以上のコンポーネントを省略することができる。
【】
本開示の別の側面によれば、コンピュータ読み取り可能な記憶媒体がさらに提供される。図10は、本開示に係る記憶媒体4000を示す概略図である。
【】
図10に示すように、前記コンピュータ記憶媒体4020には、コンピュータ読み取り可能な命令4010が格納されている。前記コンピュータ読み取り可能な命令4010がプロセッサによって実行されると、の図面を参照しながら説明する本開示の実施形態による方法を実行することができる。本開示の実施形態におけるコンピュータ読み取り可能な記憶媒体は、揮発性メモリであってもよく、不揮発性メモリであってもよく、あるいは揮発性メモリと不揮発性メモリの両方を含んでもよい。不揮発性メモリは、読み出し専用メモリ(ROM)、プログラマブル読み出し専用メモリ(PROM)、消去可能なプログラマブル読み出し専用メモリ(EPROM)、電気的に消去可能なプログラマブル読み出し専用メモリ(EEPROM)、又はフラッシュメモリであってもよい。揮発性メモリは、外部キャッシュとして使用されるランダムアクセスメモリ(RAM)であってもよい。非限定的な説明ではないが、一例として、スタティックランダムアクセスメモリ(SRAM)、ダイナミックランダムアクセスメモリ(DRAM)、同期ダイナミックランダムアクセスメモリ(SDRAM)、ダブルデータレート同期ダイナミックランダムアクセスメモリ(DDR SDRAM)、拡張型同期ダイナミックランダムアクセスメモリ(ESDRAM)、同期リンクダイナミックランダムアクセスメモリ(SLDRAM)、及びダイレクトメモリバスランダムアクセスメモリ(DR RAM)など、多くの形式のRAMが利用可能である。本明細書に記載される方法のメモリは、これら及びその他の適切な種類のメモリを含むことを意図しているが、これらに限定されないことに注意されたい。本明細書に記載される方法のメモリは、これら及びその他の適切な種類のメモリを含むことを意図しているが、これらに限定されないことに注意されたい。
【】
本開示の実施形態によれば、コンピュータ読み取り可能な記憶媒体に記憶されたコンピュータ命令を含むコンピュータプログラム製品又はコンピュータプログラムがさらに提供される。コンピュータデバイスのプロセッサは、コンピュータ読み取り可能な記憶媒体からコンピュータ命令を読み取り、実行することにより、当該コンピュータデバイスに本開示の方法を実行させるようにする。
【】
なお、添付図面中のフローチャート及びブロック図は、本開示の様々な実施形態によるシステム、方法、及びコンピュータプログラム製品の実現可能なアーキテクチャ、機能及び動作を示している。この点において、フローチャート又はブロック図における各ブロックは、特定の論理機能を実現するための1つ以上の実行可能な命令を含むモジュール、プログラムセグメント、又はコードの一部を表すことができる。また、いくつかの代替な実装では、ブロック内に示される機能は、添付図面に示されている順序とは異なる順序で実行される場合があることに留意されたい。例えば、連続して示される2つのブロックは、実際には実質的に並行して実行される場合もあれば、関連する機能に応じて、逆の順序で実行される場合もある。また、ブロック図及び/又はフローチャートにおける各ブロック、並びにブロック図及び/又はフローチャートにおけるブロックの組み合わせは、特定の機能又は動作を実行する専用のハードウェアベースのシステムによって実装されてもよいし、専用のハードウェアとコンピュータ命令の組み合わせによって実装されてもよいことにも留意されたい。
【】
一般的に言えば、本開示の様々な例示的なハードウェアや専用回路、ソフトウェア、ファームウェア、ロジック、又はそれらの任意の組み合わせで実装することができる。ある側面はハードウェアで実装することができるが、他の側面は、コントローラ、マイクロプロセッサ、又は他のコンピューティングデバイスによって実行可能なファームウェア又はソフトウェアで実装することができる。本開示の実施形態の様々な側面が図示されているか、ブロック図、フローチャート、又はその他のグラフィカル表現で説明されている場合、本明細書で説明されるブロック、装置、システム、技術、又は方法は、非限定的な例として、ハードウェア、ソフトウェア、ファームウェア、専用回路又はロジック、汎用ハードウェア、コントローラ、又はその他のコンピューティングデバイス、又はそれらの組み合わせで実装できることを理解するであろう。
【】
で詳細に説明した本開示の例示的な説明のみを目的としており、限定的なものではない。当業者であれば、本開示の原理及び精神から逸脱することなく、これらの実施形態又はその特徴に対して様々な変更や組み合わせを加えることが可能であるが、そのような変更は本開示の範囲内に含まれることを理解するであろう。
【符号の説明】
【】
2000 電子デバイス
2010 プロセッサ
2020 メモリ
3000 コンピューティングデバイス
3010 バス
3020 CPU
3030 読み出し専用メモリ(ROM)
3040 ランダムアクセスメモリ(RAM)
3050 通信ポート
3060 入出力コンポーネント
3070 ハードディスク
3080 ユーザーインターフェース
4000 記憶媒体
4010 コンピュータ読み取り可能な命令
4020 コンピュータ記憶媒体
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【手続補正書】
【提出日】
【手続補正】
【補正対象書類名】特許請求の範囲
【補正対象項目名】全文
【補正方法】変更
【補正の内容】
【特許請求の範囲】
【請求項】
入力オブジェクトに対応するグラフデータを取得するステップであって、前記グラフデータには、少なくとも1つのノード及び各ノードに対応するノードデータが含まれるステップと、
グラフエンコーダを用いて前記グラフデータを符号化及び離散化し、前記入力オブジェクトに対応するデータシーケンスを取得するステップであって、前記データシーケンスは、符号化後に得られた各ノードのノード特徴及び位置特徴のうちの少なくとも1つの離散化情報を表すためものであるステップと、
前記グラフデータベースから、前記データシーケンスと所定の類似度閾値を満たす目標データシーケンスを検索し、検索した目標データシーケンスに基づいて、前記入力オブジェクトと類似する出力オブジェクトを特定するステップと、
を含む、ことを特徴とする検索方法。
【請求項】
前記入力オブジェクトは、3次元空間において3次元的に配置された複数の内部コンポーネントを有し、前記入力オブジェクトに対応するグラフデータ内の各ノードは、前記入力オブジェクトの1つ以上の内部コンポーネントに対応し、前記各ノードに対応するノードデータには、3次元空間における前記ノードの位置情報が含まれる、ことを特徴とする請求項1に記載の検索方法。
【請求項】
前記グラフデータには、ノード間に接続されたエッジデータであって、前記入力オブジェクト内の2つの内部コンポーネント間の関連付け関係を表すためのエッジデータがさらに含まれる、ことを特徴とする請求項2に記載の検索方法。
【請求項】
前記入力オブジェクトに対応するグラフデータは、回転同変性、並進同変性、及びスケーリング同変性のうちの少なくとも1つを満たす、ことを特徴とする請求項1に記載の方法。
【請求項】
前記入力オブジェクトがタンパク質である場合に、入力オブジェクトに対応するグラフデータを取得する前記ステップは、
前記タンパク質に含まれる複数のアミノ酸配列情報に基づいて、前記入力オブジェクトに対応するグラフデータ内の各ノード及びそのノードデータを特定するステップであって、各ノードには1つのアミノ酸が対応し、各ノードに対応するノードデータには、前記アミノ酸の主鎖上の各原子の種類情報と、3次元空間における各原子の座標が含まれるステップと、
前記グラフデータ内の各ノードのノードデータに基づいて、前記グラフデータ内の各エッジデータを特定するステップと、
を含む、ことを特徴とする請求項1に記載の方法。
【請求項】
前記グラフデータ内の各ノードのノードデータに基づいて、前記グラフデータ内の各エッジデータを特定する前記ステップは、
2つのアミノ酸の原子間の化学結合に基づいて、前記化学結合に対応するエッジデータを作成し格納するステップ、又は、
2つのアミノ酸の原子間の距離が所定の閾値未満であることに基づいて、2つのアミノ酸の原子を接続するエッジデータを作成し格納するステップ
を含む、ことを特徴とする請求項5に記載の検索方法。
【請求項】
前記グラフエンコーダには、同変なグラフニューラルネットワークモデル及び離散化器が含まれる場合に、グラフエンコーダを用いてグラフデータを符号化及び離散化する前記ステップは、
前記同変なグラフニューラルネットワークモデルを用いて、前記グラフデータを符号化し、前記グラフデータ内の各ノードのノード特徴及び位置特徴を取得するステップと、
前記離散化器を用いて、前記各ノードの前記ノード特徴及び位置特徴のうちの少なくとも1つをベクトル量子化し、前記各ノードのノード特徴及び位置特徴のうちの少なくとも1つの離散化情報を表すためのデータシーケンスを取得するステップと、
を含む、ことを特徴とする請求項1に記載の方法。
【請求項】
前記同変なグラフニューラルネットワークモデルには、各ノードのノード特徴ベクトル及び空間位置ベクトルを符号化するための複数の隠れ層又はパーセプトロンが含まれる場合に、1番目の隠れ層又はパーセプトロンを除く各隠れ層又はパーセプトロンの符号化は、
前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記グラフデータ内の第1ノード及び第2ノードが符号化されたノード特徴ベクトル及び位置特徴ベクトルを取得するステップと、
前記ノード特徴ベクトル及び位置特徴ベクトルに基づいて、前記第2ノードから前記第1ノードへの伝播メッセージを特定するステップと、
前記伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって符号化されたノード特徴ベクトル及び位置特徴ベクトルを特定するステップと、
を含む、ことを特徴とする請求項7に記載の方法。
【請求項】
前記ノード特徴ベクトル及び位置特徴ベクトルに基づいて、前記第2ノードから前記第1ノードへの伝播メッセージを特定する前記ステップは、
前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記第1ノード及び前記第2ノードが符号化された位置特徴ベクトルに基づいて、前記第1ノードと前記第2ノード間の同変性特徴ベクトルを特定するステップと、
前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記グラフデータ内の第1ノード及び前記第2ノードが符号化されたノード特徴ベクトル、前記第1ノードと前記第2ノード間の同変性特徴ベクトル、及び前記第1ノードと第2ノード間のエッジデータに基づいて、前記第2ノードから前記第1ノードへの伝播メッセージを特定するステップと、
を含む、ことを特徴とする請求項8に記載の方法。
【請求項】
前記第1ノードが複数の前記第2ノードに隣接する場合に、前記伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって符号化されたノード特徴ベクトルを特定する前記ステップは、
複数の前記第2ノードから前記第1ノードへの複数の伝播メッセージを取得するステップと、
前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記グラフデータ内の第1ノードが符号化されたノード特徴ベクトル及び前記複数の伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって前記第1ノードが符号化されたノード特徴ベクトルを特定するステップと、
を含む、ことを特徴とする請求項9に記載の方法。
【請求項】
前記第1ノードが複数の前記第2ノードに隣接する場合に、前記伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって符号化された位置特徴ベクトルを特定する前記ステップは、
複数の前記第2ノードから前記第1ノードへの複数の伝播メッセージを取得するステップと、
前記同変なグラフニューラルネットワークモデルにおける直前の隠れ層又はパーセプトロンによって、前記グラフデータ内の第1ノード及び複数の前記第2ノードが符号化された位置特徴ベクトル及び前記複数の伝播メッセージに基づいて、前記隠れ層又はパーセプトロンによって前記第1ノードが符号化された位置特徴ベクトルを特定するステップと、
を含む、ことを特徴とする請求項8~10のいずれか1項に記載の方法。
【請求項】
グラフデータベースから、前記データシーケンスと所定の類似度閾値を満たす目標データシーケンスを検索する前記ステップは、
動的計画法を用いて、前記データシーケンスを前記グラフデータベース内の他のデータシーケンスと比較し、前記データシーケンスと前記グラフデータベース内の他のデータシーケンスとの間の局所的な類似度を示す比較結果を取得するステップと、
前記比較結果に基づいて、入力オブジェクトと類似する出力オブジェクトを特定するステップと、
を含む、ことを特徴とする請求項1に記載の方法。
【請求項】
前記グラフエンコーダの訓練は、
前記グラフデータ内の各ノードに対応するノードデータに基づいて、訓練中のグラフエンコーダを用いて、各ノードの予測カテゴリ値を特定するステップと、
前記各ノードの予測カテゴリ値及び前記各ノードの実際のカテゴリ値に基づいて、カテゴリ予測損失を特定するステップと、
前記カテゴリ予測損失に基づいて、前記グラフエンコーダのニューラルネットワークパラメータを調整するステップと、
を含む、ことを特徴とする請求項1に記載の方法。
【請求項】
グラフデコーダを用いて前記グラフエンコーダの訓練を支援する場合に、前記グラフエンコーダの訓練は、
前記グラフデータ内の各ノードに対応するノードデータに基づいて、訓練中のグラフエンコーダを用いて各ノードの予測隠れ表現を特定するステップと、
前記各ノードの予測隠れ表現に基づいて、訓練中のグラフデコーダーを用いて前記各ノードの復元位置情報を特定するステップと、
前記各ノードの3次元空間における位置情報及び前記各ノードの復元位置情報に基づいて、位置不一致損失を特定するステップと、
前記位置不一致損失に基づいて、前記グラフエンコーダ及び/又は前記グラフデコーダーのニューラルネットワークパラメータを調整するステップと、
を含む、ことを特徴とする請求項13に記載の方法。
【請求項】
入力オブジェクトに対応するグラフデータを取得するステップであって、前記グラフデータには、少なくとも1つのノード及び各ノードに対応するノードデータが含まれるステップを実行するように構成されたグラフデータ構築モジュールと、
グラフエンコーダを用いて前記グラフデータを符号化及び離散化し、前記入力オブジェクトに対応するデータシーケンスを取得するステップであって、前記データシーケンスは、符号化後に得られた各ノードのノード特徴及び位置特徴のうちの少なくとも1つの離散化情報を表すためのものであるステップを実行するように構成された符号化モジュールと、
前記グラフデータベースから、前記データシーケンスと所定の類似度閾値を満たす目標データシーケンスを検索するとともに、検索した目標データシーケンスに基づいて、前記入力オブジェクトと類似する出力オブジェクトを特定するステップを実行するように構成された比較モジュールと、
を備える、ことを特徴とするデータ検索装置。
【請求項】
1つ以上のプロセッサと、1つ以上のメモリとを備え、前記メモリにはコンピュータ実行可能なプログラムが記憶されており、前記コンピュータ実行可能なプログラムが前記プロセッサによって実行されると、請求項1に記載の方法が実現される、ことを特徴とする電子デバイス。
【請求項】
コンピュータ命令を含むコンピュータプログラムであって、前記コンピュータ命令がプロセッサによって実行されると、請求項1に記載の方法が実現される、コンピュータプログラム。
【国際調査報告】

[広告欄]

ログインすれば広告は減ります

ログインすれば広告は減ります