技術分野
音声からなりすましを検出するための、なりすまし検出装置、なりすまし検出方法、及びこれらを実現するためのプログラム
発明が解決しようとする課題[発明の詳細な説明]から抜粋
CQTは、時間領域信号x(n)を時間周波数領域に変換して、各周波数ビンの中心周波数が幾何学的に離れ、且つ、品質係数Q、すなわち各ウィンドウの帯域幅に対する中心周波数の比が一定に保たれるようにする。従って、CQTは低周波数ではより優れた周波数分解能を、高周波数ではより優れた時間分解能を有する。CQTは、人間の聴覚システムにおける解像度を反映しており、なりすましの検出に適していると考えられる。
課題を解決するための手段[発明の詳細な説明]から抜粋
目的を達成するため、本発明の一側面における、なりすまし検出装置は、
音声データから種類の異なる複数のスペクトログラムを抽出し、抽出した複数のスペクトログラムを統合して、マルチチャネルスペクトログラムを生成する、マルチチャネルスペクトログラム生成手段と、
ラベル付きのマルチチャネルスペクトログラムを訓練データとして用いて構築された分類器に、生成された前記マルチチャネルスペクトログラ・・・ 続きを
知財ポータルサイト IP Force にログインして見る
発明の効果[発明の詳細な説明]から抜粋
以上のように本発明によれば、話者のなりすまし検出において、音声から得られる複数種類のスペクトログラムを用いて、誤認識の発生を抑制することができる。
この特許の権利範囲[特許請求の範囲]
知財ポータルサイト IP Force にログインして確認する (無料)
この特許公報に記載されている図面[図面の簡単な説明]から抜粋
図面は、詳細な説明とともに、本発明のなりすまし検出方法の原理を説明するのに役立つ。図面は説明のためのものであり、技術の適用を制限するものではない。
【図1】
図1は、本発明の実施の形態における、なりすまし検出装置の構成を概略的に示すブロック図である。
【図2】
図2は、本発明の実施の形態における、なりすまし検出装置の詳細構成を示すブロック図である。
【図3】
図3は、本発明の実施の形態における、マルチチャネルスペクトログラム生成部の一例を示すブロック図である。
【図4】
図4は、本発明の実施の形態における、マルチチャネルスペクトログラム生成部の他の例を示すブロック図である。
【図5】
図5は、本発明の実施の形態における、なりすまし検出装置の動作のフェーズを示す図であり、図5(a)は訓練フェーズを示し、図5(b)はなりすまし検出フェーズを示している。
【図6】
図6は、本発明の実施の形態における、なりすまし検出装置の全体の動作の一例を示すフロー図である。
【図7】
図7は、本発明の実施の形態における、なりすまし検出装置の訓練フェーズの特定の動作を示すフロー図である。
【図8】
図8は、本発明の実施の形態における、なりすまし検出フェーズの特定の動作を示すフロー図である。
【図9】
図9は、本発明の実施の形態における、マルチチャネルスペクトログラム生成部の動作の一例を示すフロー図である。
【図10】
図10は、本発明の実施の形態における、マルチチャネルスペクトログラム生成部の動作の他の例を示すフロー図である。
【図11】
図11は、本発明の実施の形態における、なりすまし検出装置を実現するコンピュータの一例を示すブロック図である。
10 マルチチャネルスペクトログラム生成部
11 CQT抽出部
12 FFT抽出部
13a リサンプリング部
13b リサンプリング部
14 スペクトログラムスタッキング部
15a ゼロ埋め部
15b ゼロ埋め部
20 分類器訓練部
30 記憶部
40 評価部
100 なりすまし検出装置
110 コンピュータ
111 CPU
112 メインメモリ
113 記憶装置
114 入力インターフェイス
115 表示コントローラ
116 データリーダ/ライタ
117 通信インターフェイス
118 入力機器
119 ディスプレイ装置
120 記録媒体
121 バス
全ての図面はログインすると無料で閲覧できます。ログイン・ユーザー登録