特表2024-529883IP Force 特許公報全文掲載

(19)【発行国】日本国特許庁(JP)
(12)【公報種別】公表特許公報(A)
(11)【公表番号】
(43)【公表日】
(54)【発明の名称】積分帯域ごとのパラメトリックオーディオコーディング
(51)【国際特許分類】
   
   
   
【FI】
【審査請求】有
【予備審査請求】有
(21)【出願番号】
(86)(22)【出願日】
(85)【翻訳文提出日】
(86)【国際出願番号】
(87)【国際公開番号】
(87)【国際公開日】
(31)【優先権主張番号】21185666.1
(32)【優先日】
(33)【優先権主張国・地域又は機関】
(81)【指定国・地域】
【公序良俗違反の表示】
(特許庁注:以下のものは登録商標)
1.Blu-ray
(71)【出願人】
【識別番号】500341779
【氏名又は名称】フラウンホーファー-ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン
(74)【代理人】
【識別番号】100085660
【弁理士】
【氏名又は名称】鈴木 均
(74)【代理人】
【識別番号】100149892
【弁理士】
【氏名又は名称】小川 弥生
(74)【代理人】
【識別番号】100185672
【弁理士】
【氏名又は名称】池田 雅人
(72)【発明者】
【氏名】マルコヴィック,ゴラン
(57)【要約】
複数のサブバンドに分割されたオーディオ信号のスペクトル表現(XMR)を符号化するためのエンコーダであって、スペクトル表現(XMR)は周波数ビンまたは周波数係数から構成され、少なくとも1つのサブバンドは2つ以上の周波数ビンを含み、エンコーダは、複数のサブバンドに分割されたオーディオ信号のスペクトル表現(XMR)の量子化表現(XQ)を生成するように構成された量子化器と、量子化表現(XQ)に応じてスペクトル表現(XMR)のコード化パラメトリック表現(zfl)を提供するように構成された帯域ごとのパラメトリックコーダであって、コード化パラメトリック表現(zfl)が、サブバンド内のスペクトル表現(XMR)を記述するパラメータ、またはパラメータのコード化バージョンから構成され、異なる少なくとも2つのサブバンド、および異なる少なくとも2つのサブバンド内のスペクトル表現(XMR)を記述するパラメータが存在する、帯域ごとのパラメトリックコーダと、を備える。
【選択図】図1a
【特許請求の範囲】
【請求項】
複数のサブバンドに分割されたオーディオ信号のスペクトル表現(XMR)を符号化するためのエンコーダ(1000)であって、前記スペクトル表現(XMR)が周波数ビンまたは周波数係数から構成され、少なくとも1つのサブバンドが1つよりも多い周波数ビンを含み、前記エンコーダ(1000)が、
前記複数のサブバンドに分割されたオーディオ信号の前記スペクトル表現(XMR)の量子化表現(XQ)を生成するように構成された量子化器(1030)と、
前記量子化表現(XQ)に応じて前記スペクトル表現(XMR)のコード化パラメトリック表現(zfl)を提供するように構成された帯域ごとのパラメトリックコーダ(1010)であって、前記コード化パラメトリック表現(zfl)が、前記サブバンド内の前記スペクトル表現(XMR)を記述するパラメータ、または前記サブバンド内の前記スペクトル表現(XMR)を記述する前記パラメータのコード化バージョンから構成され、異なる少なくとも2つのサブバンド、および異なる前記少なくとも2つのサブバンド内の前記スペクトル表現(XMR)を記述するパラメータが存在する、帯域ごとのパラメトリックコーダ(1010)と
を備える、エンコーダ(1000)。
【請求項】
前記複数のサブバンドのうちの少なくとも1つのサブバンドがゼロに量子化されるか、もしくは前記量子化表現(XQ)において前記複数のサブバンドのうちの少なくとも1つのサブバンドのスペクトル表現(XMR)がゼロであり、かつ/または
前記帯域ごとのパラメトリックコーダ(1010)が、ゼロに量子化された前記量子化表現(XQ)内の前記複数のサブバンドのうちの前記少なくとも1つのサブバンドを決定し、かつ/または前記帯域ごとのパラメトリックコーダ(1010)が、前記量子化表現(XQ)内でゼロに量子化された前記複数のサブバンドのうちの前記少なくとも1つのサブバンドをコード化し、かつ/または
前記パラメータが前記サブバンド内のエネルギーを記述し、もしくは前記パラメータがゼロに量子化された前記サブバンド内の前記エネルギーを記述する、
請求項1に記載のエンコーダ(1000)。
【請求項】
前記コード化パラメトリック表現(zfl)が可変数のビットを使用するか、もしくは前記コード化パラメトリック表現(zfl)を表現するために使用されるビットの前記数が、オーディオ信号の前記スペクトル表現(XMR)に依存し、かつ/または
コード化表現(spect)が可変数のビットを使用するか、もしくは前記コード化表現(spect)を表現するために使用されるビットの前記数が、オーディオ信号の前記スペクトル表現(XMR)に依存し、かつ/または
コード化表現(spect)が可変数のビットを有するエントロピーコーディングを使用し、かつ/または前記ゼロ充填レベルの前記エントロピーコーディングに必要な前記ビット数が計算され、かつ/または
前記コード化パラメトリック表現(zfk)およびコード化表現(spect)を表現するために使用されるビットの前記数が、所定の閾値を下回る、
請求項1または2に記載のエンコーダ(1000)。
【請求項】
前記量子化表現(XQ)のコード化表現(spect)を生成するように構成されたスペクトルコーダ(1020)をさらに備え、かつ/または
前記帯域ごとのパラメトリックコーダ(1010)が、スペクトルコーダ(1020)とともにジョイントコーダを形成し、かつ/または前記帯域ごとのパラメトリックコーダ(1010)が、スペクトルコーダ(1020)とともに、オーディオ信号の前記スペクトル表現(XMR)のコード化バージョンを一緒に取得するように構成される、
請求項1から3のいずれか一項に記載のエンコーダ(1000)。
【請求項】
サンプリングレートを有するオーディオ信号を前記スペクトル表現に変換して前記スペクトル表現を取得するように構成された時間スペクトル変換器またはMDCT変換器をさらに備える、請求項1から4のいずれか一項に記載のエンコーダ(1000、101、101’)。
【請求項】
前記スペクトル表現が知覚的に平坦化され、かつ/または前記エンコーダ(1000、101、101’)が、
前記スペクトル表現から知覚的に平坦化されたスペクトル表現を提供するように構成されたスペクトル整形器をさらに備え、かつ/または
前記知覚的に平坦化されたスペクトル表現が、スペクトル平坦化に使用されるコード化スペクトル形状とは異なるかもしくはより高い周波数分解能のサブバンドに分割され、かつ/または前記エンコーダ(1000、101、101’)が、
オーディオ信号をスペクトル的に平坦化するために、LPフィルタを用いて時間スペクトル変換器もしくはMDCT変換器の入力信号を処理するための手段をさらに備える、
請求項1から5のいずれか一項に記載のエンコーダ(1000、101、101’)。
【請求項】
最適量子化ステップを決定するため、もしくは最適量子化ステップを推定するように構成されたレート歪みループをさらに備え、かつ/または
少なくとも2つの反復ステップもしくは2つの量子化ステップのための少なくとも2つの反復ステップを実行するように構成されたレート歪みループをさらに備え、かつ/または
前の量子化ステップに依存する量子化ステップを適合させるように、もしくは最適量子化ステップを決定するために前の量子化ステップに依存する前記量子化ステップを適合させるように構成されたレート歪みループをさらに備える、
請求項1から6のいずれか一項に記載のエンコーダ(1000、1001)。
【請求項】
前記レート歪みループが、コーディングに使用されるビットを推定するように構成されたビットカウンタ(1050)、および/または前記スペクトル表現(XMR)を記述する前記パラメータを再コード化するように構成された再コーダ(1055)を備える、請求項7に記載のエンコーダ(1000、101、101’)。
【請求項】
前記スペクトル表現(XMR)を記述する前記パラメータの前記数が、前記量子化表現(XQ)に依存する、請求項1から8のいずれか一項に記載のエンコーダ(1000、101、101’)。
【請求項】
前記量子化表現(XQ)のコード化表現(spect)と前記コード化パラメトリック表現(zfl)とのジョイントコーディングが、前記ジョイントコーディングのためのビットの総数が所定の閾値を下回るという制約を満たすかどうかの判断を提供するように構成されたスペクトルコーダ判断エンティティをさらに備え、かつ/または
前記量子化スペクトルの前記コード化表現および前記パラメトリック表現の前記コード化表現の両方が、前記スペクトル表現に依存するか、もしくは前記知覚的に平坦化されたスペクトル表現の導関数に依存する可変数のビットおよび前記量子化ステップに基づく、
請求項4から9のいずれか一項に記載のエンコーダ(1000)。
【請求項】
前記量子化スペクトルおよび/またはオーディオ信号の前記スペクトル表現(XMR)における前記サブバンドのコンテンツに応じて、前記量子化スペクトルにおける少なくともサブバンドを適応的にゼロに設定するように構成された修正器(156m、302)をさらに備える、請求項1から10のいずれか一項に記載のエンコーダ(1000、300)。
【請求項】
前記パラメータが前記サブバンド内の前記エネルギーを記述し、前記帯域ごとのパラメトリックコーダ(1010)が2つの段を備え、前記2つの段の最初の段において、前記帯域ごとのパラメトリックコーダ(1010)が、ある周波数(fEZ)より上の前記サブバンドの個々のパラメトリック表現を提供するように構成され、前記2つの段の2番目の段が、前記周波数(fEZ)より上のサブバンド用の追加の平均パラメトリック表現を提供し、前記個々のパラメータ表現がゼロであり、前記周波数(fEZ)より下のサブバンド用である、請求項1から11のいずれか一項に記載のエンコーダ(1000)。
【請求項】
符号化オーディオ信号を復号するためのデコーダ(1200)であって、前記符号化オーディオ信号が、少なくともスペクトルのコード化表現(spect)およびコード化パラメトリック表現(zfl)から構成され、前記符号化オーディオ信号が量子化ステップ
をさらに含み、前記デコーダ(1200)が、
スペクトルの前記コード化表現(spect)および量子化ステップ
から復号および逆量子化されたスペクトル(XD)を生成するように構成されたスペクトル領域デコーダ(1230、156sd)であって、前記復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、スペクトル領域デコーダ(1230、156sd)と、
復号されたスペクトルまたは前記復号および逆量子化されたスペクトル(XD)内のゼロサブバンドを識別し、前記コード化パラメトリック表現(zfl)に基づいて前記ゼロサブバンドのパラメトリック表現(EB)を復号するように構成された帯域ごとのパラメトリックデコーダ(1210,162)と
を備え、
前記パラメトリック表現(EB)がサブバンドを記述するパラメータを含み、異なる少なくとも2つのサブバンド、したがって、異なる少なくとも2つのサブバンド内のパラメータが存在し、かつ/または前記コード化パラメトリック表現(zfl)が可変数のビットの使用によって表現され、かつ/または前記コード化パラメトリック表現(zfl)を表現するために使用されるビットの前記数が、スペクトルの前記コード化表現(spect)に依存する、
デコーダ(1200)。
【請求項】
符号化オーディオ信号を復号するためのデコーダ(1200)であって、前記符号化オーディオ信号が量子化ステップ
をさらに含み、前記デコーダ(1200)が、
前記符号化オーディオ信号に応じて復号および逆量子化されたスペクトル(XD)を生成するように構成されたスペクトル領域デコーダ(1230、156sd)であって、前記復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、スペクトル領域デコーダ(1230、156sd)と、
前記復号されたスペクトルまたは前記復号および逆量子化されたスペクトル(XD)内のゼロサブバンドを識別し、前記符号化オーディオ信号に基づいて、前記ゼロサブバンドのパラメトリック表現(EB)を復号するように構成された、帯域ごとのパラメトリックデコーダ(1210、162)と、
前記ゼロサブバンドの前記パラメトリック表現(EB)に応じて帯域ごとの生成スペクトルを生成するように構成された帯域ごとのスペクトル生成器(1220、158sg)と、
帯域ごとの合成スペクトル(XCT)を提供するように構成された合成器(1240、158c)であって、前記帯域ごとの合成スペクトル(XCT)が、前記帯域ごとの生成スペクトルと前記復号および逆量子化されたスペクトル(XD)の合成、または、前記帯域ごとの生成スペクトルと、予測スペクトル(XPS)および前記復号および逆量子化されたスペクトル(XD)の合成(XDT)と、の合成を含む、合成器(1240、158c)と、
前記帯域ごとの合成スペクトル(XCT)または前記帯域ごとの合成スペクトル(XCT)の導関数を時間表現に変換するように構成されたスペクトル時間変換器(1250、161)と
を備える、デコーダ(1200)。
【請求項】
前記帯域ごとの合成スペクトル(XCT)の前記導関数が、スペクトル整形器(SNS)および/もしくはノイズ整形器(TNS)の使用によって再整形された再整形スペクトル(XC)を含み、かつ/または前記デコーダ(1200)が、
スペクトル時間変換器の出力から時間領域信号を取得するように構成された手段、および/もしくはLPフィルタによる処理によって(スペクトル時間変換器の出力から導出された)時間領域信号をスペクトル的に整形するように構成された手段をさらに備える、
請求項14に記載のデコーダ(1200)。
【請求項】
前記帯域ごとのパラメトリックデコーダ(1210、162)が、量子化ステップを使用して前記符号化オーディオ信号に基づいて前記ゼロサブバンドのパラメトリック表現(EB)を復号するように構成され、かつ/または
前記パラメトリック表現(EB)が、サブバンド内のエネルギーを記述するパラメータを含み、異なる少なくとも2つのサブバンド、したがって、異なる少なくとも2つのサブバンド内のエネルギーを記述するパラメータが存在し、かつ/または
前記パラメトリック表現(EB)が、サブバンド内のエネルギーを記述するパラメータを含み、かつ/または
非ゼロサブバンド内の個々のゼロラインのエネルギーが推定され、明示的にコード化されず、かつ/または
ゼロサブバンドが、前記スペクトルデコーダ(1200)からの、復号されたスペクトルもしくは前記復号および逆量子化されたスペクトル出力によって画定され、かつ/または
前記コード化パラメトリック表現(zfl)が、可変数のビットの使用によってコード化され、かつ/または前記コード化パラメトリック表現(zfl)を表現するために使用されるビットの前記数が、スペクトルの前記コード化表現(spect)に依存し、かつ/または
前記パラメトリック表現(EB)が存在するサブバンドの数が、スペクトルの前記コード化表現(spect)に依存する、
請求項13、14、または15に記載のデコーダ(1200)。
【請求項】
前記ゼロサブバンドの前記パラメトリック表現(EB)の値が、量子化ステップ
に応じて復号されるか、または
パラメトリック表現がスペクトルの前記コード化表現(spect)に依存する、
請求項13、14、15、または16に記載のデコーダ(1200)。
【請求項】
前記帯域ごとのパラメトリックデコーダ(1210、162)が、前記スペクトル領域デコーダ(1230、156sd)の出力の情報を使用して、または前記復号および逆量子化されたスペクトル(XD)を使用して、前記符号化オーディオ信号に基づいて前記ゼロサブバンドの前記パラメトリック表現(EB)を復号するように構成される、請求項13、14、15、16、または17に記載のデコーダ(1200)。
【請求項】
前記スペクトル整形器が、コード化スペクトル形状から取得されたスペクトル形状を使用して、前記帯域ごとの合成スペクトル(XCT)または前記帯域ごとの合成スペクトル(XCT)の前記導関数をスペクトル的に整形するように構成され、前記コード化スペクトル形状が、前記サブバンド分割とは異なるか、またはより低い周波数分解能を使用する、請求項14に記載のデコーダ(1200)。
【請求項】
前記復号および逆量子化されたスペクトル(XD)に、または予測スペクトルと前記復号および逆量子化されたスペクトル(XDT)の合成に加算される生成スペクトル(XG)を生成するように構成された帯域ごとのパラメトリックスペクトル生成器(158sg)をさらに備え、前記生成スペクトル(XG)が、ソーススペクトルから帯域ごとに取得され、前記ソーススペクトルが、
-第2の予測スペクトル(XNP)、または
-ランダムノイズスペクトル(XN)、または
-前記生成スペクトルのすでに生成された部分、または
-前記復号および逆量子化されたスペクトル(XDT)もしくは前記予測スペクトルと前記復号および逆量子化されたスペクトル(XDT)の合成、または
-のうちの1つもしくは2つの合成
のうちの1つである、
請求項13から19のいずれか一項に記載のデコーダ(1200)。
【請求項】
前記復号および逆量子化されたスペクトル(XD)に、または予測スペクトルと前記復号および逆量子化されたスペクトル(XDT)の合成に加算される生成スペクトル(XG)を生成するように構成された帯域ごとのパラメトリックスペクトル生成器(158sg)であって、前記生成スペクトル(XG)が、ソーススペクトルから帯域ごとに取得され、前記ソーススペクトルが、
-第2の予測スペクトル(XNP)、または
-ランダムノイズスペクトル(XN)、または
-前記生成スペクトル(XG)のすでに生成された部分、または
-前記復号および逆量子化されたスペクトル(XDT)もしくは前記予測スペクトルと前記復号および逆量子化されたスペクトル(XDT)の合成、または
-のうちの1つもしくは2つの合成
のうちの1つである、
帯域ごとのパラメトリックスペクトル生成器(158sg)。
【請求項】
ソーススペクトルが、ゼロサブバンドのエネルギーパラメータに基づいて重み付けされる、請求項13から19のいずれか一項に記載のデコーダ(1200)。
【請求項】
前記ソーススペクトルが、ゼロ帯域の前記エネルギーパラメータ(EB)に基づいて重み付けされる、請求項20または21に記載の帯域ごとのパラメトリックスペクトル生成器(158sg)。
【請求項】
サブバンド用の前記ソーススペクトル(158sc)の選択が、前記サブバンド位置、音調性情報(toi)、パワースペクトル推定値(ZC)、エネルギーパラメータ(EB)、ピッチ情報(pii)、および/または時間情報(tei)のうちの少なくとも1つに依存する、請求項13から20のいずれか一項に記載のデコーダ(1200)。
【請求項】
サブバンド用の前記ソーススペクトル(158sc)の選択が、前記サブバンド位置、音調性情報(toi)、パワースペクトル推定値(ZC)、エネルギーパラメータ(EB)、ピッチ情報(pii)、および/または時間情報(tei)のうちの少なくとも1つに依存する、請求項21または23のいずれか一項に記載の帯域ごとのパラメトリックスペクトル生成器(158sg)。
【請求項】
前記音調性情報がφHであり、かつ/またはピッチ情報が
であり、かつ/または時間情報がTNSがアクティブであるか否かの前記情報である、請求項24に記載のデコーダ(1200)。
【請求項】
前記音調性情報がφHであり、かつ/またはピッチ情報が
であり、かつ/または時間情報がTNSがアクティブであるか否かの前記情報である、請求項25に記載の帯域ごとのパラメトリックスペクトル生成器(158sg)。
【請求項】
複数のサブバンドに分割されたオーディオ信号のスペクトル表現(XMR)を符号化するための方法であって、前記スペクトル表現(XMR)が周波数ビンまたは周波数係数から構成され、少なくとも1つのサブバンドが1つよりも多い周波数ビンを含み、前記方法が、
複数のサブバンドに分割されたオーディオ信号の前記スペクトル表現(XMR)の量子化表現(XQ)を生成するステップと、
前記量子化表現(XQ)に応じて前記スペクトル表現(XMR)のコード化パラメトリック表現(zfl)を提供するステップであって、前記コード化パラメトリック表現(zfl)が、前記サブバンド内の前記スペクトル表現(XMR)を記述するパラメータ、または前記サブバンド内の前記スペクトル表現(XMR)を記述する前記パラメータのコード化バージョンから構成され、異なる少なくとも2つのサブバンド、および異なる前記少なくとも2つのサブバンド内の前記スペクトル表現(XMR)を記述するパラメータが存在する、ステップと
を含む、方法。
【請求項】
符号化オーディオ信号を復号するための方法であって、前記符号化オーディオ信号が、少なくともスペクトルのコード化表現(spect)およびコード化パラメトリック表現(zfl)から構成され、前記符号化オーディオ信号が量子化ステップ
をさらに含み、前記方法が、
スペクトルの前記コード化表現(spect)および量子化ステップ
から復号および逆量子化されたスペクトル(XD)を生成するステップであって、前記復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、ステップと、
復号されたスペクトルまたは前記復号および逆量子化されたスペクトル(XD)内のゼロサブバンドを識別し、前記コード化パラメトリック表現(zfl)に基づいて前記ゼロサブバンドのパラメトリック表現(EB)を復号するステップと
を含み、
前記パラメトリック表現(EB)がサブバンドを記述するパラメータを含み、異なる少なくとも2つのサブバンド、したがって、異なる少なくとも2つのサブバンド内のパラメータが存在し、かつ/または前記コード化パラメトリック表現(zfl)が可変数のビットの使用によって表現され、かつ/または前記コード化パラメトリック表現(zfl)を表現するために使用されるビットの前記数が、スペクトルの前記コード化表現(spect)に依存する、
方法。
【請求項】
符号化オーディオ信号を復号するための方法であって、前記方法が、
符号化オーディオ信号に基づいて復号および逆量子化されたスペクトル(XD)を生成するステップであって、前記復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、ステップと、
復号されたスペクトルまたは前記復号および逆量子化されたスペクトル(XD)においてゼロサブバンドを識別し、前記符号化オーディオ信号に基づいて前記ゼロサブバンドのパラメトリック表現(EB)を復号するステップと、
前記ゼロサブバンドの前記パラメトリック表現(EB)に応じて帯域ごとの生成スペクトルを生成するステップと
帯域ごとの合成スペクトル(XCT)を提供するステップであって、前記帯域ごとの合成スペクトル(XCT)が、前記帯域ごとの生成スペクトルと前記復号および逆量子化されたスペクトル(XD)
)の合成、または前記帯域ごとの生成スペクトルの合成、および予測スペクトル(XPS)と前記復号および逆量子化されたスペクトル(XD)の合成(XDT)を含む、ステップと、
前記帯域ごとの合成スペクトル(XCT)または前記帯域ごとの合成スペクトル(XCT)の導関数を時間表現に変換するステップと
を含む、方法。
【請求項】
帯域ごとの生成スペクトルを生成するための方法であって、前記復号および逆量子化されたスペクトル(XD)に、または予測スペクトルと前記復号および逆量子化されたスペクトル(XDT)の合成に加算される生成スペクトル(XG)を生成するステップを含み、前記生成スペクトル(XG)が、ソーススペクトルから帯域ごとに取得され、前記ソーススペクトルが、
-第2の予測スペクトル(XNP)、または
-ランダムノイズスペクトル(XN)、または
-前記生成スペクトル(XG)のすでに生成された部分、または
-のうちの少なくとも2つの合成
のうちの1つである、方法。
【請求項】
コンピュータ上で実行されると、請求項28から31のいずれか一項に記載の方法を実行するためのプログラムコードを有するコンピュータプログラムを記憶している、コンピュータ可読デジタル記憶媒体。
【発明の詳細な説明】
【技術分野】
【】
エンコーダおよびデコーダに言及する。さらなる符号化および復号のための方法、ならびに対応するコンピュータプログラムに言及する。一般に、積分帯域ごとのパラメトリックコーダの分野にある。
【背景技術】
【】
低ビットレートの現代のオーディオおよび音声コーダは、通常、そのスペクトル帯域幅の少なくとも一部にある種のパラメトリックコーディングを使用する。パラメトリックコーディングは、波形保存コーダ(この場合、帯域幅拡張を有するコアコーダと呼ばれる)から分離されるか、または非常に単純である(例えば、ノイズ充填)。
従来技術では、パラメトリックコーダの分野におけるいくつかの手法がすでに知られている。
[1]では、伝達されたノイズフィルインレベルから導出された振幅のコンフォートノイズは、ゼロに丸められたサブベクトルに挿入される。
[2]では、エンコーダにおけるノイズレベル計算およびノイズ置換検出は、
・ノイズ置換によってデコーダにおいて知覚的に等価に再生され得るスペクトル帯域を検出およびマーキングする。例えば、音調性またはスペクトル平坦性の尺度は、この目的のためにチェックされる場合がある、
・平均量子化誤差を計算し、量子化する(それは、複数のスケールファクタ帯域またはゼロに量子化されていないすべてのスケールファクタ帯域にわたって計算される場合がある)、および
・(デコーダが)導入したノイズが元のエネルギーと一致するように、ゼロに量子化された帯域用のスケールファクタを計算する。
[2]では、ノイズは「ノイズ充填開始ライン」から始まってゼロに量子化されたスペクトル線に導入され、導入されたノイズの振幅は平均量子化誤差に依存し、導入されたノイズは帯域ごとにスケールファクタでスケーリングされる。
【】
[3]では、周波数領域コーダにおけるノイズ充填が提案され、ゼロ量子化ラインは音調性および非ゼロ量子化ラインの位置に応じて整形されたランダムノイズで置き換えられ、挿入されたノイズのレベルはグローバルノイズレベルに基づいて設定される。
[4]では、ノイズ状の成分は、エンコーダ内でコーダ周波数帯域に基づいて検出される。ノイズ状の成分を含むスケールファクタ帯域内のスペクトル係数は量子化/コーディングから省略され、ノイズ置換フラグおよび置換帯域の総電力のみが伝達される。デコーダにおいて、所望の全電力を有するランダムベクトルが置換スペクトル係数用に挿入される。
[5]では、不調波性を回避する時間領域内で動作する帯域幅拡張方法が提案されている。復号信号の調波性は、振幅スペクトルの自己相関関数の計算によって保証され、振幅スペクトルは復号された時間領域信号から取得される。自己相関を使用することにより、F0の推定が回避される。LF部分の分析信号は、ヒルベルト変換によって生成され、変調器によって増幅されて帯域幅拡張をもたらす。包絡線整形およびノイズ加算は、SBRによって行われる。
【】
[6]では、完全なコア帯域がHF領域にコピーされ、その後、コアの最高高調波が複製されたスペクトルの最低高調波と一致するようにシフトされる。最後に、スペクトル包絡線が復元される。変調周波数とも呼ばれる周波数シフトは、全スペクトルを使用してエンコーダ側で、またはコア帯域のみを使用してデコーダ側で計算され得るf0に基づいて計算される。提案はまた、LF帯域とHF帯域とを分離するためにMDCTの急勾配帯域通過フィルタを利用する。
[7~14]では、インテリジェントギャップ充填(IGF)と呼ばれるセミパラメトリックコーディング技法が提案され、この技法は、低周波コンテンツから生成された合成HFと、HFスペクトルおよび時間包絡線から構成されるパラメトリックサイド情報による後処理とを使用して、高周波領域内のスペクトルホールを充填する。IGF範囲は、ユーザ定義のIGF開始および停止周波数によって決定される。コアコーダによる波形保存方法でコード化される必要があると見なされた波形、例えば顕著なトーンは、IGF開始周波数の上に位置する場合もある。エンコーダは、IGF範囲内のスペクトル包絡線をコード化し、その後、MDCTスペクトルを量子化する。デコーダは、IGF開始周波数の下の従来のノイズ充填を使用する。スペクトル帯域幅の表形式のユーザ定義の分割は、タイル境界におけるトーンに関連する問題を低減するために、ソースパーティション(タイル)の可能な信号適応選択およびタイルの後処理(例えば、クロスフェード)とともに使用される。
【】
[11]では、心理音響モデルに基づいて、IGFにおけるソースターゲットタイルマッピングおよびホワイトニングレベルの自動選択が提案されている。
[15]では、エンコーダは、スペクトル内の極値係数を見つけ、極値係数またはその近傍係数を修正し、サイド情報を生成し、その結果、擬似係数は修正されたスペクトルおよびサイド情報によって示される。擬似係数は、復号されたスペクトルにおいて決定され、修正されたスペクトルを取得するためにスペクトル内の事前定義された値に設定される。時間領域信号は、スペクトル位置および疑似係数の値によって制御される発振器によって生成される。生成された時間領域信号は、修正されたスペクトルから取得された時間領域信号と混合される。
[16]では、疑似係数は、復号されたスペクトルにおいて決定され、固定トーンパターンまたは周波数掃引パターンによって置き換えられる。
[17][18]では、量子化器は、入力信号特性に応じて適合された不感帯を使用する。不感帯は、低レベルのスペクトル係数、潜在的にノイズが多い係数がゼロに量子化されることを保証する。
【】
以下、従来技術の欠点が説明され、従来技術の分析および欠点の識別は本発明の一部である。
従来技術では、単に単純なノイズ充填がコアコーダに統合され[1][2][3][4]、コアコーダがスペクトル線用の波形保存量子化器であるか、またはコアコーダと帯域幅拡張との間に相違がある[1][5][6][7~14]。IGF[7~14]が全帯域幅におけるスペクトル線の保存を可能にする場合でも、それはスペクトル領域エンコーダの前に動作するスペクトル分析器を必要とするので、スペクトル領域エンコーダの結果に応じてスペクトルのどの部分をパラメトリックにコード化するかを選択することは可能でない。[4]のPNSは、量子化の前に、音調性のみに応じて、どのサブバンドをゼロにするかを判断し、サブバンドの置換にランダムノイズのみを使用する。
[15]では、単一音調成分のパラメトリックコーディングのみが考慮されている。量子化器の前に、どのスペクトル線をパラメトリックにコード化するかが判断され、判断には単純な最大値決定のみが使用される。量子化器の結果は、どのスペクトル線をパラメトリックにコード化するかを決定するために使用されない。非ゼロ疑似係数はスペクトル内でコード化される必要があり、非ゼロ係数をコード化することは、ほとんどすべての場合において、ゼロ係数をコード化することよりも高くつく。疑似係数をコード化することに加えて、疑似係数を波形保存スペクトル係数から区別するためにサイド情報が必要とされる。したがって、多くの音調成分を有する信号を生成するために、多くの情報が伝達される必要がある。方法はまた、信号の非音調部分に対するいかなる解決策も提案していない。加えて、パラメトリックにコード化された多くの音調成分を含む信号を生成するための計算複雑度は非常に高い。
【】
[16]では、時間領域生成器の代わりにスペクトルパターンを使用することにより、[15]と比較して高い計算複雑度が低減される。さらに、疑似係数を置き換えるために所定のパターンまたはそれらの修正のみが使用され、したがって多くのストレージを必要とするか、または生成され得る可能なトーンの範囲を制限する。[15]からの他の欠点は[16]に残っている。
[1][2][3]および同様の方法におけるノイズ充填は、ゼロに量子化されたスペクトル線の置換を提供するが、スペクトル分解能は非常に低く、通常は全帯域幅に対して単一のレベルのみを使用する。
IGFは事前定義されたサブバンド分割を有し、スペクトル包絡線は、いくつかのサブバンドに対してのみスペクトル包絡線を適応的に伝達する可能性なしに、完全なIGF範囲に対して伝達される。
[5]では、変調器で使用されるオフセットを選択するために、振幅スペクトルの自己相関の特性および事前定義された定数のみが使用される。全スペクトル帯域幅に対して1つのオフセットのみが見つかる。
[6]では、全帯域幅用の1つの変調周波数のみが周波数シフトに使用され、変調周波数が基本周波数のみに基づいて計算される。
【】
[11]では、IGF開始周波数の下に事前定義されたソースタイルのみが、IGFターゲット範囲を満たすために使用され、ターゲット範囲は開始周波数の上である。タイル選択は適応符号化によって規定され、したがってビットストリーム内でコード化される必要がある。提案された総当たり手法は、高い計算複雑度を有する。
IGFでは、ソースタイルは、IGF開始周波数の下で取得され、したがって、IGF開始周波数の上に位置する波形保存コアコード化突出トーンを使用しない。また、合成された低周波数コンテンツと、IGF開始周波数の上に位置する波形保存コアコード化突出トーンとをソースタイルとして使用することについて言及されていない。これは、IGFがコアコーダに追加されたツールであり、コアコーダの不可欠な部分ではないことを示す。
不感帯[17][18]を使用する方法は、ゼロに設定されるべきスペクトル係数の値の範囲を推定しようと試みる。それらは量子化の実際の出力を使用していないので、推定に誤差が生じやすい。
【発明の概要】
【発明が解決しようとする課題】
【】
本発明の目的は、効率的なコーディング、特に効率的なパラメトリックコーディングのための概念を提供することである。
【課題を解決するための手段】
【】
この目的は、独立請求項の主題によって解決される。
一複数のサブバンドに分割されたオーディオ信号のスペクトル表現(XMR)を符号化するためのエンコーダを提供し、スペクトル表現(XMR)は周波数ビンまたは周波数係数から構成され、少なくとも1つのサブバンドは2つ以上の周波数ビンを含む。エンコーダは、量子化器および帯域ごとのパラメトリックコーダを備える。量子化器は、複数のサブバンドに分割されたオーディオ信号のスペクトル表現(XMR)の量子化表現(XQ)を生成するように構成される。帯域ごとのパラメトリックコーダは、量子化表現(XQ)に応じて(基づいて)、例えば帯域ごとに、スペクトル表現(XMR)のコード化パラメトリック表現(zfl)を提供するように構成され、コード化パラメトリック表現(zfl)は、サブバンド内のエネルギーを記述するパラメータ、またはサブバンド内のエネルギーを記述するパラメータのコード化バージョンから構成され、異なる少なくとも2つのサブバンド、したがって異なる少なくとも2つのサブバンド内のエネルギーを記述する対応するパラメータが存在する。少なくとも2つのサブバンドは、複数のサブバンドに属する場合があることに留意されたい。
本発明の一態様は、オーディオ信号または複数のサブバンドに分割されたオーディオ信号のスペクトル表現を帯域ごとに効率的にコード化できるという知見に基づく(帯域ごとは、帯域/サブバンドごとを意味する場合がある)。実施形態によれば、概念は、(スペクトルを量子化するために使用される)量子化器によってゼロに量子化されたサブバンドにおいてのみパラメトリックコーディングを限定することを可能にする。この概念は、スペクトルおよび帯域ごとのパラメータの効率的なジョイントコーディングを可能にし、その結果、スペクトルコーダのスペクトル分解能よりも低いが、パラメトリックコーディングのための高いスペクトル分解能が実現される。結果として得られたコーダは、波形保存コーダ内の積分帯域ごとのパラメトリックコーディングエンティティとして定義される。実施形態によれば、スペクトルコーダとともに帯域ごとのパラメトリックコーダは、オーディオ信号のスペクトル表現(XMR)のコード化バージョンを一緒に取得するように構成される。このジョイントコーダの概念は、2つのコーダ間のビットレート分配が一緒に行われ得るという利点を有する。
【】
さらなる実施形態によれば、少なくとも1つのサブバンドはゼロに量子化される。例えば、パラメトリックコーダは、どのサブバンドがゼロであるかを特定し、ゼロであるサブバンドの表現(だけ)をコード化する。実施形態によれば、少なくとも2つのサブバンドは異なるパラメータを有する場合がある。
実施形態によれば、スペクトル表現は知覚的に平坦化される。これは、例えば、コード化スペクトル形状から取得されたスペクトル形状に基づいて、スペクトル表現から知覚的に平坦化されたスペクトル表現を提供するように構成されたスペクトル整形器を使用することによって行うことができる。知覚的に平坦化されたスペクトル表現は、コード化スペクトル形状とは異なるかまたはより高い周波数分解能のサブバンドに分割されることに留意されたい。
さらなる実施形態によれば、エンコーダは、サンプリングレートを有するオーディオ信号をスペクトル表現に変換するように構成されたMDCT変換器のような時間スペクトル変換器をさらに備える場合がある。前記拡張から始めて、帯域ごとのパラメトリックコーダは、知覚的に平坦化されたスペクトル表現のパラメトリック表現、またはスペクトル的に平坦化されたスペクトル表現の導関数を提供するように構成され、パラメトリック表現は、最適量子化ステップに依存する場合があり、サブバンド内のエネルギーを記述するパラメータから構成される場合があり、量子化スペクトルはゼロであり、その結果、少なくとも2つのサブバンドは異なるパラメータを有するか、または少なくとも1つのパラメータは1つのサブバンドのみに限定される。
【】
さらなる実施形態によれば、スペクトル表現は最適量子化ステップを決定するために使用される。例えば、エンコーダは、量子化ステップを決定するように構成されたいわゆるレート歪みループの使用によって強化することができる。これにより、前記レート歪みループが、で使用された最適量子化ステップを決定または推定することが可能になる。これは、前記ループがいくつかの(少なくとも2つの)反復ステップを実行するように行われる場合があり、量子化ステップは1つまたは複数の前の量子化ステップに応じて適合される。
量子化スペクトルの表現をコード化するために、エンコーダは、無損失スペクトルコーダをさらに備える場合がある。さらなる実施形態によれば、エンコーダは、量子化スペクトルのコード化表現とパラメトリック表現のコード化表現のジョイントコーディングが、ジョイントコーディング用のビットの総数が所定の閾値を下回るという制約を満たすかどうかの判断を提供するように構成されたスペクトルコーダおよび/またはスペクトルコーダ判断エンティティを備える。これは、量子化スペクトルの符号化表現およびパラメトリックスペクトルのコード化表現の両方が、スペクトル表現に依存するか、または知覚的に平坦化されたスペクトル表現の導関数および量子化ステップに依存する可変数のビット(任意選択の特徴)に基づくときに、特に理にかなっている。さらなる実施形態によれば、帯域ごとのパラメトリックコーダならびにスペクトルコーダの両方は、例えば、可変数のビットまたは量子化ステップの両方に使用されるパラメータを考慮に入れるために相互作用を可能にするジョイントコーダを形成する。
【】
さらなる実施形態によれば、エンコーダは、量子化スペクトルおよび/またはスペクトル表現におけるサブバンドのコンテンツに応じて、量子化ステップにおける少なくともサブバンドを適応的にゼロに設定するように構成された修正器をさらに備える。
さらなる実施形態によれば、帯域ごとのパラメトリックコーダは2つの段を含み、帯域ごとのパラメトリックコーダの2つの段の最初の段は、ある周波数より上のサブバンドの個々のパラメトリック表現を提供するように構成され、2つの段の2番目の段は、例えば(個々の)サブバンドのパラメトリック表現に基づいて、ある周波数より上のサブバンド用の追加の平均パラメトリック表現を提供し、個々のパラメータ表現はゼロであり、ある周波数より下のサブバンド用である。
【】
実施形態によれば、このエンコーダは、方法、すなわち以下の、
-複数のサブバンドに分割されたオーディオ信号のスペクトル表現XMRの量子化表現XQを生成するステップと、
-量子化表現XQに応じてスペクトル表現XMRのコード化パラメトリック表現zflを提供するステップであって、コード化パラメトリック表現zflが、サブバンド内のスペクトル表現XMRを記述するパラメータ、またはパラメータのコード化バージョンから構成され、異なる少なくとも2つのサブバンド、および異なる少なくとも2つのサブバンド内のスペクトル表現XMRを記述するパラメータが存在する、ステップと
を含む、オーディオ信号を符号化するための方法によって実装される場合がある。
ここで、異なる少なくとも2つのサブバンドが存在し、したがって、少なくとも2つのサブバンド内のエネルギーを記述するパラメータは異なる。
【】
別の実施形態はデコーダを提供する。デコーダは、スペクトル領域デコーダと帯域ごとのパラメトリックデコーダとを含む。スペクトル領域デコーダは、符号化オーディオ信号に基づいて復号されたスペクトルまたは逆量子化(および復号)されたスペクトルを生成するように構成され、復号されたスペクトルはサブバンドに分割される。任意選択で、スペクトル領域デコーダは、量子化ステップに関する情報を復号/逆量子化するために使用される。帯域ごとのパラメトリックデコーダは、復号および/または逆量子化されたスペクトル内のゼロサブバンドを識別し、符号化オーディオ信号に基づいてゼロサブバンドのパラメトリック表現を復号するように構成される。ここで、パラメトリック表現は、サブバンドを記述するパラメータ、例えばサブバンド内のエネルギーを含み、異なる少なくとも2つのサブバンド、したがって異なる少なくとも2つのサブバンドを記述するパラメータが存在し、識別は、復号および逆量子化されたスペクトル、または逆量子化ステップなしでスペクトル領域デコーダによって処理された、復号スペクトルと呼ばれるスペクトルのみに基づいて実行され得ることに留意されたい。追加または代替として、コード化パラメトリック表現は、可変数のビットの使用によってコード化され、かつ/またはコード化パラメトリック表現を表現するために使用されるビットの数は、オーディオ信号のスペクトル表現に依存する。言い換えて表すと、これは、デコーダが、ジョイントコーディングされたスペクトルおよび帯域ごとのパラメータから復号出力を生成するように構成されることを意味する。
【】
別の以下のエンティティ:スペクトル領域デコーダ、帯域ごとのスペクトル生成器と組み合わされた帯域ごとのパラメトリックデコーダ、合成器、およびスペクトル時間変換器を有する別のデコーダを提供する。スペクトル領域デコーダ、帯域ごとのパラメトリックデコーダは、のように定義されてもよく、あるいは、IGF([7~14]参照)からのような別のパラメトリックデコーダが使用されてもよい。帯域ごとのスペクトル生成器は、ゼロサブバンドのパラメトリック表現に応じて、帯域ごとの生成スペクトルを生成するように構成される。合成器は、帯域ごとの合成スペクトルを提供するように構成され、帯域ごとの合成スペクトルは、帯域ごとの生成スペクトルと復号スペクトルの合成、または帯域ごとの生成スペクトルの合成、または予測スペクトルと復号スペクトルの合成を含む。スペクトル時間変換器は、帯域ごとの合成スペクトルあるいはその導関数(例えば、SNSもしくはTNSによって再整形された、または代替としてLP予測子の使用によって再整形された再整形スペクトル)を時間表現に変換するように構成される。
【】
帯域ごとのパラメトリックデコーダは、実施形態によれば、量子化ステップを使用して、符号化オーディオ信号に基づいてゼロサブバンドのパラメトリック表現(EB)を復号するように構成される場合がある。さらなる実施形態によれば、デコーダは、帯域ごとの合成スペクトル、または帯域ごとの合成スペクトルの導関数から再整形されたスペクトルを提供するように構成されたスペクトル整形器を備える。例えば、スペクトル整形器は、サブバンド分割とは異なるかまたはより低い周波数分解能のコード化スペクトル形状から取得されたスペクトル形状を使用することができる。
さらなる実施形態によれば、パラメトリック表現は、少なくとも2つのサブバンドが異なるパラメータを有するように、または少なくとも1つのパラメータが1つのサブバンドのみに限定されるように、ゼロサブバンド内のエネルギーを記述するパラメータから構成される。ゼロサブバンドは、スペクトルデコーダの復号および/または逆量子化されたスペクトル出力によって画定されることに留意されたい。
【】
別の実施形態によれば、帯域ごとのパラメトリックスペクトル生成器は、のデコーダと一緒に、または独立して設けられる場合がある。パラメトリックスペクトル生成器は、復号および逆量子化されたスペクトルに、または予測スペクトルと復号スペクトルの合成に加算される生成スペクトルを生成するように構成される。復号および逆量子化されたスペクトルに加算するステップは、例えば、システム内にLTPが存在しないときに実行されることに留意されたい。ここで、生成スペクトル(XG)は、ソーススペクトルから帯域ごとに取得される場合があり、ソーススペクトルは、
-第2の予測スペクトル(XNP)、または
-ランダムノイズスペクトル(XN)、または
-生成スペクトルのすでに生成された部分、または
-のうちの1つの合成
のうちの1つである。
デコーダは、方法によって実装される場合がある。オーディオ信号を復号するための方法は、
-スペクトルのコード化表現(spect)から復号および逆量子化されたスペクトル(XD)を生成するステップであって、復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、ステップと、
-復号および逆量子化されたスペクトル(XD)内のゼロサブバンドを識別し、コード化パラメトリック表現(zfl)に基づいてゼロサブバンドのパラメトリック表現(EB)を復号するステップと
を含む
パラメトリック表現(EB)はサブバンドを記述するパラメータを含み、異なる少なくとも2つのサブバンド、したがって異なる少なくとも2つのサブバンドを記述するパラメータが存在し、かつ/またはコード化パラメトリック表現(zfl)は、可変数のビットの使用によってコード化され、かつ/またはコード化パラメトリック表現(zfl)を表現するために使用されるビット数は、スペクトルのコード化表現(spect)に依存することに留意されたい。
【】
あるいは、方法は、以下の
-符号化オーディオ信号に基づいて復号および逆量子化されたスペクトル(XD)を生成するステップであって、復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、ステップと、
-符号化オーディオ信号に基づいて、復号および逆量子化されたスペクトル(XD)内のゼロサブバンドを識別し、ゼロサブバンドのパラメトリック表現(EB)を復号するステップと、
-ゼロサブバンドのパラメトリック表現(EB)に応じて帯域ごとの生成スペクトルを生成するステップと
-帯域ごとの合成スペクトル(XCT)を提供するステップであって、帯域ごとの合成スペクトル(XCT)が、帯域ごとの生成スペクトルと復号および逆量子化されたスペクトル(XD)の合成、または帯域ごとの生成スペクトルの合成、および予測スペクトル(XPS)と復号および逆量子化されたスペクトル(XD)の合成(XDT)を含む、ステップと、
-帯域ごとの合成スペクトル(XCT)または帯域ごとの合成スペクトル(XCT)の導関数を時間表現に変換するステップと
を含む。
【】
上述された生成器は、復号および逆量子化されたスペクトルに、または予測スペクトルと復号スペクトルの合成に加算される生成スペクトルを生成するための方法によって実装される場合があり、生成スペクトルは、ソーススペクトルから帯域ごとに取得され、ソーススペクトルは、
-第2の予測スペクトル、または
-ランダムノイズスペクトル、または
-生成スペクトルのすでに生成された部分、または
-のうちの1つの合成
のうちの1つである。
ソーススペクトルは、列挙された可能性のいずれかから導出され得ることに留意されたい。
【】
実施形態によれば、ソーススペクトルは、ゼロサブバンドのエネルギーパラメータに基づいて重み付けされる。さらなる実施形態によれば、サブバンド用のソーススペクトルの選択は、サブバンド位置、音調性情報、パワースペクトル推定値、エネルギーパラメータ、ピッチ情報、および/または時間情報に依存する。音調性情報はφHであり得、かつ/またはピッチ情報は
であり得、かつ/または時間情報はTNSがアクティブであるか否かの情報であり得ることに留意されたい。
実施形態によれば、ソーススペクトルは、ゼロのバンドのエネルギーパラメータに基づいて重み付けされる。
上述された方法のすべては、コンピュータプログラムを使用して実装される場合があることに留意されたい。
続いて同封の図を参照して説明される。
【図面の簡単な説明】
【】
【図】一実施形態による帯域ごとのパラメトリックコーダを有するエンコーダの基本的な実装形態の概略図である。
【図】一実施形態による帯域ごとのパラメトリックコーダを有するエンコーダの別の実装形態の概略図である。
【図】一実施形態によるデコーダの実装形態の概略図である。
【図】一実施形態によるエンコーダおよび別の実施形態によるデコーダを示す概略ブロック図である。
【図】一実施形態によるを含む図2aの抜粋を示す概略ブロック図である。
【図】別の実施形態によるデコーダを含む図2aの抜粋を示す概略ブロック図である。
【図】実施形態による残差信号用の信号エンコーダおよび別の実施形態によるデコーダの概略ブロック図である。
【図】さらなる実施形態による、ゼロ充填の原理を含むデコーダの概略ブロック図である。
【図】実施形態による、ピッチ輪郭(ブロックギャップピッチ輪郭参照)を決定する原理を説明するための概略図である。
【図】さらなる実施形態による、ピッチ輪郭に関する情報を使用するパルス抽出器の概略ブロック図である。
【図】代替の実施形態による、追加情報としてピッチ輪郭を使用するパルス抽出器の概略ブロック図である。
【図】さらなる実施形態によるパルスコーダを示す概略ブロック図である。
【図】実施形態による、パルスをスペクトル的に平坦化する原理を説明するための概略図である。
【図】実施形態による、パルスをスペクトル的に平坦化する原理を説明するための概略図である。
【図】さらなる実施形態によるパルスコーダの概略ブロック図である。
【図】平坦化された元のパルス波形から始まる予測残差信号を決定する原理を示す概略図である。
【図】平坦化された元のパルス波形から始まる予測残差信号を決定する原理を示す概略図である。
【図】さらなる実施形態によるパルスコーダの概略ブロック図である。
【図】実施形態を説明するための残差信号およびコード化パルスを示す概略図である。
【図】さらなる実施形態によるパルスデコーダの概略ブロック図である。
【図】さらなる実施形態によるパルスデコーダの概略ブロック図である。
【図】実施形態によるブロックIBPCを使用して最適量子化ステップ(すなわち、ステップサイズ)を推定する原理を示す概略フローチャートである。
【図】実施形態による、長期予測の原理を説明するための概略図である。
【図】実施形態による、長期予測の原理を説明するための概略図である。
【図】実施形態による、長期予測の原理を説明するための概略図である。
【図】実施形態による、長期予測の原理を説明するための概略図である。
【図】さらなる実施形態による、高調波ポストフィルタリングの原理を説明するための概略図である。
【図】さらなる実施形態による、高調波ポストフィルタリングの原理を説明するための概略図である。
【図】さらなる実施形態による、高調波ポストフィルタリングの原理を説明するための概略図である。
【図】さらなる実施形態による、高調波ポストフィルタリングの原理を説明するための概略図である。
【発明を実施するための形態】
【】
以下、同封の図を参照して本発明の実施形態が続いて説明されるが、同一または類似の機能を有するオブジェクトには同一の参照番号が与えられているので、その説明は相互に適用可能かつ交換可能である。
図1aは、量子化器1030と、帯域ごとのパラメトリックコーダ1010と、任意選択の(無損失)スペクトルコーダ1020とを備えるエンコーダ1000を示す。帯域ごとのパラメトリックコーダ1010を説明する前に、帯域ごとのパラメトリックコーダの周りが説明される。パラメトリックコーダ1010の周りには、エンコーダ1000は複数の任意選択要素を備える。
【】
実施形態によれば、パラメトリックコーダ1010は、ジョイントコーダ1010プラス1020を形成するために、スペクトルコーダまたは無損失スペクトルコーダ1020と結合される。ジョイントコーダ1010プラス1020によって処理される信号は、量子化器1030によって提供され、量子化器1030は、複数のサブバンドに分割されたオーディオ信号のスペクトル表現XMRを入力として使用する。
量子化器1030は、XMRを量子化して、(複数のサブバンドに分割された)オーディオ信号のスペクトル表現Xの量子化表現XQを生成する。任意選択で、量子化器は、知覚的に平坦化されたスペクトル表現の量子化スペクトル、または知覚的に平坦化されたスペクトル表現の導関数を提供するように構成される場合がある。量子化は、反復的に決定されるさらなる実施形態による最適量子化ステップに依存する場合がある(図16参照)。
コーダ1010および1020の両方は、量子化表現XQ、すなわち量子化器1030および任意選択の修正器(図1aには示されていないが、図3には156mとして示されている)によって前処理された信号XMRを受け取る。パラメトリックコーダ1010は、XQ内のどのサブバンドがゼロであるかをチェックし、XQ内のゼロであるサブバンド用のXMRの表現をコード化する。修正器に関して、修正器は(図3に示されたように)量子化および修正されたオーディオ信号をジョイントコーダ1010プラス1020に提供することに留意されたい。例えば、修正器は、図16に関して説明されるように、異なるサブバンドをゼロに設定することができる(図16では、修正器は302でマークされている)。
【】
実施形態によれば、コード化パラメトリック表現(zfl)は可変数のビットを使用する。例えば、コード化パラメトリック表現(zfl)を表現するために使用されるビット数は、オーディオ信号のスペクトル表現(XMR)に依存する。
実施形態によれば、コード化表現(spect)は可変数のビットを使用するか、またはコード化表現(spect)を表現するために使用されるビット数はオーディオ信号のスペクトル表現(XMR)に依存する。コード化表現(spect)は、無損失スペクトルコーダによって取得される場合があることに留意されたい。
実施形態によれば、コード化パラメトリック表現(zfl)およびコード化表現(spect)を表現するために必要なビット数(の合計)は、所定の限度を下回る場合がある。
実施形態によれば、パラメータは、量子化表現(XQ)がゼロである(すなわち、サブバンド内のXQのすべての周波数ビンがゼロである)サブバンド内でのみエネルギーを記述する。ゼロサブバンドの他のパラメトリック表現が使用される場合がある。これは、「量子化表現(XQ)に依存する」の仕様であり得る。
実施形態によれば、帯域ごとのパラメトリックコーダ1010は、ゼロに量子化されたサブバンドのパラメトリック記述を提供するように構成される。パラメトリック表現は、最適量子化ステップ(図16のステップサイズおよび図3の
参照)に依存する場合があり、量子化スペクトルがゼロであるサブバンド内のエネルギーを記述するパラメータから構成される場合があり、その結果、少なくとも2つのサブバンドが異なるパラメータを有するか、または少なくとも1つのパラメータが1つのサブバンドのみに限定される。無損失スペクトルコーダ1020は、(量子化)スペクトルのコード化表現を提供するように構成される。このジョイントコーディング1010プラス1020は高効率であり、特に、スペクトルコーダ1020のスペクトル分解能よりも低いが、パラメトリックコーディング1010の高いスペクトル分解能を可能にする。
の手法は、スペクトルを量子化するために使用される量子化器によってゼロに量子化されたサブバンド内でのみパラメトリックコーディングを限定することをさらに可能にする。修正器の使用に起因して、帯域ごとのパラメトリックコーダ1010とスペクトルコーダ1020との間でビットを分配する適応的な方法を提供することがさらに可能であり、コーダの各々は他方のビット需要を考慮し、ビットレート限度の実現を可能にする。
さらなる実施形態によれば、エンコーダ1000は、オーディオ信号のスペクトル表現を前記サブバンドに分割するように構成された分割器(図示せず)のようなエンティティを備える場合がある。任意選択または追加として、エンコーダ1000は、時間領域オーディオ信号に基づいてスペクトル表現を提供するように構成されたMDCT変換器(エンティティ152、MDCTまたは同等のもの参照)のようなTDtoFD変換器(図示せず)を上流経路に備える場合がある。さらなる任意選択要素は、時間ノイズ整形(TNSE、図2aの154参照)、ならびにスペクトル整形器SNS/時間ノイズ整形TNSEの信号XMS、XMT、およびXPSを合成するエンティティ155である。
オーディオ信号1010プラス1020の出力には、ビットストリームマルチプレクサ(図示せず)が配置される場合がある。マルチプレクサは、帯域ごとのパラメトリックコード化ビットストリームとスペクトルコード化ビットストリームを合成する目的を有する。
【】
実施形態によれば、MDCT152の出力は長さLMのXMである。例えば、48kHzの入力サンプリングレートにおいて、20ミリ秒の例示的なフレーム長の場合、LMは960に等しい。コーデックは、他のサンプリングレートおよび/または他のフレーム長で動作する場合がある。
XMから導出されたすべての他のスペクトル:XMS、XMT、XMR、XQ、XD、XDT、XCT、XCS、XC、XP、XPS、XN、XNP、XSも同じ長さLMのスペクトルであり得るが、場合によっては、スペクトルの一部のみが必要とされ、使用される場合がある。スペクトルは、スペクトルビンまたは周波数ビンとしても知られるスペクトル係数から構成される。MDCTスペクトルの場合、スペクトル係数は正および負の値を有する場合がある。各スペクトル係数は帯域幅をカバーすると言える。48kHzのサンプリングレートおよび20ミリ秒のフレーム長の場合、スペクトル係数は25Hzの帯域幅をカバーする。スペクトル係数は、例えば、0からLM-1までインデックス付けされる場合がある。
【】
SNSEおよびSNSD(図2a参照)で使用されるSNSスケールファクタは、帯域幅が増加するNSB=64個の周波数サブバンド(帯域と呼ばれることも多い)内のエネルギーから取得される場合があり、エネルギーは、周波数サブバンド内に分割されたスペクトルから取得される。例えば、Hzで表されるサブバンド境界は、0、50、100、150、200、250、300、350、400、450、500、550、600、700、800、900、1000、1100、1200、1300、1400、1500、1600、1700、1800、1900、2050、2200、2350、2500、2650、2800、2950、3100、3300、3500、3700、3900、4100、4350、4600、4850、5100、5400、5700、6000、6300、6650、7000、7350、7750、8150、8600、9100、9650、10250、10850、11500、12150、12800、13450、14150、15000、16000、24000に設定される場合がある。サブバンドは、0からNSB-1までインデックス付けされる場合がある。この例では、0番目のサブバンド(0~50Hz)は2つのスペクトル係数を含み、サブバンド1~11と同じであり、サブバンド62は40個のスペクトル係数を含み、サブバンド63は320個の係数を含む。
【】
NSB=64個の周波数サブバンド内のエネルギーは、コード化された16個の値にダウンサンプリングされる場合があり、コード化された値は「sns」と表記される(図2a、図2b、図2c参照)。「sns」から取得された16個の復号値はSNSスケールファクタに補間され、例えば、32、64、または128個のスケールファクタが存在する場合がある。SNSの取得に関するさらなる詳細については、読者は[21~25]を参照されたい。
iBPC、「zfl復号」、および/または「ゼロ充填」のブロックでは、スペクトルは、様々な長さ
のサブバンドBiに分割される場合があり、サブバンドiは
から始まる。SNSスケールファクタを取得するためのエネルギーに使用されるのと同じ64個のサブバンド境界が使用される場合があるが、SNSとは無関係に、任意の他の数のサブバンドおよび任意の他のサブバンド境界が使用される場合もある。強調するために、SNSにおけるのと同じサブバンド分割の原理が使用される場合があるが、iBPC、「zfl復号」、および/または「ゼロ充填」のブロックにおけるサブバンド分割は、SNSから、ならびにSNSEおよびSNSのブロックから独立している。のサブバンド分割の例では、
および
、
および
、…、
および
、
および
である。
他の例では、iBPCは、時間-周波数変換器の入力において(例えば、152の入力において)SNSEがLP分析フィルタと置き換えられ、周波数-時間変換器の出力において(例えば、161の出力において)SNSDがLP合成フィルタと置き換えられるコーデックにおいて使用される場合がある。
さらなる実施形態によれば、帯域ごとのパラメトリックコーダ1010は、図1bによって示されたように、量子化スペクトルの効率的な修正のおかげで、レート歪みループ(図16参照)に統合される。
【】
図1bは、レート歪みループ1001の一部を示す。レート歪みループ1001の一部は、量子化器1030と、ジョイント帯域ごとのパラメトリックおよびスペクトルコーダ1010-1020と、ビットカウンタ1050と、再コーダ(リコーダ、recorder)1055とを備える。再コーダ1055は、(例えば、図16によって詳細に示されたように)スペクトルおよび帯域ごとのパラメータを記録するように構成される。例えば、ビットカウンタ1050は、コーディングに必要なビットを格納するための効率的な方法に到達するために、スペクトル線のコーディングに必要なビットを推定/計算/再計算することができる。言い換えて表すと、実際のコーディングではなく、コーディングに必要なビットの最大数の推定が実行される場合がある。これは、限られたビットバジェットを有する効率的なコーディングを実行するのに役立つ。図1bは図16の一部を示すことに留意されたい。ここで、1030は301に相当し、1010+1020は303に相当し、1050は304であり、1055は「再コーダ」に相当する。したがって、実施形態によれば、レート歪みループは、コーディングに使用されるビットを推定もしくは計算するように構成されたビットカウンタ1050、ならびに/またはスペクトル表現(XMR)を記述するパラメータ、例えばスペクトルパラメータおよび帯域パラメータを再コード化するように構成された再コーダ1055を含む。
【】
図1aおよび図1bでは、ブロックが同じ機能を有することを示す同じブロックが使用されているが、図1aのエンティティ(図3の一部)は図1bのエンティティ(図16の一部)とは異なることに留意されたい。
図1cに関して、デコーダ1200が説明される。図1cは、オーディオ信号を復号するためのデコーダを示す。それはスペクトル領域デコーダ1230を備え、帯域ごとのパラメータデコーダ1210は帯域ごとのスペクトル生成器1220を有する処理経路内に配置され、帯域ごとのパラメータデコーダ1210はスペクトルデコーダ1230の出力を使用する。両方のデコーダは合成器1240への出力を有し、スペクトル時間変換器1250が合成器1240の出力に配置される。
【】
(デコーダと組み合わされた逆量子化器を備える場合がある)スペクトル領域デコーダ1230は、量子化ステップに応じて逆量子化されたスペクトル(XD)を生成するように構成され、逆量子化されたスペクトルはサブバンドに分割される。帯域ごとのパラメータデコーダ1210は、逆量子化されたスペクトルにおいてゼロサブバンド、すなわちゼロのみから構成されるサブバンドを識別し、ゼロサブバンドのエネルギーパラメータを復号し、ゼロサブバンドは、スペクトルデコーダの逆量子化されたスペクトル出力によって画定される。このために、例えばスペクトルデコーダ1230の出力から取られた量子化表現(XQ)に関する情報が使用される場合があり、これは、どのサブバンドがパラメトリック表現を有するかがspectから取得された復号スペクトルに依存するからである。1220への入力として使用される1230の出力は、復号されたスペクトルおよび逆量子化されたスペクトルの両方が同じゼロサブバンドを有することができるので、復号されたスペクトルに関する情報または逆量子化されたスペクトルに関する情報のようなその導関数を有することができることに留意されたい。spectから取得された復号スペクトルは、図1aの1010+1020への入力と同じ情報を含む場合がある。量子化ステップ
は、復号スペクトルから逆量子化されたスペクトル(XD)を取得するために使用される場合がある。復号されたスペクトルおよび/または逆量子化されたスペクトルにおけるゼロサブバンドの位置は、量子化ステップ
とは無関係に決定される場合がある。
【】
これから始めて、帯域ごとのスペクトル生成器1220は、ゼロサブバンドのパラメトリック表現に応じて帯域ごとの生成スペクトルXGを提供する。合成器1240は、帯域ごとの合成スペクトルXCTを提供する。例えば、合成スペクトルXCTの場合、以下の合成が可能である:
-帯域ごとの生成スペクトルXGおよび復号スペクトルXD、または
-帯域ごとの生成スペクトルXG
および予測スペクトルと復号スペクトルの合成XDT。
言い換えれば、エンティティ1220、1230のエンティティ1240との相互作用は、以下のように記載することができる。帯域ごとのパラメトリックスペクトル生成器1220は、エンティティ1240による復号スペクトルまたは予測スペクトルと復号スペクトルの合成に加算される生成スペクトルXGを提供する。生成スペクトルXGは、ソーススペクトルから帯域ごとに取得され、ソーススペクトルは、第2の予測スペクトルXNP、またはランダムノイズスペクトルXN、または生成スペクトルのすでに生成された部分、またはそれらの合成である。XCTはXGを含む場合があることに留意されたい。
【】
XCTのすでに生成された部分は、XGを生成するために使用される場合がある。ソーススペクトルは、ゼロサブバンドのエネルギーパラメータに基づいて重み付けされる場合がある。サブバンド用のソーススペクトルの選択は、帯域位置、音調性、パワースペクトル推定値、エネルギーパラメータ、ピッチパラメータ、および時間情報に基づく場合がある。この方法は、復号スペクトルに基づいてパラメトリックにコード化されるサブバンドの選択を取得し、したがってビットストリーム内の追加のサイド情報が回避される。この適応的な方法における別の方法によれば、サブバンドごとに、サブバンド内のゼロを置き換えるためにどのソーススペクトルを使用するかがデコーダ1200に提供されると判断され、したがってビットストリーム内の追加のサイド情報が回避され、ソーススペクトル選択のための多数の可能性が可能になる。
合成器1240の出力は、いわゆる再整形されたスペクトルを取得するために、任意選択のTNSまたはSNSD(図示せず)によってさらに処理することができる。合成器1240の出力に基づいて、またはこの再整形されたスペクトルに基づいて、任意選択のスペクトル時間変換器1250は時間表現を出力する。さらなる実施形態によれば、デコーダ1200は、帯域ごとの合成スペクトルから、または帯域ごとの合成スペクトルの導関数から再整形されたスペクトルを提供するためのスペクトル整形器を備える場合がある。
【】
さらなる実施形態によれば、エンコーダは、量子化スペクトルのコード化表現とパラメトリックなゼロサブバンド表現のコード化表現のジョイントコーディングが、ジョイントコーディングのビットの総数が所定の閾値を下回るという制約を満たすかどうかの判断を提供するためのスペクトルコーダ判断エンティティを備える場合がある。ここで、量子化スペクトルの符号化表現およびパラメトリックなゼロサブバンドのコード化表現の両方は、知覚的に平坦化されたスペクトル表現、もしくは知覚的に平坦化されたスペクトル表現の導関数に依存する可変数のビット、および/または量子化ステップを使用することができる。
上述されたように、帯域ごとのパラメトリックスペクトル生成器および合成器1240は、以下のように実装される場合がある。帯域ごとのパラメトリックスペクトル生成器は、帯域ごとに生成スペクトルを提供し、復号スペクトルに、または予測スペクトルと復号スペクトルの合成にそれを加算する。生成スペクトルは、ソーススペクトルから帯域ごとに取得され、ソーススペクトルは、第2の予測スペクトル、またはランダムノイズスペクトル、または生成スペクトルのすでに生成された部分、またはそれらの合成である。ソーススペクトルは、ゼロバンドのエネルギーパラメータに基づいて重み付けされる場合がある。生成スペクトルのすでに生成された部分の使用は、復号スペクトルの任意の2つの別個の部分の合成を提供し、したがって、復号スペクトルの1つの部分を使用するだけでは利用できない高調波または音調のソーススペクトルを提供する。第2の予測スペクトルとソーススペクトルの合成は、復号スペクトルを使用するだけでは利用できない高調波または音調のソーススペクトルを作成するための別の利点である。
【】
図2aは、デコーダ201と組み合わされたエンコーダ101を示す。
エンコーダ101の主なエンティティは、参照番号110、130、150によってマークされている。エンティティ110はパルス抽出を実行し、パルスpはパルスコーディングのためにエンティティ132を使用して符号化される。
信号エンコーダ150は、複数のエンティティ152、153、154、155、156、157、158、159、160、および161によって実装される。これらのエンティティ152~161は、エンコーダ150の主要経路を形成し、並行して、追加のエンティティ162、163、164、165、および166が配置される場合がある。エンティティ162(zflデコーダ)は、ゼロ充填のためにエンティティ156(iBPC)をエンティティ158と報知的に接続する。エンティティ165(TNS取得)は、エンティティ153(SNSE)をエンティティ154、158、および159と報知的に接続する。エンティティ166(SNS取得)は、エンティティ152をエンティティ153、163、および160と報知的に接続する。エンティティ158はゼロ充填を実行し、図4の文脈で説明される合成器158cを備えることができる。エンティティ153および160が存在しない実装形態、例えば、MDCT入力のLP分析フィルタリングおよびIMDCT出力のLP合成フィルタリングを有するシステムが存在する可能性があることに留意されたい。したがって、これらのエンティティ153および160は任意選択である。
【】
エンティティ163および164は、予測スペクトルXPおよび/または知覚的に平坦化された予測XPSを生成するために、エンティティ180からのピッチ輪郭およびコード化残差yCを受け取る。異なるエンティティの機能および相互作用が以下に記載される。
エンコーダ101の機能、特にエンコーダ150の機能を説明する前に、デコーダ210の短い説明が与えられる。デコーダ210は、エンティティ157、162、163、164、158、159、160、161、ならびに(復元されたパルス波形から構成されるパルス部分を復号および復元するための)エンコーダ固有エンティティ214(HPF)、23(信号合成器)、および22を備える場合がある。
【】
以下、符号化機能が説明される。パルス抽出110は、入力オーディオ信号PCMIのSTFTを取得し、STFTの非線形振幅スペクトログラムおよび位相スペクトログラムを使用してパルスを見つけ抽出し、各パルスはハイパス特性を有する波形を有する。パルス残差信号yMは、入力されたオーディオ信号からパルスを除去することによって取得される。パルスはパルスコーディング132によってコード化され、コード化されたパルスCPはデコーダ201に伝達される。
パルス残差信号yMは、長さLMのXMを生成するためにMDCT152を介してウィンドウ処理および変換される。ウィンドウは、[19]のように3つのウィンドウの中から選択される。以下の例では、最長ウィンドウは10ミリ秒のオーバーラップを有する30ミリ秒の長さであるが、任意の他のウィンドウおよびオーバーラップの長さが使用されてもよい。
XMのスペクトル包絡線は、XMSを取得するSNSE153によって知覚的に平坦化される。任意選択で、時間ノイズ整形TNSE154は、スペクトルの少なくとも一部において、時間包絡線を平坦化するために適用され、XMTを生成する。スペクトルの一部(XMまたはXMSまたはXMT)における少なくとも1つの音調性フラグφHが推定され、デコーダ201/210に伝達される場合がある。任意選択で、ピッチ輪郭180に続く長期予測LTP164は、過去の復号されたサンプルから予測されたスペクトルXPを構築するために使用され、知覚的に平坦化された予測XPSは、XMTからMDCT領域内で減算され、LTP残差XMRを生成する。ピッチ輪郭180は、高い平均高調波を有するフレームについて取得され、デコーダ201/210に伝達される。ピッチ輪郭180および高調波は、コーデックの多くの部分を操作するために使用される。平均高調波は、フレームごとに計算される場合がある。
【】
図2bは、エンティティ180、110、152、153、153、155、156’、165、166、および132を備えるエンコーダ101’に焦点を当てた図2aの抜粋を示す。図2aの156は、図2bの156’と図2cの156’’の合成の一種であることに留意されたい。(図2a、図2cの)エンティティ163は、153と同じまたは同等であり得、160の逆であることに留意されたい。
実施形態によれば、エンコーダは、入力信号をフレームに分割し、例えばフレームごとに、以下のパラメータのうちの少なくとも1つまたは複数を出力する。
-ピッチ輪郭
-MDCTウィンドウ選択、2ビット
-LTPパラメータ
-コード化パルス
-sns、すなわちSNSを介したスペクトル整形のためのコード化情報
-tns、すなわちTNSを介した時間整形のためのコード化情報
-グローバル利得gQo、すなわちMDCTコーデック用のグローバル量子化ステップサイズ
-エントロピーコード化量子化MDCTスペクトルから構成されるspect
-量子化されたパラメトリックにコード化されたゼロの部分から構成されるzfl
XPSは、エンコーダでも使用されるLTPに由来するが、LTPはデコーダにのみ示されている(図2aおよび図2c参照)。
【】
図2cは、図2aの文脈で説明されているエンティティ156’’、162、163、164、158、159、160、161、214、23、および22を備えるエンコーダ201’に焦点を当てた図2aの抜粋を示す。LTP164に関して:基本的に、LTPは、(内部デコーダの一部として)エンコーダでも使用/必要とされ得る(HPF、「波形構築」およびそれらの出力を除き)デコーダの一部である。LTPがない実装形態では、内部デコーダはエンコーダ内で必要とされない。
エンティティ155によって出力されるXMR(LTPからの残差)の符号化は、図3に関して説明されるように、積分帯域ごとのパラメータコーダ(iBPC)において行われる。
【】
図3は、サブエンティティ156q、156m、156pc、156sc、および156muを有する場合があるエンティティiBPC156を示す。図1aは図3の一部を示し、ここで、1030は156qに相当し、1010は156pcに相当し、1020は156scに相当する。
ビットストリームマルチプレクサ156muの出力において、帯域ごとのパラメトリックデコーダ162は、スペクトルデコーダ156sdとともに配置される。エンティティ162は信号zflを受け取り、エンティティ156sdは信号spectを受け取り、両方ともグローバル利得/ステップサイズgQ0を受け取ることができる。パラメトリックデコーダ162は、zflを復号するためにスペクトルデコーダ156sdの出力XDを使用することに留意されたい。それは、代替として、デコーダ156sdから出力される別の信号を使用する場合がある。その背景は、スペクトルデコーダ156sdが、2つの部分、すなわちスペクトル無損失デコーダおよび逆量子化器を備える場合があることである。例えば、スペクトル無損失デコーダの出力は、spectから取得され、パラメトリックデコーダ162への入力として使用される復号スペクトルであり得る。スペクトル無損失デコーダの出力は、156pcおよび156scの入力XQと同じ情報を含む場合がある。逆量子化器は、グローバル利得/ステップサイズを使用して、スペクトル無損失デコーダの出力からXDを導出することができる。復号されたスペクトルおよび/または逆量子化されたスペクトルXDにおけるゼロサブバンドの位置は、量子化ステップ
とは無関係に決定される場合がある。
【】
XMRは、量子化スペクトルXQ(の一部)のゼロ値のエネルギーの量子化およびコーディングを含む量子化およびコード化され、XQはXMRの量子化バージョンである。
XMRの量子化およびコーディングは、積分帯域ごとのパラメトリックコーダ
iBPC156において行われる。
iBPCの部分の1つとして、適応帯域ゼロ化156mとともに量子化(量子化器156q)は、最適量子化ステップサイズ
に基づいて量子化スペクトルXQを生成する。
iBPC156は、(XQを表す)spect 156scおよび(XQの一部においてゼロ値のエネルギーを表すことができる)zfl162から構成されるコード化情報を生成する。
エンティティ157の出力に配置されたゼロ充填エンティティ158が図4によって示されている。
【】
図4は、エンティティ162から信号EBを受け取るゼロ充填エンティティ158と、任意選択的に要素157を介してエンティティ156sdからの予測スペクトル(XPS)と復号および逆量子化されたスペクトル(XD)の合成(XDT)とを示す。ゼロ充填エンティティ158は、2つのサブエンティティ158scおよび158sgならびに合成器158cを含む場合がある。
spectは、XMRの量子化バージョンに相当する逆量子化されたスペクトXD(復号されたLTP残差、誤差スペクトル)を取得するために復号される。
EBは、XDにおけるゼロ値の位置を考慮してzflから取得される。
EBは、XQにおけるゼロ値のエネルギーの平滑化バージョンであり得る。
EBは、zflとは異なる分解能、好ましくは平滑化に由来するより高い分解能を有することができる。
【】
EB(162参照)を取得した後、知覚的に平坦化された予測XPSは、任意選択的に復号されたXDに加算され、XDTが生成される。ゼロ充填XGが取得され、「ゼロ充填」において(例えば、加算158cを使用して)XDTと合成され、ゼロ充填XGは、EBに基づいて重み付けされた帯域ごとのソーススペクトル
(156sc参照)から構成されるソーススペクトルXSから反復的に取得された帯域ごとのゼロ充填
から構成される。
XCTは、ゼロ充填XGとスペクトルXDT(158c)の帯域ごとの合成である。
【】
XSは帯域ごとに構成され(158sgはXGを出力する)、XCTは最も低いサブバンドから開始して帯域ごとに取得される。サブバンドごとに、ソーススペクトルは、例えば、サブバンド位置、音調性フラグ(toi)、XDTから推定されたパワースペクトル、EB、ピッチ情報(pii)、および時間情報(tei)に応じて選択される(158sc参照)。
XDTから推定されたパワースペクトルは、XDTまたはXDから導出される場合があることに留意されたい。あるいは、ソーススペクトルの選択は、ビットストリームから取得される場合がある。開始周波数fZFstartまでのXS内の最も低いサブバンド
は0に設定される場合があり、これは、最も低いサブバンド内でXCTがXDTのコピーであり得ることを意味する。
fZFStartは0であり得、これは、ゼロとは異なるソーススペクトルがさらにスペクトルの開始から選択され得ることを意味する。サブバンドi用のソーススペクトルは、例えば、ランダムノイズもしくは予測スペクトル、またはXCTのすでに取得された下位部分、ランダムノイズ、および予測スペクトルの合成であり得る。ソーススペクトルXSは、ゼロ充填XGを取得するために、EBに基づいて重み付けされる。
【】
重み付けは、例えば、エンティティ158sgによって実行される場合があり、サブバンド分割よりも高い分解能を有することができ、それは、さらに平滑な重み付けを取得するためにサンプルごとに決定される場合があり、
はXDTのサブバンドiに加算されてXCTのサブバンドiを生成する。完全なXCTを取得した後、その時間包絡線は、任意選択で、TNSD159(図2a参照)を介して、XMSの時間包絡線に一致するように修正され、XCSを生成する。次いで、XCS
のスペクトル包絡線は、XMのスペクトル包絡線に一致するようにSNSD160を使用して修正され、XCを生成する。時間領域信号yCは、IMDCT161の出力としてXCから取得され、IMDCT161は、逆MDCT、ウィンドウ処理、およびオーバーラップ加算から構成される。yCは、次のフレームのために(図2aおよび図2cのバッファ164に相当するか、または164+163の合成に相当するかのいずれかである)LTPバッファ164を更新するために使用される。高調波間のノイズを低減し、yHを出力するために、ピッチ輪郭に従う高調波ポストフィルタ(HPF)がyCに適用される。コード化パルス波形から構成されるコード化パルスが復号され、復号されたパルス波形から時間領域信号yPが構築される。
yPは、復号オーディオ信号(PCMO)を生成するためにyHと合成される。あるいは、yPはyCと合成される場合があり、それらの合成は、HPFへの入力として使用することができ、その場合、HPF214の出力は復号オーディオ信号である。
【】
図5を参照して、エンティティ「ピッチ輪郭取得」180が以下に記載される。
次に、ブロック「ピッチ輪郭取得180」内の処理が説明される。入力信号は、フルサンプリングレートからより低いサンプリングレート、例えば8kHzにダウンサンプリングされる。ピッチ輪郭は、現在のフレームからのpitch_midおよびpitch_end、ならびに前のフレームからのpitch_endに等しいpitch_startによって決定される。フレームは図5によって例示的に示されている。ピッチ輪郭で使用されるすべての値は、小数精度を有するピッチラグとして格納される場合がある。ピッチラグ値は、(444.4Hzに対応する)最小ピッチラグdFmin=2.25ミリ秒と(51.3Hzに対応する)最大ピッチラグdFmax=19.5ミリ秒との間であり、dFminからdFmaxまでの範囲はフルピッチ範囲と呼ばれる。他の範囲の値が使用される場合もある。pitch_midおよびpitch_endの値は、複数のステップで見出される。各ステップにおいて、ダウンサンプリングされた信号の領域または入力信号の領域でピッチ探索が実行される。
ピッチ探索は、その入力および入力の遅延バージョンの正規化自己相関ρH[dF]を計算する。ラグdFは、ピッチ探索開始dFStartとピッチ探索終了dFendとの間である。ピッチ探索開始dFstart、ピッチ探索終了dFend、自己相関長lρH、および過去のピッチ候補dFpastは、ピッチ探索のパラメータである。ピッチ探索は、小数精度を有するピッチラグとしての最適なピッチdFoptimと、最適なピッチラグでの自己相関値から取得された高調波レベルρHopimとを返す。
ρHoptimの範囲は0~1であり、0は高調波がないことを意味し、1は最大高調波を意味する。
【】
正規化自己相関における絶対最大値の位置は、最適なピッチラグ向けの第1の候補
である。
dFpastがdF1に近い場合、最適なピッチラグ向けの第2の候補dF2はdFpastであり、そうでない場合、dFpastに近い極大値の位置は第2の候補dF2である。
dFpastがdF1に近い場合、dF1はdF2に対して再び選択されるので、極大値は探索されない。
dF1およびdF2における正規化自己相関の差がピッチ候補閾値τDFを上回る場合、dFoptimはdF1(ρH[dF1]-ρH[dF2]>τdF⇒dFoptim=dF1)に設定され、そうでない場合、dFoptimはdF2に設定される。
τdFは、dF1、dF2、およびdFpastに応じて適応的に選択され、例えば、0.75・dF1≦dFpast≦1.25・dF1である場合τdF=0.01であり、そうではなく、dF1≦dF2である場合τdF=0.02であり、dF1>dF2である場合τdF=0.03である(小さいピッチ変更の場合、新しい最大値位置に切り替えることがより容易であり、変更が大きい場合、大きいピッチラグに切り替えるよりも小さいピッチラグに切り替えることがより容易である)。
【】
フレーム処理およびウィンドウ処理に関連するピッチ探索のための領域の位置が図5に示されている。領域ごとに、ピッチ探索は、領域の長さに設定された自己相関長lρHで実行される。最初に、ピッチ探索の実行において、dFpast=pitch_start、dFstart=dFmin、およびdFend=dFmaxを使用して、ピッチラグstart_pitch_dsおよび関連付けられた高調波start_norm_corr_dsがより低いサンプリングレートで計算される。次いで、ピッチ探索の実行において、dFpast=start_pitch_ds、dFstart=dFmin、およびdFend=dFmaxを使用して、ピッチラグavg_pitch_dsおよび関連付けられた高調波avg_norm_corr_dsがより低いサンプリングレートで計算される。現在のフレームにおける平均高調波が、max(start_norm_corr_ds,avg_norm_corr_ds)に設定される。ピッチ探索の実行において、dFpast=avg_pitch_ds、dFstart=0.3・avg_pitch_ds、およびdFend=0.7・avg_pitch_dsを使用して、ピッチラグmid_pitch_dsおよびend_pitch_dsならびに関連付けられた高調波mid_norm_corr_dsおよびend_norm_corr_dsがより低いサンプリングレートで計算される。ピッチ探索の実行において、dFpast=pitch_ds、dFstart=pitch_ds-ΔFdown、およびdFend==pitch_ds+ΔFdownを使用して、ピッチラグpitch_midおよびpitch_endならびに関連付けられた高調波norm_corr_midおよびnorm_corr_endがフルサンプリングレートで計算され、ΔFdownはフルサンプリングレートとより低いサンプリングレートの比であり、pitch_ds=pitch_mid用のmid_pitch_dsであり、pitch_ds=pitch_end用のend_pitch_dsである。
【】
平均高調波が0.3を下回る場合、またはnorm_corr_endが0.3を下回る場合、またはnorm_corr_midが0.6を下回る場合、現在のフレームにピッチ輪郭が存在しないことが単一ビットを有するビットストリーム内で通知される。平均高調波が0.3を上回る場合、ピッチ輪郭は、pitch_end用の絶対コーディングおよびpitch_mid用の差分コーディングを使用してコード化される。Pitch_midは、8つの事前定義された値の中の(pitch_start+pitch_end)/2との差のためのコードを使用することにより、3ビットを使用して(pitch_start+pitch_end)/2に差分的にコード化され、それはpitch_mid領域内の自己相関を最小化する。フレーム内に高調波の終了がある場合、例えば、norm_corr_end<norm_corr_mid/2である場合、pitch_startおよびpitch_midからの線形外挿がpitch_endに使用され、その結果、pitch_midがコード化される場合がある(例えば、norm_corr_mid>0.6およびnorm_corr_end<0.3)。
|pitch_mid-pitch_start|≦τHPFconstであり、|norm_corr_mid-norm_corr_start|≦0.5であり、pitch_startおよびpitch_midの領域内の予想されるHPF利得が1に近く、大きく変化しない場合、HPFが一定のパラメータを使用するべきことがビットストリーム内で通知される。
【】
実施形態によれば、ピッチ輪郭は、現在のウィンドウ内及び少なくともdFmax個の過去のサンプル内の、あらゆるサンプルiにおけるピッチラグ値dcontour[i]を、dcontourに提供する。ピッチ輪郭のピッチラグは、現在のフレーム、前のフレーム、および2番目に前のフレームからのpitch_midおよびpitch_endの線形補間によって取得される。
平均ピッチラグ
は、pitch_start、pitch_mid、およびpitch_endの平均としてフレームごとに計算される。
【】
さらなる実施形態によれば、ハーフピッチラグ補正も可能である。
エンコーダおよびデコーダの両方で利用可能なLTPバッファ164は、入力信号のピッチラグがdFminを下回るかどうかをチェックするために使用される。入力信号のピッチラグがdFminを下回る場合の検出は「ハーフピッチラグ検出」と呼ばれ、それが検出された場合、「ハーフピッチラグが検出された」と言われる。コード化ピッチラグ値(pitch_mid、pitch_end)はコード化され、dFmin~dFmaxの範囲で伝達される。これらのコード化されたパラメータから、ピッチ輪郭はで定義されたように導出される。ハーフピッチラグが検出された場合、コード化ピッチラグ値は、真のピッチラグ値の整数倍nFcorrectionに近い値を有することが予想される(同等に、入力信号ピッチはコード化されたピッチの整数倍nFcorrectionに近い)。コード化可能範囲を超えてピッチラグ範囲を拡張するために、補正されたピッチラグ値(pitch_mid_corrected、pitch_end_corrected)が使用される。真のピッチラグ値がコード化可能範囲内にある場合、補正されたピッチラグ値(pitch_mid_corrected、pitch_end_corrected)は、コード化されたピッチラグ値(pitch_mid、pitch_end)に等しい場合がある。ピッチ輪郭がピッチラグ値から導出されるのと同じ方法で、補正されたピッチラグ値は、補正されたピッチ輪郭を取得するために使用される場合があることに留意されたい。言い換えれば、これにより、コード化ピッチパラメータ用の周波数範囲外にピッチ輪郭の周波数範囲を拡張することが可能になり、補正されたピッチ輪郭が生成される。
【】
ハーフピッチ検出は、ピッチが現在のウィンドウ内で一定であると見なされ、
である場合にのみ実行される。max(|pitch_mid-pitch_start|,|pitch_mid-pitch_end|)<τFconst
である場合、ピッチは現在のウィンドウ内で一定であると見なされる。ハーフピッチ検出では、nFmultiple∈{1,2,…nFMaxcorrection}
ごとに、ピッチ探索は、
、dFpast=
、
dFStart=dFpast-3、およびdFend=dFpast+3を使用して実行される。
【】
nFcorrectionは、ピッチ探索によって返された正規化相関を最大化するnFmultipleに設定される。nFcorrection>1であり、nFcorrectionに対するピッチ探索によって返された正規化相関が0.8を上回り、nFmultiple=1である場合にピッチ探索によって返される正規化相関を0.02上回る場合、ハーフピッチが検出されたと見なされる。
ハーフピッチラグが検出された場合、pitch_mid_correctedおよびpitch_end_correctedは、
nFmultiple=nFcorrectionに対するpitch探索によって返された値を取り、そうでない場合、pitch_mid_correctedおよびpitch_end_correctedは、それぞれ、pitch_midおよびpitch_endに設定される。
平均補正されたピッチラグ
は、最終的なオクターブジャンプを補正した後、pitch_start、pitch_mid_corrected、およびpitch_end_correctedの平均として計算される。オクターブジャンプ補正は、pitch_start、pitch_mid_corrected、およびpitch_end_correctedの中から最小値を見つけ、pitch_start、pitch_mid_corrected、およびpitch_end_correctedの中からピッチごとに、(nFmultiple∈{1,2,…nFMaxcorrection}に対して)最小値に最も近いpitch/nFmultipleを見つける。次いで、pitch/nFmultipleは、平均の計算において元の値の代わりに使用される。
【】
以下、図6の文脈でパルス抽出が説明される場合がある。図6は、エンティティ111hp、112、113c、113p、114、および114mを有するパルス抽出器110を示す。入力における最初のエンティティは、パルス抽出器112に信号を出力する(パルスおよび統計データを抽出する)任意選択のハイパスフィルタ111hpである。
出力において、2つのエンティティ113cおよび113pが配置され、それらは一緒に相互作用し、エンティティ180からピッチ輪郭を入力として受け取る。パルス113cを選択するためのエンティティは、波形を生成する別のエンティティ114にパルスpを直接出力する。これはパルスの波形であり、残差信号R(パルスを抽出した後の残差)を生成するために、PCM信号からミキサ114mを使用して減算することができる。
【】
フレーム当たり最大8個のパルスが抽出され、コード化される。別の例では、他の数の最大パルスが使用される場合がある。前のフレームからの
個のパルスが保持され、抽出および予測コーディングで使用される(
)。別の例では、
に対して他の制限が使用される場合がある。「ピッチ輪郭取得」180は
を提供し、あるいは、
が使用される場合がある。高調波が低いフレームでは、
がゼロであると予想される。
【】
パルスを見つけ抽出するために短時間フーリエ変換(STFT)を介する時間周波数分析が使用される(エンティティ112参照)。別の例では、他の時間周波数表現が使用される場合がある。信号PCMIはハイパスされ(111hp)、2ミリ秒の長さの二乗正弦ウィンドウを使用して75%のオーバーラップでウィンドウ処理され、離散フーリエ変換(DFT)を介して周波数領域(FD)に変換される場合がある。あるいは、ハイパスフィルタリングは、FDで(112sまたは112sの出力で)行われる場合がある。したがって、20ミリ秒の各フレームには、周波数帯域(バンド)ごとに40点が存在し、各点は振幅および位相から構成される。各周波数帯域(バンド)は500Hz幅であり、残りの47帯域は対称拡張を介して構築される場合があるので、サンプリングレートFS=48kHz向けの49帯域のみを検討している。したがって、STFTの各時間インスタンスに49点が存在し、フレームの時間周波数平面に40・49点が存在する。STFTホップサイズはHP=0.0005FSである。
【】
図7では、エンティティ112がより詳細に示されている。112teにおいて、時間包絡線は、周波数軸にわたる積分によって対数振幅スペクトログラムから取得され、すなわち、時間包絡線の1つのサンプルを取得するために、STFTの時間インスタンスごとに対数振幅が合計される。
図示されたエンティティ112は、PCMI信号に基づいて位相および/または振幅のスペクトログラムを出力するスペクトログラムエンティティ112sを含む。位相スペクトログラムはパルス抽出器112peに転送され、振幅スペクトログラムはさらに処理される。振幅スペクトログラムは、背景除去器112brを使用して処理される場合があり、背景推定器112beは、除去される背景信号を推定するためのものである。追加または代替として、時間包絡線決定器112teおよびパルスロケータ112plは、振幅スペクトログラムを処理する。エンティティ112plおよび112teは、パルス抽出器112peおよび背景推定器112beへの入力として使用されるパルス位置を決定することを可能にする。パルスロケータファインダ112plは、ピッチ輪郭情報を使用することができる。任意選択で、いくつかのエンティティ、例えば、エンティティ112beおよびエンティティ112teは、エンティティ112loによって取得された振幅スペクトログラムのアルゴリズム表現を使用することができる。
【】
以下、機能が説明される。平滑化された時間包絡線は、短い対称FIRフィルタ(例えば、FS=48kHzにおける4次フィルタ)を使用する時間包絡線のローパスフィルタリングされたバージョンである。
時間包絡線の正規化自己相関が計算される:

ここで、
は平均除去後の時間包絡線である。最大値に対する正確な遅延(
)は、正規化自己相関においてピークを形成する3点のラグランジュ多項式を使用して推定される。
【】
予想平均パルス距離は、時間包絡線の正規化自己相関およびフレーム内の平均ピッチラグから推定される場合がある。
ここで、高調波が低いフレームの場合、
が13に設定され、それは6.5ミリ秒に対応する。
パルスの位置は、ピークがそれらの周囲より上にあるという要件を有する平滑化された時間包絡線内の局所ピークである。周囲は、適応長さを有する単純移動平均フィルタを使用する時間包絡線のローパスフィルタリングされたバージョンとして定義され、フィルタの長さは、予想される平均パルス距離(
)の半分に設定される。正確なパルス位置(
)は、平滑化された時間包絡線においてピークを形成する3点のラグランジュ多項式を使用して推定される。パルス中心位置(
)は、STFT時間インスタンスに丸められた正確な位置であり、したがって、パルスの中心位置間の距離は0.5ミリ秒の倍数である。各パルスは、その中心位置から左に2つの時間インスタンス、右に2つの時間インスタンスを伸ばすと考えられる。他の数の時間インスタンスが使用される場合もある。
20ミリ秒当たり最大8パルスが見出され、より多くのパルスが検出された場合、より小さいパルスは無視される。見出されたパルスの数は
と表記される。
【】
i番目のパルスは
と表記される。平均パルス距離は、
と定義される。
強化されたスペクトログラムとも呼ばれる強化されたSTFTがパルスのみから構成されるように、パルス位置に基づいて振幅が強化される。パルスの背景は、左および右の背景の線形補間として推定され、左および右の背景は、(時間)中心位置から3番目~5番目の時間インスタンスの平均である。背景は、112beにおける対数振幅領域で推定され、112brにおける線形振幅領域でそれを減算することによって除去される。強化されたSTFT内の振幅は線形スケールである。位相は修正されない。パルスに属さない時間インスタンスにおけるすべての振幅はゼロに設定される。
パルスの開始周波数は、フレーム内の(近くのパルス波形間の)平均パルス距離の逆数に比例するが、750Hzと7250Hzとの間に制限される。
【】
開始周波数(
)は、STFT帯域のインデックスとして表現される。
連続パルスにおける開始周波数の変化は、500Hz(1つのSTFT帯域)に制限される。開始周波数の下の強化STFTの振幅は、112peにおいてゼロに設定される。
各パルスの波形は、112peにおいて強化STFTから取得される。パルス波形は、その(時間)中心の周りの4ミリ秒で非ゼロであり、パルス長は
である(パルス波形のサンプリングレートは入力信号のサンプリングレートFSに等しい)。記号
はi番目のパルスの波形を表す。
各パルスPiは、中心位置
およびパルス波形
によって一意に決定される。パルス抽出器112peは、中心位置
およびパルス波形
から構成されるパルスPiを出力する。パルスはSTFTグリッドに位置合わせされる。あるいは、パルスはSTFTグリッドに位置合わせされない場合があり、かつ/または正確なパルス位置(
)が
の代わりにパルスを決定する場合がある。
【】
特徴はパルスごとに計算される:
・パルス内の局所エネルギーの割合-
・パルス内のフレームエネルギーの割合-
・パルスエネルギーが局所エネルギーの半分を上回る帯域の割合-
・各パルスペア間の(現在のフレーム内のパルスと過去のフレームからの
個の最後にコード化されたパルスとの間の)相関
および距離
・パルスの正確な位置におけるピッチラグ-
局所エネルギーは、元のSTFTにおけるパルス中心の周りの11個の時間インスタンスから計算される。すべてのエネルギーは、開始周波数を超えてのみ計算される。
パルスペア間の距離
は、パルス間の最大相互相関の位置から取得される
。相互相関は、2ミリ秒の長さの長方形のウィンドウでウィンドウ処理され、パルスのノルムによって正規化される(また、2ミリ秒の長方形のウィンドウでウィンドウ処理される)。パルス相関は、正規化相互相関の最大値である。





の値は、0~1の範囲内である。
【】
ピッチとパルス距離との間の誤差は、次のように計算される:
パルス距離の倍数(
)を導入すると、ピッチ推定の誤差が考慮される。ピッチラグの倍数(
)を導入することにより、列内のパルスが歪んでいるか、または列に属するパルスの検出を妨げるパルス列に属さない過渡信号が存在する場合のパルス列内の不完全性に由来する不在パルスが解決される。
【】
i番目およびj番目のパルスがパルス列に属する確率(113p参照):
すでにコード化された過去パルスのみとの関係を有するパルスの確率は、次のように定義される:
パルスの確率(
)が繰り返し見出される(エンティティ113p参照):
1.すべてのパルス確率(
)が1に設定される
【】
2.パルスの時間出現順序において、まだ可能性が高い(
)パルスごとに:
a.現在のフレーム内のパルス列に属するパルスの確率が計算される:


b.それが真にパルスである最初の確率は、次のとおりである:
c.確率は、局所エネルギーの半分を上回る多くの帯域(バンド)内のエネルギーを有するパルスについて増加する。
d.確率は、時間包絡線相関およびパルス内の局所エネルギーの割合によって制限される。
e.パルス確率が閾値を下回る場合、その確率はゼロに設定され、それ以上考慮されない。

3.現在の反復において少なくとも1つのゼロに設定された
が存在する限り、またはすべての
がゼロに設定されるまで、ステップ2が繰り返される。
この手順の最後に、1に等しい
を有する
個の真のパルスが存在する。すべての真のパルスのみがパルス部分Pを構成し、CPとしてコード化される。真の
個のパルスのうち、最大3つの最後のパルスは、その後のフレーム内の
および
を計算するためにメモリに保持される。現在のフレーム内に存在する真のパルスが3つより少ない場合、すでにメモリにあるいくつかのパルスが保持される。合計で最大3つのパルスがメモリに保持される。メモリに保持されるパルスの数には、他の制限、例えば2または4があってもよい。メモリに3つのパルスが存在した後、メモリは一杯のままであり、メモリ内の最も古いパルスが新たに見つかったパルスによって置き換えられる。言い換えれば、メモリに保持された過去パルスの数
は、処理の開始時に
まで増加し、その後3に保たれる。
【】
以下、図8に関して、パルスコーディング(エンコーダ側、エンティティ132参照)が説明される。
図8は、主要経路内のエンティティ132fs、132c、および132pcを備えるパルスコーダ132を示し、エンティティ132asは、スペクトル的な平坦化を実行するように構成されたエンティティ132fsへの入力としてスペクトル包絡線を決定および提供するために配置されている。主要経路132fs、132c、および132pc内で、パルスPはコード化されて、コード化されたスペクトル的に平坦化されたパルスを決定する。エンティティ132pcによって実行されるコーディングは、スペクトル的に平坦化されたパルスに対して実行される。図2a~図2cのコード化パルスCPは、コード化スペクトル平坦化パルスおよびパルススペクトル包絡線から構成される。複数のパルスのコーディングは、図10を参照して詳細に説明される。
パルスは、以下のパラメータを使用してコード化される。
・フレーム内のパルス数
・フレーム内の位置
・パルス開始周波数
・パルススペクトル包絡線
・予測利得
、および
がゼロでない場合
o予測ソースのインデックス
o予測オフセット
・イノベーション利得
・最大4つのインパルスから構成されるイノベーションであり、各パルスがその位置および符号によってコード化される
【】
単一のコード化パルスは、以下のパラメータによって決定される。
・パルス開始周波数
・パルススペクトル包絡線
・予測利得
、および
がゼロでない場合
○予測ソースのインデックス
○予測オフセット
・イノベーション利得
・最大4つのインパルスから構成されるイノベーションであり、各パルスがその位置および符号によってコード化される
単一のコード化パルスを決定するパラメータから、単一のコード化パルスを提示する波形を構築することができる。次いで、コード化パルス波形は、単一のコード化パルスのパラメータによって決定されると言うこともできる。
パルス数はハフマンコーディングされる。
最初のパルス位置
は、ハフマンコーディングを使用して絶対的にコード化される。後続のパルスの場合、位置デルタ
がハフマンコーディングされる。フレーム内のパルス数に応じて、かつ最初のパルス位置に応じて、異なるハフマンコードが存在する。
【】
最初のパルス開始周波数
は、ハフマンコーディングを使用して絶対的にコード化される。後続のパルスの開始周波数は、差分コード化される。ゼロの差分が存在する場合、後続の差分もすべてゼロなので、非ゼロ差分の数がコード化される。すべての差分は同じ符号を有するので、差分の符号はフレーム当たり1ビットでコード化することができる。ほとんどの場合、絶対差は最大1であり、したがって、最大絶対差が1以上である場合、コーディングに単一ビットが使用される。最後に、最大絶対差が1以上である場合のみ、すべての非ゼロ絶対差がコード化される必要があり、それらは単項コード化される。
例えばSTFT(図8のエンティティ132fs参照)を使用して実行されるスペクトル的な平坦化は、図9aおよび図9bによって示され、図9aは図9bの平坦化バージョンと比較して元のパルス波形を示している。スペクトル的な平坦化は、代替として、例えば時間領域内でフィルタによって実行される場合があることに留意されたい。
【】
フレーム内のすべてのパルスは、8つの帯域(バンド)から構成される同じスペクトル包絡線(エンティティ132as参照)を使用することができる。帯域(バンド)境界周波数は、1kHz、1.5kHz、2.5kHz、3.5kHz、4.5kHz、6kHz、8.5kHz、11.5kHz、16kHzである。16kHzを超えるスペクトルコンテンツは明示的にコード化されない。別の例では、他の帯域境界が使用される場合がある。
パルスの各時間インスタンスにおけるスペクトル包絡線は、包絡線帯域内の振幅を合計することによって取得され、パルスは5つの時間インスタンスから構成される。包絡線は、フレーム内のすべてのパルスにわたって平均化される。時間周波数平面におけるパルス間の点は考慮されない。
値は4乗根を使用して圧縮され、包絡線はベクトル量子化される。ベクトル量子化器は2つの段を有し、2番目の段は2つの半分に分割される。

および
を有するフレームに対して、かつ
および
の値に対して、異なるコードブックが存在する。異なるコードブックは異なる数のビットを必要とする。
【】
量子化された包絡線は、線形補間を使用して平滑化される場合がある。パルスのスペクトログラムは、平滑化された包絡線を使用して平坦化される(エンティティ132fs参照)。平坦化は、(エンティティ132asから受け取った)包絡線で振幅を除算することによって実現され、それは対数振幅領域内の減算と等価である。位相値は変更されない。あるいは、フィルタプロセッサは、時間領域内でパルス波形をフィルタリングすることにより、振幅またはパルスSTFTをスペクトル的に平坦化するように構成される場合がある。
スペクトル的に平坦化されたパルスの波形
は、132cにおいて、STFTから逆DFT、ウィンドウ処理、およびオーバーラップ加算を介して取得される。
【】
図10は、複数のスペクトル的に平坦化されたパルス波形のうちの単一のスペクトル的に平坦化されたパルス波形をコード化するためのエンティティ132pcを示す。各単一コード化パルス波形は、コード化パルス信号として出力される。別の観点から、図10の単一パルスをコード化するためのエンティティ132pcは、図8に示されたようにパルス波形をコード化するように構成されたエンティティ132pcと同じであるが、いくつかのパルス波形をコード化するために数回使用される。
図10のエンティティ132pcは、一種のフィードバックループとして配置された、パルスコーダ132spcと、平坦化されたパルス波形のための構築器132cpwと、メモリ132mとを備える。構築器132cpwは220cpwと同じ機能を有し、メモリ132mは図14の229と同じ機能を有する。各単一/現在パルスは、過去パルスを考慮して平坦化パルス波形に基づいてエンティティ132spcによってコード化される。過去パルスに関する情報は、メモリ132mによって提供される。132pcによってコード化された過去パルスは、パルス波形構築器132cpwおよびメモリ132mを介して供給されることに留意されたい。これにより、予測が可能になる。そのような予測手法を使用することによる結果が図11によって示されている。ここで、図11aは予測と一緒に平坦化された元のパルスを示し、図11bの予測残差信号をもたらす。
【】
実施形態によれば、前のフレームからの
個のパルスおよび現在のフレームからのすでに量子化されたパルスの中から、最も類似する以前に量子化されたパルスが見出される。で定義された相関
は、最も類似するパルスを選択するために使用される。相関の差が0.05を下回る場合、より近いパルスが選択される。最も類似する前のパルスは予測のソース
であり、現在コード化されているパルスに対して、そのインデックス
がパルスコーディングで使用される。最大4つの相対予測ソースインデックス
がグループ化され、ハフマンコーディングされる。グループ化およびハフマンコードは、
および
か
かに依存する。
【】
最大相関用のオフセットは、パルス予測オフセット
である。それは、推定値に対して絶対的に、差分的に、または相対的にコード化され、推定値は、パルスの正確な位置
におけるピッチラグから計算される。コーディングのタイプごとに必要なビット数が計算され、最小ビットを有するものが選択される。
予測
のスケーリングには、SNRを最大化する利得
が使用される。予測利得は、3~4ビットで不均一に量子化される。予測残差のエネルギーがパルスのエネルギーよりも少なくとも5%小さくない場合、予測は使用されず、
はゼロに設定される。
【】
予測残差は、最大4つのインパルスを使用して量子化される。別の例では、他の最大数のインパルスが使用される場合がある。インパルスから構成される量子化残差はイノベーション
と呼ばれる。これが図12に示されている。ビットを節約するために、インパルスの数は、このフレーム内のパルスから予測されたパルスごとに1つだけ低減される。言い換えれば、予測利得がゼロである場合、または予測のソースが前のフレームからのパルスである場合、4つのインパルスが量子化され、そうでない場合、インパルスの数は予測ソースと比較して減少する。
図12は、図10のプロセスブロック132spcとして使用される処理経路を示す。プロセス経路は、コード化パルスを決定することを可能にし、3つのエンティティ132bp、132qi、132ceを含む場合がある。
最良の予測を見つけるための最初のエンティティ132bpは、過去パルスおよびパルス波形を使用して、iSOURCE、シフト、GP’、および予測残差を決定する。量子化インパルスエンティティ132giは、予測残差を量子化し、GI’およびインパルスを出力する。エンティティ132ceは、補正係数を計算し適用するように構成される。
コード化インパルスを出力するように、すべてのこの情報は、パルス波形と一緒に、エネルギーを補正するためのエンティティ132ceによって受け取られる。実施形態によれば、以下のアルゴリズムが使用される場合がある。
【】
インパルスの発見およびコーディングには、以下のアルゴリズムが使用される。:
1.全波整流を使用して絶対パルス波形
が構築される。
2.各位置におけるインパルスの数を有するベクトル
がゼロで初期化される。
3.
の最大値の位置が見つかる。
4.インパルスの数を有するベクトルは、見つかった最大値の位置
で1つ増加する。
【】
5.
の最大値が低減される。
6.ステップ3~5は、必要な数のインパルスが見つかるまで繰り返され、ここで、パルスの数は
に等しい。
インパルスは同じ位置を有する場合があることに気付かれたい。パルスの位置は、パルス中心からのそれらの距離によって順序付けられる。最初のインパルスの位置は絶対的にコード化される。後続のインパルスの位置は、前のインパルスの位置に依存する確率で差分的にコード化される。インパルス位置にはハフマンコーディングが使用される。各インパルスの符号もコード化される。複数のインパルスが同じ位置を共有する場合、符号は一度だけコード化される。
【】
残差信号15rの4つの発見およびスケーリングされたインパルス15iが図13によって示されている。詳細には、線によって表されるインパルス
は、それに応じて、例えばインパルス+/-1に利得
を乗算してスケーリングされる場合がある。
SNRを最大化する利得
は、インパルスから構成されるイノベーション
をスケーリングするために使用される。イノベーション利得は、パルスの数
に応じて、2~4ビットで不均一に量子化される。
【】
次いで、平坦化されたパルス波形の量子化のための第1の推定値
は、
であり、ここで、
は量子化を表記する。
利得はSNRを最大化することによって見出されるので、
のエネルギーは元のターゲット
のエネルギーよりもはるかに低くなり得る。エネルギー低減を補償するために、補正係数cgが計算される。
最終的な利得は、次のとおりである:

【】
予測のためのメモリは、量子化された平坦化パルス波形
を使用して更新される。


個の量子化され平坦化パルス波形のコーディングの最後に、後続のフレームにおける予測のためにメモリに保持される。
【】
以下、図14を参照して、パルスを復元するための手法が説明される。
図14は、単一のパルス波形を復元するためのエンティティ220を示す。単一のパルス波形を復元するための以下に説明される手法は、複数のパルス波形に対して複数回実行される。複数のパルス波形は、複数のパルスを含む波形を復元するために図15のエンティティ22’によって使用される。別の観点から、エンティティ220は、複数のコード化パルスおよび複数のパルススペクトル包絡線から構成される信号を処理し、コード化パルスごとに、関連付けられたパルススペクトル包絡線は単一の復元されたパルス波形を出力し、その結果、複数の復元されたパルス波形から構成される信号がエンティティ220の出力にある。
エンティティ220は、複数のサブエンティティ、例えば、スペクトル的に平坦化されたパルス波形を構築するためのエンティティ220cpw、スペクトル的に平坦化されたパルス波形のパルススペクトログラム(位相および振幅のスペクトログラム)を生成するためのエンティティ224、ならびにパルス振幅スペクトログラムをスペクトル的に整形するためのエンティティ226を含む。このエンティティ226は、振幅スペクトログラムならびにパルススペクトル包絡線を使用する。エンティティ226の出力は、パルススペクトログラムを参照番号228によってマークされた波形に変換するための変換器に供給される。このエンティティ228は、パルス波形を復元するために、位相スペクトログラムならびにスペクトル的に整形されたパルス振幅スペクトログラムを受け取る。(スペクトル的に平坦化されたパルス波形を構築するように構成された)エンティティ220cpwは、コード化パルスを記述する信号をその入力で受け取ることに留意されたい。構築器220cpwは、更新メモリ229を含む一種のフィードバックループを含む。これにより、過去パルスを考慮してパルス波形が構築されることが可能になる。ここで、以前に構築されたパルス波形は、過去パルスが次のパルス波形を構築するためにエンティティ220cpwによって使用され得るようにフィードバックされる。以下、このパルス復元器220の機能が説明される。デコーダ側には(復号された平坦化パルス波形またはコード化された平坦化パルス波形とも呼ばれる)量子化された平坦化パルス波形だけが存在することが留意されるべきであり、デコーダ側に元のパルス波形が存在しないので、デコーダ側で量子化された平坦化パルス波形を命名するために平坦化パルス波形を使用し、(復号パルス波形またはコード化パルス波形または復号化パルス波形とも呼ばれる)量子化パルス波形を命名するためにパルス波形を使用する。
【】
デコーダ側220でパルスを復元するために、利得(
および
)、インパルス/イノベーション、予測ソース(
)、およびオフセット(
)を復号した後に、量子化された平坦化パルス波形が構築される(エンティティ220cpw参照)。予測用メモリ229は、エンティティ132m内のエンコーダと同様に更新される。次いで、パルス波形ごとにSTFT(エンティティ224参照)が取得される。例えば、75%のオーバーラップを有する同じ2ミリ秒の長さの2乗正弦ウィンドウが、パルス抽出と同様に使用される。STFTの振幅は、復号され平滑化されたスペクトル包絡線を使用して再整形され、パルス開始周波数
より下でゼロにされる。STFTを整形するために、包絡線との振幅の単純な乗算が使用される(エンティティ226参照)。位相は修正されない。パルスの復元された波形は、STFTから逆DFT、ウィンドウ処理、およびオーバーラップ加算を介して取得される(エンティティ228参照)。あるいは、包絡線は、STFTを回避してFIRフィルタを介して整形することができる。
【】
図15は、波形yPを構築するためにパルスの複数の復元された波形ならびにパルスの位置を受け取るエンティティ228に続くエンティティ22’を示す(図2a、図2c参照)。このエンティティ22’は、例えば、2aまたは2cの波形構築器22内の最後のエンティティとして使用される。
復元されたパルス波形は、復号された位置
に基づいて連結され、図15のエンティティ22’のパルス間にゼロを挿入する。連結された波形は、復号信号に加算される(図2aもしくは図2cの23または図6の114m参照)。同様に、元のパルス波形
が連結され(図6の114参照)、MDCTベースのコーデックの入力から減算される(図6参照)。
復元されたパルス波形は、復号された位置
に基づいて連結され、パルス間にゼロを挿入する。連結された波形は、復号信号に加算される。同様に、元のパルス波形
が連結され、MDCTベースのコーデックの入力から減算される。
復元されたパルス波形は、元のパルスの完全な表現ではない。したがって、入力から復元されたパルス波形を除去すると、信号の過渡部分の一部が残る。過渡信号はMDCTコーデックで良好に提示することができないので、フレーム全体にわたって広がるノイズが存在し、パルスを別々にコード化する利点が低減される。このため、元のパルスは入力から除去される。
【】
実施形態によれば、HF音調性フラグφHは、以下のように定義される場合がある。
正規化された相関ρHFは、現在のウィンドウ内のサンプルと
(または
)の遅延を伴う遅延バージョンとの間でyMHFに対して計算され、ここで、yMHFはパルス残差信号yMのハイパスフィルタリングされたバージョンである。一例として、約6kHzのクロスオーバー周波数を有するハイパスフィルタが使用される場合がある。
指定された周波数を上回るMDCT周波数ビンごとに、[20]の5.3.3.2.5のように、周波数ビンが音調またはノイズのようであるかどうかが判定される。音調周波数ビンの総数nHFTonalCurrが現在のフレーム内で計算され、さらに平滑化された音調周波数の総数がnHFTonal=0.5・nHFTonal+nHFTonalCurrとして計算される。
HF音調性フラグφHは、TNSが非アクティブであり、ピッチ輪郭が存在し、高周波数に音調性が存在する場合、1に設定され、音調性は、ρHF>0またはnHFTonal>1の場合、高周波数に存在する。
【】
図16に関して、iBPC手法が説明される。次に、最適量子化ステップサイズ
を取得するプロセスが説明される。プロセスは、ブロックiBPCの不可欠な部分であり得る。図16のエンティティ300は、XMRに基づいて
を出力することに留意されたい。別の装置では、入力としてXMRおよび
が使用される場合がある(詳細については図3参照)。
【】
図16は、ステップサイズを推定するための手法のフローチャートを示す。プロセスはi=0で始まり、次いで、例えば、量子化、適応帯域ゼロ化、帯域ごとのパラメータとスペクトルを一緒に決定すること、およびスペクトルがコード化可能であるかどうかを判定することの4つのステップが実行される。これらのステップは、参照番号301~304によってマークされている。スペクトルがコード化可能である場合、ステップサイズは減少し(ステップ307参照)、次の反復++iが実行される、参照番号308参照。これは、iが最大反復と等しくない限り実行される(判断ステップ309参照)。最大反復が達成された場合、ステップサイズが出力される。最大反復が達成されない場合、次の反復が実行される。
【】
スペクトルがコード化可能でない場合、検証ステップ(スペクトルが今コード化可能)313と一緒にステップ311および312を有するプロセスが適用される。その後、次の反復(ステップ308参照)を開始する前にステップサイズが増加する(314参照)。
スペクトル包絡線が知覚的に平坦化されたスペクトルXMRは、コード化された帯域幅全体にわたって単一の量子化ステップサイズgQを使用してスカラ量子化され、例えば、コード化されたspectを生成するコンテキストベースの算術コーダでエントロピーコード化される。コード化されたスペクトル帯域幅は、増加する幅
のサブバンドBiに分割される。
グローバル利得とも呼ばれる最適量子化ステップサイズ
は、説明されたように反復的に見出される。
【】
各反復において、スペクトルXMRは
を生成するためにブロック量子化301で量子化される。ブロック「適応帯域ゼロ化」302では、ゼロ量子化ラインのエネルギーと元のエネルギーの比がサブバンドBi
において計算され、エネルギー比が適応閾値
を上回る場合、
内のサブバンド全体がゼロに設定される。閾値
は、音調性フラグφHおよびフラグ
に基づいて計算され、フラグ
は、サブバンドが前のフレーム内でゼロにされたかどうかを示す。
【】
ゼロにされたサブバンドごとに、フラグ
が1に設定される。処理の最後に、現在のフレーム
が
にコピーされる。あるいは、2つ以上の音調性フラグおよび複数の音調性フラグから各サブバンドの音調性へのマッピングが存在する可能性があり、サブバンドごとの音調性値
が生成される。
の値は、例えば、値のセット{0.25、0.5、0.75}
からの値を有することができる。あるいは、ゼロ量子化ラインのエネルギーおよび元のエネルギーならびにコンテンツ
およびXBR
に基づいて、
のサブバンドi全体をゼロにするかどうかを判断するために、他の判断が使用される場合がある。
【】
適応帯域ゼロ化が使用される周波数範囲は、特定の周波数fABZStart、例えば7000Hzの上に限定され、最も低いサブバンドがゼロにされる限り、適応帯域ゼロ化が特定の周波数fABZMin、例えば700Hzまで下方に伸ばされる。
完全にゼロであるfEZを上回る
のサブバンドの個々のゼロ充填レベル(個々のzfl)、ここでfEZは例えば3000Hzである、が明示的にコード化され、さらに、ゼロに量子化されたfEZを下回るすべてのゼロサブバンドおよびfEZを上回るすべてのゼロサブバンド用の1つのゼロ充填レベル(zflsmall)がコード化される。適応帯域ゼロ化によって明示的に0に設定されていない場合でも、ブロック量子化における量子化に起因して
のサブバンドは完全に0であり得る。ゼロ充填レベル(個々のzflおよびzflsmallから構成されるzfl)ならびに
のスペクトル線のエントロピーコーディングに必要なビット数が(例えば、帯域ごとのパラメトリックコーダによって)計算される。さらに、利用可能なビットバジェットで明示的にコード化することができるスペクトル線の数NQが見出される。
【】
NQはコード化されたspectの不可欠な部分であり、スペクトル線をコード化するためにいくつのビットが使用されるかを見つけるためにデコーダにおいて使用される。スペクトル線をコード化するためのビット数を見つけるための他の方法、例えば特別なEOF文字を使用する方法が使用される場合がある。すべての非ゼロラインをコード化するのに十分なビットが存在しない限り、NQを上回る
のラインはゼロに設定され、必要なビット数が再計算される。
スペクトル線をコード化するために必要なビットの計算の場合、下から始まるラインをコード化するために必要なビットが計算される。スペクトル線のコーディングに必要なビットの再計算は、各n≦NQについてn個のラインをコード化するために必要なビット数を記憶することによって効率化されるので、この計算は1回だけ必要とされる。
各反復において、必要なビット数が利用可能なビットを超えた場合、グローバル利得gQは減少し(307)、そうでない場合gQは増加する(314)。各反復において、グローバル利得の変化速度が適合される。グローバル利得を反復的に修正するために、EVS[20]からのレート歪みループと同じ変化速度の適合が使用される場合がある。反復プロセスの最後に、最適量子化ステップサイズ
は、例えば、EVSからの基準を使用してスペクトルの最適なコーディングを生成するgQに等しく、XQは対応する
に等しい。
実際のコーディングの代わりに、コーディングに必要なビットの最大数の推定値が使用される場合がある。反復プロセスの出力は、最適量子化ステップサイズ
であり、出力はまた、それらを再度取得する際の反復処理を回避するために、通常はすでに利用可能であるように、コード化されたspectおよびコード化されたノイズ充填レベル(zfl)を含む場合がある。
【】
以下、ゼロ充填が詳細に説明される。
実施形態によれば、ソーススペクトルを選択する方法の例から始めて、次に、ブロック「ゼロ充填」が説明される。
ゼロ充填を作成するために、以下のパラメータが適応的に見出される。
・最適な長いコピーアップ距離
・最小コピーアップ距離
・最小コピーアップソース開始
・コピーアップ距離シフトΔC
ソーススペクトルがXCTのすでに取得された下部である場合、最適なコピーアップ距離

は最適な距離を決定する。
の値は、例えば5600Hzに対応するインデックスに設定された最小値
と、例えば6225Hzに対応するインデックスに設定された最大値
との間にある。他の値が制約
とともに使用される場合がある。
【】
高調波間の距離
は、平均ピッチラグ
から計算され、平均ピッチラグ
は、ビットストリームから復号されるか、またはビットストリームからのパラメータ(例えばピッチ輪郭)から推論される。あるいは、
は、XDTまたは(例えば、XDTを使用して取得された時間領域信号からの)その導関数を分析することによって取得される場合がある。高調波間の距離
は、必ずしも整数ではない。
である場合
はゼロに設定され、ゼロは有意なピッチラグが存在しないことを通知する方法である。
の値は、最小最適コピーアップ距離
よりも大きい高調波距離
の最小倍数である。
がゼロである場合、
は使用されない。
【】
開始TNSスペクトル線プラスTNS次数はiTと表記され、それは、例えば1000Hzに対応するインデックスであり得る。
TNSがフレーム内で非アクティブである場合、
は
に設定される。TNSがアクティブである場合、
はiTに設定され、さらに、HFが音調である場合(例えば、ΦHが1である場合)、
によって下限される。
【】
振幅スペクトルZCは、復号されたspectであるXDTから推定される。
推定された振幅スペクトルの正規化された相関が計算される。
相関の長さLCは、利用可能なスペクトルによって許容される最大値に設定され、任意選択的に何らかの値(例えば、5000Hzに相当する長さ)に制限される。
【】
基本的に、コピーアップソース
と宛先

との間の相関を最大化するnを検索しており、ここで0≦m<LCである
【】
n
(
)の中から
を選択し、ここで、ρCは最初のピークを有し、ρCの平均を上回り、すなわち、
および
であり、すべての
について
であることは満たされない。他の実装形態では、
~
の範囲内の絶対最大値であるように、
を選択することができる。最適な長いコピーアップ距離が予想される場所では、
~
の範囲内の任意の他の値が
に選択される場合がある。
【】
TNSがアクティブである場合、
を選択することができる。
TNSが非アクティブである場合、
であり、ここで
は正規化された相関であり、
は前のフレームにおける最適距離である。フラグ
は、前のフレームにおいて音調性の変化があったかどうかを示す。関数
は、
、
、または
のいずれかを返す。
においてどの値を返すかの判断は、主に値
、
、および

に基づく。フラグ
が真であり、
または
が有効である場合、
は無視される。
および
の値は、まれな場合に使用される。
【】
一例では、
は以下の判断で定義される可能性がある。
・
が少なくとも
に対して
よりも大きく、少なくとも
に対して
よりも大きい場合に
が返され、ここで、
および
は、それぞれ、
および
に比例する適応閾値であり、さらに、
は、何らかの絶対閾値、例えば例0.5を上回ることが要求される場合があり、
・そうでない場合、
が少なくとも閾値、例えば0.2に対して
よりも大きい場合に
が返され、
・そうでない場合、
が設定され、
である場合に
が返され、
・そうでない場合、
が設定され、
の値が有効である場合、すなわち、有意なピッチラグが存在する場合に
が返され、
・そうでない場合、
が小さい、例えば0.1を下回り、
の値が有効である場合、すなわち有意なピッチラグが存在し、前のフレームからのピッチラグ変化が小さい場合に
が返され、
・そうでない場合、
が返される。
【】
フラグ
は、TNSがアクティブである場合、または
であり、かつ音調性が低い場合に真に設定され、音調性は、例えばφHが偽である場合、または
が0である場合に低い。
は、1より小さい値、例えば0.7である。
に設定された値は、次のフレームで使用される。
前のフレームと現在のフレームとの間の
のパーセント変化
も計算される。
最適なコピーアップ距離
が
に等しくなく、
でない限り(
は所定の閾値である)、コピーアップ距離シフトΔCは
に設定され、その場合、ΔCは前のフレームと同じ値に設定され、連続するフレームにわたって一定になる。
は、前のフレームと現在のフレームとの間の
の変化(例えば、パーセント変化)の尺度である。
が
のパーセント変化である場合、
は例えば0.1に設定される可能性がある。TNSがフレーム内でアクティブである場合、ΔCは使用されない。
【】
最小コピーアップソース開始
は、TNSがアクティブである場合、例えばiTに設定することができ、任意選択で、HFが音調である場合
によって下限され、または現在のフレームにおいてTNSがアクティブでない場合、例えば
に設定することができる。
最小コピーアップ距離
は、例えば、TNSが非アクティブである場合
に設定される。TNSがアクティブである場合、
は、例えばHFが音調でない場合
に設定され、または
は、例えばHFが音調である場合
に設定される。
【】
例えば、初期条件として
を使用して、ランダムノイズスペクトルXNは
のように構成され、ここで、関数shortは結果を16ビットに切り詰める。任意の他のランダムノイズ生成器および初期条件が使用される場合がある。次いで、ランダムノイズスペクトXNは、XDの非ゼロ値の位置でゼロに設定され、任意選択で、ゼロに設定された位置の間のXNの部分は、XDの非ゼロ値の位置の近くのランダムノイズを低減するためにウィンドウ処理される。
XCTの
から始まる長さ
のサブバンドBiごとに、
用のソーススペクトルが見出される。サブバンド分割は、zflをコード化するために使用されるサブバンド分割と同じであり得るが、異なる、より高い、またはより低いものであってもよい。
例えば、TNSがアクティブでなく、HFが音調でない場合、ランダムノイズスペクトルXNは、すべてのサブバンド用のソーススペクトルとして使用される。別の例では、XNは、他のソースが空であるサブバンド、または最小のコピーアップ宛先:
の下から始まるいくつかのサブバンド用のソーススペクトルとして使用される。
【】
別の例では、TNSがアクティブではなく、HFが音調である場合、予測スペクトルXNPは、
の下から始まり、隣接するサブバンドにおいてEB
がEBを少なくとも12dB上回るサブバンド用のソースとして使用される場合があり、予測スペクトルは、過去の復号スペクトルから、または過去の復号スペクトルから(例えば、復号TD信号から)取得された信号から取得される。
の例に含まれていないケースでは、距離dCは、
または
および
の混合が、
から始まる
用のソーススペクトルとして使用され得るように見出される場合があり、ここで、
である。一例では、TNSがアクティブであるが、より高い周波数(例えば、4500Hz)からのみ始まり、HFが音調でない場合、
および
の混合は、
である場合ソーススペクトルとして使用される場合があり、さらに別の例では、
またはゼロから構成されるスペクトルのみがソースとして使用される場合がある。
である場合、dCは
に設定される可能性がある。TNSがアクティブである場合、正の整数nが見つかる場合があり、その結果、
およびdCは、
、例えば最小のそのような整数nに設定される場合がある。TNSがアクティブでない場合、別の正の整数nが見つかる場合があり、その結果、
およびdCは、
、例えば最小のそのような整数nに設定される場合がある。
【】
別の例では、開始周波数fZFStartまでのXSにおいて最も低いサブバンド
は0に設定される場合があり、最も低いサブバンドXCTがXDTのコピーであり得ることを意味する。
次に、ブロック「ゼロ充填」内のEBに基づいて、ソーススペクトルを重み付けする一例が与えられる。
EBを平滑化する一例では、
はzflから取得される場合があり、各
はEBのサブバンドiに対応する。次いで、
が平滑化される:
および
。
スケーリングファクタ
は、ソーススペクトルに応じてサブバンドBiごとに計算される。
【】
さらに、スケーリングは、次のように計算された係数
で制限される:
ソーススペクトル帯域
(
)は2つの半分に分割され、各半分はスケーリングされ、第1の半分は
であり、第2の半分は
である。
【】
の説明では、
は
を使用して導出され、
は
を使用して導出され、
および
は
および
を使用して導出されることに留意されたい。
は
および
および
を使用して導出される。この説明は、
の使用を明確に示すためにのみ使用された。さらなる実施形態によれば、EBは
を使用して導出される場合があり、の式を異なる方法で書くことができる。

【】
EBが
を使用して導出され得るこのさらなる実施形態であっても、
および
の値は、前の例と同じであり得る。
スケーリングされたソーススペクトル帯域
、ここでスケーリングされたソーススペクトル帯域は
である、は
を取得するために

に加算される。
【】
次に、(iBPCの一部として)ゼロ量子化ラインのエネルギーを量子化する一例が与えられる。
XQZは、非ゼロ量子化ラインをゼロに設定することによってXMRから取得される。例えば、XNと同じ方法で、XQの非ゼロ量子化ラインの位置の値はゼロに設定され、非ゼロ量子化ライン間のゼロ部分がXMRでウィンドウ処理され、XQZが生成される。
ゼロライン用の帯域i当たりのエネルギー(
)は、XQZ:
から計算される。
【】
は、例えば、ステップサイズ1/8を使用して量子化され、6/8に制限される。別個の
は、完全にゼロに量子化されるfEZ上回るサブバンド用の個々のzflとしてのみコード化され、ここでfEZは例えば3000Hzである。さらに、1つのエネルギーレベル
は、fEZを下回るゼロサブバンドおよびfEZを上回るゼロサブバンドからのすべての
の平均として計算され、ここで
はゼロに量子化され、ゼロサブバンドは完全なサブバンドがゼロに量子化されることを意味する。ローレベル
は、ステップサイズ1/16で量子化され、3/16に制限される。非ゼロサブバンド内の個々のゼロラインのエネルギーは、(例えば、デコーダによって)推定され、明示的にコード化されない。
の値はzflからデコーダ側で取得され、ゼロサブバンド用の
の値は
の量子化値に対応する。したがって、
から構成されるEBの値は、最適量子化ステップ
に応じてコード化される場合がある。これは、パラメトリックコーダ156pcが入力として
を受け取る図3によって示されている。別の例では、最適量子化ステップ
とは無関係に、パラメトリックコーダに固有の他の量子化ステップサイズが使用される場合がある。さらに別の例では、不均一なスカラ量子化器またはベクトル量子化器がzflをコード化するために使用される場合がある。しかし、提示された例では、XMRからゼロへの量子化が最適量子化ステップ
に依存するので、最適量子化ステップ
を使用することが有利である。
【】
長期予測(LTP)
次に、ブロックLTPが説明される。時間領域信号yCはLTPへの入力として使用され、ここでyはXからIMDCTの出力として取得される。
IMDCTは、逆MDCT、ウィンドウ処理、およびオーバーラップ加算から構成される。現在のフレーム内のyCの左側のオーバーラップ部分および非オーバーラップ部分は、LTPバッファに保存される。
LTPバッファは、MDCTの全ウィンドウについての予測信号を生成するために、LTP内の後続のフレームで使用される。これが図17aによって示されている。
より短いオーバーラップ、例えば半分のオーバーラップが現在のウィンドウにおける右オーバーラップに使用される場合、非オーバーラップ部分「オーバーラップ差」もLTPバッファに保存される。したがって、位置「オーバーラップ差」(図17b参照)にあるサンプルも、「オーバーラップ差」の前の2本の縦線の間の位置にあるサンプルと一緒にLTPバッファに入れられる。非オーバーラップ部分「オーバーラップ差」は、現在のフレーム内のデコーダ出力にはなく、後続のフレームのみに存在する(図17bおよび図17c参照)。
より短いオーバーラップが現在のウィンドウ内の左オーバーラップに使用される場合、現在のウィンドウの開始までの非オーバーラップ部分全体が、予測信号を生成するためのLTPバッファの一部として使用される。
【】
MDCTの全ウィンドウ用の予測信号は、LTPバッファから生成される。ウィンドウ長の時間区間は、ホップサイズLupdateF0=LsubF0/2を有する長さLsubF0の重複する部分区間に分割される。他のホップサイズおよび部分区間長とホップサイズとの間の関係が使用される場合がある。オーバーラップ長は、LupdateF0-LsubF0以下であり得る。
LsubF0は、部分区間内で著しいピッチ変化が予想されないように選択される。一例では、LupdateF0は、
に最も近いが、
より大きくない整数であり、LsubF0は2LupdateF0に設定される。図17dに示されたように、別の例では、フレーム長またはウィンドウ長がLupdateF0によって割り切れることがさらに要求される場合がある。
以下、「符号化オーディオ信号のフレームに関連付けられた区間内の部分区間の位置に依存する符号化されたピッチパラメータから部分区間パラメータを導出するように構成された計算手段(1030)」の例、ならびに「パラメータが符号化されたピッチパラメータおよび符号化オーディオ信号のフレームに関連付けられた区間内の部分区間位置から導出される」一例も与えられる。部分区間ごとに、部分区間の中心isubCenterにあるピッチラグがピッチ輪郭から取得される。最初のステップでは、部分区間ピッチラグdsubF0は、部分区間中心の位置にあるピッチラグdcontour[isubCenter]に設定される。ウィンドウ開始までの部分区間終了の距離(isubCenter+LsubF0/2)がdsubF0より大きい限り、dsubF0は部分区間中心の左の位置dsubF0にあるピッチ輪郭からのピッチラグの値まで増加し、すなわち、isubCenter+LsubF0/2<dsubF0になるまでdsubF0=dsubF0+dcontour[isubCenter-dsubF0]である。ウィンドウ開始までの部分区間終了の距離(isubCenter+LsubF0/2)は、部分区間終了と呼ばれる場合もある。
【】
各部分区間において、予測信号は、LTPバッファおよび伝達関数HLTP(z)
を有するフィルタを使用して構築され、ここで、

であり、ここで、TintはdsubF0の整数部分、すなわち
であり、TfrはdsubF0の小数部分、すなわちTfr=dsubF0-Tintであり、B(z,Tfr)は小数遅延フィルタである。
B(z,Tfr)はローパス特性を有することができる(または、それは高周波数を強調しない場合がある)。次いで、予測信号は、部分区間のオーバーラップ領域においてクロスフェードされる。
【】
あるいは、予測信号は、伝達関数HLTP2(z)を有するフィルタに基づくフィルタのゼロ入力応答(ZIR)およびフィルタの初期出力として使用されるLTPバッファを用いて、[21]に記載されているようなカスケードフィルタを有する方法を使用して構築することができ、ここで、
である。
B(z,Tfr)の例:



例では、Tfrは、通常、値のリストから最も近い値に丸められ、リスト内の値ごとにフィルタBが事前定義される。
予測信号XP’は、XMを生成するために使用されるウィンドウと同じウィンドウでウィンドウ処理され、XPを取得するためにMDCTを介して変換される。
【】
以下、符号化されたピッチパラメータから導出されたパラメータに応じて、予測スペクトル、または予測スペクトルの導関数を修正するための手段の一例が与えられる。XP
XPの高調波から少なくともnFsafeguard離れたMDCT係数の振幅はゼロに設定され(または1より小さい正の係数で乗算され)、ここでnFsafeguardは例えば10である。あるいは、高調波間の振幅を低減するために、長方形のウィンドウ以外の他のウィンドウが使用される場合がある。XPの高調波は
の整数倍であるビン位置にあると見なされ、ここで、LMはXP長であり、
は平均補正されたピッチラグである。高調波位置は
である。これにより、特にハーフピッチラグが検出されると、高調波間のノイズが除去される。
Xのスペクトル包絡線は、XPSを取得するために、例えばSNSEを介して、XMと同じ方法で知覚的に平坦化される。
【】
以下、「コード化されたピッチパラメータに基づいて予測可能な高調波の数が決定される」一例が与えられる。XPS、XMS、および
を使用して、予測可能な高調波の数nLTPが決定される。
nLTPがコード化され、デコーダに伝達される。最大NLTP個の高調波が予測される場合があり、例えばNLTP=8である。
XPSおよびXMSは、長さ
のNLTP個の帯域に分割され、各帯域は
から始まり、
である。
nLTPは、すべてのn≦nLTPについてXMS-XPSおよびXMSのエネルギーの比が閾値τLTPを下回るように選択され、例えばτLTP=0.7である。そのようなnが存在しない場合、nLTP=0であり、LTPは現在のフレーム内でアクティブではない。LTPがアクティブであるか否かは、フラグで通知される。
XPSおよびXMSの代わりに、XPおよびXMが使用される場合がある。
XPSおよびXMSの代わりに、XPSおよびXMTが使用される場合がある。あるいは、予測可能な高調波の数は、ピッチ輪郭dcontourに基づいて決定される場合がある。
【】
LTPがアクティブである場合、ゼロ番目の係数を除くXPSの最初の
個の係数は、XMTから減算されてXMRを生成する。ゼロ番目および
を上回る係数は、XMTからXMRにコピーされる。
量子化のプロセスでは、XQはXMRから取得され、Xはspectとしてコード化され、XDを復号することによってspectから取得される。
【】
以下、予測スペクトル(XP)の少なくとも一部分または予測スペクトルの導関数(XPS)の一部分を誤差スペクトル(XD)と合成するように構成された合成器(157)の一例が与えられる。LTPがアクティブである場合、ゼロ番目の係数を除くXPSの最初の
個の係数は、XDに加算されてXDTを生成する。ゼロ番目および
を上回る係数は、XDからXDTにコピーされる。
【】
以下、高調波ポストフィルタリングの任意選択の特徴が説明される。
時間領域信号yCは、IMDCTの出力としてXCから取得され、ここで、IMDCTは、逆MDCT、ウィンドウ処理、およびオーバーラップ加算から構成される。高調波間のノイズを低減し、yCを出力するために、ピッチ輪郭に従う高調波ポストフィルタ(HPF)がyHに適用される。
yCの代わりに、復号パルス波形から構築されたyCと時間領域信号yの合成は、HPFへの入力として使用される場合がある。図18aによって示されるとおりである。
現在のフレームkへのHPF入力はyc[n](0≦n<N)である。過去の出力サンプルyH[n](-dHPFmax≦n<0、ここで、dHPFmaxは少なくとも最大ピッチラグである)も利用可能である。逆MDCT出力の右オーバーラップ領域の時間エイリアスされた部分を含む場合がある。
Nahead個のIMDCT先読みサンプルも利用可能である。HPFが適用される時間区間が現在のフレームと等しい一例を示すが、異なる区間が使用されてもよい。MDCT/IMDCTウィンドウに対するHPF現在入力/出力、HPF過去出力、およびIMDCT先読みの位置は、オーバーラップ加算を生成するために通常通り加算され得るオーバーラップ部分も示す図18aによって示されている。
【】
HPFが一定のパラメータを使用するべきであることがビットストリーム内で通知される場合、現在のフレームの先頭で平滑化が使用され、フレームの残りの部分で一定のパラメータを有するHPFが続く。あるいは、一定のパラメータが使用されるべきかどうかを判断するために、yCに対してピッチ分析が実行される場合がある。平滑化が使用される領域の長さは、ピッチパラメータに依存する場合がある。
一定のパラメータが通知されない場合、HPF入力は、ホップサイズLk,update=Lk/2を有する長さLkの重複する部分区間に分割される。他のホップサイズが使用される場合がある。オーバーラップ長は、Lk,update-Lk以下であり得る。
Lkは、部分区間内で著しいピッチ変化が予想されないように選択される。一例では、Lk,updateは、pitch_mid/2に最も近いが、pitch_mid/2より大きくない整数であり、Lkは2Lk,updateに設定される。pitch_midの代わりに、いくつかの他の値、例えばpitch_midとpitch_startの平均、またはyCに関するピッチ分析から取得された値、または例えば変化するピッチを有する信号についての区間内で予想される最小ピッチラグが使用される場合がある。あるいは、固定数の部分区間が選択される場合がある。別の例では、フレーム長がLk,updateによって割り切れることがさらに要求される場合がある(図18b参照)。
現在の区間k内の部分区間の数はKkであり、前の区間k-1ではKk-1であり、次の区間k+1ではKk+1であると言う。図18bに示された例では、Kk=6およびKk-1=4である。
【】
他の例では、以下に示されたように、現在の(時間)区間が非整数の数の部分区間に分割されること、および/または部分区間の長さが現在の区間内で変化することが可能である。これが図18cおよび図18dによって示されている。
現在の区間k(1≦l≦Kk)内の部分区間lごとに、部分区間ピッチラグpk,lは、ピッチ探索アルゴリズムを使用して見つけられ、ピッチ探索アルゴリズムは、ピッチ輪郭を取得するために使用されるピッチ探索と同じであってもよく、それとは異なっていてもよい。部分区間lのピッチ探索は、部分区間にわたる探索の複雑さを低減し、かつ/または値pk,lの安定性を高めるために、コード化されたピッチラグ(pitch_mid、pitch_end)から導出された値を使用することができ、例えば、コード化されたピッチラグから導出された値は、ピッチ輪郭の値であり得る。他の例では、部分区間にわたる探索の複雑さおよび/または値pk,lの安定性を低減するために、コード化されたピッチラグの代わりに、yCの完全な区間内のグローバルピッチ分析によって見出されたパラメータが使用される場合がある。別の例では、部分区間ピッチラグを探索するとき、前の部分区間に対する高調波ポストフィルタリングの中間出力が利用可能であり、(前の区間の部分区間を含む)ピッチ探索で使用されることが想定される。
Nahead個の(潜在的に時間エイリアスされた)先読みサンプルはまた、区間/フレーム境界を横切る部分区間内のピッチを見つけるために使用される場合があり、または、例えば、先読みが利用できない場合、区間内の最後の部分区間を先読みするために遅延がデコーダに導入される場合がある。あるいは、コード化されたピッチラグ(pitch_mid、pitch_end)から導出された値が
に使用される場合がある。
【】
高調波ポストフィルタリングには、利得適応高調波ポストフィルタが使用される場合がある。例では、HPFは伝達関数:
を有し、ここで、B(z,Tfr)は小数遅延フィルタである。選択は独立しているので、B(z,Tfr)はLTPで使用される小数遅延フィルタと同じであってもよく、それらと異なっていてもよい。HPFでは、B(z,Tfr)はローパス(または高周波数を強調しないチルトフィルタ)としても機能する。
【】
伝達関数H(z)およびB(z,Tfr)の係数としてのbj(Tfr)を有する利得適応高調波ポストフィルタ用の差分方程式の一例は、次のとおりである:
小数遅延を有するローパスフィルタの代わりに、識別フィルタが使用されてもよく、B(z,Tfr)=1および異なる式:
が与えられる。
パラメータgは最適利得である。それは、信号の振幅変化(変調)をモデル化し、信号適応型である。
パラメータhは高調波レベルである。それは、信号高調波の所望の増加を制御し、信号適応型である。パラメータβはまた、信号高調波の増加を制御し、一定であるか、またはサンプリングレートおよびビットレートに依存する。パラメータβは1に等しい場合もある。積βhの値は0と1との間であるべきであり、0は高調波に変化をもたらさず、1は高調波を最大限に増加させる。実際には、βh<0.75であることが通常である。
高調波ポストフィルタのフィードフォワード部分(すなわち1-αβhB(z,0))は、ハイパス(または低周波数を強調しないチルトフィルタ)として機能する。パラメータαは、ハイパスフィルタリングの強度を決定し(または言い換えれば、それはデエンファシス傾斜を制御し)、0と1との間の値を有する。パラメータαは、一定であるか、またはサンプリングレートおよびビットレートに依存する。実施形態では、0.5と1との間の値が好ましい。
【】
部分区間ごとに、最適な利得gk,lおよび高調波レベルhk,lが見出されるか、または場合によっては、それは他のパラメータから導出される可能性がある。
所与のB(z,Tfr)について、信号をシフト/フィルタリングするための関数を、次のように定義する:



これらの定義では、
は、長さLを有する(部分)区間l内の
個の信号yCを表し、
はB(z,0)を有するyCのフィルタリングを表し、y-pは(場合によっては小数の)p個のサンプルについてのyHのシフトを表す。
【】
長さLおよびシフトpを有する(部分)区間lにある信号yCおよびyHの正規化された相関
を、次のように定義する:

の代替の定義は、次の通りであり得る:

【】
代替の定義では、
はn<TINTについての過去の部分区間内のyHを表す。
の定義では、4次のB(z,Tfr)を使用している。
j用の範囲の変更を必要とする任意の他の次数が使用される場合がある。
B(z,Tfr)=1である例では、整数シフトのみが考慮される場合に使用され得る
および
が得られる。
このように定義された正規化された相関は、小数シフトpの計算を可能にする。
【】
normcorr、l及びLのパラメータは、正規化された相関用のウィンドウを定義する。の定義では、長方形のウィンドウが使用される。任意の他のタイプのウィンドウ(例えば、Hann、コサイン)が代わりに使用される場合があり、それはでw[n]で
と
を乗算して行うことができ、ここでw[n]はウィンドウを表す。
部分区間に対する正規化された相関を得るために、区間番号にlを設定し、部分区間の長さにLを設定する。
の出力は、サブフレームl用の利得適応高調波ポストフィルタH(z)のZIRを表し、β=h=g=1および
およびTfr=p-Tintである。
【】
最適な利得gk,lは、サブフレームl内の振幅変化(変調)をモデル化する。それは、例えば、ローパス入力との予測信号の相関を予測信号のエネルギーで割ったものとして計算される場合がある。
別の例では、最適な利得gk,lは、ローパス入力のエネルギーを予測信号のエネルギーで割ったものとして計算される場合がある。
高調波レベルhk,lは、信号高調波の所望の増加を制御し、例えば、正規化された相関の二乗として計算することができる。
通常、部分区間の正規化された相関は、部分区間におけるピッチ探索からすでに利用可能である。
高調波レベルhk,lはまた、LTPに応じて、かつ/または復号されたスペクトル特性に応じて修正される場合がある。例えば、
を設定することができ、ここで、hmodLTPは0と1との間の値であり、LTPによって予測された高調波の数に比例し、hmodTiltは0と1との間の値であり、XCの傾きに反比例する。一例では、nLTPが0である場合hmodLTP=0.5であり、そうでない場合
である。
XCの傾きは、以下の43個の係数のエネルギーに対する最初の7個のスペクトル係数のエネルギーの比であり得る。
【】
部分区間l用のパラメータを計算すると、部分区間l+1と重複しない部分区間jの部分について高調波ポストフィルタリングの中間出力を生成することができる。上述されたように、この中間出力は、後続の部分区間用のパラメータを見つける際に使用される。
各部分区間は重複し、2つのフィルタパラメータ間の平滑化演算が使用される。[3]に記載された平滑化が使用される場合がある。
【】
以下、好ましい実施形態が説明される。
実施形態によれば、オーディオ信号を符号化するための装置が提供され、装置は、以下のエンティティ:
サンプリングレートを有するオーディオ信号をスペクトル表現に変換するための時間スペクトル変換器(MDCT)と、
スペクトル表現から知覚的に平坦化されたスペクトル表現を提供するためのスペクトル整形器(SNS)であって、知覚的に平坦化されたスペクトル表現が、スペクトル整形器とは異なる(より高い)周波数分解能のサブバンドに分割される、スペクトル整形器と、
最適量子化ステップを見つけるためのレート歪みループと、
最適量子化ステップに応じて、知覚的に平坦化されたスペクトル表現の量子化スペクトル、または知覚的に平坦化されたスペクトル表現の導関数を提供するための量子化器と、
量子化スペクトルのコード化表現を提供するための無損失スペクトルコーダと、
知覚的に平坦化されたスペクトル表現、または知覚的に平坦化されたスペクトル表現の導関数のパラメトリック表現を提供するための帯域ごとのパラメトリックコーダであって、パラメトリック表現が最適量子化ステップに依存し、量子化スペクトルが0であるサブバンド内のエネルギーを記述するパラメータから構成され、その結果、少なくとも2つのサブバンドが異なるパラメータを有するか、または少なくとも1つのパラメータが1つのサブバンドのみに限定される、帯域ごとのパラメトリックコーダと
を備える。
【】
別のオーディオ信号を符号化するための装置を提供し、装置は、逆に以下のエンティティ:
サンプリングレートを有するオーディオ信号をスペクトル表現に変換するための時間スペクトル変換器(MDCT)と、
スペクトル表現から知覚的に平坦化されたスペクトル表現を提供するためのスペクトル整形器(SNS)であって、知覚的に平坦化されたスペクトル表現が、スペクトル整形器とは異なる(より高い)周波数分解能のサブバンドに分割される、スペクトル整形器と、
最適量子化ステップを見つけるためのレート歪みループであって、各ループ反復において、量子化ステップを提供し、量子化ステップに応じて最適量子化ステップを選択する、レート歪みループと、
最適量子化ステップに応じて、知覚的に平坦化されたスペクトルの量子化スペクトル、または知覚的に平坦化されたスペクトル表現の導関数を提供するための量子化器と、
知覚的に平坦化されたスペクトル表現、または知覚的に平坦化されたスペクトル表現の導関数のパラメトリック表現を提供するための帯域ごとのパラメトリックコーダであって、パラメトリック表現が最適量子化ステップに依存し、量子化スペクトルが0であるサブバンド内のエネルギーを記述するパラメータから構成され、帯域ごとのパラメトリックコーダと、
量子化スペクトルのコード化表現およびパラメトリックゼロサブバンド表現のコード化表現のジョイントコーディングが、ジョイントコーディング用のビットの総数が所定の限度を下回るという制約を満たすかどうかの判断を提供するためのスペクトルコーダ判断と
を備え、
量子化スペクトルのコード化表現およびパラメトリックゼロサブバンドのコード化表現の両方が、知覚的に平坦化されたスペクトル表現、または知覚的に平坦化されたスペクトル表現の導関数に応じて、可変数のビットを必要とする。
【】
実施形態によれば、両方の装置は、量子化スペクトルおよび知覚的に平坦化されたスペクトル表現内のサブバンドのコンテンツに応じて、量子化スペクトル内の少なくともサブバンドを適応的にゼロに設定する修正器によって強化される場合がある。
ここでは、2ステップの帯域ごとのパラメトリックコーダが使用される場合がある。2ステップの帯域ごとのパラメトリックコーダは、(少なくとも2つのサブバンドが異なるパラメトリック表現を有するように)量子化スペクトルがゼロであるサブバンドに対して、量子化ステップに応じて、知覚的に平坦化されたスペクトル表現、または知覚的に平坦化されたスペクトル表現の導関数のパラメトリック表現を提供するように構成され、
2ステップの最初のステップでは、帯域ごとのパラメトリックコーダは、量子化スペクトルがゼロである周波数fEZより上のサブバンド向けに個々のパラメトリック表現を提供し、
2番目のステップでは、個々のパラメトリック表現がゼロである周波数fEZより上のサブバンド、およびfEZより下のサブバンド向けに追加の平均パラメトリック表現を提供する。
【】
別の符号化オーディオ信号を復号するための装置を提供する。復号するための装置は、以下のエンティティ:
量子化ステップに応じて復号スペクトルを生成するためのスペクトル領域オーディオデコーダであって、復号スペクトルがサブバンドに分割される、スペクトル領域オーディオデコーダと、
復号スペクトル内のゼロのみから構成されるゼロサブバンドを識別し、量子化ステップを使用してゼロサブバンドのパラメトリック表現を復号する帯域ごとのパラメトリックデコーダであって、パラメトリック表現が、ゼロサブバンド内のエネルギーを記述するパラメータから構成され、その結果、少なくとも2つのサブバンドが異なるパラメータを有するか、または少なくとも1つのパラメータが1つのサブバンドのみに限定される、帯域ごとのパラメトリックデコーダと、
ゼロサブバンドのパラメトリック表現に応じて帯域ごとに生成されたスペクトルを提供する帯域ごとの生成器と、
帯域ごとの合成スペクトルを、
帯域ごとに生成されたスペクトルおよび復号されたスペクトル、または
帯域ごとに生成されたスペクトルおよび予測スペクトルと復号スペクトルの合成
の合成として提供する合成器と、
帯域ごとの合成スペクトル、または帯域ごとの合成スペクトルの導関数から再整形されたスペクトルを提供するためのスペクトル整形器(SNS)であって、スペクトル整形器がサブバンド分割とは異なる(より低い)周波数分解能を有する、スペクトル整形器(SNS)と、
再整形されたスペクトルを時間表現に変換するためのスペクトル時間変換器と
を備える。
【】
別の復号スペクトルと合成された生成スペクトル、または
予測スペクトルと復号スペクトルの合成
を提供する帯域ごとのパラメトリックスペクトル生成器を提供し、
生成スペクトルは、ソーススペクトルから帯域ごとに取得され、ソーススペクトルは、
ゼロスペクトル、または
第2の予測スペクトル、または
ランダムノイズスペクトル、または
すでに生成された部分と復号スペクトル(および予測スペクトル)の合成、
それらの合成
のうちの1つであり、
少なくとも場合によっては、ソースは、すでに生成された部分と復号スペクトル(および予測スペクトル)の合成である。
ソーススペクトルは、さらなる実施形態によれば、ゼロサブバンドのエネルギーパラメータに基づいて重み付けされることに留意されたい。サブバンド用のソーススペクトルの選択は、サブバンド位置、パワースペクトル推定値、エネルギーパラメータ、ピッチ情報、および時間情報に依存する。
実施形態によれば、スペクトル表現(XMR)を記述するパラメータの数は、量子化表現(XQ)に依存する場合がある。
【】
さらに別の実施形態では、iBPC、「zfl復号」、および「ゼロ充填」のためのサブバンド(すなわち、サブバンド境界)は、XDおよび/またはXQにおけるゼロスペクトル係数の位置から導出される可能性があることに留意されたい。
いくつかの態様が装置の文脈で記載されたが、これらの態様は対応する方法の説明も表すことは明らかであり、ブロックまたはデバイスは方法ステップまたは方法ステップの特徴に対応する。同様に、方法ステップの文脈で記載された態様は、対応する装置の対応するブロックまたは項目または特徴の説明も表す。方法ステップの一部またはすべては、例えば、マイクロプロセッサ、プログラマブルコンピュータ、または電子回路のようなハードウェア装置によって(またはそれらを使用して)実行される場合がある。いくつかの実施形態では、最も重要な方法ステップのある1つまたは複数は、そのような装置によって実行される場合がある。
【】
本発明の符号化オーディオ信号は、デジタル記憶媒体に記憶することができるか、またはワイヤレス伝送媒体などの伝送媒体もしくはインターネットなどの有線伝送媒体上で伝送することができる。
特定の実装要件に応じて、ハードウェアまたはソフトウェアに実装することができる。実装は、電子的に読取り可能な制御信号を記憶しているデジタル記憶媒体、例えば、フロッピーディスク、DVD、Blu-Ray、CD、ROM、PROM、EPROM、EEPROM、またはフラッシュメモリを使用して実行することができ、それらはそれぞれの方法が実行されるようにプログラム可能なコンピュータシステムと協働する(または協働することが可能である)。したがって、デジタル記憶媒体はコンピュータ可読であり得る。
本発明によるいくつかの本明細書に記載された方法のうちの1つが実行されるように、プログラム可能なコンピュータシステムと協働することが可能な電子的に読取り可能な制御信号を有するデータキャリアを含む。
一般に、プログラムコードを有するコンピュータプログラム製品として実装することができ、プログラムコードは、コンピュータプログラム製品がコンピュータ上で実行されると、方法のうちの1つを実行するように動作する。プログラムコードは、例えば、機械可読キャリアに記憶される場合がある。
【】
他の機械可読キャリアに記憶された、本明細書に記載された方法のうちの1つを実行するためのコンピュータプログラムを含む。
言い換えれば、本発明の方法の一したがって、コンピュータプログラムがコンピュータ上で実行されると、本明細書に記載された方法のうちの1つを実行するためのプログラムコードを有するコンピュータプログラムである。
本発明の方法のさらなるしたがって、本明細書に記載された方法のうちの1つを実行するためのコンピュータプログラムを記録して含むデータキャリア(またはデジタル記憶媒体もしくはコンピュータ可読媒体)である。データキャリア、デジタル記憶媒体、または記録された媒体は、通常、有形および/または非一時的である。
本発明の方法のさらなるしたがって、本明細書に記載された方法のうちの1つを実行するためのコンピュータプログラムを表すデータストリームまたは信号シーケンスである。データストリームまたは信号シーケンスは、例えば、データ通信接続を介して、例えばインターネットを介して転送されるように構成される場合がある。
【】
さらなる本明細書に記載された方法のうちの1つを実行するように構成または適合された処理手段、例えばコンピュータまたはプログラマブル論理デバイスを含む。
さらなる本明細書に記載された方法のうちの1つを実行するためのコンピュータプログラムをインストールしたコンピュータを含む。
本発明によるさらなる本明細書に記載された方法のうちの1つを実行するためのコンピュータプログラムを受信機に(例えば、電子的または光学的に)転送するように構成された装置またはシステムを含む。受信機は、例えば、コンピュータ、モバイルデバイス、メモリデバイスなどであり得る。装置またはシステムは、例えば、コンピュータプログラムを受信機に転送するためのファイルサーバを備える場合がある。
いくつかの実施形態では、本明細書に記載された方法の機能の一部またはすべてを実行するために、プログラマブル論理デバイス(例えば、フィールドプログラマブルゲートアレイ)が使用される場合がある。いくつかの実施形態では、フィールドプログラマブルゲートアレイは、本明細書に記載された方法のうちの1つを実行するために、マイクロプロセッサと協働することができる。一般に、方法は、任意のハードウェア装置によって実行されることが好ましい。
【】
上述された本発明の原理についての単なる例示である。本明細書に記載された構成および詳細の修正および変形は、当業者には明らかであることが理解される。したがって、本明細書の実施形態の記載および説明として提示された特定の詳細によってではなく、近い将来の特許請求の範囲によってのみ制限されることが意図される。
【】
参考文献
[1]第3世代パートナーシッププロジェクト、Technical Specification Group Services and System Aspects、Audio codec processing functions、Extended Adaptive Multi-Rate-Wideband(AMR-WB+) codec、Transcoding functions(Release 16)、no.26.290.3GPP(登録商標)、2020年
[2]N.Rettelbach、B.Grill、G.Fuchs、S.Geyrsberger、M.Multrus、H.Popp、J.Herre、S.Wabnik、G.Schuller、およびJ.Hirschfeld、「Audio Encoder、Audio Decoder、Methods For Encoding And Decoding An Audio Signal、Audio Stream And Computer Program」、PCT/EP2009/0046022009
[3]S.Disch、M.Gayer、C.Helmrich、G.Markovic、およびM.Luis Valero、「Noise Filling Concept」,PCT/EP2014/0516302014
【】
[4]J.Herre and D.Schultz、「Extending the MPEG-4 AAC Codec by Perceptual Noise Substitution」 in Audio Engineering Society Convention 104、1998年
[5]F.Nagel、S.Disch、およびS.Wilde、「A continuous modulated single sideband bandwidth extension」 in 2010 IEEE International Conference on Acoustics、Speech and Signal Processing、2010年、ページ357~360
[6]C.Neukam、F.Nagel、G.Schuller、およびM.Schnabel、「A MDCT based harmonic spectral bandwidth extension method」 in 2013 IEEE International Conference on Acoustics、Speech and Signal Processing、2013年、ページ566~570
【】
[7]S.Disch、R.Geiger、C.Helmrich、F.Nagel、C.Neukam、K.Schmidt、およびM.Fischer、「Apparatus、Method And Computer Program For Decoding An Encoded Audio Signal」、PCT/EP2014/0651182013
[8]S.Disch、F.Nagel、R.Geiger、B.N.Thoshkahna、K.Schmidt、S.Bayer、C.Neukam、B.Edler、およびC.Helmrich、「Apparatus And Method For Encoding Or Decoding An Audio Signal With Intelligent Gap Filling In The Spectral Domain」、 PCT/EP2014/0651232013
[9]S.Disch、F.Nagel、R.Geiger、B.N.Thoshkahna、K.Schmidt、S.Bayer、C.Neukam、B.Edler、およびC.Helmrich、「Apparatus And Method For Encoding And Decoding An Encoded Audio Signal Using Temporal Noise/Patch Shaping」、 PCT/EP2014/0651232013
[10]S.Disch、A.Niedermeier、C.R.Helmrich、C.Neukam、K.Schmidt、R.Geiger、J.Lecomte、F.Ghido、F.Nagel、およびB.Edler、「Intelligent Gap Filling in Perceptual Transform Coding of Audio」、2016年
【】
[11]S.Disch、S.van de Par、A.Niedermeier、E.Burdiel Perez、A.Berasategui Ceberio、およびB.Edler、「Improved Psychoacoustic Model for Efficient Perceptual Audio Codecs」 in Audio Engineering Society Convention 145、2018年
[12]C.R.Helmrich、A.Niedermeier、S.Disch、およびF.Ghido、「Spectral envelope reconstruction via IGF for audio transform coding」 in 2015 IEEE International Conference on Acoustics、Speech and Signal Processing(ICASSP)、2015年、ページ389~393
[13]C.Neukam、S.Disch、F.Nagel、A.Niedermeier、K.Schmidt、およびB.N.Thoshkahna、「Apparatus And Method For Decoding And Encoding An Audio Signal Using Adaptive Spectral Tile Selection」、PCT/EP2014/0651162013
[14]A.Niedermeier、C.Ertel、R.Geiger、F.Ghido、およびC.Helmrich、「Apparatus And Method For Decoding Or Encoding An Audio Signal Using Energy Information Values For A Reconstruction Band」、PCT/EP2014/0651102013
【】
[15]S.Disch、B.Schubert、R.Geiger、およびM.Dietz、「Apparatus And Method For Audio Encoding And Decoding Employing Sinusoidal Substitution」、PCT/EP2012/0767462012
[16]S.Disch、B.Schubert、R.Geiger、B.Edler、およびM.Dietz、「Apparatus And Method For Efficient Synthesis Of Sinusoids And Sweeps By Employing Spectral Patterns」、PCT/EP2013/0695922013
[17]M.Dietz、G.Fuchs、C.Helmrich、およびG.Markovic、「Low-Complexity Tonality-Adaptive Audio Signal Quantization」、PCT/EP2014/0516242014
[18]M.Oger、S.Ragot、およびM.Antonini、「Model-based deadzone optimization for stack-run audio coding with uniform scalar quantization」 in 2008 IEEE International Conference on Acoustics、Speech and Signal Processing、2008年、ページ4761~4764
【】
[19]C.Helmrich、J.Lecomte、G.Markovic、M.Schnell、B.Edler、およびS.Reuschl、「Apparatus And Method For Encoding Or Decoding An Audio Signal Using A Transient-Location Dependent Overlap」、PCT/EP2014/053293、2014年
[20]第3世代パートナーシッププロジェクト、Technical Specification Group Services and System Aspects、Codec for Enhanced Voice Services(EVS)、Detailed algorithmic description、no.26.445.3GPP(登録商標)、2019年
[21]G.Markovic、E.Ravelli、M.Dietz、およびB.Grill、「Signal Filtering」、PCT/EP2018/080837、2018年
[22]E.Ravelli、M.Schnell、C.Benndorf、M.Lutzky、およびM.Dietz、Apparatus And Method For Encoding And Decoding An Audio Signal Using Downsampling Or Interpolation Of Scale Parameters、U.S. Patent PCT/EP2017/078921
【】
[23]E.Ravelli、M.Schnell、C.Benndorf、M.Lutzky、M.Dietz、およびS.Korse、Apparatus And Method For Encoding And Decoding An Audio Signal Using Downsampling Or Interpolation Of Scale Parameters、U.S. Patent PCT/EP2018/0801372018
[24]Low Complexity Communication Codec.Bluetooth、2020年
[25]Digital Enhanced Cordless Telecommunications(DECT)、Low Complexity Communication Codec plus(LC3plus)、no.103 634.ETSI、2019年
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【手続補正書】
【提出日】
【手続補正】
【補正対象書類名】特許請求の範囲
【補正対象項目名】全文
【補正方法】変更
【補正の内容】
【特許請求の範囲】
【請求項】
複数のサブバンドに分割されたオーディオ信号のスペクトル表現(XMR)を符号化するためのエンコーダ(1000)であって、前記スペクトル表現(XMR)が周波数ビンまたは周波数係数から構成され、少なくとも1つのサブバンドが1つよりも多い周波数ビンを含み、前記エンコーダ(1000)が、
前記複数のサブバンドに分割されたオーディオ信号の前記スペクトル表現(XMR)の量子化表現(XQ)を生成するように構成された量子化器(1030)と、
前記量子化表現(XQ)に応じて前記スペクトル表現(XMR)のコード化パラメトリック表現(zfl)を提供するように構成された帯域ごとのパラメトリックコーダ(1010)であって、前記コード化パラメトリック表現(zfl)が、前記サブバンド内の前記スペクトル表現(XMR)を記述するパラメータ、または前記サブバンド内の前記スペクトル表現(XMR)を記述する前記パラメータのコード化バージョンから構成され、異なる少なくとも2つのサブバンド、および異なる前記少なくとも2つのサブバンド内の前記スペクトル表現(XMR)を記述する前記パラメータが存在する、帯域ごとのパラメトリックコーダ(1010)と
を備え、
前記パラメータが前記サブバンド内のエネルギーを記述し、
前記複数のサブバンドのうちの少なくとも1つのサブバンドがゼロに量子化されるか、もしくは前記量子化表現(X Q )において前記複数のサブバンドのうちの少なくとも1つのサブバンドのスペクトル表現(X MR )がゼロである、
エンコーダ(1000)。
【請求項】
前記帯域ごとのパラメトリックコーダ(1010)が、ゼロに量子化された前記量子化表現(XQ)内の前記複数のサブバンドのうちの前記少なくとも1つのサブバンドを決定し、かつ/または前記帯域ごとのパラメトリックコーダ(1010)が、前記量子化表現(XQ)内でゼロに量子化された前記複数のサブバンドのうちの前記少なくとも1つのサブバンドをコード化し、または
前記パラメータがゼロに量子化された前記サブバンド内の前記エネルギーを記述する、
請求項1に記載のエンコーダ(1000)。
【請求項】
前記コード化パラメトリック表現(zfl)が可変数のビットを使用するか、もしくは前記コード化パラメトリック表現(zfl)を表現するために使用されるビットの前記数が、オーディオ信号の前記スペクトル表現(XMR)に依存し、または
コード化表現(spect)が可変数のビットを使用するか、もしくは前記コード化表現(spect)を表現するために使用されるビットの前記数が、オーディオ信号の前記スペクトル表現(XMR)に依存し、または
コード化表現(spect)が可変数のビットを有するエントロピーコーディングを使用し、または前記コード化パラメトリック表現(zfl)の前記エントロピーコーディングに必要な前記ビット数が計算され、または
前記コード化パラメトリック表現(zfk)およびコード化表現(spect)を表現するために使用されるビットの前記数が、所定の閾値を下回る、
請求項1または2に記載のエンコーダ(1000)。
【請求項】
前記量子化表現(XQ)のコード化表現(spect)を生成するように構成されたスペクトルコーダ(1020)をさらに備え、または
前記帯域ごとのパラメトリックコーダ(1010)が、スペクトルコーダ(1020)とともにジョイントコーダを形成し、または前記帯域ごとのパラメトリックコーダ(1010)が、スペクトルコーダ(1020)とともに、オーディオ信号の前記スペクトル表現(XMR)のコード化バージョンを一緒に取得するように構成される、
請求項1から3のいずれか一項に記載のエンコーダ(1000)。
【請求項】
サンプリングレートを有するオーディオ信号を前記スペクトル表現に変換して前記スペクトル表現を取得するように構成された時間スペクトル変換器またはMDCT変換器をさらに備える、請求項1から4のいずれか一項に記載のエンコーダ(1000、101、101’)。
【請求項】
前記スペクトル表現が知覚的に平坦化され、または前記エンコーダ(1000、101、101’)が、
前記スペクトル表現から知覚的に平坦化されたスペクトル表現を提供するように構成されたスペクトル整形器をさらに備え、または
前記知覚的に平坦化されたスペクトル表現が、スペクトル平坦化に使用されるコード化スペクトル形状とは異なるかもしくはより高い周波数分解能のサブバンドに分割され、または前記エンコーダ(1000、101、101’)が、
オーディオ信号をスペクトル的に平坦化するために、LPフィルタを用いて時間スペクトル変換器もしくはMDCT変換器の入力信号を処理するための手段をさらに備える、
請求項1から5のいずれか一項に記載のエンコーダ(1000、101、101’)。
【請求項】
最適量子化ステップを決定するため、もしくは最適量子化ステップを推定するように構成されたレート歪みループをさらに備え、または
少なくとも2つの反復ステップもしくは2つの量子化ステップのための少なくとも2つの反復ステップを実行するように構成されたレート歪みループをさらに備え、または
前の量子化ステップに依存する量子化ステップを適合させるように、もしくは最適量子化ステップを決定するために前の量子化ステップに依存する前記量子化ステップを適合させるように構成されたレート歪みループをさらに備える、
請求項1から6のいずれか一項に記載のエンコーダ(1000、1001)。
【請求項】
前記レート歪みループが、コーディングに使用されるビットを推定するように構成されたビットカウンタ(1050)、および前記スペクトル表現(XMR)を記述する前記パラメータを再コード化するように構成された再コーダ(1055)を備える、請求項7に記載のエンコーダ(1000、101、101’)。
【請求項】
前記スペクトル表現(XMR)を記述する前記パラメータの前記数が、前記量子化表現(XQ)に依存する、請求項1から8のいずれか一項に記載のエンコーダ(1000、101、101’)。
【請求項】
前記量子化表現(XQ)のコード化表現(spect)と前記コード化パラメトリック表現(zfl)とのジョイントコーディングが、前記ジョイントコーディングのためのビットの総数が所定の閾値を下回るという制約を満たすかどうかの判断を提供するように構成されたスペクトルコーダ判断エンティティをさらに備え、または
前記量子化スペクトルの前記コード化表現および前記パラメトリック表現の前記コード化表現の両方が、前記スペクトル表現に依存するか、もしくは前記知覚的に平坦化されたスペクトル表現の導関数に依存する可変数のビットおよび前記量子化ステップに基づく、
請求項4から9のいずれか一項に記載のエンコーダ(1000)。
【請求項】
前記量子化スペクトルおよびオーディオ信号の前記スペクトル表現(XMR)における前記サブバンドのコンテンツに応じて、前記量子化スペクトルにおける少なくともサブバンドを適応的にゼロに設定するように構成された修正器(156m、302)をさらに備える、請求項1から10のいずれか一項に記載のエンコーダ(1000、300)。
【請求項】
前記パラメータが前記サブバンド内の前記エネルギーを記述し、前記帯域ごとのパラメトリックコーダ(1010)が2つの段を備え、前記2つの段の最初の段において、前記帯域ごとのパラメトリックコーダ(1010)が、ある周波数(fEZ)より上の前記サブバンドの個々のパラメトリック表現を提供するように構成され、前記2つの段の2番目の段が、前記周波数(fEZ)より上のサブバンド用の追加の平均パラメトリック表現を提供し、前記個々のパラメータ表現がゼロであり、前記周波数(fEZ)より下のサブバンド用である、請求項1から11のいずれか一項に記載のエンコーダ(1000)。
【請求項】
符号化オーディオ信号を復号するためのデコーダ(1200)であって、前記符号化オーディオ信号が、少なくともスペクトルのコード化表現(spect)およびコード化パラメトリック表現(zfl)から構成され、前記符号化オーディオ信号が量子化ステップ
をさらに含み、前記デコーダ(1200)が、
スペクトルの前記コード化表現(spect)および量子化ステップ
から復号および逆量子化されたスペクトル(XD)を生成するように構成されたスペクトル領域デコーダ(1230、156sd)であって、前記復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、スペクトル領域デコーダ(1230、156sd)と、
復号されたスペクトルまたは前記復号および逆量子化されたスペクトル(XD)内のゼロサブバンドを識別し、前記コード化パラメトリック表現(zfl)に基づいて前記ゼロサブバンドのパラメトリック表現(EB)を復号するように構成された帯域ごとのパラメトリックデコーダ(1210,162)と
を備え、
前記パラメトリック表現(EB)が前記ゼロサブバンド内の前記エネルギーを記述するパラメータを含み、異なる少なくとも2つのサブバンド、したがって、異なる少なくとも2つのサブバンド内のパラメータが存在し、かつ前記コード化パラメトリック表現(zfl)が可変数のビットの使用によって表現され、かつ前記コード化パラメトリック表現(zfl)を表現するために使用されるビットの前記数が、スペクトルの前記コード化表現(spect)に依存する、
デコーダ(1200)。
【請求項】
符号化オーディオ信号を復号するためのデコーダ(1200)であって、前記デコーダ(1200)が、
前記符号化オーディオ信号に応じて復号および逆量子化されたスペクトル(XD)を生成するように構成されたスペクトル領域デコーダ(1230、156sd)であって、前記復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、スペクトル領域デコーダ(1230、156sd)と、
復号されたスペクトルまたは復号および逆量子化されたスペクトル(XD)内のゼロサブバンドを識別し、前記符号化オーディオ信号に基づいて、前記ゼロサブバンドのパラメトリック表現(EB)を復号するように構成された、帯域ごとのパラメトリックデコーダ(1210、162)と、
前記ゼロサブバンドの前記パラメトリック表現(EB)に応じて帯域ごとの生成スペクトルを生成するように構成された帯域ごとのスペクトル生成器(1220、158sg)と
帯域ごとの合成スペクトル(XCT)を提供するように構成された合成器(1240、158c)であって、前記帯域ごとの合成スペクトル(XCT)が、前記帯域ごとの生成スペクトルと前記復号および逆量子化されたスペクトル(XD)の合成、または、前記帯域ごとの生成スペクトルと、予測スペクトル(XPS)および前記復号および逆量子化されたスペクトル(XD)の合成(XDT)と、の合成を含む、合成器(1240、158c)と、
前記帯域ごとの合成スペクトル(XCT)または前記帯域ごとの合成スペクトル(XCT)の導関数を時間表現に変換するように構成されたスペクトル時間変換器(1250、161)と
を備える、デコーダ(1200)。
【請求項】
前記帯域ごとの合成スペクトル(XCT)の前記導関数が、スペクトル整形器(SNS)もしくはノイズ整形器(TNS)の使用によって再整形された再整形スペクトル(XC)を含み、または前記デコーダ(1200)が、
スペクトル時間変換器の出力から時間領域信号を取得するように構成された手段、もしくはLPフィルタによる処理によって(スペクトル時間変換器の出力から導出された)時間領域信号をスペクトル的に整形するように構成された手段をさらに備え、
または、帯域ごとの合成スペクトル(X CT )または再整形されたスペクトル(X C )がスペクトル時間変換器を用いて前記時間領域信号に変換される、
請求項13または14に記載のデコーダ(1200)。
【請求項】
前記帯域ごとのパラメトリックデコーダ(1210、162)が、量子化ステップを使用して前記符号化オーディオ信号に基づいて前記ゼロサブバンドのパラメトリック表現(EB)を復号するように構成され、または
前記パラメトリック表現(EB)が、サブバンド内のエネルギーを記述するパラメータを含み、異なる少なくとも2つのサブバンド、したがって、異なる少なくとも2つのサブバンド内のエネルギーを記述するパラメータが存在し、または
前記パラメトリック表現(EB)が、サブバンド内のエネルギーを記述するパラメータを含み、または
非ゼロサブバンド内の個々のゼロラインのエネルギーが推定され、明示的にコード化されず、または
ゼロサブバンドが、前記スペクトルデコーダ(1200)からの、復号されたスペクトルもしくは前記復号および逆量子化されたスペクトル出力によって画定され、または
前記コード化パラメトリック表現(zfl)が、可変数のビットの使用によってコード化され、かつ前記コード化パラメトリック表現(zfl)を表現するために使用されるビットの前記数が、スペクトルの前記コード化表現(spect)に依存し、または
前記パラメトリック表現(EB)が存在するサブバンドの数が、スペクトルの前記コード化表現(spect)に依存する、
請求項13、14、または15に記載のデコーダ(1200)。
【請求項】
前記ゼロサブバンドの前記パラメトリック表現(EB)の値が、量子化ステップ
に応じて復号されるか、または
パラメトリック表現がスペクトルの前記コード化表現(spect)に依存する、
請求項13、14、15、または16に記載のデコーダ(1200)。
【請求項】
前記帯域ごとのパラメトリックデコーダ(1210、162)が、前記スペクトル領域デコーダ(1230、156sd)の出力の情報を使用して、または前記復号および逆量子化されたスペクトル(XD)を使用して、前記符号化オーディオ信号に基づいて前記ゼロサブバンドの前記パラメトリック表現(EB)を復号するように構成される、請求項13、14、15、16、または17に記載のデコーダ(1200)。
【請求項】
前記スペクトル整形器が、コード化スペクトル形状から取得されたスペクトル形状を使用して、前記帯域ごとの合成スペクトル(XCT)または前記帯域ごとの合成スペクトル(XCT)の前記導関数をスペクトル的に整形するように構成され、前記コード化スペクトル形状が、前記サブバンド分割とは異なるか、またはより低い周波数分解能を使用する、請求項14に記載のデコーダ(1200)。
【請求項】
スペクトル(X G )を生成し、前記復号および逆量子化されたスペクトル(XD)に、または予測スペクトルと前記復号および逆量子化されたスペクトル(XDT)の合成に加算される生成スペクトル(XG)を取得するように構成された帯域ごとのパラメトリックスペクトル生成器(158sg)をさらに備え、前記生成スペクトル(XG)が、ソーススペクトルから帯域ごとに取得され、前記ソーススペクトルが、
-第2の予測スペクトル(XNP)、または
-ランダムノイズスペクトル(XN)、または
-前記生成スペクトルのすでに生成された部分、または
-前記復号および逆量子化されたスペクトル(XDT)もしくは前記予測スペクトルと前記復号および逆量子化されたスペクトル(XDT)の合成、または
-のうちの1つもしくは2つの合成
のうちの1つである、
請求項13から19のいずれか一項に記載のデコーダ(1200)。
【請求項】
スペクトル(X G )を生成し、前記復号および逆量子化されたスペクトル(XD)に、または予測スペクトルと復号および逆量子化されたスペクトル(XDT)の合成に加算される生成スペクトル(XG)を取得するように構成された帯域ごとのパラメトリックスペクトル生成器(158sg)であって、前記生成スペクトル(XG)が、ソーススペクトルから帯域ごとに取得され、前記ソーススペクトルが、
-第2の予測スペクトル(XNP)、または
-ランダムノイズスペクトル(XN)、または
-前記生成スペクトル(XG)のすでに生成された部分、または
-前記復号および逆量子化されたスペクトル(XDT)もしくは前記予測スペクトルと前記復号および逆量子化されたスペクトル(XDT)の合成、または
-のうちの1つもしくは2つの合成
のうちの1つであり、
前記生成スペクトル(X G )の前記すでに生成された部分を用いて少なくとも一つのサブバンドが取得される、
帯域ごとのパラメトリックスペクトル生成器(158sg)。
【請求項】
ソーススペクトルが、ゼロサブバンドのエネルギーパラメータに基づいて重み付けされる、請求項13から19のいずれか一項に記載のデコーダ(1200)。
【請求項】
前記ソーススペクトルが、ゼロサブバンドの前記エネルギーパラメータ(EB)に基づいて重み付けされる、請求項20または21に記載の帯域ごとのパラメトリックスペクトル生成器(158sg)。
【請求項】
サブバンド用の前記ソーススペクトル(158sc)の選択が、前記サブバンド位置、音調性情報(toi)、パワースペクトル推定値(ZC)、エネルギーパラメータ(EB)、ピッチ情報(pii)、または時間情報(tei)のうちの少なくとも1つに依存する、請求項20に記載のデコーダ(1200)。
【請求項】
サブバンド用の前記ソーススペクトル(158sc)の選択が、前記サブバンド位置、音調性情報(toi)、パワースペクトル推定値(ZC)、エネルギーパラメータ(EB)、ピッチ情報(pii)、および時間情報(tei)のうちの少なくとも1つに依存する、請求項21または23のいずれか一項に記載の帯域ごとのパラメトリックスペクトル生成器(158sg)。
【請求項】
前記音調性情報がφHであり、またはピッチ情報が
であり、または時間情報がTNSがアクティブであるか否かの前記情報である、請求項24に記載のデコーダ(1200)。
【請求項】
前記音調性情報がφHであり、またはピッチ情報が
であり、または時間情報がTNSがアクティブであるか否かの前記情報である、請求項25に記載の帯域ごとのパラメトリックスペクトル生成器(158sg)。
【請求項】
複数のサブバンドに分割されたオーディオ信号のスペクトル表現(XMR)を符号化するための方法であって、前記スペクトル表現(XMR)が周波数ビンまたは周波数係数から構成され、少なくとも1つのサブバンドが1つよりも多い周波数ビンを含み、前記方法が、
複数のサブバンドに分割されたオーディオ信号の前記スペクトル表現(XMR)の量子化表現(XQ)を生成するステップと、
前記量子化表現(XQ)に応じて前記スペクトル表現(XMR)のコード化パラメトリック表現(zfl)を提供するステップであって、前記コード化パラメトリック表現(zfl)が、前記サブバンド内の前記スペクトル表現(XMR)を記述するパラメータ、または前記サブバンド内の前記スペクトル表現(XMR)を記述する前記パラメータのコード化バージョンから構成され、異なる少なくとも2つのサブバンド、および異なる前記少なくとも2つのサブバンド内の前記スペクトル表現(XMR)を記述する前記パラメータが存在するステップと、を含み、前記パラメータが前記サブバンド内の前記エネルギーを記述し、
前記複数のサブバンドのうちの少なくとも一つのサブバンドがゼロに量子化され、
または、前記複数のサブバンドのうちの少なくとも一つのためのスペクトル表現(X MR )が前記量子化表現(X Q )内でゼロである、
、方法。
【請求項】
符号化オーディオ信号を復号するための方法であって、前記符号化オーディオ信号が、少なくともスペクトルのコード化表現(spect)およびコード化パラメトリック表現(zfl)から構成され、前記符号化オーディオ信号が量子化ステップ
をさらに含み、前記方法が、
スペクトルの前記コード化表現(spect)および量子化ステップ
から復号および逆量子化されたスペクトル(XD)を生成するステップであって、前記復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、ステップと、
復号されたスペクトルまたは前記復号および逆量子化されたスペクトル(XD)内のゼロサブバンドを識別し、前記コード化パラメトリック表現(zfl)に基づいて前記ゼロサブバンドのパラメトリック表現(EB)を復号するステップと
を含み、
前記パラメトリック表現(EB)が前記ゼロサブバンド内の前記エネルギーを記述するパラメータを含み、異なる少なくとも2つのサブバンド、したがって、異なる少なくとも2つのサブバンド内のパラメータが存在し、または前記コード化パラメトリック表現(zfl)が可変数のビットの使用によって表現され、または前記コード化パラメトリック表現(zfl)を表現するために使用されるビットの前記数が、スペクトルの前記コード化表現(spect)に依存する、
方法。
【請求項】
符号化オーディオ信号を復号するための方法であって、前記方法が、
符号化オーディオ信号に基づいて復号および逆量子化されたスペクトル(XD)を生成するステップであって、前記復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、ステップと、
復号されたスペクトルまたは前記復号および逆量子化されたスペクトル(XD)においてゼロサブバンドを識別し、前記符号化オーディオ信号に基づいて前記ゼロサブバンドのパラメトリック表現(EB)を復号するステップと、
前記ゼロサブバンドの前記パラメトリック表現(EB)に応じて帯域ごとの生成スペクトルを生成するステップと
帯域ごとの合成スペクトル(XCT)を提供するステップであって、前記帯域ごとの合成スペクトル(XCT)が、前記帯域ごとの生成スペクトルと前記復号および逆量子化されたスペクトル(XD)
)の合成、または前記帯域ごとの生成スペクトルの合成、および予測スペクトル(XPS)と前記復号および逆量子化されたスペクトル(XD)の合成(XDT)を含む、ステップと、
前記帯域ごとの合成スペクトル(XCT)または前記帯域ごとの合成スペクトル(XCT)の導関数を時間表現に変換するステップと
を含む、方法。
【請求項】
帯域ごとの生成スペクトルを生成するための方法であって、スペクトル(X G )を生成し、前記復号および逆量子化されたスペクトル(XD)に、または予測スペクトルと復号および逆量子化されたスペクトル(XDT)の合成に加算される生成スペクトル(XG)を取得するステップを含み、前記生成スペクトル(XG)が、ソーススペクトルから帯域ごとに取得され、前記ソーススペクトルが、
-第2の予測スペクトル(XNP)、または
-ランダムノイズスペクトル(XN)、または
-前記生成スペクトル(XG)のすでに生成された部分、または
-のうちの少なくとも2つの合成
のうちの1つである、方法。
【請求項】
コンピュータ上で実行されると、請求項28から31のいずれか一項に記載の方法を実行するためのプログラムコードを有するコンピュータプログラムを記憶している、コンピュータ可読デジタル記憶媒体。
【手続補正書】
【提出日】
【手続補正】
【補正対象書類名】特許請求の範囲
【補正対象項目名】全文
【補正方法】変更
【補正の内容】
【特許請求の範囲】
【請求項】
複数のサブバンドに分割されたオーディオ信号のスペクトル表現(XMR)を符号化するためのエンコーダ(1000)であって、前記スペクトル表現(XMR)が周波数ビンまたは周波数係数から構成され、少なくとも1つのサブバンドが1つよりも多い周波数ビンを含み、前記エンコーダ(1000)が、
前記複数のサブバンドに分割されたオーディオ信号の前記スペクトル表現(XMR)の量子化表現(XQ)を生成するように構成された量子化器(1030)と、
前記量子化表現(XQ)に応じて前記スペクトル表現(XMR)のコード化パラメトリック表現(zfl)を提供するように構成された帯域ごとのパラメトリックコーダ(1010)であって、前記コード化パラメトリック表現(zfl)が、前記サブバンド内の前記スペクトル表現(XMR)を記述するパラメータ、または前記サブバンド内の前記スペクトル表現(XMR)を記述する前記パラメータのコード化バージョンから構成され、異なる少なくとも2つのサブバンド、および異なる前記少なくとも2つのサブバンド内の前記スペクトル表現(XMR)を記述する前記パラメータが存在する、帯域ごとのパラメトリックコーダ(1010)と
を備え、
前記パラメータが前記サブバンド内のエネルギーを記述し、
前記複数のサブバンドのうちの少なくとも1つのサブバンドがゼロに量子化されるか、もしくは前記量子化表現(XQ)において前記複数のサブバンドのうちの少なくとも1つのサブバンドのスペクトル表現(XMR)がゼロである、
エンコーダ(1000)。
【請求項】
前記帯域ごとのパラメトリックコーダ(1010)が、ゼロに量子化された前記量子化表現(XQ)内の前記複数のサブバンドのうちの前記少なくとも1つのサブバンドを決定し、かつ/または前記帯域ごとのパラメトリックコーダ(1010)が、前記量子化表現(XQ)内でゼロに量子化された前記複数のサブバンドのうちの前記少なくとも1つのサブバンドをコード化し、または
前記パラメータがゼロに量子化された前記サブバンド内の前記エネルギーを記述する、
請求項1に記載のエンコーダ(1000)。
【請求項】
前記コード化パラメトリック表現(zfl)が可変数のビットを使用するか、もしくは前記コード化パラメトリック表現(zfl)を表現するために使用されるビットの前記数が、オーディオ信号の前記スペクトル表現(XMR)に依存し、または
コード化表現(spect)が可変数のビットを使用するか、もしくは前記コード化表現(spect)を表現するために使用されるビットの前記数が、オーディオ信号の前記スペクトル表現(XMR)に依存し、または
コード化表現(spect)が可変数のビットを有するエントロピーコーディングを使用し、または前記コード化パラメトリック表現(zfl)の前記エントロピーコーディングに必要なビット数が計算され、または
前記コード化パラメトリック表現(zfk)およびコード化表現(spect)を表現するために使用されるビットの前記数が、所定の閾値を下回る、
請求項1に記載のエンコーダ(1000)。
【請求項】
前記量子化表現(XQ)のコード化表現(spect)を生成するように構成されたスペクトルコーダ(1020)をさらに備え、または
前記帯域ごとのパラメトリックコーダ(1010)が、スペクトルコーダ(1020)とともにジョイントコーダを形成し、または前記帯域ごとのパラメトリックコーダ(1010)が、スペクトルコーダ(1020)とともに、オーディオ信号の前記スペクトル表現(XMR)のコード化バージョンを一緒に取得するように構成される、
請求項1に記載のエンコーダ(1000)。
【請求項】
サンプリングレートを有するオーディオ信号を前記スペクトル表現(X MR )に変換して前記スペクトル表現(X MR )を取得するように構成された時間スペクトル変換器またはMDCT変換器をさらに備える、請求項1に記載のエンコーダ(1000、101、101’)。
【請求項】
前記スペクトル表現が知覚的に平坦化され、または前記エンコーダ(1000、101、101’)が、
前記スペクトル表現から知覚的に平坦化されたスペクトル表現を提供するように構成されたスペクトル整形器をさらに備え、または
前記知覚的に平坦化されたスペクトル表現が、スペクトル平坦化に使用されるコード化スペクトル形状とは異なるかもしくはより高い周波数分解能のサブバンドに分割され、または前記エンコーダ(1000、101、101’)が、
オーディオ信号をスペクトル的に平坦化するために、LPフィルタを用いて時間スペクトル変換器もしくはMDCT変換器の入力信号を処理するための手段をさらに備える、
請求項1に記載のエンコーダ(1000、101、101’)。
【請求項】
最適量子化ステップを決定するため、もしくは最適量子化ステップを推定するように構成されたレート歪みループをさらに備え、または
少なくとも2つの反復ステップもしくは2つの量子化ステップのための少なくとも2つの反復ステップを実行するように構成されたレート歪みループをさらに備え、または
前の量子化ステップに依存する量子化ステップを適合させるように、もしくは最適量子化ステップを決定するために前の量子化ステップに依存する前記量子化ステップを適合させるように構成されたレート歪みループをさらに備える、
請求項1に記載のエンコーダ(1000、1001)。
【請求項】
前記レート歪みループが、コーディングに使用されるビットを推定するように構成されたビットカウンタ(1050)、および前記スペクトル表現(XMR)を記述する前記パラメータを再コード化するように構成された再コーダ(1055)を備える、請求項7に記載のエンコーダ(1000、101、101’)。
【請求項】
前記スペクトル表現(XMR)を記述する前記パラメータの前記数が、前記量子化表現(XQ)に依存する、請求項1に記載のエンコーダ(1000、101、101’)。
【請求項】
前記量子化表現(XQ)のコード化表現(spect)と前記コード化パラメトリック表現(zfl)とのジョイントコーディングが、前記ジョイントコーディングのためのビットの総数が所定の閾値を下回るという制約を満たすかどうかの判断を提供するように構成されたスペクトルコーダ判断エンティティをさらに備え、または
量子化スペクトルの前記コード化表現(spect)および前記パラメトリック表現のコード化表現の両方が、前記スペクトル表現に依存するか、もしくは知覚的に平坦化されたスペクトル表現の導関数に依存する可変数のビットおよび量子化ステップに基づく、
請求項4に記載のエンコーダ(1000)。
【請求項】
量子化スペクトルおよびオーディオ信号の前記スペクトル表現(XMR)における前記サブバンドのコンテンツに応じて、前記量子化スペクトルにおける少なくともサブバンドを適応的にゼロに設定するように構成された修正器(156m、302)をさらに備える、請求項1に記載のエンコーダ(1000、300)。
【請求項】
前記パラメータが前記サブバンド内の前記エネルギーを記述し、前記帯域ごとのパラメトリックコーダ(1010)が2つの段を備え、前記2つの段の最初の段において、前記帯域ごとのパラメトリックコーダ(1010)が、ある周波数(fEZ)より上の前記サブバンドの個々のパラメトリック表現を提供するように構成され、前記2つの段の2番目の段が、前記周波数(fEZ)より上のサブバンド用の追加の平均パラメトリック表現を提供し、前記個々のパラメータ表現がゼロであり、前記周波数(fEZ)より下のサブバンド用である、請求項1に記載のエンコーダ(1000)。
【請求項】
符号化オーディオ信号を復号するためのデコーダ(1200)であって、前記符号化オーディオ信号が、少なくともスペクトルのコード化表現(spect)およびコード化パラメトリック表現(zfl)から構成され、前記符号化オーディオ信号が量子化ステップ
をさらに含み、前記デコーダ(1200)が、
スペクトルの前記コード化表現(spect)および量子化ステップ
から復号および逆量子化されたスペクトル(XD)を生成するように構成されたスペクトル領域デコーダ(1230、156sd)であって、前記復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、スペクトル領域デコーダ(1230、156sd)と、
復号されたスペクトルまたは前記復号および逆量子化されたスペクトル(XD)内のゼロサブバンドを識別し、前記コード化パラメトリック表現(zfl)に基づいて前記ゼロサブバンドのパラメトリック表現(EB)を復号するように構成された帯域ごとのパラメトリックデコーダ(1210,162)と
を備え、
前記パラメトリック表現(EB)が前記ゼロサブバンド内のエネルギーを記述するパラメータを含み、異なる少なくとも2つのサブバンド、したがって、異なる少なくとも2つのサブバンド内のパラメータが存在し、かつ前記コード化パラメトリック表現(zfl)が可変数のビットの使用によって表現され、かつ前記コード化パラメトリック表現(zfl)を表現するために使用されるビットの前記数が、スペクトルの前記コード化表現(spect)に依存する、
デコーダ(1200)。
【請求項】
符号化オーディオ信号を復号するためのデコーダ(1200)であって、前記デコーダ(1200)が、
前記符号化オーディオ信号に応じて復号および逆量子化されたスペクトル(XD)を生成するように構成されたスペクトル領域デコーダ(1230、156sd)であって、前記復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、スペクトル領域デコーダ(1230、156sd)と、
復号されたスペクトルまたは復号および逆量子化されたスペクトル(XD)内のゼロサブバンドを識別し、前記符号化オーディオ信号に基づいて、前記ゼロサブバンドのパラメトリック表現(EB)を復号するように構成された、帯域ごとのパラメトリックデコーダ(1210、162)と、
前記ゼロサブバンドの前記パラメトリック表現(EB)に応じて帯域ごとの生成スペクトルを生成するように構成された帯域ごとのスペクトル生成器(1220、158sg)と
帯域ごとの合成スペクトル(XCT)を提供するように構成された合成器(1240、158c)であって、前記帯域ごとの合成スペクトル(XCT)が、前記帯域ごとの生成スペクトルと前記復号および逆量子化されたスペクトル(XD)の合成、または、前記帯域ごとの生成スペクトルと、予測スペクトル(XPS)および前記復号および逆量子化されたスペクトル(XD)の合成(XDT)と、の合成を含む、合成器(1240、158c)と、
前記帯域ごとの合成スペクトル(XCT)または前記帯域ごとの合成スペクトル(XCT)の導関数を時間表現に変換するように構成されたスペクトル時間変換器(1250、161)と
を備える、デコーダ(1200)。
【請求項】
前記帯域ごとの合成スペクトル(XCT)の前記導関数が、スペクトル整形器(SNS)もしくはノイズ整形器(TNS)の使用によって再整形された再整形スペクトル(XC)を含み、または前記デコーダ(1200)が、
スペクトル時間変換器の出力から時間領域信号を取得するように構成された手段、もしくはLPフィルタによる処理によって(スペクトル時間変換器の出力から導出された)時間領域信号をスペクトル的に整形するように構成された手段をさらに備え、
または、帯域ごとの合成スペクトル(XCT)または再整形されたスペクトル(XC)がスペクトル時間変換器を用いて前記時間領域信号に変換される、
請求項13または14に記載のデコーダ(1200)。
【請求項】
前記帯域ごとのパラメトリックデコーダ(1210、162)が、量子化ステップを使用して前記符号化オーディオ信号に基づいて前記ゼロサブバンドのパラメトリック表現(EB)を復号するように構成され、または
前記パラメトリック表現(EB)が、サブバンド内のエネルギーを記述するパラメータを含み、異なる少なくとも2つのサブバンド、したがって、異なる少なくとも2つのサブバンド内のエネルギーを記述するパラメータが存在し、または
前記パラメトリック表現(EB)が、サブバンド内のエネルギーを記述するパラメータを含み、または
非ゼロサブバンド内の個々のゼロラインのエネルギーが推定され、明示的にコード化されず、または
ゼロサブバンドが、前記デコーダ(1200)からの、復号されたスペクトルもしくは前記復号および逆量子化されたスペクトル出力によって画定され、または
前記コード化パラメトリック表現(zfl)が、可変数のビットの使用によってコード化され、かつ前記コード化パラメトリック表現(zfl)を表現するために使用されるビットの前記数が、スペクトルの前記コード化表現(spect)に依存し、または
前記パラメトリック表現(EB)が存在するサブバンドの数が、スペクトルの前記コード化表現(spect)に依存する、
請求項13または14に記載のデコーダ(1200)。
【請求項】
前記ゼロサブバンドの前記パラメトリック表現(EB)の値が、量子化ステップ
に応じて復号されるか、または
パラメトリック表現がスペクトルの前記コード化表現(spect)に依存する、
請求項13または14に記載のデコーダ(1200)。
【請求項】
前記帯域ごとのパラメトリックデコーダ(1210、162)が、前記スペクトル領域デコーダ(1230、156sd)の出力の情報を使用して、または前記復号および逆量子化されたスペクトル(XD)を使用して、前記符号化オーディオ信号に基づいて前記ゼロサブバンドの前記パラメトリック表現(EB)を復号するように構成される、請求項13または14に記載のデコーダ(1200)。
【請求項】
コード化スペクトル形状から取得されたスペクトル形状を使用して、前記帯域ごとの合成スペクトル(XCT)または前記帯域ごとの合成スペクトル(XCT)の前記導関数をスペクトル的に整形するように構成されるスペクトル整形器を備え、前記コード化スペクトル形状が、サブバンド分割とは異なるか、またはより低い周波数分解能を使用する、請求項14に記載のデコーダ(1200)。
【請求項】
スペクトル(XG)を生成し、前記復号および逆量子化されたスペクトル(XD)に、または予測スペクトルと前記復号および逆量子化されたスペクトル(XDT)の合成に加算される生成スペクトル(XG)を取得するように構成された帯域ごとのパラメトリックスペクトル生成器(158sg)をさらに備え、前記生成スペクトル(XG)が、ソーススペクトルから帯域ごとに取得され、前記ソーススペクトルが、
-第2の予測スペクトル(XNP)、または
-ランダムノイズスペクトル(XN)、または
-前記生成スペクトルのすでに生成された部分、または
-前記復号および逆量子化されたスペクトル(XDT)もしくは予測スペクトルと前記復号および逆量子化されたスペクトル(XDT)の合成、または
-のうちの1つもしくは2つの合成
のうちの1つである、
請求項13または14に記載のデコーダ(1200)。
【請求項】
スペクトル(XG)を生成し、前記復号および逆量子化されたスペクトル(XD)に、または予測スペクトルと復号および逆量子化されたスペクトル(XDT)の合成に加算される生成スペクトル(XG)を取得するように構成された帯域ごとのパラメトリックスペクトル生成器(158sg)であって、前記生成スペクトル(XG)が、ソーススペクトルから帯域ごとに取得され、前記ソーススペクトルが、
-第2の予測スペクトル(XNP)、または
-ランダムノイズスペクトル(XN)、または
-前記生成スペクトル(XG)のすでに生成された部分、または
-前記復号および逆量子化されたスペクトル(XDT)もしくは予測スペクトルと前記復号および逆量子化されたスペクトル(XDT)の合成、または
-のうちの1つもしくは2つの合成
のうちの1つであり、
前記生成スペクトル(XG)の前記すでに生成された部分を用いて少なくとも一つのサブバンドが取得される、
帯域ごとのパラメトリックスペクトル生成器(158sg)。
【請求項】
ソーススペクトルが、ゼロサブバンドのエネルギーパラメータに基づいて重み付けされる、請求項13または14に記載のデコーダ(1200)。
【請求項】
前記ソーススペクトルが、ゼロサブバンドのエネルギーパラメータ(EB)に基づいて重み付けされる、請求項21に記載の帯域ごとのパラメトリックスペクトル生成器(158sg)。
【請求項】
サブバンド用の前記ソーススペクトルの選択が、サブバンド位置、音調性情報(toi)、パワースペクトル推定値(ZC)、エネルギーパラメータ(EB)、ピッチ情報(pii)、または時間情報(tei)のうちの少なくとも1つに依存する、請求項20に記載のデコーダ(1200)。
【請求項】
サブバンド用の前記ソーススペクトルの選択が、サブバンド位置、音調性情報(toi)、パワースペクトル推定値(ZC)、エネルギーパラメータ(EB)、ピッチ情報(pii)、および時間情報(tei)のうちの少なくとも1つに依存する、請求項21に記載の帯域ごとのパラメトリックスペクトル生成器(158sg)。
【請求項】
前記音調性情報(toi)がφHであり、またはピッチ情報が
であり、または時間情報がTNSがアクティブであるか否かの前記情報である、請求項24に記載のデコーダ(1200)。
【請求項】
前記音調性情報(toi)がφHであり、またはピッチ情報が
であり、または時間情報がTNSがアクティブであるか否かの前記情報である、請求項25に記載の帯域ごとのパラメトリックスペクトル生成器(158sg)。
【請求項】
複数のサブバンドに分割されたオーディオ信号のスペクトル表現(XMR)を符号化するための方法であって、前記スペクトル表現(XMR)が周波数ビンまたは周波数係数から構成され、少なくとも1つのサブバンドが1つよりも多い周波数ビンを含み、前記方法が、
複数のサブバンドに分割されたオーディオ信号の前記スペクトル表現(XMR)の量子化表現(XQ)を生成するステップと、
前記量子化表現(XQ)に応じて前記スペクトル表現(XMR)のコード化パラメトリック表現(zfl)を提供するステップであって、前記コード化パラメトリック表現(zfl)が、前記サブバンド内の前記スペクトル表現(XMR)を記述するパラメータ、または前記サブバンド内の前記スペクトル表現(XMR)を記述する前記パラメータのコード化バージョンから構成され、異なる少なくとも2つのサブバンド、および異なる前記少なくとも2つのサブバンド内の前記スペクトル表現(XMR)を記述する前記パラメータが存在するステップと、を含み、前記パラメータが前記サブバンド内の前記エネルギーを記述し、
前記複数のサブバンドのうちの少なくとも一つのサブバンドがゼロに量子化され、
または、前記複数のサブバンドのうちの少なくとも一つのためのスペクトル表現(XMR)が前記量子化表現(XQ)内でゼロである、
、方法。
【請求項】
符号化オーディオ信号を復号するための方法であって、前記符号化オーディオ信号が、少なくともスペクトルのコード化表現(spect)およびコード化パラメトリック表現(zfl)から構成され、前記符号化オーディオ信号が量子化ステップ
をさらに含み、前記方法が、
スペクトルの前記コード化表現(spect)および量子化ステップ
から復号および逆量子化されたスペクトル(XD)を生成するステップであって、前記復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、ステップと、
復号されたスペクトルまたは前記復号および逆量子化されたスペクトル(XD)内のゼロサブバンドを識別し、前記コード化パラメトリック表現(zfl)に基づいて前記ゼロサブバンドのパラメトリック表現(EB)を復号するステップと
を含み、
前記パラメトリック表現(EB)が前記ゼロサブバンド内のエネルギーを記述するパラメータを含み、異なる少なくとも2つのサブバンド、したがって、異なる少なくとも2つのサブバンド内のパラメータが存在し、または前記コード化パラメトリック表現(zfl)が可変数のビットの使用によって表現され、または前記コード化パラメトリック表現(zfl)を表現するために使用されるビットの前記数が、スペクトルの前記コード化表現(spect)に依存する、
方法。
【請求項】
符号化オーディオ信号を復号するための方法であって、前記方法が、
符号化オーディオ信号に基づいて復号および逆量子化されたスペクトル(XD)を生成するステップであって、前記復号および逆量子化されたスペクトル(XD)がサブバンドに分割される、ステップと、
復号されたスペクトルまたは前記復号および逆量子化されたスペクトル(XD)においてゼロサブバンドを識別し、前記符号化オーディオ信号に基づいて前記ゼロサブバンドのパラメトリック表現(EB)を復号するステップと、
前記ゼロサブバンドの前記パラメトリック表現(EB)に応じて帯域ごとの生成スペクトルを生成するステップと
帯域ごとの合成スペクトル(XCT)を提供するステップであって、前記帯域ごとの合成スペクトル(XCT)が、前記帯域ごとの生成スペクトルと前記復号および逆量子化されたスペクトル(XD)
)の合成、または前記帯域ごとの生成スペクトルの合成、および予測スペクトル(XPS)と前記復号および逆量子化されたスペクトル(XD)の合成(XDT)を含む、ステップと、
前記帯域ごとの合成スペクトル(XCT)または前記帯域ごとの合成スペクトル(XCT)の導関数を時間表現に変換するステップと
を含む、方法。
【請求項】
帯域ごとの生成スペクトルを生成するための方法であって、スペクトル(XG)を生成し、前記復号および逆量子化されたスペクトル(XD)に、または予測スペクトルと復号および逆量子化されたスペクトル(XDT)の合成に加算される生成スペクトル(XG)を取得するステップを含み、前記生成スペクトル(XG)が、ソーススペクトルから帯域ごとに取得され、前記ソーススペクトルが、
-第2の予測スペクトル(XNP)、または
-ランダムノイズスペクトル(XN)、または
-前記生成スペクトル(XG)のすでに生成された部分、または
-のうちの少なくとも2つの合成
のうちの1つである、方法。
【請求項】
コンピュータ上で実行されると、請求項28から31のいずれか一項に記載の方法を実行するためのプログラムコードを有するコンピュータプログラムを記憶している、コンピュータ可読デジタル記憶媒体。
【国際調査報告】

[広告欄]

ログインすれば広告は減ります

ログインすれば広告は減ります