(19)【発行国】日本国特許庁(JP)
(12)【公報種別】公表特許公報(A)
(11)【公表番号】
(43)【公表日】
(54)【発明の名称】汎用コードブックを用いてAR/VRメタデータを符号化又は復号するための装置及び方法
(51)【国際特許分類】
【FI】
【審査請求】有
【予備審査請求】未請求
(21)【出願番号】
(86)(22)【出願日】
(85)【翻訳文提出日】
(86)【国際出願番号】
(87)【国際公開番号】
(87)【国際公開日】
(31)【優先権主張番号】PCT/EP2022/069523
(32)【優先日】
(33)【優先権主張国・地域又は機関】
(81)【指定国・地域】
【公序良俗違反の表示】
(特許庁注:以下のものは登録商標)
(71)【出願人】
【識別番号】500341779
【氏名又は名称】フラウンホーファー-ゲゼルシャフト・ツール・フェルデルング・デル・アンゲヴァンテン・フォルシュング・アインゲトラーゲネル・フェライン
(74)【代理人】
【識別番号】100134119
【氏名又は名称】奥町 哲行
(72)【発明者】
【氏名】ボールス・クリスティアン
【テーマコード(参考)】
【Fターム(参考)】
5J064BA09
5J064BA14
5J064BC02
5J064BC16
(57)【要約】
一実施形態による、1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための装置(100)が提供される。この装置(100)は、符号化された追加のオーディオ情報がエントロピー符号化される場合に、復号された追加のオーディオ情報を取得するために、符号化された追加のオーディオ情報を復号するための少なくとも1つのエントロピー復号モジュール(110)を備えている。更に、装置(100)は、1つ又は複数の符号化されたオーディオ信号に応じて、かつ復号された追加のオーディオ情報に応じて、1つ又は複数のオーディオ出力信号を生成するための信号プロセッサ(120)を備えている。
【特許請求の範囲】
【請求項】
1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための装置(100)であって、前記装置(100)が、
符号化された追加のオーディオ情報がエントロピー符号化される場合に、復号された追加のオーディオ情報を取得するために、前記符号化された追加のオーディオ情報を復号するための少なくとも1つのエントロピー復号モジュール(110;116,118)と、
前記1つ又は複数の符号化されたオーディオ信号に応じて、かつ前記復号された追加のオーディオ情報に応じて、前記1つ又は複数のオーディオ出力信号を生成するための信号プロセッサ(120)と、を備えている、装置(100)。
【請求項】
前記装置(100)が、
前記符号化された追加のオーディオ情報がエントロピー符号化されていない場合に、前記復号された追加のオーディオ情報を取得するために、前記符号化された追加のオーディオ情報を復号するための少なくとも1つの非エントロピー復号モジュール(111)と、
前記符号化された追加のオーディオ情報がエントロピー符号化されているか否かに応じて、前記符号化された追加のオーディオ情報を復号するために、前記少なくとも1つのエントロピー復号モジュール(110;116,118)と、前記少なくとも1つの非エントロピー復号モジュール(111)と、のうちの1つを選択するためのセレクタ(115)と、
を更に、備えている、請求項1に記載の装置(100)。
【請求項】
前記符号化された追加のオーディオ情報が、拡張現実データ又は仮想現実データを含む、
請求項1又は2に記載の装置(100)。
【請求項】
前記符号化された追加のオーディオ情報が、現実リスニング環境に依存するか、又は仮想リスニング環境に依存するか、又は拡張リスニング環境に依存する、
請求項1から3のいずれか一項に記載の装置(100)。
【請求項】
前記符号化された追加のオーディオ情報が、前記現実リスニング環境又は前記仮想リスニング環境又は前記拡張リスニング環境における1つ又は複数の伝播経路に沿った1つ又は複数の音波の1つ又は複数の伝播に依存する伝播情報を含む、
請求項4に記載の装置(100)。
【請求項】
前記伝播情報が、前記現実リスニング環境又は前記仮想リスニング環境又は前記拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の反射物体における1つ又は複数の反射に依存する反射情報である、
請求項5に記載の装置(100)。
【請求項】
前記伝播情報が、前記現実リスニング環境又は前記仮想リスニング環境又は前記拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の回折物体における1つ又は複数の回折に依存する回折情報である、
請求項5に記載の装置(100)。
【請求項】
前記符号化された追加のオーディオ情報が、早期反射をレンダリングするためのデータを含み、
前記信号プロセッサ(120)が、早期反射をレンダリングするための前記データに応じて前記1つ又は複数のオーディオ出力信号を生成するように構成されている、
請求項1から7のいずれか一項に記載の装置(100)。
【請求項】
前記信号プロセッサ(120)が、前記1つ又は複数のオーディオ出力信号として2つのバイノーラルチャネルを含むバイノーラル信号を生成するように構成されている、
請求項1から8のいずれか一項に記載の装置(100)。
【請求項】
前記少なくとも1つのエントロピー復号モジュール(110;116,118)が、前記符号化された追加のオーディオ情報がハフマン符号化されている場合に前記符号化された追加のオーディオ情報を復号するためのハフマン復号モジュール(116)を備えている、
請求項1から9のいずれか一項に記載の装置(100)。
【請求項】
前記少なくとも1つのエントロピー復号モジュール(110;116,118)が、前記符号化された追加のオーディオ情報が算術的に符号化されている場合に前記符号化された追加のオーディオ情報を復号するための算術復号モジュール(118)を備えている、
請求項1から10のいずれか一項に記載の装置(100)。
【請求項】
前記セレクタ(115)が、前記符号化された追加のオーディオ情報を復号するために、前記少なくとも1つの非エントロピー復号モジュール(111)と、前記ハフマン復号モジュール(116)と、前記算術復号モジュール(118)と、のうちの1つを選択するように構成されている、
請求項2及び請求項10及び請求項11に記載の装置(100)。
【請求項】
前記少なくとも1つの非エントロピー復号モジュール(111)が、前記符号化された追加のオーディオ情報が固定長符号化されている場合に前記符号化された追加のオーディオ情報を復号するための固定長復号モジュールを備えている、
請求項2に更に従属する、請求項3から請求項12のいずれか一項に記載の装置(100)。
【請求項】
前記装置(100)が選択情報を受信するように構成されており、
前記セレクタ(115)が、前記選択情報に応じて、前記少なくとも1つのエントロピー復号モジュール(110;116,118)と、前記少なくとも1つの非エントロピー復号モジュール(111)と、のうちの1つを選択するように構成されている、
請求項2に更に従属する、請求項3から請求項13のいずれか一項に記載の装置(100)。
【請求項】
前記装置(100)が、前記符号化された追加のオーディオ情報が依存するコードブック又はコード化ツリーを受信するように構成されており、
前記少なくともエントロピー復号モジュール(110;116,118)が、前記コードブックを使用して、又は前記コード化ツリーを使用して、前記符号化された追加のオーディオ情報を復号するように構成されている、
請求項1から14のいずれか一項に記載の装置(100)。
【請求項】
前記装置(100)が、前記符号化された追加のオーディオ情報が依存する前記コード化ツリーの構造の符号化を受信するように構成されており、
前記少なくともエントロピー復号モジュール(110;116,118)が、前記コード化ツリーの前記構造に応じて前記コード化ツリーの複数のコードワードを再構築するように構成されており、
前記少なくともエントロピー復号モジュール(110;116,118)が、前記コード化ツリーの前記コードワードを使用して、前記符号化された追加のオーディオ情報を復号するように構成されている、
請求項15に記載の装置(100)。
【請求項】
前記装置(100)が、コードブック又はコード化ツリーを格納したメモリを更に備え、
前記少なくともエントロピー復号モジュール(110;116,118)が、前記コードブックを使用して、又は前記コード化ツリーを使用して、前記符号化された追加のオーディオ情報を復号するように構成されている、
請求項1から14のいずれか一項に記載の装置(100)。
【請求項】
前記装置(100)が、複数の送信されたシンボル及びオフセット値を含む前記符号化された追加のオーディオ情報を受信するように構成されており、
前記少なくとも1つの非エントロピー復号モジュール(111)が、前記複数の送信されたシンボルを使用して、かつ前記オフセット値を使用して、前記符号化された追加のオーディオ情報を復号するように構成されている、
請求項1から17のいずれか一項に記載の装置(100)。
【請求項】
早期反射をレンダリングするための前記データが、環境内の1つ又は複数の現実壁又は仮想壁である1つ又は複数の壁の位置に関する情報を含み、
前記信号プロセッサ(120)が、1つ又は複数の壁の前記位置に関する前記情報に応じて前記1つ又は複数のオーディオ出力信号を生成するように構成されている、
請求項8に更に従属する、請求項9から請求項18のいずれか一項に記載の装置(100)。
【請求項】
前記1つ又は複数の壁の各壁に関する前記情報が、前記壁の方位角及び/又は仰角に関する情報を含み、前記壁の前記方位角がエントロピー符号化され、かつ/又は前記壁の前記仰角がエントロピー符号化され、
前記少なくとも1つのエントロピー復号モジュール(110;116,118)の1つ又は複数のエントロピー復号モジュールが、前記壁のエントロピー符号化された方位角及び/又は前記壁のエントロピー符号化された仰角を復号するように構成されている、
請求項19に記載の装置(100)。
【請求項】
前記少なくとも1つのエントロピー復号モジュール(110;116,118)の前記1つ又は複数が、前記コードブック又は前記コード化ツリーを使用して、前記壁の前記エントロピー符号化された方位角及び/又は前記壁の前記エントロピー符号化された仰角を復号するように構成されている、
請求項15から請求項17のいずれか一項に更に従属する、請求項20に記載の装置(100)。
【請求項】
前記符号化された追加のオーディオ情報が、ボクセル位置情報を含み、前記位置情報が、3次元座標系内の複数のボクセルのうちの1つ又は複数のボクセルの1つ又は複数の位置に関する情報を含み、
前記信号プロセッサ(120)が、前記ボクセル位置情報に応じて前記1つ又は複数のオーディオ出力信号を生成するように構成されている、
請求項1から21のいずれか一項に記載の装置(100)。
【請求項】
前記少なくとも1つのエントロピー復号モジュール(110;116,118)が、エントロピー符号化されている符号化された追加のオーディオ情報を復号するように構成されており、エントロピー符号化されている前記符号化された追加のオーディオ情報が、
三角形インデックスのリストと、
三角形インデックスのリストのアレイ長さと、
球面座標における面法線を指定する方位角を有するアレイと、
球面座標における面法線を指定する仰角を有するアレイと、
距離値を有するアレイと、
リスナーの位置を有するアレイと、
1つ又は複数の音源の位置を有するアレイと、
除去されるべき反射シーケンスのセット又は除去されるべき参照反射シーケンスリストの反射シーケンスのインデックスを指定する除去リスト又は除去セットと、
反射シーケンスの数又は反射経路の数と、
反射次数を指定するアレイと、
反射シーケンスと、
の少なくとも1つを含む、請求項1から22のいずれか一項に記載の装置(100)。
【請求項】
1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための装置(200)であって、前記装置(200)が、
前記1つ又は複数のオーディオ信号を符号化して1つ又は複数の符号化されたオーディオ信号を得るオーディオ信号エンコーダ(210)と、
符号化された追加のオーディオ情報を取得するためにエントロピー符号化を使用して前記追加のオーディオ情報を符号化するための少なくとも1つのエントロピー符号化モジュール(220)と、を備えている、装置(200)。
【請求項】
前記装置(200)が、
前記符号化された追加のオーディオ情報を取得するために前記追加のオーディオ情報を符号化するための少なくとも1つの非エントロピー符号化モジュール(221)と、
符号化されるべき前記追加のオーディオ情報内のシンボル分布に応じて、前記追加のオーディオ情報を符号化するために、前記少なくとも1つのエントロピー符号化モジュール(220)と、前記少なくとも1つの非エントロピー符号化モジュール(221)と、のうちの1つを選択するためのセレクタ(215)と、
を更に備えている、請求項24に記載の装置(200)。
【請求項】
前記符号化された追加のオーディオ情報が拡張現実データ又は仮想現実データを備えている、
請求項24又は25に記載の装置(200)。
【請求項】
前記符号化された追加のオーディオ情報が、現実リスニング環境に依存するか、又は仮想リスニング環境に依存するか、又は拡張リスニング環境に依存する、
請求項24から26のいずれか一項に記載の装置(200)。
【請求項】
前記符号化された追加のオーディオ情報が、前記現実リスニング環境又は前記仮想リスニング環境又は前記拡張リスニング環境における1つ又は複数の伝播経路に沿った1つ又は複数の音波の1つ又は複数の伝播に依存する伝播情報を含む、
請求項27に記載の装置(200)。
【請求項】
前記伝播情報が、前記現実リスニング環境又は前記仮想リスニング環境又は前記拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の反射物体における1つ又は複数の反射に依存する反射情報である、
請求項28に記載の装置(200)。
【請求項】
前記伝播情報が、前記現実リスニング環境又は前記仮想リスニング環境又は前記拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の回折物体における1つ又は複数の回折に依存する回折情報である、
請求項28に記載の装置(200)。
【請求項】
前記符号化された追加のオーディオ情報が、早期反射をレンダリングするためのデータを含む、
請求項24から30のいずれか一項に記載の装置(200)。
【請求項】
前記少なくとも1つのエントロピー符号化モジュール(220)が、ハフマン符号化を使用して前記追加のオーディオ情報を符号化するためのハフマン符号化モジュール(226)を備えている、
請求項24から31のいずれか一項に記載の装置(200)。
【請求項】
前記少なくとも1つのエントロピー符号化モジュール(220)が、算術符号化を使用して前記追加のオーディオ情報を符号化するための算術符号化モジュール(228)を備えている、
請求項24から32のいずれか一項に記載の装置(200)。
【請求項】
前記セレクタ(215)が、前記追加のオーディオ情報を符号化するために、前記少なくとも1つの非エントロピー符号化モジュール(221)と、前記ハフマン符号化モジュール(226)と、前記算術符号化モジュール(228)と、のうちの1つを選択するように構成されている、
請求項25及び請求項32及び請求項33に記載の装置(200)。
【請求項】
前記少なくとも1つの非エントロピー符号化モジュール(221)が、前記追加のオーディオ情報を符号化するための固定長符号化モジュールを備えている、請求項25に更に従属する、
請求項24から34のいずれか一項に記載の装置(200)。
【請求項】
前記装置(200)が、前記追加のオーディオ情報を符号化するために採用された前記少なくとも1つのエントロピー符号化モジュール(220)と、前記少なくとも1つの非エントロピー符号化モジュール(221)と、のうちの1つを示す選択情報を生成するように構成されている、
請求項25に更に従属する、請求項24から35のいずれか一項に記載の装置(200)。
【請求項】
前記装置(200)が、前記追加のオーディオ情報を符号化するために採用されているコードブック又はコード化ツリーを送信するように構成されている、
請求項24から36のいずれか一項に記載の装置(200)。
【請求項】
前記装置(200)が、前記符号化された追加のオーディオ情報が依存する前記コード化ツリーの構造の符号化を送信するように構成されている、
請求項37に記載の装置(200)。
【請求項】
前記装置(200)が、コードブック又はコード化ツリーを格納したメモリを更に備え、
前記少なくともエントロピー復号モジュール(220)が、前記コードブックを使用して、又は前記コード化ツリーを使用して、前記符追加のオーディオ情報を符号化するように構成されている、
請求項24から36のいずれか一項に記載の装置(200)。
【請求項】
前記少なくとも1つのエントロピー符号化モジュール(220)が、前記符号化された追加のオーディオ情報が複数の送信されたシンボル及びオフセット値を備えるように前記追加のオーディオ情報を符号化するように構成されている、
請求項24から39のいずれか一項に記載の装置(200)。
【請求項】
早期反射をレンダリングするための前記データが、環境内の1つ又は複数の現実壁又は仮想壁である1つ又は複数の壁の位置に関する情報を含む、
請求項31に更に従属する、請求項24から40のいずれか一項に記載の装置(200)。
【請求項】
前記1つ又は複数の壁の各壁に関する前記情報が、前記壁の方位角及び/又は仰角に関する情報を含み、前記壁の前記方位角がエントロピー符号化され、かつ/又は前記壁の前記仰角がエントロピー符号化され、
前記少なくとも1つのエントロピー符号化モジュール(220)の1つ又は複数のエントロピー符号化モジュールが、前記符号化された追加のオーディオ情報が前記壁のエントロピー符号化された方位角及び/又は前記壁のエントロピー符号化された仰角を備えるように、前記追加のオーディオ情報を符号化するように構成されている、
請求項41に記載の装置(200)。
【請求項】
前記1つ又は複数のエントロピー符号化モジュールが、前記コードブック又は前記コード化ツリーを使用して、前記壁の前記エントロピー符号化された方位角及び/又は前記壁の前記エントロピー符号化された仰角を符号化するように構成されている、
請求項37から請求項39のいずれか一項に更に従属する、請求項42に記載の装置(200)。
【請求項】
前記符号化された追加のオーディオ情報が、ボクセル位置情報を含み、前記位置情報が、3次元座標系内の複数のボクセルのうちの1つ又は複数のボクセルの1つ又は複数の位置に関する情報を含む、
請求項24から43のいずれか一項に記載の装置(200)。
【請求項】
前記少なくとも1つのエントロピー復号モジュール(220)が、前記エントロピー符号化を使用して、前記符追加のオーディオ情報を符号化するように構成されており、前記符号化された追加のオーディオ情報が、
三角形インデックスのリストと、
三角形インデックスのリストのアレイ長さと、
球面座標における面法線を指定する方位角を有するアレイと、
球面座標における面法線を指定する仰角を有するアレイと、
距離値を有するアレイと、
リスナーの位置を有するアレイと、
1つ又は複数の音源の位置を有するアレイと、
除去されるべき反射シーケンスのセット又は除去されるべき参照反射シーケンスリストの反射シーケンスのインデックスを指定する除去リスト又は除去セットと、
反射シーケンスの数又は反射経路の数と、
反射次数を指定するアレイと、
反射シーケンスと、
の少なくとも1つを含む、請求項24から44のいずれか一項に記載の装置(200)。
【請求項】
1つ又は複数の符号化されたオーディオ信号及び符号化された追加のオーディオ情報を取得するために、1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための、請求項24から45のいずれか一項に記載の装置(200)と、
前記1つ又は複数の符号化されたオーディオ信号から、前記符号化された追加のオーディオ情報に応じて1つ又は複数のオーディオ出力信号を生成するための、請求項1から23のいずれか一項に記載の装置(100)と、
を備えたシステム。
【請求項】
1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための方法であって、前記方法が、
符号化された追加のオーディオ情報がエントロピー符号化される場合に、復号された追加のオーディオ情報を取得するために、前記符号化された追加のオーディオ情報を復号することと、
前記1つ又は複数の符号化されたオーディオ信号に応じて、かつ前記復号された追加のオーディオ情報に応じて、前記1つ又は複数のオーディオ出力信号を生成することと、を含む、方法。
【請求項】
1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための方法であって、前記方法が、
前記1つ又は複数のオーディオ信号を1つ又は複数の符号化されたオーディオ信号に符号化することと、
符号化された追加のオーディオ情報を取得するためにエントロピー符号化を使用して前記追加のオーディオ情報を符号化することと、を含む、方法。
【請求項】
コンピュータ又は信号プロセッサ上で実行される場合に、請求項47又は48に記載の方法を実施するためのコンピュータプログラム。
【発明の詳細な説明】
【技術分野】
【】
本発明は、符号化又は復号のための装置及び方法に関し、特に、汎用コードブックを用いて拡張現実(AR)又は仮想現実(VR)メタデータを符号化又は復号するための装置及び方法
【背景技術】
【】
オーディオコード化技術の更なる改善及び開発は、オーディオコード化研究の継続的なタスクであり、例えば、例えば物体、壁などでの反射によって引き起こされる残響などのオーディオ効果を考慮に入れる拡張現実又は仮想現実シナリオにおいて、リスナーにとって現実的なオーディオ体験を作成することを意図しており、一方、同時に、オーディオ情報を高効率で符号化及び復号することを意図している。
【発明の概要】
【発明が解決しようとする課題】
【】
拡張現実又は仮想現実のための改善されたリスニング体験を作り出すことを目的とするこれらの新しいオーディオ技術の1つは、例えば、MPEG-Iである。MPEG-Iは、仮想現実及び拡張現実アプリケーションのための新たな開発中の規格である。それは、自然で現実的であり、目だけでなく耳にも全体的に説得力のある体験を提供するAR又はVR体験を作成することを目的としている。
【】
例えば、MPEG-I技術を使用すると、VRでコンサートを聴くとき、リスナーはただ1つのスポットにルーティングされるのではなく、コンサート会場の周りを自由に移動することができる。あるいは、例えば、MPEG-I技術は、ユーザが試合を見ながらスタジアムを動き回ることができるeスポーツ又はスポーツイベントの放送に採用されてもよい。
【】
以前の解決策は、3自由度(3DoF)として知られるものにおいて、1つの観測点からの視覚的又は音響的体験を可能にする。対照的に、今後のMPEG-I規格は、完全な6自由度(6DoF)をサポートする。3DoFでは、ユーザは頭を自由に動かし、複数の面から入力を受け取ることができる。しかし、6DoFでは、ユーザは仮想空間内を移動することができる。ユーザは、歩き回り、あらゆる視野角を探索し、仮想世界と相互作用することさえできる。MPEG-I技術は、仮想要素によって拡張された現実世界内でユーザが行動する拡張現実(AR)にも同様に適用可能である。例えば、いくつかの仮想のミュージシャンをリビングルームに配置し、自分の個人的なコンサートを楽しむことができる。
【】
この目的を達成するために、MPEG-Iは、説得力のある高度に没入型のオーディオ体験を生み出すための高度な技術を提供し、音響の多くの態様を考慮することを含む。一例は、部屋内及び障害物の周りの音の伝播である。もう1つは音源であり、音源は静止していても動いていてもよく、動いている音源はドップラー効果を生成する。音の伝播は、現実的な放射パターン及びサイズを有するものとする。例えば、MPEG-I技術は、障害物又は部屋の角の周りの音の回折を考慮に入れ、これらの効果の効率的なレンダリングを提供することを目的とする。
【】
全体として、MPEG-Iは、豊富なVR及びARコンテンツのための長期的に安定したフォーマットを提供することを目的としている。MPEG-Iを使用した再生は、専用の受信デバイスと、日常のスマートフォンとの両方で可能となる。MPEG-Iは、既存の配信チャンネルを介して次世代ビデオサービスとしてVR及びARコンテンツを配信することを目的としており、その結果、プロバイダは、エンターテイメント、ドキュメント、教育又はスポーツコンテンツで真にエキサイティングで没入型の体験をユーザに提供することができる。
【】
現実又は仮想の音響環境に関する情報及び/又は残響などのそれらの効果などの追加のオーディオ情報が、例えば追加のオーディオ情報としてデコーダに提供されることが望ましい。このような情報を効率的な方法で提供することは、高く評価されるであろう。
【】
を要約すると、オーディオ符号化及びオーディオ復号のための改善された概念が提供されれば、高く評価されるであろう。
【課題を解決するための手段】
【】
本発明の目的は、オーディオ符号化及びオーディオ復号のための改善された概念を提供することである。本発明の目的は、独立請求項の主題によって解決される。特定の従属請求項に提供される。
【】
一実施形態による、1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための装置が提供される。この装置は、符号化された追加のオーディオ情報がエントロピー符号化される場合に、復号された追加のオーディオ情報を取得するために、符号化された追加のオーディオ情報を復号するための少なくとも1つのエントロピー復号モジュールを備えている。更に、装置は、1つ又は複数の符号化されたオーディオ信号に応じて、かつ復号された追加のオーディオ情報に応じて、1つ又は複数のオーディオ出力信号を生成するための信号プロセッサを備えている。
【】
更に、一実施形態による1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための装置が提供される。この装置は、1つ又は複数のオーディオ信号を符号化して1つ又は複数の符号化されたオーディオ信号を得るオーディオ信号エンコーダを備えている。更に、この装置は、符号化された追加のオーディオ情報を取得するためにエントロピー符号化を使用して追加のオーディオ情報を符号化するための少なくとも1つのエントロピー符号化モジュールを備えている。
【】
更に、一実施形態による、1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための装置が提供される。この装置は、1つ又は複数の符号化されたオーディオ信号を受信し、追加のオーディオ情報データを受信するための入力インターフェースを備えている。更に、装置は、符号化されたオーディオ信号に応じて、かつ第2の追加のオーディオ情報に応じて、1つ又は複数のオーディオ出力信号を生成するための信号生成器を備える。信号生成器は、追加のオーディオ情報データが冗長状態を示す場合、追加のオーディオ情報データを使用し、第1の追加のオーディオ情報を使用して第2の追加のオーディオ情報を取得するように構成される。更に、信号生成器は、追加のオーディオ情報データが非冗長状態を示す場合、第1の追加のオーディオ情報を使用せずに追加のオーディオ情報データを使用して第2の追加のオーディオ情報を取得するように構成される。
【】
更に、一実施形態による1つ又は複数のオーディオ信号を符号化するため、及び追加のオーディオ情報データを生成するための装置が提供される。この装置は、1つ又は複数のオーディオ信号を符号化して1つ又は複数の符号化されたオーディオ信号を得るオーディオ信号エンコーダを備えている。更に、装置は、追加のオーディオ情報データを生成するための追加のオーディオ情報生成器を備え、追加のオーディオ情報生成器は、非冗長動作モード及び冗長動作モードを示す。追加のオーディオ情報生成器は、追加のオーディオ情報生成器が非冗長動作モードを示す場合に、追加のオーディオ情報データが第2の追加のオーディオ情報を含むように、追加のオーディオ情報データを生成するように構成される。更に、追加のオーディオ情報生成器は、追加のオーディオ情報生成器が非冗長動作モードを示す場合に、追加のオーディオ情報データが第2の追加のオーディオ情報を含まないように、又は第2の追加のオーディオ情報の一部のみを含むように、追加のオーディオ情報データを生成するように構成され、その結果、第2の追加のオーディオ情報は、第1の追加のオーディオ情報とともに追加のオーディオ情報データを使用して得ることができる。
【】
更に、一実施形態による、1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための方法が提供される。本方法は、
符号化された追加のオーディオ情報がエントロピー符号化される場合に、復号された追加のオーディオ情報を取得するために、符号化された追加のオーディオ情報を復号することと、
1つ又は複数の符号化されたオーディオ信号に応じて、かつ復号された追加のオーディオ情報に応じて、1つ又は複数のオーディオ出力信号を生成することと、を含む。
【】
更に、一実施形態による1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための方法が提供される。本方法は、
1つ又は複数のオーディオ信号を1つ又は複数の符号化されたオーディオ信号に符号化することと、
符号化された追加のオーディオ情報を取得するためにエントロピー符号化を使用して追加のオーディオ情報を符号化することと、を含む。
【】
更に、別の実施形態による、1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための方法が提供される。本方法は、
1つ又は複数の符号化されたオーディオ信号を受信し、追加のオーディオ情報データを受信することと、
符号化されたオーディオ信号に応じて、かつ第2の追加のオーディオ情報に応じて、1つ又は複数のオーディオ出力信号を生成することと、を含む。
【】
本方法は、追加のオーディオ情報データが冗長状態を示す場合、追加のオーディオ情報データを使用し、第1の追加のオーディオ情報を使用して第2の追加のオーディオ情報を取得することを含む。更に、本方法は、追加のオーディオ情報データが非冗長状態を示す場合、追加のオーディオ情報データを使用し、第1の追加のオーディオ情報を使用せずに、第2の追加のオーディオ情報を取得することを含む。
【】
更に、一実施形態による1つ又は複数のオーディオ信号を符号化するため、及び追加のオーディオ情報データを生成するための方法が提供される。本方法は、
1つ又は複数の符号化されたオーディオ信号を取得するために1つ又は複数のオーディオ信号を符号化することと、
追加のオーディオ情報データを生成することと、を含む。
【】
非冗長動作モードでは、追加のオーディオ情報データが第2の追加のオーディオ情報を含むように、追加のオーディオ情報データの生成が行われる。冗長動作モードでは、第2の追加のオーディオ情報が第1の追加のオーディオ情報とともに追加のオーディオ情報データを使用して取得可能であるように、追加のオーディオ情報データが第2の追加のオーディオ情報を含まないか、又は第2の追加のオーディオ情報の一部のみを含むように、追加のオーディオ情報データの生成が行われる。
【】
更に、コンピュータプログラムが提供され、コンピュータプログラムの各々は、コンピュータ又は信号プロセッサ上で実行されると、上述の方法のうちの1つを実施するように構成される。
【】
以下では、本発明の実施形態が、図面を参照してより詳細に説明される。
【図面の簡単な説明】
【】
【図】一実施形態による、1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための装置を示す図である。
【図】少なくとも1つの非エントロピー復号モジュールとセレクタとを更に備える、別の実施形態による1つ又は複数のオーディオ出力信号を生成するための装置を示す図である。
【図】更なる実施形態による1つ又は複数のオーディオ出力信号を生成するための装置を示す図であり、この装置は、非エントロピー復号モジュールと、ハフマン復号モジュールと、算術復号モジュールとを備える。
【図】一実施形態による1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための装置を示す図である。
【図】少なくとも1つの非エントロピー符号化モジュールとセレクタとを備える、別の実施形態による1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための装置を示す図である。
【図】更なる実施形態による1つ又は複数のオーディオ出力信号を生成するための装置を示す図であり、この装置は、非エントロピー符号化モジュールと、ハフマン符号化モジュールと、算術符号化モジュールとを備える。
【図】一実施形態によるシステムを示す図である。
【図】追加のオーディオデータの符号化及び符号化された追加のオーディオデータの復号を示す特定の実施形態を示す図である。
【図】別の実施形態による、1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための装置を示す図である。
【図】一実施形態による1つ又は複数のオーディオ信号を符号化するため、及び追加のオーディオ情報データを生成するための装置を示す図である。
【図】別の実施形態によるシステムを示す図である。
【発明を実施するための形態】
【】
図1は、一実施形態による、1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための装置100を示す図である。
【】
この装置100は、符号化された追加のオーディオ情報がエントロピー符号化される場合に、復号された追加のオーディオ情報を取得するために、符号化された追加のオーディオ情報を復号するための少なくとも1つのエントロピー復号モジュール110を備えている。
【】
更に、装置100は、1つ又は複数の符号化されたオーディオ信号に応じて、かつ復号された追加のオーディオ情報に応じて、1つ又は複数のオーディオ出力信号を生成するための信号プロセッサ120を備えている。
【】
図2は、別の実施形態による1つ又は複数のオーディオ出力信号を生成するための装置100を示し、図1の装置100と比較して、図2の装置100は、少なくとも1つの非エントロピー復号モジュール111及びセレクタ115を更に備える。
【】
少なくとも1つの非エントロピー復号モジュール111は、例えば、符号化された追加のオーディオ情報がエントロピー符号化されていない場合に、復号された追加のオーディオ情報を取得するために、符号化された追加のオーディオ情報を復号するように構成されてもよい。
【】
セレクタ115は、例えば、符号化された追加のオーディオ情報がエントロピー符号化されているか否かに応じて、符号化された追加のオーディオ情報を復号するために、少なくとも1つのエントロピー復号モジュール110と、少なくとも1つの非エントロピー復号モジュール111と、のうちの1つを選択するように構成されてもよい。
【】
一実施形態によれば、符号化された追加のオーディオ情報は、例えば、拡張現実データ又は仮想現実データを含むことができる。
【】
一実施形態では、符号化された追加のオーディオ情報が、現実リスニング環境に依存するか、又は仮想リスニング環境に依存するか、又は拡張リスニング環境に依存する。
【】
典型的な適用シナリオでは、リスニング環境は、エンコーダ側でモデル化及び符号化されるものとし、リスニング環境のモデル化は、デコーダ側で受信されるものとする。
【】
リスニング環境に関する典型的な追加のオーディオ情報は、例えば、例えば音波が反射され得る複数の反射物体に関する情報であり得る。一般に、反射に関連する反射物体は、可聴音の波長よりも(著しく)大きい拡張を有するものである。したがって、反射を考慮する場合、壁又は他の大きな反射物体が特に重要である。そのような反射物体は、例えば、音が反射される表面によって適切に表され得る。
【】
3次元環境では、表面は、例えば、3次元座標系の3つの点によって特徴付けられてもよく、これらの3つの点の各々は、例えば、そのx座標値、そのy座標値、及びそのz座標値によって定義されてもよい。したがって、3つの点の各々について、3つのx値、y値、z値が必要とされ、したがって、表面を画定するために合計9つの座標値が必要とされる。
【】
表面のより効率的な表現は、例えば、その法線ベクトル
を使用することによって、及び定義された原点から表面までの距離を定義するスカラー距離値dを使用することによって、表面を定義することによって達成され得る。表面の法線ベクトル
が方位角及び仰角によって定義される場合(法線ベクトルの長さは1であるため、符号化する必要はない)、表面は3つの値、すなわち表面のスカラー距離値dと、表面の法線ベクトル
の方位角及び仰角によってのみ定義できる。
【】
通常、効率的な符号化のために、方位角及び仰角は、例えば、適切に量子化され得る。例えば、各方位角は、2n個の異なる方位角値のうちの1つを有してもよく、仰角は、例えば、各仰角が2n-1個の異なる仰角値のうちの1つを有し得るように符号化されてもよい。
【】
で概説したように、反射に焦点を合わせたリスニング環境を定義する場合、壁の表現は重要な役割を果たす。これは、屋内の壁が、例えば早期反射に関して非常に重要な役割を果たす屋内シナリオに当てはまる。しかしながら、これは、建物の壁が関連する反射物体の大部分を表す屋外シナリオにも当てはまる。
【】
通常の環境では、多くの壁が互いに約90°の角度で立っていることが観察される。例えば、屋内シナリオでは、多くの水平壁及び垂直壁が存在する。構造偏差に起因して、壁の間の関係は必ずしも正確に90°であるとは限らず、例えば89.8°、89.6°、90.3°などであってもよいが、約90°及び約0°の互いに対する関係を有する壁のかなりの割合が依然として存在することが分かっている。
【】
例えば、壁の仰角は、壁が水平壁である場合、例えば0°になるように定義されてもよく、壁の表面が垂直壁である場合、例えば90°になるように定義されてもよい。次に、現実世界の例では、約90°の仰角を有する壁のかなりの割合(例えば、89.8°、89.7°、90.2°)、及び約0°の仰角を有する壁のかなりの割合(例えば、0.3°、-0.2°、0.4°)が存在する。
【】
仰角についての同じ観察は、部屋が長方形の形状を有することが多いため、方位角についても適用されることが多い。
【】
しかしながら、仰角の例に戻ると、仰角の0°値がとは異なるように定義される場合、通常の壁が示す他の値が生じることに留意されたい。例えば、表面が0°の仰角を有するように定義されている場合、が水平面に対して20°傾斜している場合、多くの現実世界の壁は、例えば、約-20°の仰角(例えば、-19.8°、-20.0°、-20.2°)を有することができ、多くの現実世界の壁は、例えば、約70°の仰角(例えば、69.8°、70.0°、70.2°)を有することができる。それでも、かなりの割合で、壁は特定の仰角(この例では約-20°及び約70°)で同じ仰角を有する。方位角についても同様である。
【】
更に、いくつかの他の壁は、他の特定の典型的な仰角を有する。例えば、屋根は、典型的には、45°又は35°又は30°傾斜している。これらの値の特定の頻度は、現実世界の例でも発生する。
【】
更に、すべての現実世界の部屋が長方形の地面形状を有するわけではなく、例えば、他の規則的な形状を示すことができることに留意されたい。例えば、八角形の地面形状を有する部屋を考える。ただし、いくつかの方位角、例えば0°、45°、90°、及び135°程度の方位角が他の方位角よりも頻繁に発生することが想定される。
【】
更に、屋外の例では、壁はしばしば同様の方位角を示す。例えば、1つの家の2つの平行な壁は、同様の方位角を示すが、これは、例えば、互いに対して規則的で同様の地面形状を有する列に構築されることが多い隣接する家の壁にも関連し得る。そこでも、隣接する住宅の壁は、同様の方位角値を示し、したがって、同様に配向された反射壁/表面を有する。
【】
の観察から、エントロピー符号化を使用して追加のオーディオ情報を符号化及び復号することが特に適していることが多いことが分かった。これは、すべての可能な値のうちの特定の値の発生が他の値よりも(著しく)頻繁に発生するシナリオに特に適用される。
【】
特定の実施形態では、表面(例えば、反射物体を表現する)の仰角の値は、例えば、エントロピーコード化を使用して、例えばハフマンコード化を使用して、又は算術コード化を使用して符号化及び復号され得る。
【】
同様に、特定の実施形態では、表面(例えば、反射物体を表現する)の方位角の値は、例えば、エントロピーコード化を使用して、例えばハフマンコード化を使用して、又は算術コード化を使用して符号化及び復号され得る。
【】
の考慮事項は、他の適用シナリオにも適用される。例えば、所与のオーディオソース位置s及び、例えば所与のリスナー位置lについて、反射シーケンスは、例えば、いくつかの1つ又は複数の表面インデックスによって識別されるいくつかの1つ又は複数の表面を定義することができ、1つ又は複数の表面インデックスは、特定の伝播経路上のオーディオソースから発生する音波がリスナー位置に到達する(聞こえる)まで反射される表面を定義する。
【】
例えば、位置sにあるソース及び位置lにあるリスナーの場合、反射シーケンス[5,18]は、特定の伝播経路上で、位置sにあるソースからの音波が最初に表面インデックス5を有する表面で反射され、次いで最終的にリスナーの位置lに到達するまで(リスナーがそれを依然として知覚することができるように可聴)表面インデックス18を有する表面で反射されることを定義する。第2の反射シーケンスは、例えば、反射シーケンス[3,12]であってもよい。特定の伝播経路上で、音源sからの音波が表面5によってのみ反射され、次いでリスナーの位置lに可聴に到達することを示す、[5]のみを含む第3の反射シーケンス。第4の反射シーケンス[3,7]は、特定の伝播経路上で、ソースsからの音波が最初に表面インデックス3を有する表面で反射され、次に表面インデックス7を有する表面で、最終的にリスナーに聴覚的に到達するまで反射されることを定義する。位置lにおけるリスナー及び位置sにおけるソースのすべての反射シーケンスは、位置lにおけるリスナー及び位置sにおけるソースの反射シーケンスのセットを共に定義する。
【】
しかしながら、例えば他の画定された表面、例えば、例えばリスナーの位置lから遠く離れて位置し、ソースの位置sから遠く離れて位置することができる、表面インデックス6、8、9、10、11、又は15を有する表面も存在し得る。これらの表面は、位置lにあるリスナー及び位置sにあるソースの反射シーケンスのセットではあまり頻繁に発生しないか、まったく発生しない。この観察から、多くの場合、エントロピーコード化を使用して反射シーケンスのセットをコード化することが望ましいことが分かった。
【】
更に、反射シーケンスの複数のセットが複数の異なるリスナー位置及び/又は複数の異なるソース位置に対して合同で符号化される場合でも、エントロピーコード化を採用することが依然として望ましい場合がある。例えば、特定のリスニング環境では、ユーザ到達可能領域を、例えば定義することができ、例えば、ユーザは、例えば、密集したブッシュ又はアクセスできない他の領域を決して移動しないと仮定することができる。いくつかの適用シナリオでは、これらのアクセス不可能な領域内のユーザ位置の反射シーケンスのセットは提供されない。これらの領域内の壁は、通常、定義されたすべての可能なユーザ位置から遠く離れて配置されているため、反射シーケンスの複数のセットにおいてあまり頻繁には現れないことになる。これは、反射シーケンスの複数のセット内の表面インデックスの異なる出現をもたらし、したがって、反射セット内のこれらの表面インデックスをエントロピー符号化することが提案される。
【】
一実施形態では、追加のオーディオ情報の異なる値の実際の出現は、例えば観察されてもよく、例えば、この観察に基づいて、エントロピー符号化又は非エントロピー符号化のいずれかが、例えば採用されてもよい。異なる値の出現が同じ又は少なくともほぼ同様の周波数で現れる場合に非エントロピー符号化を使用することは、とりわけ、エンコーダからデコーダに送信される必要がない所定のコードワード対シンボルの関係を例えば採用することができるという利点を有する。
【】
今説明したもの以外の他の適用例にも適用され得るより一般的な例に再び戻る。
【】
一実施形態によれば、符号化された追加のオーディオ情報は、例えば、現実リスニング環境又は仮想リスニング環境又は拡張リスニング環境における1つ又は複数の伝播経路に沿った1つ又は複数の音波の1つ又は複数の伝播に依存する伝播情報を含むことができる。
【】
一実施形態では、伝播情報は、例えば、現実リスニング環境又は仮想リスニング環境又は拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の反射物体における1つ又は複数の反射に依存する反射情報であってもよい。
【】
一実施形態によれば、伝播情報は、例えば、現実リスニング環境又は仮想リスニング環境又は拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の回折物体における1つ又は複数の回折に依存する回折情報であってもよい。
【】
一実施形態によれば、符号化された追加のオーディオ情報は、早期反射をレンダリングするためのデータを含むことができる。信号プロセッサ120は、例えば、早期反射をレンダリングするためのデータに応じて1つ又は複数のオーディオ出力信号を生成するように構成されてもよい。
【】
一実施形態では、信号プロセッサ120は、例えば、1つ又は複数のオーディオ出力信号として2つのバイノーラルチャネルを含むバイノーラル信号を生成するように構成されてもよい。
【】
一実施形態によれば、少なくとも1つのエントロピー復号モジュール110は、例えば、符号化された追加のオーディオ情報がハフマン符号化されている場合に符号化された追加のオーディオ情報を復号するためのハフマン復号モジュール116を備えることができる。
【】
一実施形態では、少なくとも1つのエントロピー復号モジュール110は、例えば、符号化された追加のオーディオ情報が算術的に符号化されている場合に符号化された追加のオーディオ情報を復号するための算術復号モジュール118を備えることができる。
【】
図3は、別の実施形態による1つ又は複数のオーディオ出力信号を生成するための装置100を示す図であり、この装置100は、非エントロピー復号モジュール111と、ハフマン復号モジュール116と、算術復号モジュール118とを備える。
【】
セレクタ115は、例えば、符号化された追加のオーディオ情報を復号するために、少なくとも1つの非エントロピー復号モジュール111と、ハフマン復号モジュール116と、算術復号モジュール118と、のうちの1つを選択するように構成されていてもよい。
【】
一実施形態によれば、少なくとも1つの非エントロピー復号モジュール111は、例えば、符号化された追加のオーディオ情報が固定長符号化されている場合に符号化された追加のオーディオ情報を復号するための固定長復号モジュールを備えることができる。
【】
一実施形態では、装置100は、例えば、選択情報を受信するように構成され得る。セレクタ115は、例えば、選択情報に応じて、少なくとも1つのエントロピー復号モジュール110と、少なくとも1つの非エントロピー復号モジュール111と、のうちの1つを選択するように構成され得る。
【】
一実施形態によれば、装置100は、例えば、符号化された追加のオーディオ情報が依存するコードブック又はコード化ツリーを受信するように構成され得る。少なくともエントロピー復号モジュール110は、例えば、コードブックを使用して、又はコード化ツリーを使用して、符号化された追加のオーディオ情報を復号するように構成され得る。
【】
一実施形態では、装置100は、例えば、符号化された追加のオーディオ情報が依存するコード化ツリーの構造の符号化を受信するように構成され得る。少なくともエントロピー復号モジュール110は、例えば、コード化ツリーの構造に応じてコード化ツリーの複数のコードワードを再構築するように構成され得る。更に、少なくともエントロピー復号モジュール110は、例えば、コード化ツリーのコードワードを使用して、符号化された追加のオーディオ情報を復号するように構成され得る。
【】
例えば、例えば、エンコーダからデコーダに送信され得る典型的なコード化情報は、例えば、コードのN個すべてのコードワードを含むN個の要素のコードワードリスト、及びコードのN個のコードワードによって符号化されたN個すべてのシンボルを含むシンボルリストであり得る。コードワードリストの1≦p≦Nを有する位置pにおけるコードワードは、シンボルリストの位置pにおけるシンボルを符号化すると定義することができる。
【】
例えば、以下の2つのリストの内容を例えば送信することができ、シンボルの各々は、例えば、特定の表面を識別する表面インデックスを表すことができる
【】
【表】
しかしながら、コードワードリストを送信する代わりに、一実施形態によれば、コード化ツリーの表現は、例えばエンコーダから送信され得、これは、例えばデコーダによって受信され得る。デコーダは、例えば、コード化ツリーの受信表現からコードワードリストを構築するように構成することができる。
【】
例えば、各内部ノード(例えば、コード化ツリーのルートノードを除く)は、例えば、第1のビット値(例えば、0)によって表されてもよく、コード化ツリーの各リーフノードは、例えば、第2のビット値(例えば、1)によって表されてもよい。
のコードワードリストを考慮すると、以下のようになる
【】
【表】
最も左側の分岐から最も右側の分岐までコード化ツリーをトラバースし、0でコード化ツリーをトラバースするときにすべての新しい内部ノードを符号化し、1でコード化ツリーをトラバースするときにすべてのリーフノードを符号化すると、のコードワードが以下のように表されるコード化ツリーの符号化が行われる
【】
【表】
結果として得られるコード化ツリーの表現は、01 1 01 01 01 1である。
デコーダ側では、コード化ツリーの表現は、コードワードのリストに分解することができる。
【】
コードワード1:第1のリーフノードは、第2のノードに到来する:ビット00を有するコードワード1
コードワード2:次に、別のリーフノードが続く:ビット:01を有するコードワード2
コードワード3:ルートノードの左側のすべてのノードが発見され、ルートノードの右分岐に進み、ルートノードの右側の最初のリーフは第2のノードにある:ビット「10」を有するコードワード3
コードワード4:1つのノードを上方に(第1の分岐1の下に)持ち上げる。内部ノード(0)を右分岐(第2の分岐1)内に下げる;リーフノード(1)を左分岐(分岐0)に移動する:コードワード4:「110」。(ブランチ1-1-0の下のリーフノード)
コードワード5:1つのノードを上方に(第2の分岐1の下に)持ち上げる。内部ノード(0)を右分岐(第3の分岐1)内に下げる;リーフノード(1)を左分岐(分岐0)に移動する:コードワード5:「1110」。(ブランチ1-1-1-0の下のリーフノード)
コードワード6:1つのノードを上昇させ、右の分岐(第4の分岐1)に下降させ、これはリーフノード(1)である:コードワード6:「1111」(分岐1-1-1-1の下のリーフノード)。
【】
コードワードの代わりにコード化ツリー構造をコード化することにより、コード化効率が向上する。
【】
一実施形態では、装置100は、例えば、コードブック又はコード化ツリーを格納したメモリを更に備えてもよい。少なくともエントロピー復号モジュール110は、例えば、コードブックを使用して、又はコード化ツリーを使用して、符号化された追加のオーディオ情報を復号するように構成され得る。
【】
一実施形態によれば、装置100は、例えば、複数の送信されたシンボル及びオフセット値を含む符号化された追加のオーディオ情報を受信するように構成され得る。少なくとも1つの非エントロピー復号モジュール111は、例えば、複数の送信されたシンボルを使用して、かつオフセット値を使用して、符号化された追加のオーディオ情報を復号するように構成され得る。
【】
一実施形態では、早期反射をレンダリングするためのデータは、例えば、環境内の1つ又は複数の現実壁又は仮想壁である1つ又は複数の壁の位置に関する情報を含み得る。信号プロセッサ120は、例えば、1つ又は複数の壁の位置の情報に応じて1つ又は複数のオーディオ出力信号を生成するように構成され得る。
【】
一実施形態によれば、1つ又は複数の壁の各壁に関する情報は、例えば、壁の方位角及び/又は仰角に関する情報を含み得、壁の方位角は、例えばエントロピー符号化され得、かつ/又は壁の仰角は、例えばエントロピー符号化され得る。少なくとも1つのエントロピー復号モジュール110の1つ又は複数のエントロピー復号モジュールが、壁のエントロピー符号化された方位角及び/又は壁のエントロピー符号化された仰角を復号するように構成されている。
【】
一実施形態では、少なくとも1つのエントロピー復号モジュール110の1つ又は複数が、コードブック又はコード化ツリーを使用して、壁のエントロピー符号化された方位角及び/又は壁のエントロピー符号化された仰角を復号するように構成されている。
【】
一実施形態によれば、符号化された追加のオーディオ情報は、例えば、ボクセル位置情報を含み得、位置情報は、例えば、3次元座標系内の複数のボクセルのうちの1つ又は複数のボクセルの1つ又は複数の位置に関する情報を含み得る。信号プロセッサ120は、例えば、ボクセル位置情報に応じて1つ又は複数のオーディオ出力信号を生成するように構成され得る。
【】
一実施形態では、少なくとも1つのエントロピー復号モジュール110は、例えば、エントロピー符号化されている符号化された追加のオーディオ情報を復号するように構成され得、エントロピー符号化されている符号化された追加のオーディオ情報は、例えば、
三角形インデックスのリスト、例えばearlySurfaceFaceIdxと、
三角形インデックスのリストのアレイ長さ、例えばearlySurfaceFaceIdxのアレイ長さ、例えばearlySurfaceLengthFaceIdxと、
球面座標(例えば、ヘッセ標準形)における面法線を指定する方位角を有するアレイ、例えばearlySurfaceAziと、
球面座標(例えば、ヘッセ標準形)における面法線を指定する仰角を有するアレイ、例えばearlySurfaceEleと、
距離値を有するアレイ(例えば、ヘッセ標準形)、例えばearlySurfaceDistと、
リスナーの位置を有するアレイ、例えば、リスナーボクセルインデックスを有するアレイ、例えばearlyVoxelLと、
1つ又は複数の音源の位置を有するアレイ、例えば、ソースボクセルインデックスを有するアレイ、例えばearlyVoxelSと、
除去されるべき反射シーケンスのセット又は除去されるべき参照反射シーケンスリストの反射シーケンスのインデックスを指定する、除去リスト又は除去セット、例えば、異なって符号化された除去リスト又は異なって符号化された除去セット、例えばearlyVoxelIndicesRemovedDiffと、
反射シーケンスの数又は反射経路の数、例えばearlyVoxelNumPathsと、
反射次数を指定するアレイ、例えば2次元アレイ、例えばearlyVoxelOrderと、
反射シーケンス、例えばearlyVoxelSurfと、の少なくとも1つを含み得る。
【】
図4は、一実施形態による1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための装置200を示す図である。
【】
装置200は、1つ又は複数のオーディオ信号を符号化して1つ又は複数の符号化オーディオ信号を得るオーディオ信号エンコーダ210を備えている。
【】
更に、装置200は、符号化された追加のオーディオ情報を取得するためにエントロピー符号化を使用して追加のオーディオ情報を符号化するための少なくとも1つのエントロピー符号化モジュール220を備えている。
【】
図5は、別の実施形態による1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための装置200を示す図である。図4の装置200と比較して、図4の装置200は、少なくとも1つの非エントロピー符号化モジュール221及びセレクタ215を更に備える。
【】
少なくとも1つの非エントロピー符号化モジュール221は、例えば、符号化された追加のオーディオ情報を取得するために追加のオーディオ情報を符号化するように構成され得る。
【】
セレクタ215は、例えば、符号化されるべき追加のオーディオ情報内のシンボル分布に応じて、追加のオーディオ情報を符号化するために、少なくとも1つのエントロピー符号化モジュール220と、少なくとも1つの非エントロピー符号化モジュール221と、のうちの1つを選択するように構成され得る。
【】
一実施形態によれば、符号化された追加のオーディオ情報は、例えば、拡張現実データ又は仮想現実データを含むことができる。
【】
一実施形態では、符号化された追加のオーディオ情報が、現実リスニング環境に依存するか、又は仮想リスニング環境に依存するか、又は拡張リスニング環境に依存する。
【】
一実施形態によれば、追加のオーディオ情報は、例えば、現実リスニング環境又は仮想リスニング環境又は拡張リスニング環境における1つ又は複数の伝播経路に沿った1つ又は複数の音波の1つ又は複数の伝播に依存する伝播情報を含むことができる。
【】
一実施形態では、伝播情報は、例えば、現実リスニング環境又は仮想リスニング環境又は拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の反射物体における1つ又は複数の反射に依存する反射情報であってもよい。
【】
一実施形態によれば、伝播情報は、例えば、現実リスニング環境又は仮想リスニング環境又は拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の回折物体における1つ又は複数の回折に依存する回折情報であってもよい。
【】
一実施形態によれば、符号化された追加のオーディオ情報は、早期反射をレンダリングするためのデータを含むことができる。
【】
一実施形態では、少なくとも1つのエントロピー符号化モジュール220は、例えば、ハフマン符号化を使用して追加のオーディオ情報を符号化するためのハフマン符号化モジュール226を備え得る。
【】
一実施形態によれば、少なくとも1つのエントロピー符号化モジュール220は、例えば、算術符号化を使用して追加のオーディオ情報を符号化するための算術符号化モジュール228を備え得る。
【】
図6は、別の実施形態による1つ又は複数のオーディオ出力信号を生成するための装置200を示す図であり、この装置200は、非エントロピー符号化モジュール221と、ハフマン符号化モジュール226と、算術符号化モジュール228とを備える。
【】
セレクタ215は、例えば、追加のオーディオ情報を符号化するために、少なくとも1つの非エントロピー符号化モジュール221と、ハフマン符号化モジュール226と、算術符号化モジュール228と、のうちの1つを選択するように構成され得る。
【】
一実施形態では、少なくとも1つの非エントロピー符号化モジュール221は、例えば、追加のオーディオ情報を符号化するための固定長符号化モジュールを備え得る。
【】
一実施形態によれば、装置200は、例えば、追加のオーディオ情報を符号化するために採用された少なくとも1つのエントロピー符号化モジュール220と、少なくとも1つの非エントロピー符号化モジュール221と、のうちの1つを示す選択情報を生成するように構成され得る。
【】
一実施形態では、装置200は、例えば、追加のオーディオ情報を符号化するために採用されているコードブック又はコード化ツリーを送信するように構成され得る。
【】
一実施形態では、装置200は、例えば、符号化された追加のオーディオ情報が依存するコード化ツリーの構造の符号化を送信するように構成され得る。
【】
一実施形態によれば、装置200は、例えば、コードブック又はコード化ツリーを格納したメモリを更に備えてもよい。少なくともエントロピー符号化モジュール220は、例えば、コードブックを使用して、又はコード化ツリーを使用して、符追加のオーディオ情報を符号化するように構成され得る。
【】
一実施形態では、少なくとも1つのエントロピー符号化モジュール220は、例えば、符号化された追加のオーディオ情報が例えば複数の送信されたシンボル及びオフセット値を備え得るように追加のオーディオ情報を符号化するように構成され得る。
【】
一実施形態によれば、早期反射をレンダリングするためのデータは、例えば、環境内の1つ又は複数の現実壁又は仮想壁である1つ又は複数の壁の位置に関する情報を含み得る。
【】
一実施形態では、1つ又は複数の壁の各壁に関する情報は、例えば、壁の方位角及び/又は仰角に関する情報を含み得、壁の方位角は、例えばエントロピー符号化され得、かつ/又は壁の仰角は、例えばエントロピー符号化され得る。少なくとも1つのエントロピー符号化モジュール220の1つ又は複数のエントロピー符号化モジュールは、符号化された追加のオーディオ情報が、例えば壁のエントロピー符号化された方位角及び/又は壁のエントロピー符号化された仰角を備え得るように、追加のオーディオ情報を符号化するように構成されている。
【】
一実施形態によれば、1つ又は複数のエントロピー符号化モジュールが、コードブック又はコード化ツリーを使用して、壁のエントロピー符号化された方位角及び/又は壁のエントロピー符号化された仰角を符号化するように構成されている。
【】
一実施形態では、符号化された追加のオーディオ情報は、例えば、ボクセル位置情報を含み得、位置情報は、例えば、3次元座標系内の複数のボクセルのうちの1つ又は複数のボクセルの1つ又は複数の位置に関する情報を含み得る。
【】
一実施形態によれば、少なくとも1つのエントロピー符号化モジュール220は、例えば、エントロピー符号化を使用して、符追加のオーディオ情報を符号化するように構成され得、符号化された追加のオーディオ情報は、例えば、
三角形インデックスのリスト、例えばearlySurfaceFaceIdxと、
三角形インデックスのリストのアレイ長さ、例えばearlySurfaceFaceIdxのアレイ長さ、例えばearlySurfaceLengthFaceIdxと、
球面座標(例えば、ヘッセ標準形)における面法線を指定する方位角を有するアレイ、例えばearlySurfaceAziと、
球面座標(例えば、ヘッセ標準形)における面法線を指定する仰角を有するアレイ、例えばearlySurfaceEleと、
距離値を有するアレイ(例えば、ヘッセ標準形)、例えばearlySurfaceDistと、
リスナーの位置を有するアレイ、例えば、リスナーボクセルインデックスを有するアレイ、例えばearlyVoxelLと、
1つ又は複数の音源の位置を有するアレイ、例えば、ソースボクセルインデックスを有するアレイ、例えばearlyVoxelSと、
除去されるべき反射シーケンスのセット又は除去されるべき参照反射シーケンスリストの反射シーケンスのインデックスを指定する、除去リスト又は除去セット、例えば、異なって符号化された除去リスト又は異なって符号化された除去セット、例えばearlyVoxelIndicesRemovedDiffと、
反射シーケンスの数又は反射経路の数、例えばearlyVoxelNumPathsと、
反射次数を指定するアレイ、例えば2次元アレイ、例えばearlyVoxelOrderと、
反射シーケンス、例えばearlyVoxelSurfと、の少なくとも1つを含み得る。
【】
図7は、一実施形態によるシステムを示す図である。このシステムは、1つ又は複数の符号化されたオーディオ信号及び符号化された追加のオーディオ情報を取得するために、1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための、図4の装置200を備えている。更に、このシステムは、1つ又は複数の符号化されたオーディオ信号から、符号化された追加のオーディオ情報に応じて1つ又は複数のオーディオ出力信号を生成するための、図1の装置100を備えている。
【】
図8は、追加のオーディオデータの符号化及び符号化された追加のオーディオデータの復号を示す特定の実施形態を示す図である。図8において、追加のオーディオデータは、符号化されたARデータ又はVRデータを得るためにエンコーダ側で符号化されるARデータ又はVRデータである。メタデータはまた、符号化されてもよい。次いで、符号化されたARデータ又は符号化されたVRデータは、復号されたARデータ又は復号されたVRデータを取得するためにデコーダ側でデコーダされる。エンコーダ側では、セレクタがエンコーダスイッチを操作して、ARデータ又はVRデータを符号化するためのN個の異なるエンコーダモジュールのうちの1つを選択する。図8において、セレクタは、N個の復号モジュールのうちの対応する復号モジュールが、符号化ARデータ又は符号化VRデータを復号するために選択されるように、デコーダ側に情報を提供する。
【】
以下では、更なる実施形態が提供される。
【】
一実施形態によれば、エンコーダサブシステム及びデコーダサブシステムを有するデータ系列を符号化及び復号するためのシステムが提供される。エンコーダサブシステムは、例えば、少なくとも2つの異なる符号化方法、エンコーダセレクタ、及び符号化方法のうちの1つを選択するエンコーダスイッチを含むことができる。エンコーダサブシステムは、例えば、選択された選択、選択されたエンコーダの符号化パラメータ、及び選択されたエンコーダによって符号化されたデータを送信することができる。デコーダサブシステムは、例えば、対応するデコーダと、復号方法のうちの1つを選択するデコーダスイッチとを備えることができる。
【】
一実施形態では、データ系列は、例えば、AR/VRデータを含むことができる。
【】
一実施形態によれば、データ系列は、例えば、早期反射をレンダリングするためのメタデータを含むことができる。
【】
一実施形態では、少なくとも1つの固定長エンコーダ/デコーダを例えば使用することができ、少なくとも1つの可変長エンコーダ/デコーダを例えば使用することができる。
【】
一実施形態によれば、可変長エンコーダ/デコーダのうちの1つはハフマンエンコーダ/デコーダである。
【】
一実施形態では、符号化パラメータは、例えば、コードブック又は復号ツリーを含むことができる。
【】
一実施形態によれば、符号化パラメータは、例えば、オフセット値を含むことができ、このオフセット値と送信されたシンボルとの組み合わせが復号されたデータ系列をもたらす。
【】
図9は、別の実施形態による、1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための装置300を示す図である。
【】
この装置300は、1つ又は複数の符号化されたオーディオ信号を受信し、追加のオーディオ情報データを受信するための入力インターフェース310を備えている。
【】
更に、装置300は、符号化されたオーディオ信号に応じて、かつ第2の追加のオーディオ情報に応じて、1つ又は複数のオーディオ出力信号を生成するための信号生成器320を備える。
【】
信号生成器320は、追加のオーディオ情報データが冗長状態を示す場合、追加のオーディオ情報データを使用し、第1の追加のオーディオ情報を使用して第2の追加のオーディオ情報を取得するように構成される。
【】
更に、信号生成器320は、追加のオーディオ情報データが非冗長状態を示す場合、第1の追加のオーディオ情報を使用せずに追加のオーディオ情報データを使用して第2の追加のオーディオ情報を取得するように構成される。
【】
一実施形態によれば、入力インターフェース310は、例えば、追加のオーディオ情報データとして伝播情報データを受信するように構成することができる。信号生成器320は、例えば、第2の伝播情報である第2の追加のオーディオ情報に依存して1つ又は複数のオーディオ出力信号を生成するように構成されてもよい。更に、信号生成器320は、例えば、伝播情報データが冗長状態を示す場合、伝播情報データを使用し、第1の伝播情報である第1の追加のオーディオ情報を使用して第2の伝播情報を取得するように構成されてもよい。更に、信号生成器320は、例えば、伝播情報データが非冗長状態を示す場合、第1の伝播情報を使用せずに伝播情報データを使用して第2の伝播情報を取得するように構成されてもよい。
【】
一実施形態によれば、第1の伝播情報及び/又は第2の伝播情報は、例えば、現実リスニング環境又は仮想リスニング環境又は拡張リスニング環境における1つ又は複数の伝播経路に沿った1つ又は複数の音波の1つ又は複数の伝播に依存し得る。
【】
一実施形態では、伝播情報データは、例えば、反射情報データ及び/又は回折情報データを含むことができる。第1の伝播情報は、例えば、第1の反射情報及び/又は第1の回折情報を含むことができる。更に、第2の伝播情報は、例えば、第2の反射情報及び/又は第2の回折情報を含むことができる。
【】
一実施形態によれば、入力インターフェース310は、例えば、伝播情報データとして反射情報データを受信するように構成することができる。信号生成器320は、例えば、第2の反射情報である第2の伝播情報に依存して1つ又は複数のオーディオ出力信号を生成するように構成されてもよい。更に、信号生成器320は、例えば、反射情報データが冗長状態を示す場合、反射情報データを使用し、第1の反射情報である第1の伝播情報を使用して第2の反射情報を取得するように構成されてもよい。更に、信号生成器320は、例えば、反射情報データが非冗長状態を示す場合、第1の反射情報を使用せずに反射情報データを使用して第2の反射情報を取得するように構成されてもよい。
【】
一実施形態では、第1の反射情報及び/又は第2の反射情報は、例えば、現実リスニング環境又は仮想リスニング環境又は拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の反射物体における1つ又は複数の反射に依存し得る。
【】
第1及び第2の反射情報は、例えば、上述した反射シーケンスのセットを含むことができる。既に概説したように、例、所与のオーディオソース位置s及び、例えば所与のリスナー位置lについて、反射シーケンスは、例えば、いくつかの1つ又は複数の表面インデックスによって識別されるいくつかの1つ又は複数の表面を定義することができ、特定の伝播経路上のオーディオソースから発生する音波がリスナー位置に到達する(聞こえる)まで反射される表面を定義する。
【】
位置lのリスナー及び位置sのソースに対して定義されたこれらの反射シーケンスはすべて、反射シーケンスのセットを形成する。
【】
例えば、隣接するリスナー位置の場合、反射シーケンスのセットは非常に類似していることが分かっている。したがって、エンコーダは、(例えば、第1の反射情報における)反射シーケンスの同様のセットに含まれない(例えば、反射情報データにおける)それらの反射シーケンスのみを符号化し、反射シーケンスの現在のセットに対して有効ではない反射シーケンスの同様のセットの反射シーケンスの同様のセットのそれらの反射シーケンスのみを示すことが提案される。同様に、それぞれのデコーダは、受信した低減された情報(例えば、反射情報データ)を使用して、反射シーケンスの同様のセット(例えば、第1の反射情報)から反射シーケンスの現在のセット(例えば、第2の反射情報)を取得する。
【】
一実施形態では、入力インターフェース310は、例えば、回折情報データを伝播情報データとして受信するように構成することができる。信号生成器320は、例えば、第2の回折情報である第2の伝播情報に依存して1つ又は複数のオーディオ出力信号を生成するように構成されてもよい。更に、信号生成器320は、例えば、回折情報データが冗長状態を示す場合、回折情報データを使用し、第1の回折情報である第1の伝播情報を使用して第2の回折情報を取得するように構成されてもよい。更に、信号生成器320は、例えば、回折情報データが非冗長状態を示す場合、第1の回折情報を使用せずに回折情報データを使用して第2の回折情報を取得するように構成されてもよい。
【】
一実施形態によれば、第1の回折情報及び/又は第2の回折情報は、例えば、現実リスニング環境又は仮想リスニング環境又は拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の回折物体における1つ又は複数の回折に依存してもよい。
【】
例えば、第1及び第2の回折情報は、例えば、位置lにおけるリスナー及び位置sにおけるソースの回折シーケンスのセットを含むことができる。回折シーケンスのセットは、例えば、反射シーケンスのセットと同様に定義することができるが、反射物体ではなく回折物体(例えば、回折を引き起こす物体)に関する。多くの場合、回折物体及び反射物体は、例えば、同じ物体であってもよい。これらの物体を反射物体と考える場合には、これらの物体の表面が考慮され、一方、これらの物体を回折物体と考える場合には、これらの物体のエッジが回折のために考慮される。
【】
一実施形態によれば、伝播情報データが冗長状態を示す場合、伝播情報データは、例えば、第1の伝播情報から除去されるべき1つ又は複数の伝播シーケンスであって、伝播シーケンスの第1のセットである、1つ又は複数の伝播シーケンスを示すことができ、及び/又は、例えば、伝播シーケンスの第2のセットである、第2の伝播情報を取得するために伝播シーケンスの第1のセットに追加されるべき1つ又は複数の伝播シーケンスを示すことができる。信号生成器320は、例えば、伝播情報データを使用して伝播シーケンスの第1のセットを更新して伝播シーケンスの第2のセットを取得するように構成されてもよい。
【】
一実施形態では、反射シーケンスの第1のセット及び反射シーケンスの第2のセットの各反射シーケンスは、例えば、1つ又は複数の反射物体のグループ又は1つ又は複数の回折物体のグループを示すことができる。
【】
一実施形態では、伝播情報データが非冗長状態を示す場合、伝播情報データは、例えば、伝播シーケンスの第2のセットを含み得、信号生成器320は、例えば、伝播情報データから伝播シーケンスの第2のセットを判定するように構成され得る。
【】
一実施形態によれば、伝播シーケンスの第1のセットは、例えば、第1のリスナー位置及び第1のソース位置に関連付けられ得る。伝播シーケンスの第2のセットは、例えば、第2のリスナー位置及び第2のソース位置に関連付けられ得る。第1のリスナー位置は、例えば、第2のリスナー位置と異なっていてもよく、及び/又は第1のソース位置は、例えば、第2のソース位置と異なっていてもよい。
【】
一実施形態では、伝播シーケンスの第1のセットは、例えば、反射シーケンスの第1のセットであってもよい。伝播シーケンスの第2のセットは、例えば、反射シーケンスの第2のセットであってもよい。反射シーケンスの第1のセットの各反射シーケンスは、例えば、反射シーケンスの1つ又は複数の反射物体のグループに関する情報を含むことができ、第1のソース位置でオーディオソースによって放射され、第1のリスナー位置でリスナーが知覚可能な音波は、現在のリスナー位置への途中で反射される。反射シーケンスの第2のセットの各反射シーケンスは、例えば、反射シーケンスの1つ又は複数の反射物体のグループに関する情報を含むことができ、第2のソース位置でオーディオソースによって放射され、第2のリスナー位置でリスナーが知覚可能な音波は、現在のリスナー位置への途中で反射される。
【】
一実施形態によれば、1つ又は複数の符号化されたオーディオ信号は、反射シーケンスの第2のセットのソース位置に位置するオーディオソースに関連付けられる。信号生成器320は、例えば、1つ又は複数のオーディオ出力信号が、例えば、反射シーケンスの第2のセットのソース位置においてオーディオソースによって放射された音波の早期反射を含むことができるように、1つ又は複数の符号化されたオーディオ信号を使用し、かつ反射シーケンスの第2のセットを使用して、1つ又は複数のオーディオ出力信号を生成するように構成することができる。
【】
一実施形態では、入力インターフェース310は、例えば、反射情報データを伝播情報データとして受信するように構成することができる。信号生成器320は、例えば、反射シーケンスの複数のセットを取得するように構成されてもよく、反射シーケンスの複数のセットの各々は、例えば、リスナー位置及びソース位置に関連付けられてもよい。入力インターフェース310は、例えば、通知を受信するように構成することができる。反射シーケンスの第2のセットを判定するために、信号生成器320は、例えば、反射情報データが冗長状態を示す場合、通知を使用して第1のリスナー位置及び第1のソース位置を判定し、反射シーケンスの複数のセットのうちのその1つを、第1のリスナー位置及び第1のソース位置に関連付けられた反射シーケンスの第1のセットとして選択するように構成され得る。
【】
例えば、反射シーケンスの複数のセットの反射シーケンスの各セットの各反射シーケンスは、例えば、反射シーケンスの1つ又は複数の反射物体のグループに関する情報を含むことができ、反射シーケンスの前述のセットのソース位置でオーディオソースによって放射され、反射シーケンスの前述のセットのリスナー位置でリスナーが知覚可能な音波は、現在のリスナー位置への途中で反射される。
【】
一実施形態によれば、反射情報データが冗長状態を示す場合、通知は、例えば、第1のリスナー位置が第2のリスナー位置に隣接するように、かつ/又は第1のソース位置が第2のリスナー位置に隣接するように、第1のリスナー位置及び第1のソース位置を選択することを示すことができる。反射情報データが冗長状態を示す場合、信号生成器320は、例えば、通知に従って第1のリスナー位置及び/又は第1のソース位置を判定するように構成されてもよい。
【】
一実施形態では、反射情報データが冗長状態を示す場合、通知は、例えば、第1のリスナー位置が第2のリスナー位置に隣接するように、かつ第1のソース位置が第2のリスナー位置と同一であるように、第1のリスナー位置及び第1のソース位置を選択することを示すことができる。信号生成器320は、通知に従って第1のリスナー位置及び第1のソース位置を判定するように構成される。
【】
又は、一実施形態では、反射情報データが冗長状態を示す場合、通知は、例えば、第1のリスナー位置が第2のリスナー位置と同一であるように、かつ第1のソース位置が第2のリスナー位置に隣接するように、第1のリスナー位置及び第1のソース位置を選択することを示すことができる。信号生成器320は、例えば、通知に従って第1のリスナー位置及び第1のソース位置を判定するように構成され得る。
【】
一実施形態によれば、座標系の各座標方向において、第1の位置が第2の位置の直前又は直後にあるか、又は第2の位置と同一である場合、及び座標系の少なくとも1つの座標方向において、第1の位置及び第2の位置が互いに異なる場合、座標系において、第1の位置及び第2の位置は隣接している。
【】
一実施形態では、通知は、例えば、
反射情報データが非冗長状態を示すことと、
反射情報データが第1の冗長状態を示し、それにより、第1のソース位置が第2のソース位置と同一であるように、かつ第1のリスナー位置が第2のリスナー位置に隣接するように、第1のリスナー位置及び第1のソース位置が選択されることになり、ここで、座標系の第1の座標方向において、第1のリスナー位置が第2のリスナー位置の直前にあり、ここで、座標系の第2の座標方向及び第3の座標方向において、第1のリスナー位置が第2のリスナー位置と同一であることと、
反射情報データが第2の冗長状態を示し、それにより、第1のソース位置が第2のソース位置と同一であるように、かつ第1のリスナー位置が第2のリスナー位置に隣接するように、第1のリスナー位置及び第1のソース位置が選択されることになり、ここで、座標系の第2の座標方向において、第1のリスナー位置が第2のリスナー位置の直前にあり、ここで、座標系の第1の座標方向及び第3の座標方向において、第1のリスナー位置が第2のリスナー位置と同一であることと、
反射情報データが第3の冗長状態を示し、それにより、第1のソース位置が第2のソース位置と同一であるように、かつ第1のリスナー位置が第2のリスナー位置に隣接するように、第1のリスナー位置及び第1のソース位置が選択されることになり、ここで、座標系の第3の座標方向において、第1のリスナー位置が第2のリスナー位置の直前にあり、ここで、座標系の第1の座標方向及び第2の座標方向において、第1のリスナー位置が第2のリスナー位置と同一であることと、のうちの1つを示し得る。
【】
通知が第1の冗長状態又は第2の冗長状態又は第1の冗長状態を示す場合、信号生成器320は、例えば、通知に従って第1のリスナー位置及び第1のソース位置を判定するように構成され得る。
【】
一実施形態によれば、第1のリスナー位置、第1のソース位置、第2のリスナー位置、及び第2のソース位置の各々は、例えば、3次元座標系内の複数のボクセルのうちのボクセルの位置を定義することができる。
【】
例えば、反射シーケンスの複数のセットの各々のリスナー位置及びソース位置の各々は、例えば、3次元座標系内の複数のボクセルのうちのボクセルの位置を定義することができる。
【】
一実施形態では、信号生成器320は、例えば、1つ又は複数のオーディオ出力信号として2つのバイノーラルチャネルを含むバイノーラル信号を生成するように構成されてもよい。
【】
図10は、一実施形態による1つ又は複数のオーディオ信号を符号化するため、及び追加のオーディオ情報データを生成するための装置400を示す図である。
【】
装置400は、1つ又は複数のオーディオ信号を符号化して1つ又は複数の符号化されたオーディオ信号を得るオーディオ信号エンコーダ410を備えている。
【】
更に、装置400は、追加のオーディオ情報データを生成するための追加のオーディオ情報生成器420を備え、追加のオーディオ情報生成器420は、非冗長動作モード及び冗長動作モードを示す。
【】
追加のオーディオ情報生成器420は、追加のオーディオ情報生成器420が非冗長動作モードを示す場合に、追加のオーディオ情報データが第2の追加のオーディオ情報を含むように、追加のオーディオ情報データを生成するように構成される。
【】
更に、追加のオーディオ情報生成器420は、追加のオーディオ情報生成器420が非冗長動作モードを示す場合に、追加のオーディオ情報データが第2の追加のオーディオ情報を含まないように、又は第2の追加のオーディオ情報の一部のみを含むように、追加のオーディオ情報データを生成するように構成され、その結果、第2の追加のオーディオ情報は、第1の追加のオーディオ情報とともに追加のオーディオ情報データを使用して得ることができる。
【】
一実施形態によれば、追加のオーディオ情報生成器420は、例えば、追加のオーディオ情報データとして伝播情報データを生成するための伝播情報生成器とすることができる。伝播情報生成器は、例えば、伝播情報生成器が非冗長動作モードを示す場合に、伝播情報データが、第2の伝播情報である第2の追加のオーディオ情報を含むように、伝播情報データを生成するように構成され得る。更に、伝播情報生成器は、例えば、伝播情報生成器が非冗長動作モードを示す場合に、伝播情報データが第2の伝播情報を含まないように、又は第2の伝播情報の一部のみを含むように、伝播情報データを生成するように構成され得、その結果、第2の伝播情報は、第1の伝播情報とともに伝播情報データを使用して得ることができる。
【】
一実施形態によれば、第1の伝播情報及び/又は第2の伝播情報は、例えば、現実リスニング環境又は仮想リスニング環境又は拡張リスニング環境における1つ又は複数の伝播経路に沿った1つ又は複数の音波の1つ又は複数の伝播に依存し得る。
【】
一実施形態では、伝播情報データは、例えば、反射情報データ及び/又は回折情報データを含むことができる。第1の伝播情報は、例えば、第1の反射情報及び/又は第1の回折情報を含むことができる。第2の伝播情報は、例えば、第2の反射情報及び/又は第2の回折情報を含むことができる。
【】
一実施形態によれば、伝播情報生成器は、例えば、伝播情報データとして反射情報データを生成するための反射情報生成器であってもよい。反射情報生成器は、例えば、反射情報生成器が非冗長動作モードを示す場合、反射情報データが第2の伝播情報として第2の反射情報を含むように、反射情報データを生成するように構成され得る。更に、反射情報生成器は、例えば、反射情報生成器が非冗長動作モードを示す場合に、反射情報データが第2の反射情報を含まないように、又は第2の反射情報の一部のみを含むように、反射情報データを生成するように構成され得、その結果、第2の反射情報は、第1の反射情報である第1の伝播情報とともに反射情報データを使用して得ることができる。
【】
一実施形態では、第1の反射情報及び/又は第2の反射情報は、例えば、現実リスニング環境又は仮想リスニング環境又は拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の反射物体における1つ又は複数の反射に依存し得る。
【】
一実施形態によれば、伝播情報生成器は、例えば、伝播情報データとして回折情報データを生成するための回折情報生成器であってもよい。回折情報生成器は、例えば、回折情報生成器が非冗長動作モードを示す場合、回折情報データが第2の伝播情報として第2の回折情報を含むように、回折情報データを生成するように構成され得る。更に、回折情報生成器は、例えば、回折情報生成器が非冗長動作モードを示す場合に、回折情報データが第2の回折情報を含まないように、又は第2の回折情報の一部のみを含むように、回折情報データを生成するように構成され得、その結果、第2の回折情報は、第1の回折情報である第1の伝播情報とともに回折情報データを使用して得ることができる。
【】
一実施形態では、第1の回折情報及び/又は第2の回折情報は、例えば、現実リスニング環境又は仮想リスニング環境又は拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の回折物体における1つ又は複数の回折に依存してもよい。
【】
一実施形態によれば、伝播情報生成器は、例えば、冗長動作モードにおいて、伝播情報データが、例えば、第1の伝播情報から除去されるべき1つ又は複数の伝播シーケンスであって、伝播シーケンスの第1のセットである、1つ又は複数の伝播シーケンスを示すことができ、及び/又は、例えば、伝播シーケンスの第2のセットである、第2の伝播情報を取得するために伝播シーケンスの第1のセットに追加されるべき1つ又は複数の伝播シーケンスを示すことができるように、伝播情報データを生成するように構成され得る。
【】
一実施形態では、伝播シーケンスの第1のセット及び伝播シーケンスの第2のセットの各伝播シーケンスは、例えば、1つ又は複数の反射物体のグループ又は1つ又は複数の回折物体のグループを示すことができる。
【】
一実施形態では、伝播情報生成器は、例えば、非冗長動作モードにおいて、伝播情報データが例えば伝播シーケンスの第2のセットを含み得るように、伝播情報データを生成するように構成され得る。
【】
一実施形態によれば、伝播シーケンスの第1のセットは、例えば、第1のリスナー位置及び第1のソース位置に関連付けられ得る。伝播シーケンスの第2のセットは、例えば、第2のリスナー位置及び第2のソース位置に関連付けられ得る。第1のリスナー位置は、例えば、第2のリスナー位置と異なっていてもよく、及び/又は第1のソース位置は、例えば、第2のソース位置と異なっていてもよい。
【】
一実施形態では、伝播シーケンスの第1のセットは、例えば、反射シーケンスの第1のセットであってもよい。伝播情報生成器は、例えば、反射情報生成器であってもよい。伝播シーケンスの第2のセットは、例えば、反射シーケンスの第2のセットであってもよい。伝播情報データは、例えば、反射情報データであってもよい。反射シーケンスの第1のセットの各反射シーケンスは、例えば、反射シーケンスの1つ又は複数の反射物体のグループに関する情報を含むことができ、第1のソース位置でオーディオソースによって放射され、第1のリスナー位置でリスナーが知覚可能な音波は、現在のリスナー位置への途中で反射される。反射情報生成器は、例えば、反射シーケンスの第2のセットの各反射シーケンスが、例えば、反射シーケンスの1つ又は複数の反射物体のグループに関する情報を含むことができ、第2のソース位置でオーディオソースによって放射され、第2のリスナー位置でリスナーが知覚可能な音波が、現在のリスナー位置への途中で反射されるように、反射情報データを生成するように構成され得る。
【】
一実施形態によれば、1つ又は複数の符号化されたオーディオ信号は、反射シーケンスの第2のセットのソース位置に位置するオーディオソースに関連付けられる。
【】
一実施形態では、反射情報生成器は、例えば、冗長動作モードにおいて、反射シーケンスの第1のセットの第1のリスナー位置及び第1のソース位置を判定するのに適した通知を生成するように構成され得る。
【】
一実施形態によれば、反射情報生成器は、例えば、冗長動作モードにおいて、通知が、例えば、第1のリスナー位置が第2のリスナー位置に隣接するように、かつ/又は第1のソース位置が第2のリスナー位置に隣接するように、第1のリスナー位置及び第1のソース位置を選択することを示すことができるように、通知を生成するように構成され得る。
【】
一実施形態では、反射情報生成器は、例えば、冗長動作モードにおいて、通知が、例えば、第1のリスナー位置が第2のリスナー位置に隣接するように、かつ第1のソース位置が第2のリスナー位置と同一であるように、第1のリスナー位置及び第1のソース位置を選択することを示すことができるように、通知を生成するように構成され得る。
【】
又は、一実施形態では、反射情報生成器は、例えば、冗長動作モードにおいて、通知が、例えば、第1のリスナー位置が第2のリスナー位置と同一であるように、かつ第1のソース位置が第2のリスナー位置に隣接するように、第1のリスナー位置及び第1のソース位置を選択することを示すことができるように、通知を生成するように構成され得る。
【】
一実施形態によれば、座標系の各座標方向において、第1の位置が第2の位置の直前又は直後にあるか、又は第2の位置と同一である場合、及び座標系の少なくとも1つの座標方向において、第1の位置及び第2の位置が互いに異なる場合、座標系において、第1の位置及び第2の位置は隣接している。
【】
一実施形態では、反射情報生成器は、例えば、冗長動作モードにおいて、通知が例えば
反射情報データが非冗長状態を示すことと、
反射情報データが第1の冗長状態を示し、それにより、第1のソース位置が第2のソース位置と同一であるように、かつ第1のリスナー位置が第2のリスナー位置に隣接するように、第1のリスナー位置及び第1のソース位置が選択されることになり、ここで、座標系の第1の座標方向において、第1のリスナー位置が第2のリスナー位置の直前にあり、ここで、座標系の第2の座標方向及び第3の座標方向において、第1のリスナー位置が第2のリスナー位置と同一であることと、
反射情報データが第2の冗長状態を示し、それにより、第1のソース位置が第2のソース位置と同一であるように、かつ第1のリスナー位置が第2のリスナー位置に隣接するように、第1のリスナー位置及び第1のソース位置が選択されることになり、ここで、座標系の第2の座標方向において、第1のリスナー位置が第2のリスナー位置の直前にあり、ここで、座標系の第1の座標方向及び第3の座標方向において、第1のリスナー位置が第2のリスナー位置と同一であることと、
反射情報データが第3の冗長状態を示し、それにより、第1のソース位置が第2のソース位置と同一であるように、かつ第1のリスナー位置が第2のリスナー位置に隣接するように、第1のリスナー位置及び第1のソース位置が選択されることになり、ここで、座標系の第3の座標方向において、第1のリスナー位置が第2のリスナー位置の直前にあり、ここで、座標系の第1の座標方向及び第2の座標方向において、第1のリスナー位置が第2のリスナー位置と同一であることと、のうちの1つを示し得るように、通知を生成するように構成することができる。
【】
一実施形態によれば、第1のリスナー位置、第1のソース位置、第2のリスナー位置、及び第2のソース位置の各々は、例えば、3次元座標系内の複数のボクセルのうちのボクセルの位置を定義することができる。
【】
図11は、別の実施形態によるシステムを示す図である。このシステムは、1又は複数の符号化されたオーディオ信号を取得するために1又は複数のオーディオ信号を符号化し、追加のオーディオ情報データを生成するための図10の装置400を備える。更に、このシステムは、1つ又は複数の符号化されたオーディオ信号から、追加のオーディオ情報データに応じて1つ又は複数のオーディオ出力信号を生成するための、図9の装置300を備えている。
【】
以下では、更なる特定の実施形態が提供される。
より詳細には、メタデータのバイナリ符号化及び復号が考慮される。
【】
MPEG-I 6DoF Audio規格の現在の作業ドラフト(「RM0の第1ドラフトバージョン」)には、earlySurfaceDataJSON、earlySurfaceConnectedDataJSON、及びearlyVoxelDataJSONが、「ASCII符号化における0終端文字列であり、この文字列には、仮データフォーマットとしてJSON形式のドキュメントが含まれている。」とのように示されていることを述べている。この入力文書において、本発明者らは、符号化方法を使用してこの仮データフォーマットをバイナリデータフォーマットに置き換えることを提案しており、その結果、ビットストリームサイズが大幅に小さくなる。
【】
このコア実験は、RM0の第1のドラフトバージョンに基づいている。それは、JSONフォーマットの早期反射メタデータをバイナリ符号化フォーマットに置き換えることを目的としている。特定の技術を適用することにより、わずかな量子化誤差を導入しながら、早期反射ペイロードのサイズの大幅な縮小が達成される。
【】
ペイロードサイズを低減するために適用される技術には、以下が含まれる。
1.データ統合:RefSoftレンダラearlySurfaceConnectedData)によってもはや使用されない変数は削除される。
【】
2.座標系:反射面の単位法線ベクトルは、係数の数を3から2に減らすためにデカルト座標ではなく球面座標で送信される。
【】
3.量子化:反射面を定義する係数は、高解像度で量子化される(準可逆コード化)。
【】
4.エントロピー符号化:送信されたシンボルのエントロピーコード化のために、コードブックベースの汎用符号化スキーマが使用される。適用される方法は、非常に多数のシンボルを有するデータ系列に特に有益であるが、少数のシンボルにも適している。
【】
5.ボクセル間冗長性の低減:ボクセル近傍のボクセルデータの類似性を利用して、ビットストリームサイズを更に低減する。差分手法が使用され、現在のボクセルデータセットと隣接ボクセルデータセットとの間の差が符号化される。
【】
レンダラのランタイム複雑度が提案された変更の影響を受けない一方で、JSONデータの解析ステップがもはや必要とされないので、デコーダは単純化される。
【】
更に、提案された置換はまた、JSONドキュメントの生成及び解析がもはや必要とされないため、レンダラのライブラリ依存性及びエンコーダのライブラリ依存性を低減する。
【】
すべての「テスト1」及び「テスト2」シーンについて、提案された符号化方法は、P13を超える全体的なビットストリームサイズの平均で21.33%の低減を提供する。メッシュデータを反映するシーンのみを考慮すると、提案された符号化方法は、P13を超える全体的なビットストリームサイズの平均で28.91%の低減を提供する。
【】
以下では、追加/置換に関する情報が考慮される。
このコア実験で提示された符号化方法は、payloadEarlyReflections()の主要部分の代替として意図されている。タイプPLD_EARLY_REFLECTIONSのパケットの参照ソフトウェア内の対応するペイロードハンドラは、それに応じて置き換えられることを意味する。
【】
以下では、更なる技術情報が提供される。
特に、使用されていない変数を除去することが提案されている。
【】
RM0ビットストリームパーサは、ビットストリーム変数earlySurfaceDataJSON及びearlySurfaceConnectedDataJSONからデータ構造earlySurfaceData及びearlySurfaceConnectedDataを生成する。このデータは、接続された表面エリアに属する静的シーンジオメトリ及び三角形の反射面を定義する。反射面に属するすべての三角形のセットを接続されたエリアのいくつかのグループに分割する動機は、視認性テスト中にレンダラがサブセットのみをチェックできるようにすることであった。しかしながら、参照ソフトウェア実装は、もはやこの特有の情報を利用しない。内部的には、Intel Embreeライブラリは、独自の加速方法(境界ボリューム階層データ構造)を用いた高速レイトレーシングに使用される。
【】
したがって、これらを、以下の接続された表面情報なしの単一のデータ構造に結合することによって、これらのデータ構造を単純化することが提案される
【】
【】
単位法線ベクトルN
0のデカルト座標を送信する代わりに、値の1つである距離として球面座標を送信する方が効率的であり、定数であり、送信する必要はない。
【】
以下のように、方位角
を12ビットで、仰角
を11ビットで量子化することが提案されている。
面法線N
0の仰角は、以下の通りである。
【】
この量子化スキームは、5°の整数倍及び2の累乗である360°の様々な除算器が量子化グリッド上に直接存在することを保証する。結果として得られる方位角の4032個の量子化ステップ及び仰角の2017個の量子化ステップは、高解像度のために準可逆と見なすことができる。
【】
表面距離dの量子化のために、1mmの分解能を提案する。これは、シーンジオメトリデータを送信するためにも使用されるのと同じ解像度である。
【】
これらの値を送信するために使用される実際のビット数は、以下のセクションで説明されるエントロピーコード化スキームに依存する。
【】
以下では、特定の実施形態によるエントロピーコード化が考慮される。
シンボル分布が均一でない場合、エントロピー符号化を使用して、データの送信に必要なビット量を低減することができる。エントロピーコード化のために広く使用されている方法は、より頻繁なシンボルに対してより小さいコードワードを使用し、より頻繁でないシンボルに対してより長いコードワードを使用するハフマンコード化であり、その結果、平均ワードサイズが小さくなる。最近では算術コード化が普及し、完全なメッセージテキストが一度に符号化される。指向性データの符号化には、例えば適応算術符号化機構が用いられる。この適応方法は、シンボル分布が時間とともに着実に変化している場合に特に有利である。
【】
早期反射メタデータの場合、(あるシンボルは送信の開始時により頻繁に発生し、他のシンボルは送信の終了時により頻繁に発生するような)シンボル分布の時間的な挙動についていかなる仮定もできない。シンボル分布が固定されており、エンコーダの初期化中に判定することができると仮定することがより合理的である。更に、実行時にシンボル分布を調整し、事前に知られているシンボル分布から逸脱するシンボル分布を使用することは、適応算術符号化方法の理論的利益を実際に無効にする。
【】
このため、早期反射メタデータのエントロピーコード化に古典的なハフマンコードを使用することが提案されている。これは、事前定義されたコードブックが使用されること、使用されたコードブックであること、又は対応するシンボルのリストとともにバイナリ復号ツリーが送信されることのいずれかを必要とする。後者は、再帰的アルゴリズムによって効率的に生成することができ、復号ツリーをトラバースし、リーフ、すなわち有効なコードワードを「1」で符号化し、分岐を「0」で符号化する。現在のワードが有効なコードワードではない場合、すなわちアルゴリズムが復号ツリーの分岐にある場合、2回の再帰が実行され、1回は現在のワードが「0」で拡張された左側、もう1回は現在のワードが「1」で拡張された右側である。以下の擬似コードは、復号ツリーの符号化アルゴリズムを示す。
【】
事前定義されたコードブックを使用することは、実際には3つの選択肢のうちの1つであり、すなわち、事前定義されたコードブックを使用すること、又はコードワードリスト及びシンボルリストを含むコードブックを使用すること、又は復号ツリー及びシンボルリストを使用することである。
function traverseTreeEncode(Bitstream reference bs,
List<int> reference symbol_list,
List<bool> code)
{
if (code in codebookInverse) {
bs.append(1);
symbol = codebookInverse[code];
symbol_list.append(symbol);
} else {
bs.append(0);
traverseTreeEncode(bs, symbol_list, code + 0);
traverseTreeEncode(bs, symbol_list, code + 1);
}
}
【】
このアルゴリズムはまた、ツリートラバース順ですべてのシンボルのリストを生成する。デコーダ側で同じメカニズムを使用して、復号ツリートポロジ及び有効なコードワードを抽出することができる。
function traverseTreeDecode(Bitstream reference bs,
List<int> reference code_list,
List<bool> code)
{
bool isLeaf = bs.readBool();
if (isLeaf) {
code_list.append(code);
} else {
traverseTreeDecode(bs, code_list, code + 0);
traverseTreeDecode(bs, code_list, code + 1);
}
}
各コードワード及び各分岐に対して単一のビットのみが費やされるので、これは復号ツリーの非常に効率的な符号化をもたらす。
【】
復号ツリーのトポロジに加えて、シンボルリストは、コードブックの完全な送信のためにツリートラバース順で送信される必要がある。
【】
場合によっては、シンボルに加えてコードブックを送信すると、単純な固定長符号化よりも更に大きいビットストリームが得られることがある。したがって、コードブックを使用してデータを送信するための新しい汎用方法を導入する。本発明者らの提案する方法は、上述の符号化スキームを使用する可変長符号化又は固定長符号化のいずれかを利用する。後者の場合、完全なコードブックの代わりに、ワードサイズ、すなわち各コードワードのビット数のみが送信されなければならない。任意選択で、オフセットとの差がより小さいワードサイズをもたらす場合、シンボルの整数値の共通オフセットがビットストリームにおいて与えられてもよい。以下の関数は、そのような汎用コードブックを解析し、現在のコードブックインスタンスのデータ構造を返す
【】
【】
この実装形態では、キーワード「Bitarray」は、特定の長さのビットシーケンスのエイリアスとして使用される。また、キーワード「append()」は、最後に追加される1つ又は複数の要素によってアレイの長さを拡張する方法を示す。
再帰的に実行されるツリートラバース関数は、以下のように定義される
【】
【】
それらは異なるシンボル分布を有するので、本発明者らは、以下のアレイに個々のコードブックを使用することを提案する。
・earlySurfaceLengthFaceIdx
・earlySurfaceFaceIdx
・earlySurfaceAzi
・earlySurfaceEle
・earlySurfaceDist
・earlyVoxelL(次のセクションを参照)
・earlyVoxelS(次のセクションを参照)
・earlyVoxelIndicesRemovedDiff(次のセクションを参照)
・earlyVoxelNumPaths(次のセクションを参照)
・earlyVoxelOrder(次のセクションを参照)
・earlyVoxelSurf(次のセクションを参照)
以下では、特定の実施形態によるボクセル間冗長性低減について説明する。
【】
早期反射ボクセルデータベースearlyVoxelDatabase[l][s]は、インデックスsを有するボクセル内のソース及びインデックスlを有するボクセル内のリスナーについて潜在的に可視である反射シーケンスのリストを格納する。多くの場合、反射シーケンスのこのリストは、隣接ボクセルについて非常に類似している。このボクセル間冗長性を低減することにより、ビットストリームサイズを大幅に低減することができる。
【】
提案されたボクセル間冗長性低減は、ビットストリーム変数earlyVoxelMode[v]によってシグナリングされる4つの動作モードを使用する。モード0(「参照なし」)では、ソースボクセルearlyVoxelS[v]及びリスナーボクセルearlyVoxelL[v]の反射シーケンスのリストは、変数earlyVoxelNumPaths[v]、earlyVoxelOrder[v][p]、及びearlyVoxelSurf[v][p][o]の汎用コードブックを使用して、パスインデックスp及び順序インデックスoを有するアレイとして送信される。他の動作モードでは、反射シーケンスの参照と現在のリストとの間の差が送信される。
【】
モード1(「x軸基準」)では、現在のソースボクセル及び負のx軸方向に隣接するリスナーボクセルの反射シーケンスのリストが参照として使用される。追加の反射シーケンスのリストとともに、除去される必要がある参照リストのエントリを指定するインデックスのリストが送信される。
【】
モード2(「y軸基準」)は、負のy軸方向に隣接するリスナーボクセルを使用することによってモード1とは異なる。
【】
モード3(「z軸基準」)は、負のz軸方向に隣接するリスナーボクセルを使用することによってモード1とは異なる。
【】
差分のゼロ終端リストearlyVoxelIndicesRemovedDiff[v]が代わりに送信される場合、除去される必要がある参照リストのエントリを指定するインデックスリストearlyVoxelIndicesRemoved[v]をより効率的に符号化することができる。これは、より小さい値がより可能性が高くなり、より大きい値がより可能性が低くなり、より顕著な分布をもたらすため、エントロピーを減少させる。変換は、蓄積を介して実行される
【】
【表】
以下では、汎用コードブックの構文について説明する。
【】
payloadEarlyReflections()のようないくつかのペイロードは、以下の構文を使用してビットストリーム内で定義される個々のコードブックを利用する
【】
【】
コードワードリスト「codeList」は、以下の再帰的ツリートラバーサルアルゴリズムを使用して送信され、キーワード「Bitarray」は、特定の長さのビットシーケンスのエイリアスとして使用される。更に、キーワード「append()」は、最後に追加される1つ又は複数の要素によってアレイの長さを拡張する方法を示す
【】
【】
そのようなコードブックのインスタンス「exampleCodebook」は、以下のように作成される。
exampleCodebook = genericCodebook();
返されるデータ構造のデータフィールドに加えて、汎用コードブックは、ビットストリームから有効なコードワード、すなわちcodeList[]のn番目の要素を読み取り、対応するシンボル、すなわちsymbolList[n]を返す方法「get_symbol()」を有する。この方法の使用は以下のように示される。
exampleVariable = exampleCodebook.get_symbol();
以下では、早期反射ペイロードのための提案された構文が提示される
【】
【】
【】
【表】
以下では、提案されたデータ構造、すなわち早期反射ペイロードデータ構造が提示される。
【】
earlyTriangleCullingDistanceOrder1 1次反射のための三角カリング距離。
earlyTriangleCullingDistanceOrder2 2次反射のための三角カリング距離。
earlySourceCullingDistanceOrder1 1次反射のためのソースカリング距離。
earlySourceCullingDistanceOrder2 2次反射のためのソースカリング距離。
earlyVoxelGridOriginX ボクセルグリッド原点[0,0,0]のデカルト座標のx成分。
earlyVoxelGridOriginY ボクセルグリッド原点[0,0,0]のデカルト座標のy成分。
earlyVoxelGridOriginZ ボクセルグリッド原点[0,0,0]のデカルト座標のz成分。
earlyVoxelGridPitchX x軸に沿ったボクセルグリッド間隔(ボクセル幅)。
earlyVoxelGridPitchY y軸に沿ったボクセルグリッド間隔(ボクセル長さ)。
earlyVoxelGridPitchZ z軸に沿ったボクセルグリッド間隔(ボクセル高さ)。
earlyVoxelGridShapeX x軸に沿ったボクセルの数。
earlyVoxelGridShapeY y軸に沿ったボクセルの数。
earlyVoxelGridShapeZ z軸に沿ったボクセルの数。
earlyHasSurfaceData earlySurfaceDataの存在を示すフラグ。
earlySurfaceDataLength バイト単位のearlySurfaceDataブロックの長さ。
earlyHasVoxelData earlyVoxelDataの存在を示すフラグ。
earlyVoxelDataLength バイト単位のearlySurfaceDataブロックの長さ。
earlySurfaceDistOffset earlySurfaceDistのmmでのオフセット。
numberOfSurfaces 表面の数。
earlySurfaceLengthFaceIdx earlySurfaceFaceIdxのアレイ長さ。
earlySurfaceFaceIdx 三角形IDのリスト。
earlySurfaceAzi 球面座標における面法線を指定する方位角を有するアレイ(ヘッセ標準系)。
earlySurfaceEle 球面座標における面法線を指定する仰角を有するアレイ(ヘッセ標準系)。
earlySurfaceDist 距離値を有するアレイ(ヘッセ標準系)
numberOfVoxelPairs 利用可能なボクセルデータを有するソース及びリスナーボクセルペアの数。
earlyVoxelL リスナーのボクセルインデックスを有するアレイ。
earlyVoxelS ソースのボクセルインデックスを有するアレイ。
earlyVoxelMode ボクセルデータの符号化モードを指定するアレイ。
earlyVoxelIndicesRemovedDiff 除去されるべき参照反射シーケンスリストのインデックスを指定する差分符号化除去リスト。
earlyVoxelNumPaths 反射経路の数。
earlyVoxelOrder 反射順序を指定する2Dアレイ。
earlyVoxelSurf 表面インデックスの3Dアレイとして与えられる反射シーケンス。
【】
以下では、早期反射を考慮したレンダラ段階が提案され、用語及び定義が提供される。
ボクセルグリッド:
レンダラは、ボクセルデータを使用して、反射音伝播経路の計算上複雑な視認性チェックを高速化する。シーンは、各次元に対して個別に定義することができるグリッド間隔を有する規則的なグリッドにラスタライズされる。各ボクセルは固有のボクセルIDによって識別され、スパースデータベースを使用して、所与のソース/リスナーボクセルペアの予め計算されたデータを格納する。関連する変数及びデータ構造は以下の通りである。
・earlyVoxelGridOriginX
・earlyVoxelGridOriginY
・earlyVoxelGridOriginZ
・earlyVoxelGridPitchX
・earlyVoxelGridPitchY
・earlyVoxelGridPitchZ
・earlyVoxelGridShapeX
・earlyVoxelGridShapeY
・earlyVoxelGridShapeZ
これらの変数は、成分として3つの整数を有するボクセル座標V=[vx,vy,vz]Tの基礎である。シーン内に位置する任意の点P=[px,py,pz]Tについて、対応するボクセル座標は、最も近い整数への以下の丸め演算によって計算される
【】
【表】
ボクセル座標は、ボクセルインデックスに変換することができる
【】
【表】
この表現は、例えば、リスナーボクセルIDl及びソースボクセルIDsのスパースボクセルデータベースearlyVoxelDatabase[l][s][p]で使用される。
【】
カリング距離:
エンコーダは、ボクセルデータの事前計算を高速化するためにソース及び/又は三角形距離カリングを使用することができる。カリング距離は、使用されるカリング閾値に達する反射をレンダラが滑らかにフェードアウトすることを可能にするためにビットストリーム内で符号化される。関連する変数及びデータ構造は以下の通りである。
・earlyTriangleCullingDistanceOrder1
・earlyTriangleCullingDistanceOrder2
・earlySourceCullingDistanceOrder1
・earlySourceCullingDistanceOrder2
【】
表面データ:
表面データは、音が反射される反射面を定義する幾何学的データである。関連する変数及びデータ構造は以下の通りである。
・earlySurfaceIdx[s];
・earlySurfaceFaceIdx[s][f];
・earlySurface_N0[s]
・earlySurface_d[s]
【】
表面インデックスearlySurfaceIdx[s]は、表面を識別し、スパースボクセルデータベースearlyVoxelDatabase[l][s][p]によって参照される。三角形IDリストearlySurfaceFaceIdx[s][f]は、この表面に属する静的メッシュの三角形を定義する。これらの三角形のうちの1つは、鏡面反射の視認性試験に成功するためにヒットしなければならない。各表面の反射面は、以下のように変換された面法線N0及び表面距離dを使用して、ヘッセ標準系で与えられる。
int max_steps_azi = 1 << 12;
int max_steps_ele = 1 << 11;
int num_steps_azi = 144 * (max_steps_azi / 144);
int num_steps_ele = 72 * (max_steps_ele / 72);
int shift_ele = num_steps_ele / 2;
float quant2azi = double(2.0 * M_PI) / double(num_steps_azi);
float quant2ele = double(M_PI) / double(num_steps_ele);
float quant2dist = 0.001f;
for (int s = 0; s < numberOfSurfaces; s++) {
earlySurfaceIdx[s] = s;
float azi = earlySurfaceAzi[s] * quant2azi;
float ele = (earlySurfaceEle[s] - shift_ele) * quant2ele;
earlySurface_N0[s][0] = -1.0 * sin(azi) * cos(ele);
earlySurface_N0[s][1] = sin(ele);
earlySurface_N0[s][2] = -1.0 * cos(azi) * cos(ele);
earlySurface_d[s] = (earlySurfaceDist[s] + dist_offset) * quant2dist;
【】
ボクセルデータ
早期反射ボクセルデータは、所与のソースボクセルとリスナーボクセルのペアについての潜在的に可視の画像ソースの反射シーケンスのリストを含むスパースボクセルデータベースである。データベースのエントリは、所与のソースボクセルとリスナーボクセルのペアがビットストリームで指定されていない場合には未定義にすることができ、空のリストにすることもでき、表面接続IDのリストを含むこともできる。関連する変数及びデータ構造は以下の通りである。
・numberOfVoxelPairs
・earlyVoxelL[v]
・earlyVoxelS[v]
・earlyVoxelMode[v]
・earlyVoxelIndicesRemovedDiff[v][k]
・earlyVoxelNumPaths[v]
・earlyVoxelOrder[v][p]
・earlyVoxelSurf[v][p][o]
【】
スパースボクセルデータベースearlyVoxelDatabase[l][s][p]は、以下のアルゴリズムによってこれらの変数から導出される。
int delta_x = voxelCoordinateToVoxelIndex( {1, 0, 0} );
int delta_y = voxelCoordinateToVoxelIndex( {0, 1, 0} );
int delta_z = voxelCoordinateToVoxelIndex( {0, 0, 1} );
int delta_list[4] = { 0, -delta_x, -delta_y, -delta_z };
for (int v = 0; v < numberOfVoxelPairs; v++) {
PathList path_list;
int l = earlyVoxelL[v];
int s = earlyVoxelS[v];
int mode = earlyVoxelMode[v];
if (mode != 0) {
int l_ref = l + delta_list[mode];
path_list = earlyVoxelDatabase[l_ref][s];
// generate list with removed items in reverse order
int numberOfIndicesRemoved =
length(earlyVoxelIndicesRemovedDiff[v]) - 1;
int listIndicesRemoved[numberOfIndicesRemoved];
int val = -1;
for (int k = 0; k < numberOfIndicesRemoved; k++) {
val += earlyVoxelIndicesRemovedDiff[v][k];
listIndicesRemoved[numberOfIndicesRemoved - 1 - k] = val;
}
// remove reflection sequences
for (int k = 0; k < numberOfIndicesRemoved; k++) {
path_list.erase(listIndicesRemoved[k]);
}
}
// add reflection sequences
for (int p = 0; p < earlyVoxelNumPaths[v]; p++) {
path_list.append(earlyVoxelSurf[v][p]);
}
// add sorted path list to sparse voxel database
path_list = shortlex_sort(path_list);
int num_paths = length(path_list);
for (int p = 0; p < num_paths; p++) {
earlyVoxelDatabase[l][s][p] = path_list[p];
}
}
【】
このアルゴリズムでは、関数voxelCoordinateToVoxelIndex()は、ボクセル座標からボクセルインデックスへの変換を表す。キーワードPathListは、リストの最後に要素を追加するメソッドappend()、及び所与の位置にあるリスト要素を削除するメソッドerase()によって変更できる整数アレイのリストを表す。また、関数shortlex_sort()は、与えられた反射シーケンスのリストをshortlex順にソートするソート関数を表す。
【】
複雑性評価
レンダラのランタイム複雑度が提案された変更の影響を受けない一方で、JSONデータの解析ステップがもはや必要とされないので、デコーダは単純化される。
メリットの根拠
提案された方法が正しく機能することを検証し、その技術的利点を証明するために、すべての「テスト1」及び「テスト2」シーンを符号化し、早期反射メタデータのサイズをP13エンコーダの符号化結果と比較した。
【】
データ圧縮
表2は、P13エンコーダのpayloadEarlyReflectionsのサイズ(「旧サイズ/バイト」)と、提案された符号化方法を用いるP13エンコーダの変形例(「新サイズ/バイト」)とを列挙している。最後の列は、達成された圧縮比、すなわち古いペイロードサイズと新しいペイロードサイズとの比を列挙している。
【】
すべての場合において、提案された方法は、より小さいペイロードサイズをもたらす。シーンオブジェクトを反映するすべてのシーン、すなわちメッシュデータを有するシーンでは、10を超える圧縮率が達成された。いくつかのシーン(「SingerInTheLab」及び「VirtualBasketball」)では、100に近い又は更にはそれを超える圧縮比が達成された
【】
【表】
以下では、総ビットストリーム節約が考慮される。
【】
以下の表は、総ビットストリームサイズの節約をパーセントで列挙する。平均して、総ビットストリームサイズは21.33%減少した。メッシュデータを有するシーンのみを考慮すると、総ビットストリームサイズは平均で28.91%減少した
【】
【】
データ検証及び量子化誤差
以下の表は、すべての「テスト4」シーンと、公式テストリポジトリに入らなかった更なるシーンとを更に含む拡張テストセットのデータ検証テストの結果を列挙しており、復号されたメタデータ、例えばearlySurfaceData及びearlyVoxelDataをP13デコーダの出力と比較している。P13ペイロードについては、新しい符号化方法と比較できるようにするために、接続された表面データと表面データとを組み合わせた。検証結果「同一構造」は、両方のペイロードが同じ反射表面を有し、データが予想される量子化誤差だけ異なることを意味する。
【】
すべてのシーンについて、復号されたearlyVoxelDataは同一であり、復号されたearlySurfaceDataは同一又は構造的に同一のいずれかであった
【】
【】
以下の表は、デカルト座標への変換後の透過平面法線N0のmmでの最小、平均、中央値、及び最大量子化誤差を列挙する。1.095mmの最大量子化誤差は、0.063°の角度偏差に対応する。量子化段階ごとに0.088°の分解能、したがって軸ごとに0.044°の最大量子化誤差を用いると、観察された結果は理論値と良好に一致する。
【】
面法線ベクトルN0の0.063°の最大角度偏差は非常に小さいため、透過率は準無損失と見なすことができる
【】
【】
以下の表は、透過面距離のmmでの最小、平均、中央値、及び最大量子化誤差を列挙する。量子化段階ごとに1mmの分解能では、0.519mmの観察された最大偏差は、0.5mmの予想最大値と良好に一致する。オーバーシュートは、「パーク」、「パーキングロット」、及び「レクリエーション」のような大規模シーンに十分なサブミリメートル分解能を提供しない、使用される単精度浮動小数点変数の限定された精度によって説明することができる。
【】
表面距離dの最大偏差0.519mmは非常に小さいため、透過率は準無損失と見なすことができる
【】
【】
一実施形態では、payloadEarlyReflections()内の早期反射メタデータの一部としてのearlySurfaceData()及びearlyVoxelData()のためのバイナリ符号化方法が提供される。30個のAR及びVRシーンを含むテストセットについて、復号されたデータをP13デコーダによって復号されたデータと比較し、予想される量子化誤差のみが観察された。表面データの量子化誤差は非常に小さかったため、透過率は準無損失と見なすことができる。送信されたボクセルデータは同一であった。
【】
すべての場合において、提案された方法は、より小さいペイロードサイズをもたらす。シーンオブジェクトを反映するすべてのシーン、すなわちメッシュデータを有するシーンでは、10を超える圧縮率が達成された。いくつかのシーン(「SingerInTheLab」及び「VirtualBasketball」)では、100に近い又は更にはそれを超える圧縮比が達成された。すべての「テスト1」及び「テスト2」シーンについて、提案された符号化方法は、P13を超える全体的なビットストリームサイズの平均で21.33%の低減を提供する。メッシュデータを反映するシーンのみを考慮すると、提案された符号化方法は、P13を超える全体的なビットストリームサイズの平均で28.91%の低減を提供する。
【】
提案された符号化方法は、レンダラのランタイム複雑度に影響を及ぼさない。
更に、提案された置換はまた、JSONドキュメントの生成及び解析がもはや必要とされないため、参照ソフトウェアのライブラリ依存性を低減する。
【】
いくつかの態様を装置の文脈で説明したが、これらの態様は対応する方法の説明も表すことは明らかであり、ブロック又はデバイスは方法ステップ又は方法ステップの特徴に対応する。同様に、方法ステップの文脈で説明される態様はまた、対応する装置の対応するブロック又は項目又は特徴の説明を表す。方法ステップのいくつか又はすべては、例えばマイクロプロセッサ、プログラマブルコンピュータ、又は電子回路などのハードウェア装置によって(又は使用して)実行されてもよい。いくつかの実施形態では、最も重要な方法ステップの1つ又は複数は、そのような装置によって実行されてもよい。
【】
特定の実装要件に応じて、ハードウェア若しくはソフトウェアで、又は少なくとも部分的にハードウェアで、又は少なくとも部分的にソフトウェアで実装することができる。実装は、電子的に読み取り可能な制御信号が格納されたデジタル記憶媒体、例えばフロッピーディスク、DVD、Blu-Ray、CD、ROM、PROM、EPROM、EEPROM又はフラッシュメモリを使用して実行することができ、これらはそれぞれの方法が実行されるようにプログラム可能なコンピュータシステムと協働する(又は協働することができる)。したがって、デジタル記憶媒体はコンピュータ可読であってもよい。
【】
本発明によるいくつかの本明細書に記載の方法のうちの1つが実行されるように、プログラム可能なコンピュータシステムと協働することができる電子的に読み取り可能な制御信号を有するデータキャリアを含む。
【】
一般に、プログラムコードを有するコンピュータプログラム製品として実装することができ、プログラムコードは、コンピュータプログラム製品がコンピュータ上で実行されるときに方法のうちの1つを実行するように動作する。プログラムコードは、例えば、機械可読キャリアに格納することができる。
【】
他の機械可読キャリアに格納された、本明細書に記載の方法の1つを実行するためのコンピュータプログラムを含む。
【】
言い換えれば、したがって、本発明の方法の一コンピュータプログラムがコンピュータ上で実行されるときに、本明細書に記載の方法のうちの1つを実行するためのプログラムコードを有するコンピュータプログラムである。
【】
したがって、本発明の方法の更なる本明細書に記載の方法の1つを実行するためのコンピュータプログラムを記録して含むデータキャリア(又はデジタル記憶媒体、又はコンピュータ可読媒体)である。データキャリア、デジタル記憶媒体、又は記録媒体は、通常、有形及び/又は非一時的である。
【】
したがって、本発明の方法の更なる本明細書に記載の方法のうちの1つを実行するためのコンピュータプログラムを表すデータストリーム又は信号シーケンスである。データストリーム又は信号シーケンスは、例えば、データ通信接続を介して、例えばインターネットを介して転送されるように構成することができる。
【】
更なる本明細書に記載の方法のうちの1つを実行するように構成又は適合された処理手段、例えばコンピュータ又はプログラマブル論理デバイスを含む。
【】
更なる本明細書に記載の方法の1つを実行するためのコンピュータプログラムがインストールされたコンピュータを含む。
【】
本発明による更なる本明細書に記載の方法のうちの1つを実行するためのコンピュータプログラムを受信機に転送する(例えば、電子的又は光学的に)ように構成された装置又はシステムを備える。受信機は、例えば、コンピュータ、モバイルデバイス、メモリデバイスなどであってもよい。装置又はシステムは、例えば、コンピュータプログラムを受信機に転送するためのファイルサーバを備えることができる。
【】
いくつかの実施形態では、プログラマブル論理デバイス(例えば、フィールドプログラマブルゲートアレイ)を使用して、本明細書に記載の方法の機能の一部又はすべてを実行することができる。いくつかの実施形態では、フィールドプログラマブルゲートアレイは、本明細書に記載の方法のうちの1つを実行するためにマイクロプロセッサと協働することができる。一般に、方法は、任意のハードウェア装置によって実行されることが好ましい。
【】
本明細書に記載の装置は、ハードウェア装置を使用して、又はコンピュータを使用して、又はハードウェア装置とコンピュータとの組み合わせを使用して実装され得る。
【】
本明細書に記載の方法は、ハードウェア装置を使用して、又はコンピュータを使用して、又はハードウェア装置とコンピュータとの組み合わせを使用して実行され得る。
【】
上述の本発明の原理の単なる例示である。本明細書に記載の構成及び詳細の修正及び変形は、当業者には明らかであることが理解される。したがって、本明細書の実施形態の記載及び説明として提示される特定の詳細によってではなく、係属中の特許請求の範囲によってのみ限定されることが意図されている。
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【図】
【手続補正書】
【提出日】
【手続補正】
【補正対象書類名】特許請求の範囲
【補正対象項目名】全文
【補正方法】変更
【補正の内容】
【特許請求の範囲】
【請求項】
1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための装置(100)であって、前記装置(100)が、
符号化された追加のオーディオ情報がエントロピー符号化される場合に、復号された追加のオーディオ情報を取得するために、前記符号化された追加のオーディオ情報を復号するための少なくとも1つのエントロピー復号モジュール(110;116,118)と、
前記1つ又は複数の符号化されたオーディオ信号に応じて、かつ前記復号された追加のオーディオ情報に応じて、前記1つ又は複数のオーディオ出力信号を生成するための信号プロセッサ(120)と、を備えている、装置(100)。
【請求項】
前記装置(100)が、
前記符号化された追加のオーディオ情報がエントロピー符号化されていない場合に、前記復号された追加のオーディオ情報を取得するために、前記符号化された追加のオーディオ情報を復号するための少なくとも1つの非エントロピー復号モジュール(111)と、
前記符号化された追加のオーディオ情報がエントロピー符号化されているか否かに応じて、前記符号化された追加のオーディオ情報を復号するために、前記少なくとも1つのエントロピー復号モジュール(110;116,118)と、前記少なくとも1つの非エントロピー復号モジュール(111)と、のうちの1つを選択するためのセレクタ(115)と、
を更に、備えている、請求項1に記載の装置(100)。
【請求項】
前記符号化された追加のオーディオ情報が、拡張現実データ又は仮想現実データを含む、
請求項1に記載の装置(100)。
【請求項】
前記符号化された追加のオーディオ情報が、現実リスニング環境に依存するか、又は仮想リスニング環境に依存するか、又は拡張リスニング環境に依存する、
請求項1に記載の装置(100)。
【請求項】
前記符号化された追加のオーディオ情報が、前記現実リスニング環境又は前記仮想リスニング環境又は前記拡張リスニング環境における1つ又は複数の伝播経路に沿った1つ又は複数の音波の1つ又は複数の伝播に依存する伝播情報を含む、
請求項4に記載の装置(100)。
【請求項】
前記伝播情報が、前記現実リスニング環境又は前記仮想リスニング環境又は前記拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の反射物体における1つ又は複数の反射に依存する反射情報である、
請求項5に記載の装置(100)。
【請求項】
前記伝播情報が、前記現実リスニング環境又は前記仮想リスニング環境又は前記拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の回折物体における1つ又は複数の回折に依存する回折情報である、
請求項5に記載の装置(100)。
【請求項】
前記符号化された追加のオーディオ情報が、早期反射をレンダリングするためのデータを含み、
前記信号プロセッサ(120)が、早期反射をレンダリングするための前記データに応じて前記1つ又は複数のオーディオ出力信号を生成するように構成されている、
請求項1に記載の装置(100)。
【請求項】
前記信号プロセッサ(120)が、前記1つ又は複数のオーディオ出力信号として2つのバイノーラルチャネルを含むバイノーラル信号を生成するように構成されている、
請求項1に記載の装置(100)。
【請求項】
前記少なくとも1つのエントロピー復号モジュール(110;116,118)が、前記符号化された追加のオーディオ情報がハフマン符号化されている場合に前記符号化された追加のオーディオ情報を復号するためのハフマン復号モジュール(116)を備えている、
請求項1に記載の装置(100)。
【請求項】
前記少なくとも1つのエントロピー復号モジュール(110;116,118)が、前記符号化された追加のオーディオ情報が算術的に符号化されている場合に前記符号化された追加のオーディオ情報を復号するための算術復号モジュール(118)を備えている、
請求項1に記載の装置(100)。
【請求項】
前記セレクタ(115)が、前記符号化された追加のオーディオ情報を復号するために、前記少なくとも1つの非エントロピー復号モジュール(111)と、前記ハフマン復号モジュール(116)と、前記算術復号モジュール(118)と、のうちの1つを選択するように構成されている、
請求項2に記載の装置(100)。
【請求項】
前記少なくとも1つの非エントロピー復号モジュール(111)が、前記符号化された追加のオーディオ情報が固定長符号化されている場合に前記符号化された追加のオーディオ情報を復号するための固定長復号モジュールを備えている、
請求項2に記載の装置(100)。
【請求項】
前記装置(100)が選択情報を受信するように構成されており、
前記セレクタ(115)が、前記選択情報に応じて、前記少なくとも1つのエントロピー復号モジュール(110;116,118)と、前記少なくとも1つの非エントロピー復号モジュール(111)と、のうちの1つを選択するように構成されている、
請求項2に記載の装置(100)。
【請求項】
前記装置(100)が、前記符号化された追加のオーディオ情報が依存するコードブック又はコード化ツリーを受信するように構成されており、
前記少なくともエントロピー復号モジュール(110;116,118)が、前記コードブックを使用して、又は前記コード化ツリーを使用して、前記符号化された追加のオーディオ情報を復号するように構成されている、
請求項1に記載の装置(100)。
【請求項】
前記装置(100)が、前記符号化された追加のオーディオ情報が依存する前記コード化ツリーの構造の符号化を受信するように構成されており、
前記少なくともエントロピー復号モジュール(110;116,118)が、前記コード化ツリーの前記構造に応じて前記コード化ツリーの複数のコードワードを再構築するように構成されており、
前記少なくともエントロピー復号モジュール(110;116,118)が、前記コード化ツリーの前記コードワードを使用して、前記符号化された追加のオーディオ情報を復号するように構成されている、
請求項15に記載の装置(100)。
【請求項】
前記装置(100)が、コードブック又はコード化ツリーを格納したメモリを更に備え、
前記少なくともエントロピー復号モジュール(110;116,118)が、前記コードブックを使用して、又は前記コード化ツリーを使用して、前記符号化された追加のオーディオ情報を復号するように構成されている、
請求項1に記載の装置(100)。
【請求項】
前記装置(100)が、複数の送信されたシンボル及びオフセット値を含む前記符号化された追加のオーディオ情報を受信するように構成されており、
前記少なくとも1つの非エントロピー復号モジュール(111)が、前記複数の送信されたシンボルを使用して、かつ前記オフセット値を使用して、前記符号化された追加のオーディオ情報を復号するように構成されている、
請求項1に記載の装置(100)。
【請求項】
早期反射をレンダリングするための前記データが、環境内の1つ又は複数の現実壁又は仮想壁である1つ又は複数の壁の位置に関する情報を含み、
前記信号プロセッサ(120)が、1つ又は複数の壁の前記位置に関する前記情報に応じて前記1つ又は複数のオーディオ出力信号を生成するように構成されている、
請求項8に記載の装置(100)。
【請求項】
前記1つ又は複数の壁の各壁に関する前記情報が、前記壁の方位角及び/又は仰角に関する情報を含み、前記壁の前記方位角がエントロピー符号化され、かつ/又は前記壁の前記仰角がエントロピー符号化され、
前記少なくとも1つのエントロピー復号モジュール(110;116,118)の1つ又は複数のエントロピー復号モジュールが、前記壁のエントロピー符号化された方位角及び/又は前記壁のエントロピー符号化された仰角を復号するように構成されている、
請求項19に記載の装置(100)。
【請求項】
前記1つ又は複数の壁の各壁に関する前記情報が、前記壁の方位角及び/又は仰角に関する情報を含み、前記壁の前記方位角がエントロピー符号化され、かつ/又は前記壁の前記仰角がエントロピー符号化され、
前記少なくとも1つのエントロピー復号モジュール(110;116,118)の1つ又は複数のエントロピー復号モジュールが、前記壁のエントロピー符号化された方位角及び/又は前記壁のエントロピー符号化された仰角を復号するように構成されている、
前記少なくとも1つのエントロピー復号モジュール(110;116,118)の前記1つ又は複数が、前記コードブック又は前記コード化ツリーを使用して、前記壁の前記エントロピー符号化された方位角及び/又は前記壁の前記エントロピー符号化された仰角を復号するように構成されている、
請求項15に記載の装置(100)。
【請求項】
前記符号化された追加のオーディオ情報が、ボクセル位置情報を含み、前記位置情報が、3次元座標系内の複数のボクセルのうちの1つ又は複数のボクセルの1つ又は複数の位置に関する情報を含み、
前記信号プロセッサ(120)が、前記ボクセル位置情報に応じて前記1つ又は複数のオーディオ出力信号を生成するように構成されている、
請求項1に記載の装置(100)。
【請求項】
前記少なくとも1つのエントロピー復号モジュール(110;116,118)が、エントロピー符号化されている符号化された追加のオーディオ情報を復号するように構成されており、エントロピー符号化されている前記符号化された追加のオーディオ情報が、
三角形インデックスのリストと、
三角形インデックスのリストのアレイ長さと、
球面座標における面法線を指定する方位角を有するアレイと、
球面座標における面法線を指定する仰角を有するアレイと、
距離値を有するアレイと、
リスナーの位置を有するアレイと、
1つ又は複数の音源の位置を有するアレイと、
除去されるべき反射シーケンスのセット又は除去されるべき参照反射シーケンスリストの反射シーケンスのインデックスを指定する除去リスト又は除去セットと、
反射シーケンスの数又は反射経路の数と、
反射次数を指定するアレイと、
反射シーケンスと、
の少なくとも1つを含む、請求項1に記載の装置(100)。
【請求項】
1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための装置(200)であって、前記装置(200)が、
前記1つ又は複数のオーディオ信号を符号化して1つ又は複数の符号化されたオーディオ信号を得るオーディオ信号エンコーダ(210)と、
符号化された追加のオーディオ情報を取得するためにエントロピー符号化を使用して前記追加のオーディオ情報を符号化するための少なくとも1つのエントロピー符号化モジュール(220)と、を備えている、装置(200)。
【請求項】
前記装置(200)が、
前記符号化された追加のオーディオ情報を取得するために前記追加のオーディオ情報を符号化するための少なくとも1つの非エントロピー符号化モジュール(221)と、
符号化されるべき前記追加のオーディオ情報内のシンボル分布に応じて、前記追加のオーディオ情報を符号化するために、前記少なくとも1つのエントロピー符号化モジュール(220)と、前記少なくとも1つの非エントロピー符号化モジュール(221)と、のうちの1つを選択するためのセレクタ(215)と、
を更に備えている、請求項24に記載の装置(200)。
【請求項】
前記符号化された追加のオーディオ情報が拡張現実データ又は仮想現実データを備えている、
請求項24に記載の装置(200)。
【請求項】
前記符号化された追加のオーディオ情報が、現実リスニング環境に依存するか、又は仮想リスニング環境に依存するか、又は拡張リスニング環境に依存する、
請求項24に記載の装置(200)。
【請求項】
前記符号化された追加のオーディオ情報が、前記現実リスニング環境又は前記仮想リスニング環境又は前記拡張リスニング環境における1つ又は複数の伝播経路に沿った1つ又は複数の音波の1つ又は複数の伝播に依存する伝播情報を含む、
請求項27に記載の装置(200)。
【請求項】
前記伝播情報が、前記現実リスニング環境又は前記仮想リスニング環境又は前記拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の反射物体における1つ又は複数の反射に依存する反射情報である、
請求項28に記載の装置(200)。
【請求項】
前記伝播情報が、前記現実リスニング環境又は前記仮想リスニング環境又は前記拡張リスニング環境の1つ又は複数の伝播経路に沿って伝播する1つ又は複数の音波の1つ又は複数の回折物体における1つ又は複数の回折に依存する回折情報である、
請求項28に記載の装置(200)。
【請求項】
前記符号化された追加のオーディオ情報が、早期反射をレンダリングするためのデータを含む、
請求項24に記載の装置(200)。
【請求項】
前記少なくとも1つのエントロピー符号化モジュール(220)が、ハフマン符号化を使用して前記追加のオーディオ情報を符号化するためのハフマン符号化モジュール(226)を備えている、
請求項24に記載の装置(200)。
【請求項】
前記少なくとも1つのエントロピー符号化モジュール(220)が、算術符号化を使用して前記追加のオーディオ情報を符号化するための算術符号化モジュール(228)を備えている、
請求項24に記載の装置(200)。
【請求項】
前記セレクタ(215)が、前記追加のオーディオ情報を符号化するために、前記少なくとも1つの非エントロピー符号化モジュール(221)と、前記ハフマン符号化モジュール(226)と、前記算術符号化モジュール(228)と、のうちの1つを選択するように構成されている、
請求項25に記載の装置(200)。
【請求項】
前記少なくとも1つの非エントロピー符号化モジュール(221)が、前記追加のオーディオ情報を符号化するための固定長符号化モジュールを備えている、請求項25に記載の装置(200)。
【請求項】
前記装置(200)が、前記追加のオーディオ情報を符号化するために採用された前記少なくとも1つのエントロピー符号化モジュール(220)と、前記少なくとも1つの非エントロピー符号化モジュール(221)と、のうちの1つを示す選択情報を生成するように構成されている、
請求項25に記載の装置(200)。
【請求項】
前記装置(200)が、前記追加のオーディオ情報を符号化するために採用されているコードブック又はコード化ツリーを送信するように構成されている、
請求項24に記載の装置(200)。
【請求項】
前記装置(200)が、前記符号化された追加のオーディオ情報が依存する前記コード化ツリーの構造の符号化を送信するように構成されている、
請求項37に記載の装置(200)。
【請求項】
前記装置(200)が、コードブック又はコード化ツリーを格納したメモリを更に備え、
前記少なくともエントロピー復号モジュール(220)が、前記コードブックを使用して、又は前記コード化ツリーを使用して、前記符追加のオーディオ情報を符号化するように構成されている、
請求項24に記載の装置(200)。
【請求項】
前記少なくとも1つのエントロピー符号化モジュール(220)が、前記符号化された追加のオーディオ情報が複数の送信されたシンボル及びオフセット値を備えるように前記追加のオーディオ情報を符号化するように構成されている、
請求項24に記載の装置(200)。
【請求項】
早期反射をレンダリングするための前記データが、環境内の1つ又は複数の現実壁又は仮想壁である1つ又は複数の壁の位置に関する情報を含む、
請求項31に記載の装置(200)。
【請求項】
前記1つ又は複数の壁の各壁に関する前記情報が、前記壁の方位角及び/又は仰角に関する情報を含み、前記壁の前記方位角がエントロピー符号化され、かつ/又は前記壁の前記仰角がエントロピー符号化され、
前記少なくとも1つのエントロピー符号化モジュール(220)の1つ又は複数のエントロピー符号化モジュールが、前記符号化された追加のオーディオ情報が前記壁のエントロピー符号化された方位角及び/又は前記壁のエントロピー符号化された仰角を備えるように、前記追加のオーディオ情報を符号化するように構成されている、
請求項41に記載の装置(200)。
【請求項】
前記1つ又は複数の壁の各壁に関する前記情報が、前記壁の方位角及び/又は仰角に関する情報を含み、前記壁の前記方位角がエントロピー符号化され、かつ/又は前記壁の前記仰角がエントロピー符号化され、
前記少なくとも1つのエントロピー符号化モジュール(220)の1つ又は複数のエントロピー符号化モジュールが、前記符号化された追加のオーディオ情報が前記壁のエントロピー符号化された方位角及び/又は前記壁のエントロピー符号化された仰角を備えるように、前記追加のオーディオ情報を符号化するように構成されており、
前記1つ又は複数のエントロピー符号化モジュールが、前記コードブック又は前記コード化ツリーを使用して、前記壁の前記エントロピー符号化された方位角及び/又は前記壁の前記エントロピー符号化された仰角を符号化するように構成されている、
請求項37に記載の装置(200)。
【請求項】
前記符号化された追加のオーディオ情報が、ボクセル位置情報を含み、前記位置情報が、3次元座標系内の複数のボクセルのうちの1つ又は複数のボクセルの1つ又は複数の位置に関する情報を含む、
請求項24に記載の装置(200)。
【請求項】
前記少なくとも1つのエントロピー復号モジュール(220)が、前記エントロピー符号化を使用して、前記符追加のオーディオ情報を符号化するように構成されており、前記符号化された追加のオーディオ情報が、
三角形インデックスのリストと、
三角形インデックスのリストのアレイ長さと、
球面座標における面法線を指定する方位角を有するアレイと、
球面座標における面法線を指定する仰角を有するアレイと、
距離値を有するアレイと、
リスナーの位置を有するアレイと、
1つ又は複数の音源の位置を有するアレイと、
除去されるべき反射シーケンスのセット又は除去されるべき参照反射シーケンスリストの反射シーケンスのインデックスを指定する除去リスト又は除去セットと、
反射シーケンスの数又は反射経路の数と、
反射次数を指定するアレイと、
反射シーケンスと、
の少なくとも1つを含む、請求項24に記載の装置(200)。
【請求項】
1つ又は複数の符号化されたオーディオ信号及び符号化された追加のオーディオ情報を取得するために、1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための、請求項24に記載の装置(200)と、
前記1つ又は複数の符号化されたオーディオ信号から、前記符号化された追加のオーディオ情報に応じて1つ又は複数のオーディオ出力信号を生成するための、請求項1に記載の装置(100)と、
を備えたシステム。
【請求項】
1つ又は複数の符号化されたオーディオ信号から1つ又は複数のオーディオ出力信号を生成するための方法であって、前記方法が、
符号化された追加のオーディオ情報がエントロピー符号化される場合に、復号された追加のオーディオ情報を取得するために、前記符号化された追加のオーディオ情報を復号することと、
前記1つ又は複数の符号化されたオーディオ信号に応じて、かつ前記復号された追加のオーディオ情報に応じて、前記1つ又は複数のオーディオ出力信号を生成することと、を含む、方法。
【請求項】
1つ又は複数のオーディオ信号及び追加のオーディオ情報を符号化するための方法であって、前記方法が、
前記1つ又は複数のオーディオ信号を1つ又は複数の符号化されたオーディオ信号に符号化することと、
符号化された追加のオーディオ情報を取得するためにエントロピー符号化を使用して前記追加のオーディオ情報を符号化することと、を含む、方法。
【請求項】
コンピュータ又は信号プロセッサ上で実行される場合に、請求項47又は48に記載の方法を実施するためのコンピュータプログラム。
【国際調査報告】