(19)【発行国】日本国特許庁(JP)
(12)【公報種別】公表特許公報(A)
(11)【公表番号】
(43)【公表日】
(54)【発明の名称】QoSベース無線通信システムを使用し制御サーバにより被制御デバイスを制御する方法
(51)【国際特許分類】
【FI】
【審査請求】有
【予備審査請求】未請求
(21)【出願番号】
(86)(22)【出願日】
(85)【翻訳文提出日】
(86)【国際出願番号】
(87)【国際公開番号】
(87)【国際公開日】
(32)【優先日】
(33)【優先権主張国・地域又は機関】
(81)【指定国・地域】
【公序良俗違反の表示】
(特許庁注:以下のものは登録商標)
(71)【出願人】
【識別番号】503163527
【氏名又は名称】ミツビシ・エレクトリック・アールアンドディー・センター・ヨーロッパ・ビーヴィ
【氏名又は名称原語表記】MITSUBISHI ELECTRIC R&D CENTRE EUROPE B.V.
【住所又は居所原語表記】Capronilaan 34,1119 NS Schiphol Rijk,The Netherlands
(74)【代理人】
【識別番号】100161207
【氏名又は名称】西澤 和純
(74)【代理人】
【識別番号】100206081
【氏名又は名称】片岡 央
(74)【代理人】
【識別番号】100188673
【氏名又は名称】成田 友紀
(74)【代理人】
【識別番号】100188891
【氏名又は名称】丹野 拓人
(72)【発明者】
【氏名】バウトティア アーノー
(72)【発明者】
【氏名】コーレー ビンセント
【テーマコード(参考)】
【Fターム(参考)】
5K067AA33
5K067EE02
5K067EE10
5K067GG06
(57)【要約】
制御サーバによって実行される、被制御デバイスを制御する方法に関し、当該方法が、
-被制御デバイスへ制御コマンドを送信するための少なくとも2つのQoSフローを確立することであって、当該少なくとも2つのQoSフローが、第1のQoSフローと第2のQoSフローとを含み、第1のQoSフローが、第2のQoSフローに関連付けられたQoSレベルより大きいQoSレベルに関連付けられる、確立することと、
-被制御デバイスへ送信される制御コマンドを判断することと、
-確立された少なくとも2つのQoSフローの中から、制御コマンドを送信するのに使用されるQoSフローを選択することと、
-選択されたQoSフローを使用して、無線通信システムを介して、少なくとも1つの被制御デバイスへ制御コマンドを送信することと、を含む。
【特許請求の範囲】
【請求項】
制御サーバ(30)によって実行される、被制御デバイス(20)を制御する方法(40)であって、前記制御が、無線通信システム(70)を使用して前記被制御デバイスへ制御コマンドを送信することによって前記被制御デバイスにタスクを実行させることを目的とし、前記無線通信システムが、それぞれの異なるQoSレベルに関連付けられた異なるサービス品質QoSフローの確立をサポートし、前記制御方法(40)が、
-前記被制御デバイスへ制御コマンドを送信するための少なくとも2つのQoSフローを確立すること(S40)と、前記少なくとも2つのQoSフローが、第1のQoSフローと第2のQoSフローとを含み、前記第1のQoSフローが、前記第2のQoSフローに関連付けられたQoSレベルより大きいQoSレベルに関連付けられ、
-前記被制御デバイスへ送信される制御コマンドを判断すること(S41)と、
-確立された前記少なくとも2つのQoSフローの中から、前記制御コマンドを送信するのに使用されるQoSフローを選択すること(S42)と、
-前記選択されたQoSフローを使用して、前記無線通信システムを介して、少なくとも1つの前記被制御デバイスへ前記制御コマンドを送信すること(S43)と、を含み、
前記少なくとも2つのQoSフローが、第1のQoSフローと第2のQoSフローとを含み、前記第1のQoSフローが、前記第2のQoSフローに関連付けられたQoSレベルより大きいQoSレベルに関連付けられる
方法(40)。
【請求項】
前記被制御デバイスによって実行される前記タスクは、それぞれのQoSレベル要件が関連付けられた複数の連続する段階を含み、前記QoSフローを選択することは、確立された前記少なくとも2つのQoSフローのうち、前記タスクの前記現在段階に必要な前記QoSレベルと適合するQoSレベルを提供するという点で前記タスクの前記現在段階と適合するQoSフローがいずれかを特定することを含み、前記選択されるQoSフローは、前記タスクの前記現在段階と適合すると特定されたQoSフローに一致する、請求項1に記載の制御方法(40)。
【請求項】
前記QoSフローを選択することは、
-前記無線通信システムが輻輳しているかどうか、または輻輳寸前であるかどうかを評価することと、
-前記無線通信システムが輻輳していること、または輻輳寸前であることを検出したことに応じて、前記QoSフローの前記選択中に前記第1のQoSフローを考慮しないことと、を含む、請求項1または2に記載の制御方法(40)。
【請求項】
前記被制御デバイスによって実行される前記タスクの現在段階に必要なQoSレベルが、確立された前記少なくとも2つのQoSフローのうちの前記第1のQoSフロー以外のQoSフローによっても提供される場合にのみ、前記無線通信システムが輻輳していること、または輻輳寸前であることを検出したことに応じて、前記QoSフローの前記選択中に前記第1のQoSフローが考慮されない、請求項3に記載の制御方法(40)。
【請求項】
前記第1のQoSフローは、前記タスクの前記現在段階に必要な前記QoSレベルが、確立された前記少なくとも2つのQoSフローのうちの別のQoSフローによって提供されないと判断された場合にのみ使用される、請求項2に記載の制御方法(40)。
【請求項】
前記被制御デバイスから制御フィードバックを受信すること(S44)をさらに含み、前記QoSフローは、前記受信された制御フィードバックに基づいて選択される、請求項1から5のいずれか一項に記載の制御方法(40)。
【請求項】
前記QoSフローの前記選択は、強化学習アルゴリズムを使用して学習された機械学習モデルを含む選択ポリシーを使用する、請求項6に記載の制御方法(40)。
【請求項】
前記機械学習モデルは、深層Q学習強化学習アルゴリズムを使用して学習されたニューラルネットワークを含む、請求項7に記載の制御方法(40)。
【請求項】
前記強化学習アルゴリズムは、第1の項と第2の項とを組み合わせた報酬関数を使用し、
-前記第1の項は、前記制御サーバによる前記被制御デバイスの前記制御の制御性能を表し、前記制御性能が低下すると前記報酬を減少させ、
-前記第2の項は、前記第2のQoSフローが使用されるときと比較して前記第1のQoSフローが使用されるときに前記報酬を減少させる、請求項7または8に記載の制御方法(40)。
【請求項】
前記強化学習アルゴリズムは、前記第2のQoSフローが使用されるときと比較して前記第1のQoSフローが使用されるときにより小さい報酬を返す報酬関数を使用し、前記機械学習モデルの前記学習は、前記結果的に得られる選択ポリシーが制御性能基準を満たすという制約の下で実行される、請求項7または8に記載の制御方法(40)。
【請求項】
前記制御サーバは、複数の被制御デバイスを制御し、前記選択ポリシーの前記機械学習モデルは、マルチエージェント強化学習アルゴリズムを使用して学習される、請求項7または8に記載の制御方法(40)。
【請求項】
少なくとも1つのプロセッサによって実行されると、請求項1から11のいずれか一項に記載の制御方法(40)を実行するように前記少なくとも1つのプロセッサを構成する命令を備える、コンピュータプログラム製品。
【請求項】
少なくとも1つのプロセッサによって実行されると、請求項1から11のいずれか一項に記載の制御方法(40)を実行するように前記少なくとも1つのプロセッサを構成する命令を備える、コンピュータ可読記憶媒体。
【請求項】
被制御デバイス(20)を制御する制御サーバ(30)であって、前記制御は、前記被制御デバイスにタスクを実行させることを目的とし、前記制御サーバ(30)は、請求項1から11のいずれか一項に記載の制御方法(40)を実行するように構成された処理回路(31)および通信ユニット(32)を備える、制御サーバ(30)。
【請求項】
請求項14に記載の制御サーバ(30)と、無線通信システム(70)を介して前記制御サーバによって制御される少なくとも1つの被制御デバイス(20)と、を備える、制御システム(10)。
【発明の詳細な説明】
【技術分野】
【】
制御サーバによる1つ以上の被制御デバイスの自動制御に関し、より具体的には、制御データを交換するためにサービス品質QoS(Quality of Service)ベース無線通信システムを使用する制御方法およびシステムに関する。
2023年4月11日に出願された欧州特許出願第23305537.5号の優先権が主張され、同欧州特許出願の内容は参照により本書に組み込まれる。
【背景技術】
【】
自動制御理論は、自動デバイスによって、すなわち人間の介入なしに、実現できる、動的システムを制御するための法則を取り扱う方法を扱う科学である。
【】
任意の所与の時点において、被制御システムは、適切な状態空間
【数】
内の点を表す状態
【数】
を有する。被制御システムは通常、任意の初期状態から任意の最終状態に操縦される必要がある、またはより一般的には目標軌道をたどる必要がある、通常はプラントと呼ばれる、1つまたは数個の被制御デバイスで構成される。被制御システムの状態は、アクチュエータを通じてプラントに適用される制御コマンドを生成する制御器によって駆動される。被制御システム(プラント)と制御器は制御システムと総称される。制御システムには2つの一般的な種類、すなわち開ループ制御システムと閉ループ制御システムがある。開ループ制御システムでは、制御器からの制御コマンドがプラントの状態とは独立であるが、閉ループ制御システムでは、センサを用いて測定される所望の実際のプラント状態に制御コマンドが左右される。
【】
ここでは、無線通信システムを使用してプラントと制御器が接続され、アクチュエータへ制御コマンドが送信され、閉ループ制御システムの場合はセンサから状態測定値が取り込まれる、制御アプリケーションに焦点を当てる。制御アプリケーションは、Wi-Fi、Bluetooth、LTEなどのいずれかの無線通信技術に頼ることができる。より最近では、3GPP(登録商標)標準化団体が、制御アプリケーションに対処する専用の手段が組み込まれた5G無線通信システムを、より具体的には超高信頼・低遅延通信(URLLC)を、規定した。無線通信システムは、無人搬送車(AGV)や自律移動ロボット(AMR)など、あらゆる種類のロボットまたは車両などの移動式または可搬式被制御デバイスに適している。一方、無線通信システムは、電波伝播効果によりパケット損失が発生しやすいが、パケットの適時送信が利用可能な無線リソースより多くの無線リソースを必要とする場合には輻輳現象も発生しやすい。その結果、制御アプリケーションの設計では、パケット損失および/または伝送遅延が発生する可能性を考慮しなければならない。
【】
アプリケーション関連の性能指標を用いて測定される、制御アプリケーションによって達成されるべき最低限の性能レベルを定義するのが一般的である。これはしばしば、期待されるアプリケーションレベルの体験品質(QoE:Quolity of Experience)として説明される。通信チャネルで起こり得る変動のため、無線リンクの性能は、所与の通信パラメータ構成で時間の経過にともない変化し得る。無線通信システムの通信パラメータを定義することは、制御アプリケーションの目的ではない。制御アプリケーションの観点からは、無線通信システムは、ほとんどの場合、パケットを不規則的に失う、および/またはパケットの配信を遅らせる、ブラックボックスのように見える。一般的な解決策は、所期のQoEに達するために無線通信システムによって達成されるべき最低限の通信関連性能レベルを、所謂サービス品質(QoS)を、定義することである。その場合、無線通信システムの役割は、通信チャネルの変化にかかわりなく、目的を満たすようにその構成を調整することである。これ以降QoSベース無線通信システムと呼ばれるそのような無線通信システムでは、パケットに、所期のQoSレベルを実現するために無線通信システムによって使用されるQoS標識または識別子がタグとして付けられる。
【】
ほとんどの制御アプリケーションは、送信されるパケットにタグとして付けるために使用されるQoEまたはQoS標識をサポートしない。この種の状況に対処するため、ここでは、無線通信システムが論理チャネルを確立し、論理チャネルの中で全てのパケットが同じQoSプロファイルに従って送信される、QoSフローメカニズムに頼る無線通信システムに焦点を当てる。基本的には、制御アプリケーションがQoSフローの確立について事前にネゴシエーションし、次に無線通信システムが自動的に、例えば入力および出力IPまたはMACアドレスやアプリケーションタイプなどに基づくフィルタリングメカニズムを使用して、パケットにタグとして対応するQoS標識を付ける。
【】
アドミッション制御とも知られるネゴシエーション段階は、無線通信システムが、その利用可能なリソースと無線通信システムの現在の負荷に関して、要求されたQoSプロファイルを実行できるかどうかをチェックするものである。
【発明の概要】
【発明が解決しようとする課題】
【】
送信の前に、制御アプリケーションは、所期のQoEを達成するために必要なQoSプロファイル(すなわち、QoSレベル)を選択する必要がある。従来の手法では、QoSフローの確立には時間がかかり、それ故、制御データの送信前にQoSフローの確立が一度だけ行われるため、最も要求の厳しい状況に適したQoSプロファイルを選択する。そうすることによって、無線通信システムは、制御アプリケーションがいかなる状況でも所期のQoEを達成することを可能にできる。しかしながら、そのような最も要求の厳しい状況に適したQoSプロファイルを適用して、制御アプリケーションのために適切な性能をいつでも得ることを可能にすると、無線通信システムがほとんどの時間に必要以上の無線リソースを割り当てることにもなり、同じ無線リソースを共有する制御アプリケーション間で輻輳が発生する。そのような輻輳は、実際に達成されるQoSレベルの一時的な低下につながる可能性があるため、回避されるべきである。そのような(最も要求の厳しい状況に適している)QoSプロファイルをいつでも適用すると、無線通信システムへのアドミッションを申し込む他の制御アプリケーションに利用可能な無線リソースの量も減り、場合によってはアドミッション制御によって多くの制御アプリケーションが拒否されることになる。
【】
その状況を改善することを目的とする。特に、ほとんどの場合に制御アプリケーションのQoE要件をなお満たすことを可能にしながら、少なくとも場合によっては、輻輳確率を低減すること、および/またはアドミッション制御の拒否率を低減することを可能にする解決策を提案することによって、上述した従来技術の限界の一部または全部に少なくとも部分的には対処することを目的とする。
【課題を解決するための手段】
【】
この目的のため、第1の態様によると、制御サーバによって実行される、被制御デバイスを制御する方法に関し、当該制御が、無線通信システムを使用して被制御デバイスへ制御コマンドを送信することによって当該被制御デバイスにタスクを実行させることを目的とし、当該無線通信システムが、無線通信システムのそれぞれの異なるQoSレベルに関連付けられた異なるサービス品質QoSフローの確立をサポートする。当該制御方法は、
-被制御デバイスへ制御コマンドを送信するための少なくとも2つのQoSフローを確立することであって、当該少なくとも2つのQoSフローが、第1のQoSフローと第2のQoSフローとを含み、第1のQoSフローが、第2のQoSフローに関連付けられたQoSレベルより大きいQoSレベルに関連付けられる、確立することと、
-被制御デバイスへ送信される制御コマンドを判断することと、
-確立された少なくとも2つのQoSフローの中から、制御コマンドを送信するのに使用されるQoSフローを選択することと、
-選択されたQoSフローを使用して、無線通信システムを介して、少なくとも1つの被制御デバイスへ制御コマンドを送信することと、を含む。
【】
よって、制御アプリケーションを実行する制御サーバは、同じ制御アプリケーションのために2つ以上のQoSフローを確立する(これに対し、従来技術では、制御アプリケーションに1つのQoSフローのみが関連付けられる)。したがって、無線通信システムの観点からは、制御サーバが、異なるQoSレベル要件(すなわち、異なるQoSプロファイル)を有する2つ以上の異なる制御アプリケーションを実行していると見なされる。無線通信システムは、制御サーバが2つ(またはそれ以上)の異なる制御アプリケーションを実行していると考えるように仕向けられる。よって、無線通信システムの変更は必要とされず、制御アプリケーションは、例えば、異なるQoSフローのトラフィックの自動フィルタリングを可能にするために、確立された異なるQoSフローに異なるポートを関連付けることができる。
【】
確立された少なくとも2つのQoSフローは異なるQoSレベルに関連付けられ、第1のQoSフローによって提供されるQoSレベルは、第2のQoSフローによって提供されるQoSレベルより大きい。「より大きいQoSレベル」とは、第1のQoSフローのQoSプロファイルが、第2のQoSフローのQoSプロファイルより優れた制御コマンド配信性能を達成することを可能にすることを意味する。「制御コマンド配信性能」は、制御コマンドの配信の性能に関するものであり、被制御デバイスへ制御コマンドをどれほど確実に配信できるか、および/または当該被制御デバイスへ制御コマンドをどれほど速く配信できるかを表す。換言すると、第1のQoSフローでは、第2のQoSフローより確実に(例えば、伝搬損失および/または無線リソース不足によるパケット誤り率がより小さい)、および/またはより速く(すなわち、遅延がより小さい)、制御コマンドが被制御デバイスへ配信されることを期待できる。通常、第1のQoSフローのQoSレベルは、最も要求の厳しい状況に適したQoSレベルに、すなわち、制御アプリケーションがいかなる状況でも所期のQoEを達成することを可能にすると考えられるQoSレベルに、相当する。一方、第2のQoSフローのQoSレベルは、より低い制御コマンド配信性能を提供し、制御アプリケーションがいかなる状況でも所期のQoEを達成することを可能にするとは考えることができない。
【】
確立された少なくとも2つのQoSフローは同じ制御アプリケーションに関連するため、制御アプリケーションによって生成されるトラフィックは少なくとも2つのQoSフローで分割され、その結果、確立されたそれぞれのQoSフローは、単一のQoSフローのみが確立された場合より少ないトラフィックを取り扱う。しかしながら、第2のQoSフローを使用するときは、無線通信システムが、場合によっては、第1のQoSフローを使用するときより少ない無線リソースを制御コマンドの送信のために割り当てることができる。したがって、少なくとも時々第2のQoSフローを使用すると、常に第1のQoSフローを使用する場合と比較して、制御アプリケーションによって使用される無線リソースの量が減り、それ故、輻輳確率が低減される。例えば、第1のQoSフローがデフォルトで使用されてよく、第2のQoSフローのQoSレベルがタスクの現在段階で所期のQoEの達成を可能にするなら、所定の条件が確認された場合にのみ(例えば、輻輳が発生する可能性が高い場合、すなわち輻輳関連の条件)、第2のQoSフローが使用されてよい。別の例では、第2のQoSフローがデフォルトで使用されてよく、所定の条件が確認された場合にのみ(例えば、タスクの段階が、所期のQoEを達成するためにより良好なQoSレベルを必要とする場合、すなわちタスク段階関連の条件)、第1のQoSフローが使用されてよい。
【】
上述したように、従来技術では、最も要求の厳しい状況を考慮することによって、確立される単一のQoSフローのQoSレベルが判断されていた。しかしながら、制御アプリケーションの性質に応じて、(制御コマンド配信性能の点で)所期のQoEを達成するために必要とされるQoSレベルは、時間の経過にともない変化し得る。例えば、移動するロボットの制御に必要なパケット誤り率(PER)は、ロボットが低速で直線に入ろうとしているときと、またはロボットがかなりの速度でUターンするときとで同じではない。直線上にある間、制御コマンドは時間の経過にともない大きく変化しないので、ロボットはより多くのパケット損失に対応できる(制御コマンドが失われた場合は、前の制御コマンドを使用可能)。よって、それぞれの異なるQoSレベルを提供する少なくとも2つのQoSフローを確立することによって、例えば、あまり厳しくないQoSレベル要件でも所期のQoEが達成され得る場合には、第2のQoSフローを使用する(したがって、第1のQoSフローを使用する場合より少ない無線リソースを使用する)ことが可能である。
【】
よって、提案される解決策は、少なくとも場合によっては、制御サーバの制御アプリケーションによって使用される無線リソースの量を減らすことを可能にし、それ故、無線通信システムが制御サーバにとってブラックボックスであるにもかかわらず、無線リソース不足による輻輳確率は低減される。無線通信システムは、あたかも複数の異なる制御アプリケーションが実行されたかのように、少なくとも2つの異なるQoSフローを制御サーバに提供する。
【】
特定の実施形態では、制御方法は、単独で、または任意の技術的に可能な組み合わせで、検討される、以下の任意選択の特徴のうちの1つ以上をさらに含み得る。
【】
特定の実施形態では、被制御デバイスによって実行されるタスクは、それぞれのQoSレベル要件が関連付けられた複数の連続する段階を含み、QoSフローを選択することは、確立された少なくとも2つのQoSフローのうち、タスクの現在段階に必要なQoSレベルと適合するQoSレベルを提供するという点でタスクの現在段階と適合するQoSフローがいずれかを特定することを含み、選択されるQoSフローは、タスクの現在段階と適合すると特定されたQoSフローに一致する。例えば、選択されるQoSフローは、最も低い制御コマンド配信性能が関連付けられた確立済みの適合QoSフローに一致する。
【】
特定の実施形態では、QoSフローを選択することは、
-無線通信システムが輻輳しているかどうか、または輻輳寸前であるかどうかを評価することと、
-無線通信システムが輻輳していること、または輻輳寸前であることを検出したことに応じて、(少なくとも、第1のQoSフローのQoSレベルがタスクの現在または次の段階で所期のQoEを達成するために必要とされない場合に)QoSフローの選択中に第1のQoSフローを考慮しないことと、を含む。
特定の実施形態では、被制御デバイスによって実行されるタスクの現在段階に必要なQoSレベルが、確立された少なくとも2つのQoSフローのうちの第1のQoSフロー以外のQoSフローによっても提供される場合にのみ、無線通信システムが輻輳していること、または輻輳寸前であることが検出されたときに、QoSフローの選択中に第1のQoSフローが考慮されない。
【】
特定の実施形態では、第1のQoSフローは、タスクの現在段階に必要なQoSレベルが、確立された少なくとも2つのQoSフローのうちの別のQoSフローによって提供されないと判断された場合にのみ使用される。
【】
特定の実施形態では、制御方法は、被制御デバイスから制御フィードバックを受信することをさらに含み、QoSフローは、受信された制御フィードバックに基づいて選択される。いくつかの非限定的な例では、制御フィードバックは、タスクに関連する被制御デバイスの状態の測定値を含み、QoSフローは、受信された状態測定値に基づいて選択される。いくつかの非限定的な例では、制御コマンドは、受信された状態測定値に基づいて判断される。
【】
特定の実施形態では、QoSフローの選択は、強化学習アルゴリズムを使用してトレーニングされた機械学習モデルを含む選択ポリシーを使用する。
【】
特定の実施形態では、機械学習モデルは、深層Q学習強化学習アルゴリズムを用いて学習されたニューラルネットワークを含む。
【】
特定の実施形態では、強化学習アルゴリズムは、第1の項と第2の項とを組み合わせた報酬関数を使用し、
-第1の項は、制御サーバによる被制御デバイスの制御の制御性能を表し、制御性能が低下すると報酬を減少させ、
-第2の項は、第2のQoSフローが使用されるときと比較して第1のQoSフローが使用されるときに報酬を減少させる。
【】
特定の実施形態では、強化学習アルゴリズムは、第2のQoSフローが使用されるときと比較して第1のQoSフローが使用されるときにより小さい報酬を返す報酬関数を使用し、機械学習モデルのトレーニングは、結果的に得られる選択ポリシーが制御性能基準を満たすという制約の下で実行される。
【】
特定の実施形態では、制御サーバは、複数の被制御デバイスを制御し、選択ポリシーの機械学習モデルは、マルチエージェント強化学習アルゴリズムを使用してトレーニングされる。
【】
第2の態様によると、少なくとも1つのプロセッサによって実行されると、本開示の実施形態のうちのいずれか1つによる制御方法を実行するように当該少なくとも1つのプロセッサを構成する命令を備える、コンピュータプログラム製品
【】
第3の態様によると、少なくとも1つのプロセッサによって実行されると、本開示の実施形態のうちのいずれか1つによる制御方法を実行するように当該少なくとも1つのプロセッサを構成する命令を備える、コンピュータ可読記憶媒体
【】
第4の態様によると、被制御デバイスを制御する制御サーバに関し、当該制御は、被制御デバイスにタスクを実行させることを目的とし、当該制御サーバは、本開示の実施形態のうちのいずれか1つによる制御方法を実行するように構成された処理回路および通信ユニットを備える。
【】
第5の態様によると、本開示の実施形態のうちのいずれか1つによる制御サーバと、無線通信システムを介して制御サーバによって制御される少なくとも1つの被制御デバイスと、を備える、制御システム
【】
特定の実施形態では、無線通信システムは5G無線通信システムである。
【発明の効果】
【】
本開示の態様によると、ほとんどの場合に制御アプリケーションのQoE要件をなお満たしながら、輻輳確率を低減すること、および/またはアドミッション制御の拒否率を低減することが可能である。
本発明は、決して限定するものではない一例として与えられ、かつ以下の図を参照してなされる、以下の説明を読むと、よりよく理解されるであろう。
【図面の簡単な説明】
【】
【図】図1は、制御システムおよび無線通信システムの図示である。
【図】図2は、制御システムの被制御デバイスの例示的な一実施形態の図示である。
【図】図3は、制御システムの制御サーバの例示的な一実施形態の図示である。
【図】図4は、制御方法の例示的な一実施形態の主要なステップを表す図である。
【図】図5は、制御方法の別の例示的な実施形態の主要なステップを表す図である。
【図】図6は、制御方法の制御性能を示すシミュレーション結果を例示するプロットである。
【発明を実施するための形態】
【】
これらの図において、ある1つの図から別の図にかけて同一の参照符号は、同一または類似の要素を示す。明確にするため、示されている要素は、特に明記しない限り、正確な縮尺になっていない。
【】
また、これらの図に表されているステップの順序は、例示の目的のみで提供されており、本開示を限定することを意図しておらず、異なる順序で遂行される同じステップでも適用され得る。
【】
図1は、制御システム10の例示的な一実施形態を概略的に表す。図1によって示されているように、制御システム10は、1つ以上の被制御デバイス20からなる被制御システムを制御する制御サーバ30を備えている。制御は、被制御システムに所与のタスクを実行させることを目的とし、タスクは、被制御システムの状態空間
【数】
において被制御システムの状態に目標軌道をたどらせるものとして定義され得る。制御システム10は、実施形態に応じて、開ループまたは閉ループであってよい。被制御システムに所望のタスクを実行させるために、制御サーバ30は、無線通信システム70を介してそれぞれの被制御デバイス20へ制御コマンドを送信する。制御サーバ30はまた、特に閉ループ制御システム10の場合に、それぞれの被制御デバイス20から無線通信システム70を介して制御フィードバックを受信できる。
【】
無線通信システム70は、それぞれの被制御デバイス20との無線通信リンクを確立するために使用される。制御サーバ30から受信された制御コマンドは、無線通信リンクを介して被制御デバイス20へ転送される。被制御デバイス20から無線通信リンク上で受信される制御フィードバックは、存在する場合、制御サーバ30へ転送される。無線通信システム70はどのような無線通信技術でも使用でき、特定の無線通信技術の選択は、本開示の非限定的な特定の実施形態に相当する。例えば、無線通信システムは、以下の無線通信技術、すなわち、Wi-Fi、Bluetooth、LTE、5Gのうちの少なくとも1つを使用できる。
【】
無線通信システム70は、被制御デバイス20との無線通信リンクを確立する1つ以上の無線ノード(例えば、基地局、アクセスポイントなど)を備える。1つ以上の無線ノードは、無線通信システム70の無線アクセスネットワーク(RAN)72を形成する。無線通信システム70はコアネットワーク(CN)71を備えてもよく、コアネットワーク(CN)71を介して、例えば制御サーバ30とデータを交換でき、例えば、無線通信リンク上で被制御デバイス20へ送信される制御コマンドと、無線通信リンク上で被制御デバイス20から受信される制御フィードバックを交換できる。
【】
無線通信システム70は、それぞれの異なるQoSレベルに関連付けられた異なるQoSフローの確立をサポートする。上述したように、QoSフローは、それぞれのQoSプロファイルに関連付けられた論理チャネルに相当する。そのようなQoSフローは、アプリケーションレベルのトラフィックを交換するために使用され、QoSプロファイルは、無線通信システム70が(契約により)当該QoSフローで実現すべきQoSレベルを記述するものである。例えば、保証ビットレート(GBR)、トラフィック、およびベストエフォートトラフィックをそれぞれ交換するために、別々のQoSフローが確立される。QoSプロファイルは、例えば、保証ビットレート、優先度レベル、PER、遅延(パケット遅延バジェット(PDB)としても知られる)などに関して実現されるQoSレベルを定義できる。原則として、ユーザアプリケーションは、単一のQoSプロファイルに関連付けられ、対応する単一のQoSフローを使用してアプリケーションレベルのトラフィックを交換する。所望のQoSプロファイル/レベルに対してQoSフローが確立されると、無線通信システム70は、制御システム10によって、アプリケーションレベルのトラフィックを交換するために使用されるブラックボックスと見なされる。特に、制御サーバ30は、無線通信リンク上で使用される通信パラメータ(例えば、変調、符号化率など)および無線リソースを、または失われる可能性があるパケットなどを、気にかける必要がない。制御サーバ30は単に、要求されたQoSプロファイル/レベルが無線通信システム70によって実行されると想定するのみである。
【】
図2は、被制御デバイス20の例示的な一実施形態を概略的に表す。被制御デバイス20は、例えば工場内のロボット、有人または無人車両など、遠隔制御され得るあらゆる種類のデバイスであってよい。
【】
図2によって示されているように、被制御デバイス20は、無線通信システム70のRAN72に対してデータを送受信するための無線通信ユニット22を備えている。したがって、無線通信ユニット22は、RAN72との無線通信リンクを確立するために、無線通信システム70によって使用される無線通信技術(例えば、Wi-Fi、Bluetooth、LTE、5Gなど)をサポートする。
【】
被制御デバイス20は、状態空間
【数】
において被制御デバイス20の状態を変更するように制御され得る1つ以上のアクチュエータ23(例えば、モータなど)を備えている。いくつかの実施形態では、図2によって示されているように、被制御デバイス20は、制御サーバ30へ送信される制御フィードバックに含まれ得る、被制御デバイス20の状態に関連して測定を実行するための1つ以上のセンサ24を備えている。
【】
被制御デバイス20はまた、無線通信ユニット22、1つ以上のアクチュエータ23、および存在する場合には1つ以上のセンサ24に接続された処理回路21を備えている。例えば、処理回路21は、1つ以上のプロセッサと1つ以上のメモリとを備える。1つ以上のプロセッサは、例えば、中央処理装置(CPU)、デジタル信号プロセッサ(DSP)、フィールドプログラマブルゲートアレイ(FPGA)、特定用途向け集積回路(ASIC)などを含み得る。1つ以上のメモリは、あらゆる種類のコンピュータ可読揮発性および不揮発性メモリ(磁気ハードディスク、固体ディスク、光ディスク、電子メモリなど)を含み得る。1つ以上のメモリは、制御サーバ30から受信される制御コマンドに基づいて1つ以上のアクチュエータ23を制御し、かつ場合によっては、1つ以上のセンサ24によって提供される測定値に基づいて制御フィードバックを生成するために、1つ以上のプロセッサによって実行される1組のプログラムコード命令の形態をとるコンピュータプログラム製品を記憶できる。
【】
図3は、制御サーバ30の例示的な一実施形態を概略的に表す。
【】
図3によって示されているように、制御サーバ30は、無線通信システム70のRAN72を介して被制御デバイス20とデータを交換するために、無線通信システム70とデータを交換するための通信ユニット32を備えている。通常、制御サーバ30は、無線通信システム70のCN71とデータを交換でき、そのデータは、無線通信システム70のRAN72を介して被制御デバイス20と交換される。しかしながら、場合によっては、制御サーバ30は、被制御デバイス20のように、無線通信リンクを介して無線通信システム70のRAN72に接続されることもある。よって、制御サーバ30の通信ユニット32は、無線通信システム70のCN71および/またはRAN72とデータを交換するのに適したいかなる有線および/または無線通信技術でもサポートし得る。
【】
制御サーバ30も通信ユニット32に接続された処理回路31を備えている。例えば、処理回路31は、1つ以上のプロセッサと1つ以上のメモリとを備える。1つ以上のプロセッサは、例えば、CPU、DSP、FPGA、ASICなどを含み得る。1つ以上のメモリは、あらゆるタイプのコンピュータ可読揮発性および不揮発性メモリ(磁気ハードディスク、固体ディスク、光ディスク、電子メモリなど)を含み得る。1つ以上のメモリは、(例えば、被制御デバイス20のための制御コマンドを生成することによって、かつ、存在する場合は、制御フィードバックを処理することによって)無線通信システム70を介して1つ以上の被制御デバイス20を遠隔制御するために、1つ以上のプロセッサによって実行される1組のプログラムコード命令を含むコンピュータプログラム製品の形態をとる制御アプリケーションを記憶できる。
【】
図4は、制御サーバ30によって実行される制御方法40の例示的な一実施形態の主要なステップを概略的に表す。
【】
図4によって示されているように、制御方法40は、制御アプリケーションのために、被制御デバイス20へ制御コマンドを送信するための少なくとも2つのQoSフローを確立するステップS40を含む。確立された少なくとも2つのQoSフローは、異なるQoSレベルに関連付けられ、第1のQoSフローと第2のQoSフローとを含む。第1のQoSフローは、確立済みのQoSフローの中で、最良のQoSレベルを提供する確立済みのQoSフローであり、したがって、第1のQoSフローによって提供されるQoSレベルは、第2のQoSフローによって提供されるQoSレベルより大きい。換言すると、制御コマンドは、第2のQoSフローを使用するときより第1のQoSフローを使用するときの方が確実におよび/または速く被制御デバイス20に配信されることが期待される。例えば、QoSプロファイル/レベルが、例えば優先度レベル、PER、および遅延によって定義される場合、
-同じPERおよび遅延によって定義される2つのQoSプロファイルでは、無線通信システム70を介して交換されるより低い優先度レベルを有するパケットより制御コマンドが優先されるので(したがって、無線リソース不足のために拒否される頻度が下がるため、制御コマンド配信の信頼性と速度が上がる)、より大きい優先度レベルを有するQoSプロファイルは(制御コマンド配信性能の点で)より大きいQoSレベルを提供し、
-同じ優先度レベルおよび遅延によって定義される2つのQoSプロファイルでは、より大きいPERを有する他のQoSプロファイルより少ないパケット損失で制御コマンドが配信されるので、より低いPERを有するQoSプロファイルは(制御コマンド配信性能の点で)より大きいQoSレベルを提供し、
-同じ優先度レベルおよびPERによって定義される2つのQoSプロファイルでは、より大きい遅延を有する他のQoSプロファイルより速く制御コマンドが配信されるので、より低い遅延を有するQoSプロファイルは(制御コマンド配信性能の点で)より大きいQoSレベルを提供する、などである。
【】
よって、本開示では、同じ制御アプリケーションのために(少なくとも)2つの異なるQoSフローが確立されるが、従来技術の解決策では、ユーザアプリケーションが理論的には単一のQoSプロファイルに関連付けられ、対応する単一のQoSフローを使用してアプリケーションレベルのトラフィックを交換する。したがって、無線通信システムの観点からは、制御サーバ30が、異なるQoSレベル要件(すなわち、異なるQoSプロファイル)を有する2つの異なる制御アプリケーションを実行していると見なされる。例えば、第1のQoSフローは、遅延に対し重大な(例えば、周期的)GBRトラフィックを交換するために確立されてよく、確立される第2のQoSフローは、ベストエフォートトラフィックを交換するために確立されてよい。通常、第1のQoSフローのQoSレベルは、最も要求の厳しい状況に適したQoSレベルに、すなわち、制御アプリケーションがいかなる状況でも所期のQoEを達成することを可能にすると考えられるQoSレベルに、相当する。一方、第2のQoSフローのQoSレベルは、より低い制御コマンド配信性能を提供し、制御アプリケーションがいかなる状況でも所期のQoEを達成することを可能にするとは考えることができない。
【】
図4によって示されているように、制御方法40は、被制御デバイス20へ送信される制御コマンドを判断するステップS41を含む。
【】
制御方法40はまた、確立された少なくとも2つのQoSフローの中から、制御コマンドを送信するために使用されるQoSフローを選択するステップS42を含む。
【】
次に、制御方法40は、無線通信システム70を介して被制御デバイス20へ制御コマンドを送信するステップS43を含む。ステップS43の間に、制御サーバ30は、無線通信システム70へ制御コマンドを送信し、選択されたQoSフローを使用して被制御デバイスへ制御コマンドを送信することを当該無線通信システム70に命令する。例えば、制御アプリケーションは、確立された異なるQoSフローに異なるポート(例えば、TCPまたはUDPポート)を関連付けることができ、無線通信システム70は、制御コマンドが受信されたポートに基づいて制御コマンドをフィルタリングし、関連付けられたQoSフローに当該制御コマンドを転送することができる。
【】
勿論、実行されるタスクが完了するまでは、制御動作中にステップS41、S42、S43が繰り返されてよい。いくつかの実施形態では、QoSフローを選択するステップS42が、生成される制御コマンドごとに遂行されてよい。しかしながら、他の実施形態では、QoSフロー選択ステップS42をより低い頻度で遂行することも可能である、すなわち、制御サーバ30の制御アプリケーションによって新たな制御コマンドが生成されるたびに遂行しないことも可能である。
【】
いくつかの実施形態では、ステップS40の間に3つ以上のQoSフローを確立することが可能である。例えば、第1のQoSフローのQoSレベルより低く、かつ第2のQoSフローのQoSレベルとは異なる(より低いまたはより大きい)関連QoSレベルを有する第3のQoSフローを確立することが可能である。したがって、QoSフロー選択ステップS42は、(制御コマンド配信性能の点で)3つの異なるQoSレベルにそれぞれ関連付けられた制御コマンドを送信するためのQoSフローを選択するための3つの異なるオプションを有する。以下では、特に明記しない限り、2つのQoSフローのみが確立されると(すなわち、第1のQoSフローおよび第2のQoSフロー)、または少なくとも第2のQoSフローが最も低いQoSレベルが関連付けられた確立済みのQoSフローに一致すると、非限定的に仮定する。
【】
第1のQoSフローが通常、同量の制御データを交換するために第2のQoSフローより多くの無線リソースを使用することに留意されたい。したがって、制御サーバ30の制御アプリケーションは、常に同じQoSフローを選択しないことによって、被制御デバイス20を制御するために実際に使用される無線リソースの量に影響を及ぼし得る。第1のQoSフローが最も要求の厳しい状況に適したQoSプロファイル/レベルに対応する場合、第1のQoSフローの代わりに第2のQoSフローを時々使用すると、上述した従来技術と比較して、使用される無線リソースの量が減少する。
【】
特に、第1のQoSフローのQoSレベルが所期のQoEを達成するために必ずしも必要ではないことに留意されたい。例えば、被制御デバイス20によって実行されるタスクは複数の連続した段階を含み得、それらの段階は、異なるQoSプロファイル/レベルで所期のQoEを達成することを可能にし得る異なる特性を有する。例えば、移動するロボットの制御に必要なQoSレベルは(制御コマンド配信性能の点で)、ロボットが低速で直線に入ろうとしているときに、またはロボットがかなりの速度でUターンするときに、同じではない。よって、低速で直線移動することと、かなりの速度でUターンすることは、所期のQoEを達成するために異なるQoSレベルを必要とする第1の段階と第2の段階とにそれぞれ対応する。第1のQoSフローは第1の段階と第2の段階の両方で所期のQoEの達成を可能にするが、第2のQoSフローのQoSレベルが第1の段階に必要なQoSレベルと適合するなら(すなわち、その制御コマンド配信性能が所期のQoEを達成するのに十分であると考えられるなら)、使用される無線リソースの量を減らすために、第1の段階で第2のQoSフローを使用することが有利であり得る。
【】
QoSフロー選択ステップS42は、使用するQoSフローを選択するために、選択ポリシーを用いる。制御方法40は様々な選択ポリシーを使用でき、特定の選択ポリシーの選択は、制御方法40の非限定的な特定の実施形態に相当する。
【】
例えば、選択ポリシーは、デフォルトで第1のQoSフローを使用することと、1つ以上の所定の条件が確認された場合にのみ第2のQoSフローを使用することとにあってよい。したがって、そのような選択ポリシーは、最良のQoSレベルを有するQoSフローを、すなわち第1のQoSフローを、デフォルトで使用することによって、制御性能を重視する。例えば、無線通信システム70の輻輳に関連する条件を考慮することができる。そのような場合、QoSフロー選択ステップS42は、無線通信システム70が輻輳しているか、または輻輳寸前である(すなわち、近い将来輻輳する可能性がある)かを評価することを含んでよく、無線通信システム70が輻輳している(または輻輳寸前である)ことが検出された場合には、第1のQoSフローの代わりに第2のQoSフロー(または、もしあるなら、より低いQoSレベルが関連付けられた別の確立済みQoSフロー)が使用される。そのような実施形態では、制御サーバ30は、第1のQoSフローによって保証される最良のQoSレベルから恩恵を得ることができるが、無線通信システム70によってもはやこれが提供され得ない場合はこの限りではない。これは、タスクの現在段階に必要なQoSレベルに関する条件にさらに従うことができる(タスク段階関連の条件)。よって、輻輳が検出された場合は、第2のQoSフローのQoSレベルがタスクの現在段階を実行するために必要なQoSレベルに適合する場合(すなわち、その制御コマンド配信性能が所期のQoEの達成を可能にする場合)にのみ、第2のQoSフローが使用され得る。適合しない場合は、第1のQoSフローが引き続き使用される。制御サーバ30が複数の被制御デバイス20を制御する場合に、他の被制御デバイス20がより低いQoSレベルを必要とするそれぞれの段階にあり得ることに留意されたい。よって、使用される無線リソースの量を全体的に減らすために、これらの他の被制御デバイス20は第2のQoSフローに切り替えることができる。よって、選択ポリシーは、1つ以上の輻輳関連および/またはタスク段階関連の条件を考慮して、第1のQoSフローから別のQoSフローに切り替えるかどうかを決定することができる。
【】
無線通信システム70の輻輳は、当業者に知られている任意の方法を用いて検出でき、特定の輻輳検出方法の選択は、本開示の特定であるが非限定的な実施形態に相当する。例えば、制御サーバ30は、例えば、被制御デバイス20から受信された(または受信されなかった)制御フィードバックに基づいて、無線通信システム70が輻輳している(または輻輳寸前である)ことを検出できる。制御フィードバックが受信されない場合、または被制御デバイス20によって1つ以上の制御コマンドが受信されていないことを受信された制御フィードバックが伝える場合、制御サーバ30は、無線通信システム70が輻輳している可能性が高いと考えることができる。別の例によると、制御サーバ30は、例えば、無線通信システム70からのレポートに基づいて、当該無線通信システム70が輻輳している可能性が高いことを検出できる。実際、無線通信システム70は、例えば失われたパケットに関するレポートを提供でき、これは輻輳の検出に役立てることができる。そのようなレポートがリアルタイムで受信されない場合でも、例えば、時間の関数として輻輳確率を表す時間的輻輳モデルを構築するのに役立てることができる。実際、場合によっては、一部の輻輳事象は、例えば概ね周期的に発生する可能性があり、そのような概ね周期的な挙動は受信されたレポートを用いて検出でき、時間的輻輳モデルを使用して、次の輻輳事象が発生する可能性が高い時期を予測できる。
【】
別の例では、選択ポリシーは、デフォルトで第2のQoSフローを使用することと、1つ以上の所定の条件が確認された場合にのみ第1のQoSフローを使用することとにあってもよい。したがって、そのような選択ポリシーは、最少の無線リソースを必要とするQoSフローを、例えば第2のQoSフローを、デフォルトで使用することによって、制御アプリケーションによって使用される無線リソースの量を最小限に抑えること(また、したがって、輻輳確率を下げること)を重視する。例えば、タスクの現在段階を実行するために必要なQoSレベルに関連する条件を考慮することができる(タスク段階関連の条件)。そのような場合、QoSフロー選択ステップS42は、タスクの現在段階に必要なQoSレベルを判断することと、確立された確立済みQoSフローの中から、タスクの現在段階中に所期のQoEの達成を可能にする制御コマンド配信性能を提供するという点において、タスクの現在段階に必要なQoSレベルに適合するQoSフローがどれかを特定することを含んでよい。例えば、選択されるQoSフローは、最も低いQoSレベルが関連付けられた確立済みの適合QoSフローに一致するので、第1のQoSフローは、QoSレベル要件を遵守するために絶対に必要とされる場合(すなわち、第1のQoSフロー以外の確立済みQoSフローを使用すると所期のQoEが達成可能であると考えられない場合)にのみ使用される。
【】
例えば、それぞれの被制御デバイス20のタスクの複数の段階は、関連付けられたQoSレベル要件と共に事前に知ることができる。そのような場合、制御サーバ30は単に、被制御デバイス20によって達成されるタスクの現在段階を検出し、検出されたタスクの現在段階に適合するQoSフローを選択する。これは、例えば、タスクを実行するために既定の一連の段階を遂行する必要がある場合に可能であるので、制御サーバ30は、例えば、各段階の持続時間や所定の軌道に沿った被制御デバイス20の状態の位置などに基づいて、どれが現在段階であるかを予測できる。開ループ制御システム10の場合、制御サーバ30は、例えば、被制御デバイス20へ送信される制御コマンドに基づいて、当該被制御デバイス20によって実行されるタスクの現在の段階を予測できる。閉ループ制御システム10の場合、制御サーバ30は、例えば、被制御デバイス20から受信される制御フィードバック(例えば、制御フィードバックに含まれている状態測定値に基づいて)に基づいて、当該被制御デバイス20によって実行されるタスクの現在段階を検出できる。
【】
図5は、制御方法40の特定の実施形態の主要なステップを概略的に表す。図4に関連して論述したステップに加えて、制御方法40は、被制御デバイス20から制御フィードバックを受信するステップS44をも含む。制御フィードバックは、例えば、1つ以上のセンサ24によって提供されるタスクに関連する被制御デバイス20の状態の測定値、および/または被制御デバイス20によって受信される制御コマンドの標識を含む。このような制御フィードバックは、閉ループ制御システム10の場合に、制御サーバ30が被制御デバイス20の現在の状態を知り、判断される制御コマンドを相応に調整するために存在する。しかしながら、開ループシステムの場合にも、制御サーバ30が被制御デバイス20の現在の状態を知り、被制御デバイス20の現在の状態を踏まえて必要とされるQoSレベルを判断するために、このような制御フィードバックが存在してよい。実際、そのような状態測定値は、例えば、回避する必要がある予期せぬ障害物の存在など(これは、例えば、センサ24のうちの1つが被制御デバイス20の環境を監視するカメラである場合に検出できる)、予期せぬ状況を考慮するのに役立ち得る。したがって、被制御デバイス20の複数の連続する段階は必ずしも事前に分かるとは限らず、少なくともそれらのうちのいくつかは予期せぬものであり得、それらを検出して、第1のQoSフローと第2のQoSフローの中から適切なQoSフローを選択することによってQoSレベルを調整する必要があることを強調する。
【】
より一般的に言えば、選択ポリシーは、制御システム10の状況に従って使用されるべきQoSフローを選択する。例えば、選択は、QoSフロー選択変数と呼ばれる1組の変数に基づいて実行されてよく、これは、(測定および/または予測できる)被制御システムの現在の状態、被制御デバイス20の位置、目標軌道、最も近い障害物までの距離などを含んでよい。これらのQoSフロー選択変数によって記述されるドメインは、通常はQoSフロー選択変数に沿ったノルム関数の計算と所定の決定閾値との比較から、(第1のQoSフローと第2のQoSフローのそれぞれについて)2つの領域に分割され得る。最後に、送信されるべき各制御コマンドについて、制御アプリケーションは、QoSフロー選択変数の値が入る領域に従ってQoSフローを選択する。
【】
無線通信システム70のパラメータ(すなわち、第1のQoSフローまたは第2のQoSフロー)を構成するために使用されるにもかかわらず、これらのQoSフロー選択変数は主に、制御システム10の状態に関連し、無線通信システム70の状態には関連しないことを強調する(輻輳を検出および/または回避しようと試みる場合を除く)。よって、選択ポリシーは、主に(または場合によっては、専ら)、無線通信システム70の状態に依存しない被制御デバイス20の状態によって駆動される。
【】
特定の実施形態では、選択ポリシーは、QoS選択変数の値を入力として受け取り、選択されたQoSポリシーを出力する機械学習モデル(例えば、ニューラルネットワーク)を含み、その機械学習モデルは強化学習によって事前にトレーニングされる。換言すると、選択ポリシーは機械学習モデルによって実施され、選択ポリシーは強化学習アルゴリズムを使用して最適化される。
【】
まず、解決しようとする問題は、マルコフ決定過程(MDP)、すなわちエージェントが行動を遂行し、その環境から次の状態の観測値とこれらの行動に対する報酬を受け取ることによって環境と順次に相互作用するエージェント環境フレームワークとしてモデル化できることに気付くであろう。各反復において、エージェントは、既定の行動の有限集合の間で行動を選択する必要がある。各行動で、エージェントは、環境の影響を反映する所与の確率で別の状態に移る。MDPにおける目標は、意思決定者のために良好なポリシーを見い出すことである:状態
【数】
にあるときに意思決定者が選択する行動
【数】
を指定する関数
【数】
。このようにしてMDPがポリシーと組み合わされると、これが状態ごとに適用される行動または規則を固定し、結果的に得られる組み合わせはマルコフ連鎖のように振る舞う。したがって、目的は、報酬の何らかの累積関数、典型的には潜在的に無限のホライズン(infinite horizon)にわたる期待割引和を最大化するポリシー
【数】
を見つけることである。
【】
より正式には、MDPは、タプル
【数】
として定義され、ここで、
-
【数】
は、(例えば、QoSフロー選択のための変数に対応する)エージェントの学習状態の集合であり、
-
【数】
は、エージェントが取りうる行動の集合であり、
-
【数】
は、
【数】
を与える状態遷移確率関数であり、
-
【数】
は、
【数】
を与える報酬関数である。
【】
報酬は、状態
【数】
で行動
【数】
が取られ、状態
【数】
への遷移が観察されるときに、期待される(または決定論的な)報酬として表現され得る。第2のモデルは以下を定義することによって得ることができる。
【数】
【】
MDPを解くことは、現在の状態からの期待されるリターンを最大化するポリシーを見つけることになる。
【数】
ここで、
【数】
は
【数】
および
【数】
を選択するポリシーであり、割引率は
【数】
を満たす。
【】
この場合、エージェント(すなわち、ロボットなどの被制御デバイス20)は、無線通信システム70が組み込まれた環境(例えば、工場)内に存在する。各反復において、意志決定者(すなわち、制御サーバ30)は、第1のQoSフローを使用して制御コマンドを送信すること、または第2のQoSフローを使用して制御コマンドを送信することのうち、いずれの行動を取るかを決定する必要がある。重要な要件は、環境によって行動ごとに与えられる報酬関数を定義することである。この点については後述する。MDPのもう1つの重要な側面は、環境が次に何をするかを特徴付ける状態遷移関数である。我々の場合、無線通信システム70は一般にブラックボックスとして使用され、それ故、その統計的特徴付けの事前の知識がない。したがって、そのような状況における解決策は、強化学習(RL)パラダイムに、すなわち、累積報酬の概念を最大化するために環境内でいかに行動を取るかに取り組む機械学習の一分野に、頼ることである。
【】
強化学習は、非常に多数の状態をともなう問題に対処するために関数近似と組み合わせることができる。最も一般的なRLアルゴリズムは、所謂Q学習アルゴリズム、すなわち、特定の状態における行動の値を学習するためのモデルフリーアルゴリズムである。
【数】
【】
Q学習アルゴリズムは、環境のモデルを必要とせず(それゆえ「モデルフリー」)、適応を必要とせずに確率的遷移および報酬に関する問題を処理できる。最も単純なQ学習は、状態値データをテーブルに格納する。エージェントが特定の状態を訪ねて特定の行動を実行する見込みがますます小さくなるため、この手法は、状態/行動数の増加につれて行き詰る。そのような状況では、Q学習に関数近似を組み合わせることができる。これにより、状態空間が連続的であっても、より大きな問題にアルゴリズムを適用することが可能になる。1つの解決策は、関数近似器としてニューラルネットワークNNを使用することであり、所謂深層Q学習強化学習につながる。
【】
好適な実施形態では、少なくとも2つの確立済みQoSフローのいずれかを選択するための最適な選択ポリシーを選ぶために、深層Q学習RLアルゴリズムが適用される。この手法を用いると、制御サーバ30は、長期累積報酬関数に関して最適なやり方で少なくとも2つの領域への学習状態空間
【数】
のセグメント化を実行する傾向がある。分離は、環境の事前の知識なしに実行され、ロボットまたは車両の制御の場合によくあるように、連続状態表現と適合する。既知のどのような深層Q学習RLアルゴリズムとでも併せて使用でき、特定の深層Q学習RLアルゴリズムの選択は、本開示の特定の非限定的な実施形態に相当する。より一般的に言えば、既知のどのようなRLアルゴリズムとでも併せて使用できる。
【】
上述したように、報酬関数の設定は、選択ポリシーの最適化に影響を及ぼすという点で重要である。
【】
第1の例によると、報酬関数は、2つの目的、すなわち、制御性能を所与の限度内に保つことと、可能な限り、少なくとも輻輳の場合には、第1のQoSフローの選択より第2のQoSフローの選択を優先することとを、組み合わせるように設定できる。これは、既存の明確ではあるが複雑な手法を用いて解決できる多目的MDP問題に対応する。報酬関数が第1の項と第2の項とを組み合わせるアドホック手法に頼ることも可能である。
-第1の項は、制御サーバ30による被制御デバイス20の制御の制御性能を表し、制御性能が低下すると報酬を減少させ、
-第2の項は、第2のQoSフローが使用されるときと比較して第1のQoSフローが使用されるときに報酬を減少させる。
【】
よって、第1の項は、制御性能が改善される場合に報酬を増加させることを可能にするが、第2のQoSフローを使用しながら制御性能が改善される場合にはより大きな報酬が得られる。
【】
非限定的な例によると、報酬関数は以下のように計算できる。
【数】
ここで、
-
【数】
は第1の項であり、制御性能が増すにつれて減少する正の関数であり、
-
【数】
は第2の項であり、第1のQoSフローが使用されるときと比較して第2のQoSフローが使用されるときにより低い値をもたらす正の関数であり、
-
【数】
は、被制御デバイス20の状態(以下では「制御状態」とも呼ばれる)であり、
【数】
は、被制御デバイス20がタスクを実行するためにたどる必要がある基準軌道である。
【】
では、制御状態
【数】
が学習状態
【数】
から区別されている。制御において、制御状態
【数】
は基本的に、制御アルゴリズムによって考慮される1組の変数に対応し、一方、深層Q学習において、学習状態
【数】
は、取られるべき行動の決定を下すために使用されるNNの入力に対応する。制御状態と学習状態は、場合によっては互いに関連し得、実施形態しだいでは、それらは同じである場合と異なる場合がある。例えば、制御に関しては、被制御デバイス20は、所定の基準軌道をたどることになっているロボットであり得る。被制御デバイス20の制御状態
【数】
は通常、その位置および速度によって定義される。学習に関しては、学習状態
【数】
は、例えば、基準軌道と被制御デバイス20の制御状態
【数】
との差であり得る。
【】
例えば、
【数】
および/または
【数】
は以下の式によって定義できる。
【数】
ここで、
-
【数】
は、被制御デバイス20の状態
【数】
と被制御デバイス20がタスクを実行するためにたどる必要がある基準軌道
【数】
との誤差であり、
【数】
はノルムに相当する、すなわち、制御性能は(制御)状態
【数】
と目標軌道
【数】
との間の距離として評価され、
-
【数】
は、所定の係数である。
【】
この例では、学習状態
【数】
は、被制御デバイス20の(制御)状態
【数】
に関連し、例えば
【数】
に相当する。
【】
別の非限定的な例によると、報酬関数は以下のように計算できる。
【数】
ここで、
-学習状態
【数】
は、例えば
【数】
に対応し、
-
【数】
は、制御状態
【数】
と目標軌道
【数】
との間の距離を所与の値未満に維持しようとするために学習で使用される所定の正の閾値に対応し、
【数】
は実際には場合によっては閾値
【数】
を超えることがあるが、関連する短期報酬は負であり、それ故、長期報酬を減少させることに留意されたく、
-
【数】
および
【数】
は所定の係数であり、例えば
【数】
である(例えば、
【数】
および
【数】
)。
【】
の例では、学習状態
【数】
は被制御デバイス20の制御状態
【数】
に関連し、これは、例えば制御状態測定値を含む制御フィードバックによって制御状態
【数】
が制御サーバ30に正確に知られると仮定している。しかしながら、他の実施形態では、制御状態
【数】
に関連しない学習状態
【数】
を考慮することが可能である。例えば、学習状態
【数】
は以下のように定義できる。
【数】
ここで、
【数】
は、被制御デバイス20が反復
【数】
で新たな制御コマンドを受信したか
【数】
否か
【数】
の指標である。そのような学習状態
【数】
はまた、最後の
【数】
個の制御コマンドのうちのどれが被制御デバイス20によって受信されたかを知るために制御フィードバックに依拠するが(ここで、反復
【数】
で制御フィードバックが受信されなかった場合、
【数】
は制御サーバ30によって
【数】
に設定されてもよい)、これは、被制御デバイス20の(制御)状態
【数】
の測定値を受信する必要はない。
【】
で定義された報酬関数の各々は、制御性能を最大化し、第2のQoSフローを優先することによって輻輳レベルを最小化するという2つの目的を併せ持つものである。しかし、それは所期のQoEが達成されているかどうかをチェックしない。別の例によると、制約付きMDP(COMDP)手法に頼ることが提案される。COMDPでは、以下のように定義される実施可能な選択ポリシーにわたって最適な選択ポリシーが探索される。
【数】
ここで、
【数】
はコスト値関数であり、
【数】
は最大許容累積コストである。換言すると、結果的に得られる選択ポリシーが所定の制御性能基準(例えば、最大許容累積コスト)を満たすという制約の下で最適化が行われる。そして、以下を探すことによってCOMPDを解決できる。
【数】
【】
例えば、報酬関数とコスト関数は以下のように定義できる。
【数】
ここで、
-
【数】
は、制御性能が増すにつれて減少する正の関数であり、
-
【数】
は、第1のQoSフローが使用されるときと比較して第2のQoSフローが使用されるときにより低い値をもたらす正の関数である。
例えば、
【数】
および/または
【数】
は以下の式によって定義できる。
【数】
ここで、
【数】
は所定の係数である。
【】
図6は、強化学習によって判断された選択ポリシーで制御性能をいかに改善できるかを示すシミュレーション結果を概略的に表す。図6では、基本的な比例制御器を使用して正弦基準信号を追跡している。より具体的には、
-図6の部分a)は、第1のQoSフローが常に使用される場合を表しており、これは基本的に上述の従来技術に相当し、
-図6の部分b)は、2つのQoSフローが確立される場合を表しており、第1のQoSフローはデフォルトで使用され、第2のQoSフローは輻輳が検出されたときに使用され、
-図6の部分c)は、2つのQoSフローが確立される場合を表しており、第1のQoSフローはデフォルトで使用され、第2のQoSフローは、輻輳が検出され、かつタスクの段階が第2のQoSフローの使用と適合する場合に使用され、選択ポリシーは強化学習によって判断されている。
【】
部分a)、部分b)、および部分c)の各々において、無線通信システム70は、最初は輻輳しておらず、ある時点で輻輳するようになり、制御サーバ30によって輻輳が検出される。無線通信システム70が輻輳していると、制御コマンドはエラーをともなって送信され、PERは0.1から0.8に増加する。パケットが失われる場合は、被制御デバイス20によって受信される最後の制御コマンドが使用される。
【】
図6の部分a)によって示されているように、常に第1のQoSフローを使用する場合、被制御デバイス20は正弦基準信号を追跡するが、無線通信システム70の多くの無線リソースを使用するという代償をともない、これは他のデバイスの通信性能に影響を及ぼす可能性があり、他のデバイスは無線通信システム70へのアクセスが拒否される可能性がある。
【】
図6の部分b)では、輻輳が検出されたときに第2のQoSフローが使用される。よって、使用される無線リソースの量が減らされ、これにより、他のデバイスが無線通信システム70へのアクセスを拒否される事態が防止され得る。しかしながら、正弦基準信号の直線部分では制御性能は低下しないが、正弦基準信号の曲線部分ではそうではなく、所期のQoEはもはや達成されない。よって、図6の部分b)は、(制御コマンド配信性能の点で)異なるQoSレベルを必要とする、実行されるべきタスク(すなわち、正弦基準信号を追跡する)の異なる段階(すなわち、直線部分と曲線部分)を強調している。
【】
図6の部分c)では、強化学習によって判断された選択ポリシーが適用される。図6の部分c)に見られるように、輻輳が検出されると、選択ポリシーが第1のQoSフローと第2のQoSフローとを切り替える。より具体的には、選択ポリシーは、正弦基準信号の曲線部分に対して第1のQoSフローを選択し、正弦基準信号の直線部分に対して第2のQoSフローを選択し、これにより、無線通信システム70が輻輳しているときには(直線部分のときには)より少ない無線リソースを使用しながら、制御の全期間にわたって所期のQoEを達成する。
【】
本開示がの例示的な実施形態に限定されないことを強調する。の例示的な実施形態の変形も本発明の範囲内にある。
【】
例えば、の例示的な主に第1のQoSフローと第2のQoSフローを考慮して提供されている。しかしながら、上述したように、制御サーバ30の制御アプリケーションのために3つ以上のQoSフローを確立することも可能である。例えば、第1のQoSフローのQoSレベルより低く、かつ第2のQoSフローのQoSレベルとは異なる(より低いまたはより大きい)関連QoSレベルを有する第3のQoSフローを確立することが可能である。したがって、QoSフロー選択ステップS42は、3つの異なるQoSレベルにそれぞれ関連付けられた制御コマンドを送信するためのQoSフローを選択するための3つの異なるオプションを有する。
【】
また、強化学習を含む前述の例は、主に単一の被制御デバイス20(ことによると、他のデバイスと無線通信システム70を共有する)を制御サーバ30が制御する場合を考慮して提供されている。MDPの脈絡で最適な解決策を見つけるための重要な仮定は、環境の定常性である。基本的に、状態遷移行列は経時的に一定であるものとする。被制御デバイス20と環境(特に無線通信システム70)を共有する他のデバイスが同種のデバイスである場合、定常性の原理はもはや成り立ち得ず、マルコフ性はもはや成り立ち得ない。第1の解決策は、全ての被制御デバイス20を単一の制御システム10として組み合わせることにあるが、被制御デバイス20の数と共に計算の複雑さが増す。これはまた、個々の被制御デバイス20のあらゆる可能な組み合わせについて制御システム10をトレーニングすることを必要とする。別の解決策は、強化学習の亜領域であるマルチエージェント強化学習MARLに頼ることである。MARLは、共有環境内に共存する複数の学習エージェントの挙動を取り扱うことに着目している。
【産業上の利用可能性】
【】
制御サーバと、無人搬送車(AGV)や自律移動ロボット(AMR)など、あらゆる種類のロボットまたは車両などの1つ以上の移動式または可搬式被制御デバイスとを含む、制御システムに適用可能である。
【図】
【図】
【図】
【図】
【図】
【図】
【手続補正書】
【提出日】
【手続補正】
【補正対象書類名】特許請求の範囲
【補正対象項目名】全文
【補正方法】変更
【補正の内容】
【特許請求の範囲】
【請求項】
制御サー
バによって実行さ
れ、被制御デバイ
スを制御する
制御アプリケーションを実行する制御方
法であって、無線通信システ
ムを使用して前記被制御デバイスへ制御コマンドを送信することによって前記被制御デバイスに
連続する複数の段階を含むタスクを実行させることを目的とし、前記無線通信システムが、それぞれの異なるQoSレベルに関連付けられた異なるサービス品質
(QoS
)フローの確立をサポートし、前記制御方
法が、
前記タスクを実行する前記被制御デバイスを制御するとき、前記制御アプリケーションが達成すべき期待体験品質(QoE)を定義することと、
前記被制御デバイスへ制御コマンドを送信するための少なくとも2つのQoSフローを確立するこ
とと、
前記タスクの現在段階の前記被制御デバイスへ送信される制御コマンドを判断するこ
とと、
確立された前記少なくとも2つのQoSフローのうち、前記タスクの前記現在段階に必要な前記QoSレベルと適合するQoSレベルを提供するという点で前記タスクの前記現在段階と適合するQoSフローがいずれかを特定することにより、確立された前記少なくとも2つのQoSフローの中から、前記制御コマンドを送信するのに使用されるQoSフローを選択するこ
とと、
前記選択されたQoSフローを使用して、前記無線通信システムを介して、少なくとも1つの前記被制御デバイスへ前記制御コマンドを送信するこ
とと、を含み、
前記少なくとも2つのQoSフローが、第1のQoSフローと第2のQoSフローとを含み、
前記第1のQoSフローのQoSレベルが前記第2のQoSフローのQoSレベルよりも大きい制御コマンド配信性能を達成でき、
前記制御コマンド配信性能は、いかに信頼できるように制御コマンドが前記被制御デバイスに配信されうるか、および/または、いかに速く制御コマンドが前記被制御デバイスに配信されうるかを示し、前記複数の段階はそれぞれのQoSレベル要件と関連付けられ、
前記選択されるQoSフローは、前記タスクの前記現在段階の前記期待QoEを達成可能にする
制御方
法。
【請求項】
前記QoSフローを選択することは、
前記無線通信システムが輻輳しているかどうか、または輻輳寸前であるかどうかを評価することと、
前記無線通信システムが輻輳していること、または輻輳寸前であることを検出したことに応じて、
前記被制御デバイスにより実行される前記タスクの前記現在段階に必要な前記QoSレベルが、確立された前記少なくとも2つのQoSフローのうちの前記第1のQoSフロー以外のQoSフローによっても提供される場合にのみ、前記QoSフロー
の選択中に前記第1のQoSフローを考慮しないことと、を含む、
請求項
1に記載の制御方
法。
【請求項】
前記第1のQoSフローは、前記タスクの前記現在段階に必要な前記QoSレベルが、確立された前記少なくとも2つのQoSフローのうちの別のQoSフローによって提供されないと判断された場合にのみ使用される、請求項
1に記載の制御方
法。
【請求項】
前記被制御デバイスから制御フィードバックを受信するこ
とをさらに含み、前記QoSフローは、前記受信された制御フィードバックに基づいて選択される、請求項
1に記載の制御方
法。
【請求項】
前記QoSフローの前記選択は、強化学習アルゴリズムを使用して学習された機械学習モデルを含む選択ポリシーを使用する、請求項
4に記載の制御方
法。
【請求項】
前記機械学習モデルは、深層Q学習強化学習アルゴリズムを使用して学習されたニューラルネットワークを含む、請求項
5に記載の制御方
法。
【請求項】
前記強化学習アルゴリズムは、第1の項と第2の項とを組み合わせた報酬関数を使用し、
前記第1の項は、前記制御サーバによる前記被制御デバイスの前記制御の制御性能を表し、前記制御性能が低下する
と報酬を減少させ、
前記第2の項は、前記第2のQoSフローが使用されるときと比較して前記第1のQoSフローが使用されるときに前記報酬を減少させる、請求項
5に記載の制御方
法。
【請求項】
前記強化学習アルゴリズムは、前記第2のQoSフローが使用されるときと比較して前記第1のQoSフローが使用されるときにより小さい報酬を返す報酬関数を使用し、前記機械学習モデルの前記学習は
、結果的に得られる前記選択ポリシーが制御性能基準を満たすという制約の下で実行される、請求項
5に記載の制御方
法。
【請求項】
前記制御サーバは、複数の被制御デバイスを制御し、前記選択ポリシーの前記機械学習モデルは、マルチエージェント強化学習アルゴリズムを使用して学習される、請求項
5に記載の制御方
法。
【請求項】
少なくとも1つのプロセッサ
に、請求項
1に記載の制御方
法を実行
させるための命令を備える、コンピュータプログラム。
【請求項】
少なくとも1つのプロセッサ
に、請求項
1に記載の制御方
法を実行
させるための命令を備える
コンピュータプログラムを記憶した、コンピュータ可読記憶媒体。
【請求項】
被制御デバイ
スを制御する制御サー
バであって、前記制御は、前記被制御デバイスにタスクを実行させることを目的とし、前記制御サー
バは、請求項
1に記載の制御方
法を実行するように構成された処理回
路および通信ユニッ
トを備える、制御サー
バ。
【請求項】
請求項
12に記載の制御サー
バと、無線通信システ
ムを介して前記制御サーバによって制御される少なくとも1つの被制御デバイ
スと、を備える、制御システ
ム。
【手続補正】
【補正対象書類名】明細書
【補正対象項目名】0010
【補正方法】変更
【補正の内容】
【】
この目的のため、第1の態様によると、制御サーバによって実行され、被制御デバイスを制御する制御アプリケーションを実行する制御方法であって、無線通信システムを使用して前記被制御デバイスへ制御コマンドを送信することによって前記被制御デバイスに連続する複数の段階を含むタスクを実行させることを目的とし、前記無線通信システムが、それぞれの異なるQoSレベルに関連付けられた異なるサービス品質(QoS)フローの確立をサポートし、前記制御方法が、
前記タスクを実行する前記被制御デバイスを制御するとき、前記制御アプリケーションが達成すべき期待体験品質(QoE)を定義することと、
前記被制御デバイスへ制御コマンドを送信するための少なくとも2つのQoSフローを確立することと、
前記タスクの現在段階の前記被制御デバイスへ送信される制御コマンドを判断することと、
確立された前記少なくとも2つのQoSフローのうち、前記タスクの前記現在段階に必要な前記QoSレベルと適合するQoSレベルを提供するという点で前記タスクの前記現在段階と適合するQoSフローがどれかを特定することにより、確立された前記少なくとも2つのQoSフローの中から、前記制御コマンドを送信するのに使用されるQoSフローを選択することと、
前記選択されたQoSフローを使用して、前記無線通信システムを介して、少なくとも1つの前記被制御デバイスへ前記制御コマンドを送信することと、を含み、
前記少なくとも2つのQoSフローが、第1のQoSフローと第2のQoSフローとを含み、
前記第1のQoSフローのQoSレベルが前記第2のQoSフローのQoSレベルよりも大きい制御コマンド配信性能を達成でき、
前記制御コマンド配信性能は、いかに信頼できるように制御コマンドが前記被制御デバイスに配信されうるか、および/または、いかに速く制御コマンドが前記被制御デバイスに配信されうるかを示し、前記複数の段階はそれぞれのQoSレベル要件と関連付けられ、
前記選択されるQoSフローは、前記タスクの前記現在段階の前記期待QoEを達成可能にする。
【手続補正】
【補正対象書類名】明細書
【補正対象項目名】0017
【補正方法】削除
【補正の内容】
【手続補正】
【補正対象書類名】明細書
【補正対象項目名】0018
【補正方法】変更
【補正の内容】
【】
特定の実施形態では、QoSフローを選択することは、
無線通信システムが輻輳しているかどうか、または輻輳寸前であるかどうかを評価することと、
無線通信システムが輻輳していること、または輻輳寸前であることを検出したことに応じて、前記被制御デバイスにより実行される前記タスクの前記現在段階に必要な前記QoSレベルが、確立された前記少なくとも2つのQoSフローのうちの前記第1のQoSフロー以外のQoSフローによっても提供される場合にのみ(少なくとも、第1のQoSフローのQoSレベルがタスクの現在または次の段階で所期のQoEを達成するために必要とされない場合に)QoSフローの選択中に第1のQoSフローを考慮しないことと、を含む。
【手続補正】
【補正対象書類名】明細書
【補正対象項目名】0048
【補正方法】変更
【補正の内容】
【】
よって、本開示では、同じ制御アプリケーションのために(少なくとも)2つの異なるQoSフローが確立されるが、従来技術の解決策では、ユーザアプリケーションが理論的には単一のQoSプロファイルに関連付けられ、対応する単一のQoSフローを使用してアプリケーションレベルのトラフィックを交換する。したがって、無線通信システムの観点からは、制御サーバ30が、異なるQoSレベル要件(すなわち、異なるQoSプロファイル)を有する2つの異なる制御アプリケーションを実行していると見なされる。例えば、第1のQoSフローは、遅延に対し重大な(例えば、周期的)GBRトラフィックを交換するために確立されてよく、第2のQoSフローは、ベストエフォートトラフィックを交換するために確立されてよい。通常、第1のQoSフローのQoSレベルは、最も要求の厳しい状況に適したQoSレベルに、すなわち、制御アプリケーションがいかなる状況でも所期のQoEを達成することを可能にすると考えられるQoSレベルに、相当する。一方、第2のQoSフローのQoSレベルは、より低い制御コマンド配信性能を提供し、制御アプリケーションがいかなる状況でも所期のQoEを達成することを可能にするとは考えることができない。
【手続補正】
【補正対象書類名】明細書
【補正対象項目名】0059
【補正方法】変更
【補正の内容】
【】
別の例では、選択ポリシーは、デフォルトで第2のQoSフローを使用することと、1つ以上の所定の条件が確認された場合にのみ第1のQoSフローを使用することとにあってもよい。したがって、そのような選択ポリシーは、最少の無線リソースを必要とするQoSフローを、例えば第2のQoSフローを、デフォルトで使用することによって、制御アプリケーションによって使用される無線リソースの量を最小限に抑えること(また、したがって、輻輳確率を下げること)を重視する。例えば、タスクの現在段階を実行するために必要なQoSレベルに関連する条件を考慮することができる(タスク段階関連の条件)。そのような場合、QoSフロー選択ステップS42は、タスクの現在段階に必要なQoSレベルを判断することと、確立済みQoSフローの中から、タスクの現在段階中に所期のQoEの達成を可能にする制御コマンド配信性能を提供するという点において、タスクの現在段階に必要なQoSレベルに適合するQoSフローがどれかを特定することを含んでよい。例えば、選択されるQoSフローは、最も低いQoSレベルが関連付けられた確立済みの適合QoSフローに一致するので、第1のQoSフローは、QoSレベル要件を遵守するために絶対に必要とされる場合(すなわち、第1のQoSフロー以外の確立済みQoSフローを使用すると所期のQoEが達成可能であると考えられない場合)にのみ使用される。
【手続補正】
【補正対象書類名】明細書
【補正対象項目名】0082
【補正方法】変更
【補正の内容】
【】
で定義された報酬関数の各々は、制御性能を最大化し、第2のQoSフローを優先することによって輻輳レベルを最小化するという2つの目的を併せ持つものである。しかし、それは所期のQoEが達成されているかどうかをチェックしない。別の例によると、制約付きMDP(COMDP)手法に頼ることが提案される。COMDPでは、以下のように定義される実施可能な選択ポリシーにわたって最適な選択ポリシーが探索される。
【数】
ここで、
【数】
はコスト値関数であり、
【数】
は最大許容累積コストである。換言すると、結果的に得られる選択ポリシーが所定の制御性能基準(例えば、最大許容累積コスト)を満たすという制約の下で最適化が行われる。そして、以下を探すことによって
COMDPを解決できる。
【数】
【国際調査報告】