(19)【発行国】日本国特許庁(JP)
(12)【公報種別】公開特許公報(A)
(11)【公開番号】P2026115928
(43)【公開日】2026-07-09
(54)【発明の名称】データ処理装置、データ処理方法、及びデータ処理プログラム
(51)【国際特許分類】
G06F 3/01 20060101AFI20260702BHJP
G06F 3/16 20060101ALI20260702BHJP
H04R 3/00 20060101ALI20260702BHJP
G10L 19/02 20130101ALI20260702BHJP
G10L 19/00 20130101ALI20260702BHJP
G10L 25/00 20130101ALI20260702BHJP
G06Q 50/10 20120101ALI20260702BHJP
G10L 13/00 20060101ALI20260702BHJP
G10L 13/02 20130101ALI20260702BHJP
G10L 25/48 20130101ALI20260702BHJP
G10L 13/04 20130101ALI20260702BHJP
H04R 1/10 20260101ALI20260702BHJP
G10L 19/16 20130101ALI20260702BHJP
G10L 21/028 20130101ALI20260702BHJP
【FI】
G06F3/01 560
G06F3/16 670
H04R3/00 310
G10L19/02 170A
G10L19/00 500Z
G06F3/01 510
G10L19/00 200
G06F3/16 650
G10L25/00
G06F3/16 610
G06Q50/10
G10L13/00 100U
G10L13/02 141Z
G10L25/48
G06F3/16 400
G06F3/16 660
G10L13/04 F
H04R1/10 104Z
G06F3/16 690
G10L19/00 500A
G10L19/16 200B
G10L21/028 A
G06F3/16 620
H04R1/10 101A
【審査請求】未請求
【請求項の数】5
【出願形態】OL
(21)【出願番号】P 2024232987
(22)【出願日】2024-12-27
(71)【出願人】
【識別番号】591280485
【氏名又は名称】ソフトバンクグループ株式会社
(74)【代理人】
【識別番号】110001519
【氏名又は名称】弁理士法人太陽国際特許事務所
(72)【発明者】
【氏名】孫 正義
【テーマコード(参考)】
5D005
5D220
5E555
5L050
【Fターム(参考)】
5D005BB03
5D005BB11
5D220AA11
5D220BA30
5E555AA14
5E555BA01
5E555BA02
5E555BA11
5E555BA35
5E555BA43
5E555BA51
5E555BA61
5E555BA62
5E555BA64
5E555BA81
5E555BB01
5E555BB02
5E555BB11
5E555BC04
5E555BC06
5E555BD03
5E555BE15
5E555BE20
5E555CB01
5E555CB51
5E555CC06
5E555CC30
5E555DA10
5E555DC01
5E555DC28
5E555DC86
5E555DD20
5E555EA30
5E555FA00
5E555FA02
5E555FA05
5E555FA08
5E555FA09
5E555FA13
5E555FA15
5E555FA17
5L050CC14
5L050CC37
5L050CC46
5L050DD06
(57)【要約】
【課題】ユーザの記憶または行動に関する発話の内容に対応する情報をユーザに提案できるデータ処理装置、データ処理方法、及びプログラムを提供する。
【解決手段】データ処理装置は、マイク、スピーカ、カメラ、及び生体センサを含みユーザの耳に装着される2つのイヤフォンで収集された音、画像、及び生体データを含むユーザデータを入力する入力部と、ユーザデータに応じた所定の推論結果を生成するデータ生成モデルを用いた特定処理を行う処理部と、特定処理の結果をスピーカから再生させる出力部と、を備え、入力部は、マイクで検出された音とカメラで撮影された画像と生体センサで取得された生体データを、ユーザデータとして入力し、処理部は、発話の内容に対応する情報をユーザに提案すると共に触覚フィードバックを取得する処理を、特定処理として行う。
【選択図】
図2
【特許請求の範囲】
【請求項1】
マイク、スピーカ、カメラ、及び生体センサを含みユーザの耳に装着される2つのイヤフォンで収集された音、画像、及び生体データを含むユーザデータを入力する入力部と、
前記ユーザデータに応じた所定の推論結果を生成するデータ生成モデルを用いた特定処理を行う処理部と、
前記特定処理の結果を前記スピーカから再生させる出力部と、
を備え、
前記イヤフォンは、カナル型のイヤフォン又はインナーイヤー型のイヤフォンであり、前記イヤフォンを装着した前記ユーザのみが前記イヤフォンから出力される音を聴くことが可能であり、
前記イヤフォンは、振動機能を備えており、触覚フィードバックを出力することが可能であり、
前記入力部は、前記マイクで検出された音と前記カメラで撮影された画像と前記生体センサによって取得された前記生体データとを、前記ユーザデータとして入力し、
前記処理部は、前記イヤフォンを装着した前記ユーザから前記ユーザの記憶または行動に関する発話を受け付けた場合、前記ユーザに紐付く前記音及び前記画像が記録された前記ユーザのライフログに基づき、前記発話の内容に対応する情報を前記ユーザに提案すると共に、前記イヤフォンによる前記触覚フィードバックを生成することを指示するプロンプトをデータ生成モデルに入力することにより、前記発話の内容に対応する情報及び前記触覚フィードバックを取得する処理を、前記特定処理として行う、データ処理装置。
【請求項2】
前記処理部は、前記発話の内容として、前記イヤフォンを装着した前記ユーザが特定の記憶を思い出すきっかけとなるメッセージを要求した場合、前記プロンプトにおいて、前記ライフログに基づき選択された1または複数のメッセージを、前記発話の内容に対応する情報として、前記ユーザに提案することを指示する、請求項1に記載のデータ処理装置。
【請求項3】
前記処理部は、前記発話の内容として、前記イヤフォンを装着した前記ユーザが特定の事柄をつぶやいた場合、前記プロンプトにおいて、前記ライフログに基づき前記事柄に対して推奨される前記ユーザの行動を、前記発話の内容に対応する情報として、前記ユーザに提案することを指示する、請求項1に記載のデータ処理装置。
【請求項4】
マイク、スピーカ、カメラ、及び生体センサを含みユーザの耳に装着される2つのイヤフォンで収集された音、画像、及び生体データを含むユーザデータを入力し、前記ユーザデータに応じた所定の推論結果を生成するデータ生成モデルを用いた特定処理を、コンピュータが実行するデータ処理方法であって、
前記イヤフォンは、カナル型のイヤフォン又はインナーイヤー型のイヤフォンであり、前記イヤフォンを装着した前記ユーザのみが前記イヤフォンから出力される音を聴くことが可能であり、
前記イヤフォンは、振動機能を備えており、触覚フィードバックを出力することが可能であり、
前記マイクで検出された音と前記カメラで撮影された画像と前記イヤフォンによって取得された前記生体データとを、前記ユーザデータとして入力し、
前記イヤフォンを装着した前記ユーザから前記ユーザの記憶または行動に関する発話を受け付けた場合、前記ユーザに紐付く前記音及び前記画像が記録された前記ユーザのライフログに基づき、前記発話の内容に対応する情報を前記ユーザに提案すると共に、前記イヤフォンによる前記触覚フィードバックを生成することを指示するプロンプトをデータ生成モデルに入力することにより、前記発話の内容に対応する情報及び前記触覚フィードバックを取得する処理を、前記特定処理として実行し、
前記特定処理の結果を前記スピーカから再生させると共に、前記振動機能により触覚フィードバックを出力する処理を、
前記コンピュータが実行するデータ処理方法。
【請求項5】
マイク、スピーカ、カメラ、及び生体センサを含みユーザの耳に装着される2つのイヤフォンで収集された音、画像、及び生体データを含むユーザデータを入力し、前記ユーザデータに応じた所定の推論結果を生成するデータ生成モデルを用いた特定処理を、コンピュータに実行させるデータ処理プログラムであって、
前記イヤフォンは、カナル型のイヤフォン又はインナーイヤー型のイヤフォンであり、前記イヤフォンを装着した前記ユーザのみが前記イヤフォンから出力される音を聴くことが可能であり、
前記イヤフォンは、振動機能を備えており、触覚フィードバックを出力することが可能であり、
前記マイクで検出された音と前記カメラで撮影された画像と前記イヤフォンによって取得された前記生体データとを、前記ユーザデータとして入力し、
前記イヤフォンを装着した前記ユーザから前記ユーザの記憶または行動に関する発話を受け付けた場合、前記ユーザに紐付く前記音及び前記画像が記録された前記ユーザのライフログに基づき、前記発話の内容に対応する情報を前記ユーザに提案すると共に、前記イヤフォンによる前記触覚フィードバックを生成することを指示するプロンプトをデータ生成モデルに入力することにより、前記発話の内容に対応する情報及び前記触覚フィードバックを取得する処理を、前記特定処理として実行し、
前記特定処理の結果を前記スピーカから再生させると共に、前記振動機能により触覚フィードバックを出力する処理を、
前記コンピュータに実行させるデータ処理プログラム。
【発明の詳細な説明】
【技術分野】
【0001】
本開示の技術は、データ処理装置、データ処理方法、及びデータ処理プログラムに関する。
【背景技術】
【0002】
特許文献1には、少なくとも一つのプロセッサにより遂行される、ペルソナチャットボット制御方法であって、ユーザ発話を受信するステップと、前記ユーザ発話を、チャットボットのキャラクターに関する説明と関連した指示文を含むプロンプトに追加するステップと前記プロンプトをエンコードするステップと、前記エンコードしたプロンプトを言語モデルに入力して、前記ユーザ発話に応答するチャットボット発話を生成するステップ、を含む、方法が開示されている。
【先行技術文献】
【特許文献】
【0003】
【発明の概要】
【発明が解決しようとする課題】
【0004】
しかしながら従来技術では、ユーザが発した言葉に対する発話を生成する際、ユーザが日常生活でとった行動が反映されないため、ユーザの発話内容に対応する情報を提案する上で、改善の余地がある。
【課題を解決するための手段】
【0005】
本開示の技術に係る第1の態様は、マイク、スピーカ、カメラ、及び生体センサを含みユーザの耳に装着される2つのイヤフォンで収集された音、画像、及び生体データを含むユーザデータを入力する入力部と、前記ユーザデータに応じた所定の推論結果を生成するデータ生成モデルを用いた特定処理を行う処理部と、前記特定処理の結果を前記スピーカから再生させる出力部と、を備え、前記イヤフォンは、カナル型のイヤフォン又はインナーイヤー型のイヤフォンであり、前記イヤフォンを装着した前記ユーザのみが前記イヤフォンから出力される音を聴くことが可能であり、前記イヤフォンは、振動機能を備えており、触覚フィードバックを出力することが可能であり、前記入力部は、前記マイクで検出された音と前記カメラで撮影された画像と前記生体センサによって取得された前記生体データとを、前記ユーザデータとして入力し、前記処理部は、前記イヤフォンを装着した前記ユーザから前記ユーザの記憶または行動に関する発話を受け付けた場合、前記ユーザに紐付く前記音及び前記画像が記録された前記ユーザのライフログに基づき、前記発話の内容に対応する情報を前記ユーザに提案すると共に、前記イヤフォンによる前記触覚フィードバックを生成することを指示するプロンプトをデータ生成モデルに入力することにより、前記発話の内容に対応する情報及び前記触覚フィードバックを取得する処理を、前記特定処理として行う、データ処理装置である。
【0006】
本開示の技術に係る第2の態様は、マイク、スピーカ、カメラ、及び生体センサを含みユーザの耳に装着される2つのイヤフォンで収集された音、画像、及び生体データを含むユーザデータを入力し、前記ユーザデータに応じた所定の推論結果を生成するデータ生成モデルを用いた特定処理を、コンピュータが実行するデータ処理方法であって、前記イヤフォンは、カナル型のイヤフォン又はインナーイヤー型のイヤフォンであり、前記イヤフォンを装着した前記ユーザのみが前記イヤフォンから出力される音を聴くことが可能であり、前記イヤフォンは、振動機能を備えており、触覚フィードバックを出力することが可能であり、前記マイクで検出された音と前記カメラで撮影された画像と前記イヤフォンによって取得された前記生体データとを、前記ユーザデータとして入力し、前記イヤフォンを装着した前記ユーザから前記ユーザの記憶または行動に関する発話を受け付けた場合、前記ユーザに紐付く前記音及び前記画像が記録された前記ユーザのライフログに基づき、前記発話の内容に対応する情報を前記ユーザに提案すると共に、前記イヤフォンによる前記触覚フィードバックを生成することを指示するプロンプトをデータ生成モデルに入力することにより、前記発話の内容に対応する情報及び前記触覚フィードバックを取得する処理を、前記特定処理として実行し、前記特定処理の結果を前記スピーカから再生させると共に、前記振動機能により触覚フィードバックを出力する処理を、前記コンピュータが実行するデータ処理方法である。
【0007】
本開示の技術に係る第3の態様は、マイク、スピーカ、カメラ、及び生体センサを含みユーザの耳に装着される2つのイヤフォンで収集された音、画像、及び生体データを含むユーザデータを入力し、前記ユーザデータに応じた所定の推論結果を生成するデータ生成モデルを用いた特定処理を、コンピュータに実行させるデータ処理プログラムであって、前記イヤフォンは、カナル型のイヤフォン又はインナーイヤー型のイヤフォンであり、前記イヤフォンを装着した前記ユーザのみが前記イヤフォンから出力される音を聴くことが可能であり、前記イヤフォンは、振動機能を備えており、触覚フィードバックを出力することが可能であり、前記マイクで検出された音と前記カメラで撮影された画像と前記イヤフォンによって取得された前記生体データとを、前記ユーザデータとして入力し、前記イヤフォンを装着した前記ユーザから前記ユーザの記憶または行動に関する発話を受け付けた場合、前記ユーザに紐付く前記音及び前記画像が記録された前記ユーザのライフログに基づき、前記発話の内容に対応する情報を前記ユーザに提案すると共に、前記イヤフォンによる前記触覚フィードバックを生成することを指示するプロンプトをデータ生成モデルに入力することにより、前記発話の内容に対応する情報及び前記触覚フィードバックを取得する処理を、前記特定処理として実行し、前記特定処理の結果を前記スピーカから再生させると共に、前記振動機能により触覚フィードバックを出力する処理を、前記コンピュータに実行させるデータ処理プログラムである。
【図面の簡単な説明】
【0008】
【
図1】
図1はデータ処理システムの構成の一例を示す概念図である。
【
図2】
図2はデータ処理装置及びイヤフォンの要部機能の一例を示す概念図である。
【
図3B】
図3Bはユーザがイヤフォンを装着した状態を示す図である。
【
図3C】
図3Cはカメラ42の画角について説明するための図である。
【
図3D】
図3Dはユーザがイヤフォンを装着した状態を示す図である。
【
図3E】
図3Eはユーザがイヤフォンを装着した状態を示す図である。
【
図3F】
図3Fはユーザがイヤフォンを装着した状態を示す図である。
【
図4】データ処理装置の特定処理部の機能構成を概略的に示す。
【
図5】データ処理装置による特定処理の動作フローの一例を概略的に示す。
【
図6】
図6はデータ処理システムの構成の一例を示す概念図である。
【発明を実施するための形態】
【0009】
以下、添付図面に従って本開示の技術に係るデータ処理装置、データ処理方法、及びプログラムの実施形態の一例について説明する。
【0010】
先ず、以下の説明で使用される文言について説明する。
【0011】
以下の実施形態において、符号付きのプロセッサ(以下、単に「プロセッサ」と称する)は、1つの演算装置であってもよいし、複数の演算装置の組み合わせであってもよい。また、プロセッサは、1種類の演算装置であってもよいし、複数種類の演算装置の組み合わせであってもよい。演算装置の一例としては、CPU(Central Processing Unit)、GPU(Graphics Processing Unit)、GPGPU(General-Purpose computing on Graphics Processing Units)、又はAPU(Accelerated Processing Unit)等が挙げられる。
【0012】
以下の実施形態において、符号付きのRAM(Random Access Memory)は、一時的に情報が格納されるメモリであり、プロセッサによってワークメモリとして用いられる。
【0013】
以下の実施形態において、符号付きのストレージは、各種プログラム及び各種パラメータ等を記憶する1つ又は複数の不揮発性の記憶装置である。不揮発性の記憶装置の一例としては、フラッシュメモリ(SSD(Solid State Drive))、磁気ディスク(例えば、ハードディスク)、又は磁気テープ等が挙げられる。
【0014】
以下の実施形態において、符号付きの通信I/F(Interface)は、通信プロセッサ及びアンテナ等を含むインタフェースである。通信I/Fは、複数のコンピュータ間での通信を司る。通信I/Fに対して適用される通信規格の一例としては、5G(5th Generation Mobile Communication System)、Wi-Fi(登録商標)、又はBluetooth(登録商標)等を含む無線通信規格が挙げられる。
【0015】
以下の実施形態において、「A及び/又はB」は、「A及びBのうちの少なくとも1つ」と同義である。つまり、「A及び/又はB」は、Aだけであってもよいし、Bだけであってもよいし、A及びBの組み合わせであってもよい、という意味である。また、本明細書において、3つ以上の事柄を「及び/又は」で結び付けて表現する場合も、「A及び/又はB」と同様の考え方が適用される。
【0016】
<第1の実施形態>
図1には、実施形態に係るデータ処理システム10の構成の一例が示されている。
【0017】
図1に示すように、データ処理システム10は、データ処理装置12及びイヤフォン14を備えている。データ処理装置12の一例としては、サーバが挙げられる。本実施形態において、データ処理装置12は、本開示の技術に係る「データ処理装置」の一例である。
【0018】
データ処理装置12は、コンピュータ22、データベース24、及び通信I/F26を備えている。コンピュータ22は、本開示の技術に係る「コンピュータ」の一例である。コンピュータ22は、プロセッサ28、RAM30、及びストレージ32を備えている。プロセッサ28、RAM30、及びストレージ32は、バス34に接続されている。また、データベース24及び通信I/F26も、バス34に接続されている。通信I/F26は、ネットワーク54に接続されている。ネットワーク54の一例としては、WAN(Wide Area Network)及び/又はLAN(Local Area Network)等が挙げられる。
【0019】
イヤフォン14は、コンピュータ36、マイクロフォン38、スピーカ40、カメラ42、及び通信I/F44を備えている。コンピュータ36は、プロセッサ46、RAM48、及びストレージ50を備えている。プロセッサ46、RAM48、及びストレージ50は、バス52に接続されている。また、マイクロフォン38、スピーカ40、及びカメラ42も、バス52に接続されている。
【0020】
マイクロフォン38は、ユーザ20が発する音声を受け付けることで、ユーザ20から指示等を受け付ける。マイクロフォン38は、ユーザ20が発する音声を捕捉し、捕捉した音声を音声データに変換してプロセッサ46に出力する。スピーカ40は、プロセッサ46からの指示に従って音声を出力する。以下ではマイクロフォン38を単にマイク38と称する場合がある。
【0021】
カメラ42は、レンズ、絞り、及びシャッタ等の光学系と、CMOS(Complementary Metal-Oxide-Semiconductor)イメージセンサ又はCCD(Charge Coupled Device)イメージセンサ等の撮像素子とが搭載された小型デジタルカメラであり、ユーザ20の周囲(例えば、一般的な健常者の視界の広さに相当する画角で規定された撮像範囲)を撮像する。
【0022】
通信I/F44は、ネットワーク54に接続されている。通信I/F44及び26は、ネットワーク54を介してプロセッサ46とプロセッサ28との間の各種情報の授受を司る。
【0023】
図2には、データ処理装置12及びイヤフォン14の要部機能の一例が示されている。
【0024】
図2に示すように、データ処理装置12では、プロセッサ28によって特定処理が行われる。ストレージ32には、特定処理プログラム56が格納されている。特定処理プログラム56は、本開示の技術に係る「データ処理プログラム」の一例である。プロセッサ28は、ストレージ32から特定処理プログラム56を読み出し、読み出した特定処理プログラム56をRAM30上で実行する。特定処理は、プロセッサ28がRAM30上で実行する特定処理プログラム56に従って特定処理部290として動作することによって実現される。
【0025】
ストレージ32には、データ生成モデル58が格納されている。データ生成モデル58は、特定処理部290によって用いられる。
【0026】
(イヤフォン14)
イヤフォン14では、プロセッサ46によって受付出力処理が行われる。ストレージ50には、受付出力プログラム60が格納されている。プロセッサ46は、ストレージ50から受付出力プログラム60を読み出し、読み出した受付出力プログラム60をRAM48上で実行する。受付出力処理は、プロセッサ46がRAM48上で実行する受付出力プログラム60に従って、制御部46Aとして動作することによって実現される。
【0027】
イヤフォン14は、
図3Aに示すように、ユーザ20の外耳道に装着されるカナル型のイヤフォンと解釈してよい。なお、イヤフォン14は、カナル型に限定されず、ユーザ20の内耳に挿入して装着されるインナーイヤー型のイヤフォンでもよく、ユーザ20の耳の全体を覆うヘッドフォン型のイヤフォンでもよい。2つのイヤフォン14のそれぞれに、マイクロフォン38、スピーカ40、及びカメラ42が設けられている。ユーザ20の耳に装着される2つのイヤフォン14で収集された音及び画像は、データベース24にライフログとして記録されてよい。
【0028】
ライフログは、ユーザ20が日常生活でとった行動の履歴と解釈してよく、ユーザ20に紐付く音及び画像、具体的には、日常生活の中でマイクロフォン38で収集された音、カメラ42で撮影された画像を含んでよい。ライフログには、ユーザ20に紐付く音及び画像が、それらが取得された日時、場所などに対応付けて記録されてよい。
【0029】
マイクロフォン38で収集された音は、ユーザ20が会話している相手の声、散歩やサイクリングをしているときにユーザ20の周囲で発生する音(車の走行音、鳥のさえずり、川のせせらぎ、風になびく木々の音)などを含んでよい。
【0030】
図3Cに示すように、カメラ42は、ユーザ20の前方を捉える画角内の風景を撮像してよく、ユーザ20の前方以外、例えばユーザ20の側方、後方、下方、上方などを捉える画角内の風景を撮像してもよい。カメラ42で撮影された画像は、ユーザ20が会話している相手の姿、散歩やサイクリングをしているときユーザ20の周囲の風景、ユーザ20の共に歩くペットの姿などを含んでよい。
【0031】
2つのイヤフォン14のそれぞれにカメラ42が設けられているため、
図3Bに示すようにユーザ20の耳に装着された2つのイヤフォン14は、左耳と右耳に特定の距離を隔てて配置される。従って、例えばビデオカメラなどのように1つの筐体に2眼カメラを並べて配置する場合に比べて、2つのカメラ42の配置間隔を広くできるため、3Dセンシングがし易くなる。3Dセンシングは、三次元形状を計測することと解釈してよい。
【0032】
また、2つのイヤフォン14がユーザ20の耳に装着されると、ユーザ20の左右の目の位置に近い箇所に、2つのカメラ42が配置されるため、肉眼で見た画像と略等しい撮像(撮影画像)を、データベース24にライフログとして記録できる。従って、特定処理において、ユーザ20からの問い合わせに対応する情報、つまりユーザ20の発話の内容に対応する情報を再現し易くなる。
【0033】
2つのイヤフォン14がユーザ20に装着されている間は、カメラ42で撮像された画像の全部または一部がデータベース24にライフログとして記録されてよい。具体的には、2つのイヤフォン14がユーザ20に装着されたとき、カメラ42で撮像された画像のデータベース24への記録が開始され、2つのイヤフォン14がユーザ20から外されたときに当該画像のデータベース24への記録が終了してよい。
【0034】
2つのイヤフォン14がユーザ20に装着されている間は、マイクロフォン38で収集された音の全部または一部がデータベース24にライフログとして記録されてよい。具体的には、2つのイヤフォン14がユーザ20に装着されたとき、マイクロフォン38で収集された音のデータベース24への記録が開始され、2つのイヤフォン14がユーザ20から外されたときに当該音のデータベース24への記録が終了してよい。
【0035】
次に、データ処理装置12が、イヤフォン14を装着したユーザ20から、ユーザ20の記憶または行動に関する発話を受け付けた場合に、ユーザ20の発話の内容に対応する情報をユーザ20に提案する特定処理を行う際の、特定処理部290の処理について説明する。
【0036】
(特定処理)
本実施形態における特定処理では、ユーザデータを入力し、入力したユーザデータに応じた所定の推論結果を生成するデータ生成モデルを用いた特定処理を行う。具体的には、特定処理では、イヤフォン14を装着したユーザ20から、ユーザ20の記憶または行動に関する発話をユーザデータとして受け付けた場合、データベース24を参照することで、発話の内容に対応する情報をユーザ20に提案する処理を実行する。具体的には、データベース24にライフログが記録された後、イヤフォン14を装着したユーザ20が、ユーザ20の記憶または行動に関する発話をした場合、特定処理として、データベース24を参照することで、発話の内容に対応する情報を、ユーザ20に提案する処理を実行してよい。
【0037】
(特定処理の第1例)
特定処理部290は、発話の内容として、イヤフォンを装着したユーザが特定の記憶を思い出すきっかけとなるメッセージを要求した場合、ライフログに基づき選択された1または複数のメッセージを、発話の内容(要求)に対応する情報として、メッセージの要求元のユーザに提案してよい。例えば、特定処理部290は、発話の内容として、イヤフォンを装着したユーザが特定の記憶を思い出すきっかけとなるメッセージを要求した場合、プロンプトにおいて、ライフログに基づき選択された1または複数のメッセージをユーザに提案することをデータ生成モデル58へ指示する。
【0038】
例えば、イヤフォン14を装着したユーザ20が自身の記憶を思い出そうとして「〇月〇日〇時ごろにAさんに対して発した言葉は?」と発した場合、特定処理部290は、特定処理として、当該メッセージをプロンプトとしてデータ生成モデル58に入力する。特定処理部290は、データベース24のライフログを参照してデータ生成モデル58で得られた出力に基づいて、「素敵なレストランを見つけたので予約しよう、と発していたと思います」というメッセージを生成してよい。当該メッセージは、ユーザ20の発話の内容に対応する情報の一例と解釈してよい。
【0039】
例えば、イヤフォン14を装着したユーザ20が自身の記憶を思い出そうとして「〇月〇日〇時ごろに誰と話していた?」と発した場合、特定処理部290は、特定処理として、当該メッセージをプロンプトとしてデータ生成モデル58に入力する。特定処理部290は、データベース24のライフログを参照してデータ生成モデル58で得られた出力に基づいて、「そのときは2人友人、おそらくBさんとCさんを交えて会話していたようです」というメッセージを生成してよい。当該メッセージは、ユーザ20の発話の内容に対応する情報の一例と解釈してよい。
【0040】
例えば、イヤフォン14を装着したユーザ20が自身の感情を思い出そうとして「〇月〇日〇時ごろにAさんと会話していたときの私の気持ちは?」と発した場合、特定処理部290は、特定処理として、当該メッセージをプロンプトとしてデータ生成モデル58に入力する。特定処理部290は、データベース24のライフログを参照してデータ生成モデル58で得られた出力に基づいて、「そのとき、あなたは沢山笑っていたため友人に好感を持ちとても喜んでいたようです」というメッセージを生成してよい。当該メッセージは、ユーザ20の発話の内容に対応する情報の一例と解釈してよい。
【0041】
(特定処理の第2例)
特定処理部290は、発話の内容として、イヤフォン14を装着したユーザ20が特定の事柄をつぶやいた場合、ライフログに基づき事柄に対して推奨されるユーザ20の行動を、発話の内容(つぶやき)に対応する情報として、メッセージの要求元のユーザ20に提案してよい。例えば、特定処理部290は、発話の内容として、イヤフォン14を装着したユーザ20が特定の事柄をつぶやいた場合、プロンプトにおいて、ライフログに基づき事柄に対して推奨されるユーザ20の行動をユーザ20に提案することをデータ生成モデル58へ指示する。
【0042】
例えば、イヤフォン14を装着したユーザ20が特定の小売店で買い物をしているとき、「何を買おうかな?」と発した場合、特定処理部290は、特定処理として、当該メッセージをプロンプトとしてデータ生成モデル58に入力する。特定処理部290は、データベース24のライフログを参照してデータ生成モデル58で得られた出力に基づいて、「数ヶ月前、このお店で商品Aを購入した後、あまり美味しくないとコメントしていましたので、今回は、最近発売された商品B、商品Cなどを購入するのはいかがでしょうか」というメッセージを生成してよい。当該メッセージは、ユーザ20の発話の内容に対応する情報の一例と解釈してよい。
【0043】
(特定処理の第3例)
図3Dに示すように、イヤフォン14を装着したユーザ20がパソコンを操作しているとき「一昨日検索した製品Aの名前はなんだった?」と発した場合、特定処理部290は、特定処理として、当該メッセージをプロンプトとしてデータ生成モデル58に入力する。データ生成モデル58は、データベース24のライフログを参照して、過去のユーザ20が操作しているときのパソコンの画面の映像を解析することで、特定の出力を生成する。特定処理部290は、データ生成モデル58で得られた出力に基づいて、「製品Aは○○○です」というメッセージを生成してよい。当該メッセージは、ユーザ20の発話の内容に対応する情報の一例と解釈してよい。
【0044】
(特定処理の第4例)
図3Eに示すように、イヤフォン14を装着したユーザ20がサイクリングをしているとき「この近くで絶景が見える場所があったけど、どこだろう?」と発した場合、特定処理部290は、特定処理として、当該メッセージをプロンプトとしてデータ生成モデル58に入力する。データ生成モデル58は、データベース24のライフログを参照して、ユーザ20が以前訪れた場所とその場所までの経路などを解析することで、特定の出力を生成する。特定処理部290は、データ生成モデル58で得られた出力に基づいて、「ここから500m進んだところにある○○岬だと思います。」というメッセージを生成してよい。当該メッセージは、ユーザ20の発話の内容に対応する情報の一例と解釈してよい。
【0045】
(特定処理の第5例)
図3Fに示すように、イヤフォン14を装着したユーザ20が訪問先のA社のX氏と出会ったとき「この人の名前を教えて?」と発した場合、特定処理部290は、特定処理として、当該メッセージをプロンプトとしてデータ生成モデル58に入力する。データ生成モデル58は、データベース24のライフログを参照し、ユーザ20がA社を訪れたときに出会った人の履歴などから、特定の出力を生成する。特定処理部290は、データ生成モデル58で得られた出力に基づいて、「氏名は○○だと思います」というメッセージを生成してよい。当該メッセージは、ユーザ20の発話の内容に対応する情報の一例と解釈してよい。
【0046】
特定処理部290は、
図4に示すように、入力部291、処理部292、及び出力部293を備えている。
【0047】
入力部291は、イヤフォン14で受け付けたユーザ入力を取得する。具体的には、イヤフォン14で受け付けたユーザの音声を取得する
【0048】
処理部292は、データ生成モデル58を用いた特定処理を行う。具体的には、データ生成モデル58に、ユーザから入力された音声を入力し、生成結果を得る。より具体的には、イヤフォン14を装着したユーザ20からユーザ20の記憶または行動に関する発話を受け付けた場合、発話の内容に対応する情報をユーザ20に提案する処理を、特定処理として行う。
【0049】
出力部293は、特定処理の結果をイヤフォン14に送信する。イヤフォン14では、制御部46Aが、スピーカ40に対して特定処理の結果を出力させる。マイクロフォン38は、特定処理の結果に対するユーザ入力を示す音声を取得する。制御部46Aは、マイクロフォン38によって取得されたユーザ入力を示す音声データをデータ処理装置12に送信する。データ処理装置12では、特定処理部290が音声データを取得する。
【0050】
データ生成モデル58は、いわゆる生成系AI(Artificial Intelligence)である。データ生成モデル58の一例としては、ChatGPT(インターネット検索<URL: https://openai.com/blog/chatgpt>)、Gemini(インターネット検索<URL: https://gemini.google.com/?hl=ja>)等の生成系AIが挙げられる。データ生成モデル58は、ニューラルネットワークに対して深層学習を行わせることによって得られる。データ生成モデル58には、指示を含むプロンプトが入力され、かつ、音声を示す音声データ、テキストを示すテキストデータ、及び画像を示す画像データ等の推論用データが入力される。データ生成モデル58は、入力された推論用データをプロンプトにより示される指示に従って推論し、推論結果を音声データ及びテキストデータ等のデータ形式で出力する。ここで、推論とは、例えば、分析、分類、予測、及び/又は要約等を指す。
【0051】
次に、データ処理システム10の作用について説明する。
【0052】
特定処理の流れの一例について
図5を参照しながら説明する。なお、
図5に示す特定処理の流れは、本開示の技術に係る「データ処理方法」の一例である。
【0053】
ステップS300で、データ処理装置12は、2つのイヤフォン14で収集された音及び画像を含むユーザデータを入力する。
【0054】
ステップS302で、データ処理装置12は、イヤフォン14を装着したユーザからユーザ20の記憶または行動に関する発話を受け付けた場合、ユーザ20のライフログに基づき、発話の内容に対応する情報をユーザ20に提案する処理を、特定処理として実行する。
【0055】
ステップS303で、データ処理装置12は、特定処理の結果をスピーカ40から再生させる処理を実行する。
【0056】
<第2の実施形態>
第2の実施形態は、ユーザの視覚情報をリアルタイムで解析し、音楽および触覚フィードバックを生成するイヤフォンに関する。特に、第2の実施形態は、視覚、聴覚、及び触覚が融合したシナスタジア体験を提供する技術に関する。
【0057】
従来のイヤフォンは、音声アシスタント、ノイズキャンセリング、又は翻訳機能等、音声に関する機能が中心であった。しかし、ユーザが視覚情報と連動した新しい体験を求める場合、これらのイヤフォンでは対応が難しかった。例えば、美術館の絵画又は自然の風景を鑑賞する際、視覚情報を他の感覚と融合させることで、より深い没入感や感動を得る手段が求められている。
【0058】
しかし、従来の技術では、視覚情報をリアルタイムで解析し、それを音楽や触覚フィードバックに変換することが困難であった。このため、視覚、聴覚、及び触覚を融合した新しい感覚体験をユーザに提供できないという課題があった。
【0059】
そこで、第2の実施形態では、イヤフォンが備えるカメラによって取得された視覚情報(色彩、形状、及び動き等)をリアルタイムで解析し、データ生成モデル58を用いて音楽又はサウンドエフェクト等を生成する。また、第2の実施形態では、イヤフォンが備える振動機能を活用し、生成された音楽又はサウンドエフェクト等に同期した触覚フィードバックを提供する。
【0060】
第2の実施形態により、ユーザは視覚、聴覚、及び触覚が融合した新しい感覚体験を得ることができる。例えば、美術館の絵画又は自然の風景等を鑑賞する際に、ユーザが得た視覚情報が、音楽及び触覚としてフィードバックされるため、ユーザはより深い没入感と感動を享受できる。また、第2の実施形態は、従来のイヤフォンでは実現できなかったマルチモーダルな体験を提供する。
【0061】
以下、第2の実施形態について図面を参照しながら詳細に説明する。
【0062】
<システム構成>
図6には、第2の実施形態に係るデータ処理システム210の構成の一例が示されている。
図6に示されているように、第2の実施形態のイヤフォンは、ユーザの耳に装着される2つのイヤフォン214である。イヤフォン214は、カナル型のイヤフォン又はインナーイヤー型のイヤフォンである。このため、イヤフォン214を装着したユーザのみがイヤフォン214から出力される音を聴くことが可能である。
【0063】
イヤフォン214は、コンピュータ36、マイクロフォン38、スピーカ40、カメラ42、生体センサ43A、振動デバイス43B、及び通信I/F44を備えている。なお、カメラ42は、ユーザ20と同じ目線に相当する位置に存在しているため、ユーザ20が得ている視覚情報と同様の情報を取得することが可能である。
【0064】
イヤフォン214が備えている生体センサ43Aは、ユーザの耳からユーザの生体データを取得することが可能である。生体データとは、例えば、ユーザ20の体温、ユーザ20の脳波、又はユーザ20の心拍数等である。
【0065】
イヤフォン214が備えている振動デバイス43Bは、受け付けた制御信号に応じて振動する。このため、イヤフォン214は振動機能を備えており、触覚フィードバックを出力することが可能である。
【0066】
次に、第2の実施形態のデータ処理装置12が、イヤフォン214を装着したユーザ20から、ユーザ20の記憶または行動に関する発話を受け付けた場合に、ユーザ20の発話の内容に対応する情報をユーザ20に提案する特定処理を行う際の、特定処理部290の処理について説明する。
【0067】
(特定処理)
第2の実施形態における特定処理では、ユーザデータを入力し、入力したユーザデータに応じた所定の推論結果を生成するデータ生成モデルを用いた特定処理を行う。第2の実施形態における特定処理では、マイクロフォン38で検出された音と、カメラ42で撮影された画像と、生体センサ43Aよって取得された生体データとを、ユーザデータとする。特定処理では、イヤフォン214を装着したユーザ20から、ユーザ20の記憶または行動に関する発話をユーザデータとして受け付けた場合、データベース24を参照することで、発話の内容に対応する情報をユーザ20に提案する処理を実行する。具体的には、データベース24にライフログが記録された後、イヤフォン214を装着したユーザ20が、ユーザ20の記憶または行動に関する発話をした場合、特定処理として、データベース24を参照することで、発話の内容に対応する情報を、ユーザ20に提案する処理を実行する。さらに、第2の実施形態では、イヤフォン214による触覚フィードバックの出力処理を、特定処理として行う。
【0068】
第2の実施形態におけるデータ処理装置12の特定処理部290は、データ生成モデル58を用いて特定処理を行う。
【0069】
第2の実施形態における入力部291は、イヤフォン214で受け付けたユーザデータを取得する。具体的には、イヤフォン214のマイクロフォン38で検出されたユーザの音声と、カメラ42で撮影された画像と、生体センサ43Aによって取得された生体データとを、ユーザデータとして取得する。
【0070】
第2の実施形態における処理部292は、データ生成モデル58を用いた特定処理を行う。具体的には、第2の実施形態における処理部292は、イヤフォン214を装着したユーザ20からユーザ20の記憶または行動に関する発話を受け付けた場合、発話の内容に対応する情報をユーザ20に提案すると共に、イヤフォン214による触覚フィードバックを生成することを指示するプロンプトをデータ生成モデル58に入力することにより、発話の内容に対応する情報及び触覚フィードバックを取得する処理を、特定処理として行う。
【0071】
より詳細には、第2の実施形態における処理部292は、イヤフォン214による触覚フィードバックを生成することを指示するプロンプトをデータ生成モデル58へ入力することにより、データ生成モデル58から出力される触覚フィードバックを取得する。例えば、プロンプトには「入力されたユーザデータ(音声、画像、又は生体データ)に適している触覚フィードバック(例えば、振動パターン)を生成してください。」といったメッセージが含まれる。これにより、データ生成モデル58からユーザデータに合った触覚フィードバックが出力される。
【0072】
なお、第2の実施形態における処理部292は、上記の処理とは異なる処理によって、触覚フィードバックを取得するようにしてもよい。例えば、第2の実施形態における処理部292は、カメラ42から取得した画像列である映像データをリアルタイムで解析し、色彩、形状、及び動きの特徴量を抽出する。次に、第2の実施形態における処理部292は、抽出した特徴量をデータ生成モデル58に入力し、特徴量と生体データに応じた音楽又はサウンドエフェクト等を生成する。なお、処理部292は、画像から特徴量を抽出せずに、画像そのものと生体データとをデータ生成モデル58に入力し、音楽又はサウンドエフェクト等を生成するようにしてもよい。そして、第2の実施形態における処理部292は、生成された音楽又はサウンドエフェクト等に基づき、触覚フィードバックに相当する振動パターンを生成する。
【0073】
出力部293は、特定処理の結果をイヤフォン214に送信する。イヤフォン214では、制御部46Aが、スピーカ40に対して特定処理の結果を出力させる。具体的には、スピーカ40は、生成された音楽又はサウンドエフェクトを再生する。また、振動デバイス43Bは、振動機能により触覚フィードバックを出力する。具体的には、振動デバイス43Bは、音楽又はサウンドエフェクトに同期した触覚フィードバックを出力する。マイクロフォン38は、特定処理の結果に対するユーザ入力を示す音声を取得する。制御部46Aは、マイクロフォン38によって取得されたユーザ入力を示す音声データをデータ処理装置12に送信する。データ処理装置12では、特定処理部290が音声データを取得する。
【0074】
(特定処理の第1例)
<美術館での利用>
イヤフォン214を装着したユーザ20が美術館で絵画を鑑賞している際、カメラ42が絵画の画像を撮像し、その画像の色彩又は形状等が解析される。第2の実施形態における特定処理部290は、その情報をもとにクラシック音楽又は独自のサウンドエフェクト等を生成し、スピーカ40から出力させる。さらに、振動デバイス43Bは、生成された音楽に合わせて微細な振動である触覚フィードバックを提供する。これにより、ユーザ20は、絵画を含む作品の雰囲気を全身で感じることができる。
【0075】
(特定処理の第2例)
<自然風景の鑑賞>
イヤフォン214を装着したユーザ20が自然の中を散策している場合、カメラ42が風景の色彩及び動き等を捉える。第2の実施形態における特定処理部290は、爽やかな音楽又は自然音等を生成し、スピーカ40から出力させる。さらに、振動デバイス43Bは、生成された音楽に合わせて微細な振動である触覚フィードバックを提供する。これにより、ユーザ20に対して聴覚と触覚とによる豊かな体験が提供される。
【0076】
第2の実施形態に係るデータ処理システム210のその他のシステム構成及び作用は、第1の実施形態と同様であるため、詳細な説明を省略する。
【0077】
以上説明したように、第2の実施形態に係るデータ処理システム210は、エンターテインメント分野のみならず、教育、リハビリテーション、又は観光等、多岐にわたる分野での利用が可能である。第2の実施形態に係るデータ処理システム210によれば、ユーザは視覚情報を多感覚的に体験することができ、新しい価値が創出される。
【0078】
以上、本開示に係るシステムをデータ処理装置12の機能を主として説明したが、本開示に係るシステムはサーバに実装されているとは限らない。本開示に係るシステムは、一般的な情報処理システムとして実装されていてもよい。本開示は、例えば、パーソナルコンピュータで動作するソフトウェアプログラム、スマートフォン等で動作するアプリケーションとして実装されてもよい。本開示に係る方法はSaaS(Software as a Service)形式でユーザに対して提供されてもよい。
【0079】
上記実施形態では、1台のコンピュータ22によって特定処理が行われる形態例を挙げたが、本開示の技術はこれに限定されず、コンピュータ22を含めた複数のコンピュータによる特定処理に対する分散処理が行われるようにしてもよい。
【0080】
上記実施形態では、ストレージ32に特定処理プログラム56が格納されている形態例を挙げて説明したが、本開示の技術はこれに限定されない。例えば、特定処理プログラム56がUSB(Universal Serial Bus)メモリなどの可搬型のコンピュータ読み取り可能な非一時的格納媒体に格納されていてもよい。非一時的格納媒体に格納されている特定処理プログラム56は、データ処理装置12のコンピュータ22にインストールされる。プロセッサ28は、特定処理プログラム56に従って特定処理を実行する。
【0081】
また、ネットワーク54を介してデータ処理装置12に接続されるサーバ等の格納装置に特定処理プログラム56を格納させておき、データ処理装置12の要求に応じて特定処理プログラム56がダウンロードされ、コンピュータ22にインストールされるようにしてもよい。
【0082】
なお、ネットワーク54を介してデータ処理装置12に接続されるサーバ等の格納装置に特定処理プログラム56の全てを格納させておいたり、ストレージ32に特定処理プログラム56の全てを記憶させたりしておく必要はなく、特定処理プログラム56の一部を格納させておいてもよい。
【0083】
特定処理を実行するハードウェア資源としては、次に示す各種のプロセッサを用いることができる。プロセッサとしては、例えば、ソフトウェア、すなわち、プログラムを実行することで、特定処理を実行するハードウェア資源として機能する汎用的なプロセッサであるCPUが挙げられる。また、プロセッサとしては、例えば、FPGA(Field-Programmable Gate Array)、PLD(Programmable Logic Device)、又はASIC(Application Specific Integrated Circuit)などの特定の処理を実行させるために専用に設計された回路構成を有するプロセッサである専用電気回路が挙げられる。何れのプロセッサにもメモリが内蔵又は接続されており、何れのプロセッサもメモリを使用することで特定処理を実行する。
【0084】
特定処理を実行するハードウェア資源は、これらの各種のプロセッサのうちの1つで構成されてもよいし、同種又は異種の2つ以上のプロセッサの組み合わせ(例えば、複数のFPGAの組み合わせ、又はCPUとFPGAとの組み合わせ)で構成されてもよい。また、特定処理を実行するハードウェア資源は1つのプロセッサであってもよい。
【0085】
1つのプロセッサで構成する例としては、第1に、1つ以上のCPUとソフトウェアの組み合わせで1つのプロセッサを構成し、このプロセッサが、特定処理を実行するハードウェア資源として機能する形態がある。第2に、SoC(System-on-a-chip)などに代表されるように、特定処理を実行する複数のハードウェア資源を含むシステム全体の機能を1つのICチップで実現するプロセッサを使用する形態がある。このように、特定処理は、ハードウェア資源として、上記各種のプロセッサの1つ以上を用いて実現される。
【0086】
更に、これらの各種のプロセッサのハードウェア的な構造としては、より具体的には、半導体素子などの回路素子を組み合わせた電気回路を用いることができる。また、上記の特定処理はあくまでも一例である。従って、主旨を逸脱しない範囲内において不要なステップを削除したり、新たなステップを追加したり、処理順序を入れ替えたりしてもよいことは言うまでもない。
【0087】
以上に示した記載内容及び図示内容は、本開示の技術に係る部分についての詳細な説明であり、本開示の技術の一例に過ぎない。例えば、上記の構成、機能、作用、及び効果に関する説明は、本開示の技術に係る部分の構成、機能、作用、及び効果の一例に関する説明である。よって、本開示の技術の主旨を逸脱しない範囲内において、以上に示した記載内容及び図示内容に対して、不要な部分を削除したり、新たな要素を追加したり、置き換えたりしてもよいことは言うまでもない。また、錯綜を回避し、本開示の技術に係る部分の理解を容易にするために、以上に示した記載内容及び図示内容では、本開示の技術の実施を可能にする上で特に説明を要しない技術常識等に関する説明は省略されている。
【0088】
本明細書に記載された全ての文献、特許出願及び技術規格は、個々の文献、特許出願及び技術規格が参照により取り込まれることが具体的かつ個々に記された場合と同程度に、本明細書中に参照により取り込まれる。
【0089】
なお、以上の説明に関して更に以下の付記を開示する。
【0090】
(付記1)
マイク、スピーカ、カメラ、及び生体センサを含みユーザの耳に装着される2つのイヤフォンで収集された音、画像、及び生体データを含むユーザデータを入力する入力部と、
前記ユーザデータに応じた所定の推論結果を生成するデータ生成モデルを用いた特定処理を行う処理部と、
前記特定処理の結果を前記スピーカから再生させる出力部と、
を備え、
前記イヤフォンは、カナル型のイヤフォン又はインナーイヤー型のイヤフォンであり、前記イヤフォンを装着した前記ユーザのみが前記イヤフォンから出力される音を聴くことが可能であり、
前記イヤフォンは、振動機能を備えており、触覚フィードバックを出力することが可能であり、
前記入力部は、前記マイクで検出された音と前記カメラで撮影された画像と前記生体センサによって取得された前記生体データとを、前記ユーザデータとして入力し、
前記処理部は、前記イヤフォンを装着した前記ユーザから前記ユーザの記憶または行動に関する発話を受け付けた場合、前記ユーザに紐付く前記音及び前記画像が記録された前記ユーザのライフログに基づき、前記発話の内容に対応する情報を前記ユーザに提案すると共に、前記イヤフォンによる前記触覚フィードバックを生成することを指示するプロンプトをデータ生成モデルに入力することにより、前記発話の内容に対応する情報及び前記触覚フィードバックを取得する処理を、前記特定処理として行う、データ処理装置。
【0091】
(付記2)
前記処理部は、前記発話の内容として、前記イヤフォンを装着した前記ユーザが特定の記憶を思い出すきっかけとなるメッセージを要求した場合、前記プロンプトにおいて、前記ライフログに基づき選択された1または複数のメッセージを、前記発話の内容に対応する情報として、前記ユーザに提案することを指示する、付記1に記載のデータ処理装置。
【0092】
(付記3)
前記処理部は、前記発話の内容として、前記イヤフォンを装着した前記ユーザが特定の事柄をつぶやいた場合、前記プロンプトにおいて、前記ライフログに基づき前記事柄に対して推奨される前記ユーザの行動を、前記発話の内容に対応する情報として、前記ユーザに提案することを指示する、付記1または2に記載のデータ処理装置。
【0093】
(付記4)
マイク、スピーカ、カメラ、及び生体センサを含みユーザの耳に装着される2つのイヤフォンで収集された音、画像、及び生体データを含むユーザデータを入力し、前記ユーザデータに応じた所定の推論結果を生成するデータ生成モデルを用いた特定処理を、コンピュータが実行するデータ処理方法であって、
前記イヤフォンは、カナル型のイヤフォン又はインナーイヤー型のイヤフォンであり、前記イヤフォンを装着した前記ユーザのみが前記イヤフォンから出力される音を聴くことが可能であり、
前記イヤフォンは、振動機能を備えており、触覚フィードバックを出力することが可能であり、
前記マイクで検出された音と前記カメラで撮影された画像と前記イヤフォンによって取得された前記生体データとを、前記ユーザデータとして入力し、
前記イヤフォンを装着した前記ユーザから前記ユーザの記憶または行動に関する発話を受け付けた場合、前記ユーザに紐付く前記音及び前記画像が記録された前記ユーザのライフログに基づき、前記発話の内容に対応する情報を前記ユーザに提案すると共に、前記イヤフォンによる前記触覚フィードバックを生成することを指示するプロンプトをデータ生成モデルに入力することにより、前記発話の内容に対応する情報及び前記触覚フィードバックを取得する処理を、前記特定処理として実行し、
前記特定処理の結果を前記スピーカから再生させると共に、前記振動機能により触覚フィードバックを出力する処理を、
前記コンピュータが実行するデータ処理方法。
【0094】
(付記5)
マイク、スピーカ、カメラ、及び生体センサを含みユーザの耳に装着される2つのイヤフォンで収集された音、画像、及び生体データを含むユーザデータを入力し、前記ユーザデータに応じた所定の推論結果を生成するデータ生成モデルを用いた特定処理を、コンピュータに実行させるデータ処理プログラムであって、
前記イヤフォンは、カナル型のイヤフォン又はインナーイヤー型のイヤフォンであり、前記イヤフォンを装着した前記ユーザのみが前記イヤフォンから出力される音を聴くことが可能であり、
前記イヤフォンは、振動機能を備えており、触覚フィードバックを出力することが可能であり、
前記マイクで検出された音と前記カメラで撮影された画像と前記イヤフォンによって取得された前記生体データとを、前記ユーザデータとして入力し、
前記イヤフォンを装着した前記ユーザから前記ユーザの記憶または行動に関する発話を受け付けた場合、前記ユーザに紐付く前記音及び前記画像が記録された前記ユーザのライフログに基づき、前記発話の内容に対応する情報を前記ユーザに提案すると共に、前記イヤフォンによる前記触覚フィードバックを生成することを指示するプロンプトをデータ生成モデルに入力することにより、前記発話の内容に対応する情報及び前記触覚フィードバックを取得する処理を、前記特定処理として実行し、
前記特定処理の結果を前記スピーカから再生させると共に、前記振動機能により触覚フィードバックを出力する処理を、
前記コンピュータに実行させるデータ処理プログラム。
【符号の説明】
【0095】
10,210 データ処理システム
12 データ処理装置
14,214 イヤフォン
290 特定処理部
291 入力部
292 処理部
293 出力部