特開2026-132055IP Force 特許公報全文掲載

技術分野

情報処理装置および情報処理方法

要約特許出願時に添付された[要約書]

【課題】Vision Language Model(VLM)おいてターゲットドメイン固有の知識を生成テキストに反映させる情報処理装置及び情報処理方法を提供する。
【解決手段】情報処理システム1において、学習部10は、データ保存部30から学習用の画像とテキストを取得し、画像とテキストをトークンに分割して埋め込み表現に変換する事前処理部と、下式の目的関数を最大化するようにモデルのパラメータを学習し、更新後のパラメータを計算結果記憶部40に格納する計算処理部と、を含む。


【選択図】図1

発明が解決しようとする課題[発明の詳細な説明]から抜粋

従来のVLMは、ベースモデルとしてLLMを利用し、言語と画像の処理能力をfine-tuningにより後から習得する。例えば、代表的なfine-tuningでは画像をLLMと同じ意味空間に射影させる。このため、事前学習済みモデル(ソースドメイン)の影響が強く、異種データ間で知識の断片化が生じる。その結果、画像やテキストといったターゲットドメイン固有の知識が十分に反映されないという課題があった。

課題を解決するための手段[発明の詳細な説明]から抜粋

本開示の一態様の情報処理装置は、画像とテキストのトークン間の関連付けをアテンションメカニズムを用いて実施する第1モジュールと言語モデルへのプロンプトを最適化する第2モジュールとを言語モデルに追加したモデルと、画像と質問テキストを前記モデルに入力し、回答テキストを出力する入出力部とを備え、前記アテンションメカニズムは、トークン間の関連性を計算する際に、トークンレベルで画像とテキストの関連性が強・・・ 続きを知財ポータルサイト IP Force にログインして見る

発明の効果[発明の詳細な説明]から抜粋

本開示によれば、VLMにおいてターゲットドメイン固有の知識を生成テキストに反映させることができる。

この発明についての権利主張の範囲[特許請求の範囲]

知財ポータルサイト IP Force にログインして確認する (無料)

この特許公報に記載されている図面[図面の簡単な説明]から抜粋

【図1】 図1は、VLMを利用した情報処理システムの構成の一例を示す図である。
【図2】 図2は、本実施形態のVLMの一例を示す図である。
【図3】 図3は、ソースドメインとターゲットドメインの更新するトークンの一例を示す図である。
【図4】 図4は、Modal Alignment Attention Mechanismで用いるマスクの一例を示す図である。
【図5】 図5は、学習処理の流れの一例を示すフローチャートである。

選択図 図1出願人が指定した本件の代表的な図

1 情報処理システム 10 学習部 11 事前処理部 12 計算処理部 20 入出力部 30 データ保存部 40 計算結果記憶部 5 ユーザ端末

全ての図面はログインすると無料で閲覧できます。ログイン・ユーザー登録

[広告欄]

ログインすれば広告は減ります

ログインすれば広告は減ります