特開2026-154813IP Force 特許公報全文掲載

技術分野

[0001]本開示の視覚言語モデル(VLM)に関し、特に、本明細書で開示されるVLMに頭部姿勢推定(HPE)を統合すること

要約特許出願時に添付された[要約書]

【課題】頭部姿勢推定(HPE)のための視覚言語モデル(VLM)を発生するための多段階処理方法を提供する。
【解決手段】方法は、人頭境界ボックス検出の能力を創り出すために、実際の人々の画像を含む画像の第1のセットに対して、第1の視覚言語モデル(VLM)を訓練するステップと、HPE指向VLMである第2のVLMを発生するために、タスク固有HPE画像を含む画像の第2のセットを用いて、第1のVLMを調整するステップと、レイヤベースVLMを作り出すために、いずれかから全体のレイヤを選択することによって、第1のVLM及び第2のVLMのバージョンのレイヤベースマージングを行うステップであって、第1のVLMのバージョンは画像の第1のセットに対して訓練する前の第1のVLMである、レイヤベースマージングを行うステップと、レイヤベースVLMの微調整を行うステップと、を含む。
【選択図】図2B

この発明についての権利主張の範囲[特許請求の範囲]

知財ポータルサイト IP Force にログインして確認する (無料)

この特許公報に記載されている図面[図面の簡単な説明]から抜粋

【図1】 HPEタスクのために設計されたプロンプト及び応答を示す図であり、これはまた無効な回答のいくつかの例を示す図である。
【図2A】 HPEタスクを、もとのグラウンディングCogVLM内に統合するためのフレームワークのいくつかの実施形態を示す図である。
【図2B】 頭部姿勢推定(HPE)のための視覚言語モデル(VLM)を発生するための多段階処理方法の、いくつかの実施形態のデータフロー図である。
【図2C】 コサイン類似度マージング基準に基づいて、レイヤベースマージングを行うための処理方法の、いくつかの実施形態のデータフロー図である。
【図3】 我々のフレームワークで用いられる様々なデータセットの詳細な概観を示す図である。
【図4】 様々なベースラインとの我々のHPE-CogVLM性能の比較を示す図である。
【図5】 データなしリハーサルが適用されたときの破滅的忘却の影響を示す図である。
【図6】 様々なリハーサル比率のもとでの破滅的忘却問題の軽減を示す図である。
【図7】 HPE指向CogVLMモデルが、我々のフレームワーク内で最も高いHPE性能を呈することを示す図である。
【図8A】 我々のカスタムプロンプトに応答して発生された交差注意マップを示す視覚化の図である。
【図8B】 我々のカスタムプロンプトに応答して発生された交差注意マップを示す視覚化の図である。
【図9】 機械学習型モデルを訓練するために用いられる、例としての機械学習アーキテクチャを表す図である。
【図10】 コンピューティングデバイスのいくつかの実施形態のブロック図である。

選択図 図2B出願人が指定した本件の代表的な図

全ての図面はログインすると無料で閲覧できます。ログイン・ユーザー登録

[広告欄]

ログインすれば広告は減ります

ログインすれば広告は減ります