Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition
PRISM-AH (Predictive Reasoning over Interacting Streams for Multimodal Ambivalence/Hesitancy Recognition) 是一个用于视频级矛盾与犹豫 (A/H) 识别的框架。它使用冻结的视觉、音频和文本编码器对齐到短时间窗口,通过轻量级流模型评分跨模态不协调、预测下一窗口以暴露犹豫惊喜信号、发现行为原型,并基于参与者元数据进行条件化。知识引导的大语言模型使用数据集专家线索分类法对结构化证据进行推理,其判断仅在验证性能提升时进行后期融合。
发展脉络
- 首次出现Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy RecognitionarXiv cs.AI
- 当前判断该研究展示了多模态情感识别在健康行为改变领域的应用潜力,特别是通过知识引导的 LLM 推理来增强模型的可解释性。可验证的下一信号:是否有健康科技公司或研究机构将 PRISM-AH 集成到远程医疗或数字疗法平台中。Agent Pulse · 分析
PRISM-AH 是一个用于视频级矛盾与犹豫 (A/H) 识别的框架。A/H 是冲突的情感状态,会导致健康行为改变的延迟或放弃。该框架将 A/H 视为随时间展开的多模态冲突。冻结的视觉、音频和文本编码器被对齐到短时间窗口,并传递给轻量级流模型,该模型评分跨模态不协调、预测每个下一窗口以暴露犹豫惊喜信号、发现行为原型,并基于参与者元数据进行条件化。密集的窗口级标注作为辅助目标监督模型,决策阈值针对宏 F1 进行校准。知识引导的大语言模型使用数据集专家线索分类法对结构化证据进行推理,其判断仅在验证性能提升时进行后期融合。
PRISM-AH 的核心创新在于将多模态冲突建模为时间序列上的不协调信号,并通过预测下一窗口来量化犹豫。这种方法将情感识别从静态分类转向动态过程建模。可验证的下一信号:该框架是否能在其他健康行为数据集(如戒烟咨询或药物依从性)上复现,以及窗口级标注的获取成本是否可控。
该研究展示了多模态情感识别在健康行为改变领域的应用潜力,特别是通过知识引导的 LLM 推理来增强模型的可解释性。可验证的下一信号:是否有健康科技公司或研究机构将 PRISM-AH 集成到远程医疗或数字疗法平台中。
对于开发数字健康干预产品的公司,PRISM-AH 提供了一种量化患者犹豫和矛盾情绪的方法,可能用于个性化干预时机和内容。可验证的下一信号:是否有数字健康初创公司采用类似方法进行用户情感分析。
如果 PRISM-AH 在真实临床场景中得到验证,它可能成为评估患者动机和干预时机的工具。未来需要关注其在低资源环境下的泛化能力以及隐私保护问题。