Explainable Parkinsons Disease Gait Recognition Using Multimodal RGB-D Fusion and Large Language ...
发布时间:2026/8/24 12:37:07 作者:尧图编辑部 阅读量:1,286

文章总结与翻译一、主要内容该研究针对帕金森病(PD)步态识别中现有方法单模态输入局限、鲁棒性不足及缺乏临床可解释性的问题,提出了一种融合RGB-D多模态数据与大语言模型(LLM)的可解释性框架。核心框架数据预处理:通过Azure Kinect传感器采集同步的RGB和深度序列,进行格式标准化、视差转换及模态对齐,保留真实场景下的空间位置变异性。双模态特征提取:采用两个独立的YOLOv11编码器,分别从RGB数据(捕捉颜色、纹理、肢体运动细节)和深度数据(提取3D结构、关节位移等光照不变特征)中提取模态特异性特征。跨空间颈部融合:包含多尺度局部-全局提取(MLGE)模块和跨空间颈部融合(CSNF)机制。MLGE分别捕捉细粒度肢体运动(如手臂摆动减少)和全局步态动态(如短步幅);CSNF整合多尺度特征并通过注意力机制强化跨模态相关性。临床报告生成:将融合特征转换为嵌入向量,结合结构化元数据(如检测到的步态异常)输入冻结的TinyLlama-1.1B-Chat-v1.0模型,生成临床可解释的文本报告。实验与结果数据集:基于Azure Kinect采集的包含正常步态和帕金森样步态的RGB-D序列,涵盖光照变化、衣物遮挡等真实场景。性能:在Rank-1准确率(89.0±0.5%