智慧校园下学生消费大数据分析及助学金精准帮扶机制研究
发布时间:2026/10/7 7:20:58 作者:尧图编辑部 阅读量:1,286

一、研究背景与意义近年来我国高度重视家庭经济困难学生资助工作。据教育部统计2023年全国累计资助学生1.68亿人次资助金额超过3000亿元其中国家助学金资助本专科生约1200万人。随着智慧校园建设的推进高校校园一卡通系统已普及学生在食堂就餐、超市购物、图书借阅、浴室洗澡等场景的消费行为全部实现了数据化记录。这些海量的校园消费数据为学生经济状况评估和助学金精准帮扶提供了全新的数据视角。然而当前高校助学金评定工作存在三大痛点一是传统助学金评定主要依赖学生提交的家庭经济困难证明和班级民主评议主观性强存在虚假贫困人情助学金等问题二是资助对象识别不够精准部分真正困难的学生因害羞未申请而遗漏部分不符合条件的学生通过各种渠道获得资助三是缺乏动态监测机制学生家庭经济状况是动态变化的但当前资助名单一经评定长期不变无法及时调整。大数据技术的发展为解决上述问题提供了新的思路。通过分析学生校园一卡通的消费数据可以客观推断学生的日常消费水平和经济状况辅助识别真正需要帮扶的学生实现助学金的精准发放。基于Spark分布式计算处理全校学生的海量消费流水数据通过机器学习算法构建贫困生识别模型再结合可视化分析工具展示资助效果能够显著提升助学金评定的精准性和公平性。二、国内外研究现状一国外研究现状在学生经济状况识别与精准资助领域国外研究起步较早。美国哈佛大学的Goldrick-Rab等人在2019年开展了基于学生消费行为数据的经济状况评估研究通过分析学生在食堂、书店、校园便利店的消费记录构建学生经济困难程度评分模型其研究目的是提高need-based奖学金评定的精准度。美国斯坦福大学的Bowen等人在2020年利用机器学习算法分析学生校园卡消费数据预测学生的辍学风险其研究目的是在学生遇到经济困难早期就及时提供帮扶。在教育大数据分析方面美国麻省理工学院的Williams等人在2021年基于Spark构建了校园大数据分析平台整合学生消费、成绩、借阅等多源数据通过聚类分析将学生划分为不同群体其研究目的是为学生事务管理提供数据支撑。美国亚利桑那州立大学的Chen等人在2022年设计了学生经济困难预警系统通过实时监测学生的食堂消费频次和消费金额自动识别可能存在经济困难的学生其研究目的是实现资助工作的从被动申请到主动发现转变。在隐私保护方面加拿大多伦多大学的Nixon等人在2023年研究了校园消费数据用于学生帮扶的伦理和隐私问题提出了差分隐私保护方案在数据分析的同时保护学生个人隐私其研究目的是平衡数据利用与隐私保护的关系。总体来看国外在学生消费行为分析和精准资助方面积累了丰富经验但主要面向西方高校的资助体系与我国助学金制度的具体场景存在差异。二国内研究现状国内学者在智慧校园大数据和学生精准资助领域也取得了一系列成果。清华大学教育研究院的史静寰团队在2020年开展了基于校园一卡通数据的学生消费行为分析研究通过分析某高校学生一年的消费流水数据识别出消费水平显著偏低的学生群体其研究目的是为学校资助部门提供精准帮扶名单。浙江大学数据分析研究中心的陈为团队在2021年研发了智慧校园学生消费可视化平台利用ECharts绘制学生消费分布直方图、消费趋势折线图、校园各场所消费热力图其研究目的是为学校管理决策提供直观的数据视图。在机器学习贫困识别方面北京航空航天大学的刘建伟团队在2022年基于SparkMLlib构建了贫困生自动识别模型使用学生的食堂消费频次、月均消费金额、就餐时间分布等特征采用随机森林算法对学生进行经济状况分类其研究目的是辅助辅导员进行助学金评定提高识别效率。华东师范大学的祝智庭团队在2023年设计了动态资助监测机制通过季度更新学生消费数据动态调整资助等级其研究目的是解决资助名单一评定终身的问题。在AI辅助教育决策方面复旦大学的肖仰华团队在2024年将大语言模型引入教育数据分析场景利用DeepSeekAI工具对学生消费数据和资助政策文本进行智能解读其执行过程包括消费特征自动提取、资助政策匹配分析、帮扶建议生成三个环节其结果是实现了助学金评定结果的自然语言解释和个性化帮扶方案生成其研究目的是提升学生资助工作的智能化水平。三研究述评综合国内外研究现状可以发现现有研究在学生消费行为分析、贫困生识别、智慧校园数据可视化等方面已取得丰富成果为本次研究提供了理论基础和技术参考。但现有研究仍存在以下不足一是多数研究聚焦于消费分析或贫困识别的单一环节缺乏集数据采集、消费分析、贫困识别、精准帮扶机制设计于一体的完整研究二是数据获取和分析的工程化描述不够详细实际落地时数据链路不清晰三是帮扶机制设计偏宏观缺乏与消费数据分析结果紧密结合的精准帮扶策略。在前人研究基础上本课题将面向国内高校助学金评定场景构建一个基于校园消费大数据的学生经济状况分析与精准帮扶机制。研究将基于Spark技术栈处理全校学生的消费流水数据采用机器学习算法实现学生经济状况的智能识别并结合消费数据分析结果设计差异化的精准帮扶策略弥补现有研究在完整机制设计和数据驱动决策方面的不足。三、研究内容与目标一研究目标本课题的总体目标是基于智慧校园学生消费大数据构建学生经济状况智能识别模型设计并验证助学金精准帮扶机制为高校资助工作的精准化和智能化提供数据支撑。具体目标包括第一构建覆盖全校学生一学年消费数据的校园消费数据库数据规模达到数万学生、数百万条消费流水第二基于机器学习构建学生经济困难程度识别模型模型识别准确率达到85%以上第三基于消费数据分析结果设计三级精准帮扶机制分别对应不同经济困难程度的学生群体第四实现学生消费数据的可视化分析展示为资助管理部门提供数据决策看板。二主要研究内容本课题的主要研究内容包括以下四个方面第一校园消费数据获取与预处理研究。针对校园一卡通系统的消费流水数据设计数据采集方案。研究数据清洗和特征工程方法包括从原始消费流水中提取学生维度的消费统计特征将原始交易数据转化为可用于经济状况评估的特征向量。第二学生经济状况智能识别模型研究。基于SparkMLlib构建学生经济困难程度分类模型对比逻辑回归、随机森林、XGBoost三种算法的识别效果通过参数调优选择最优模型。研究消费特征与学生经济状况之间的关联关系。第三助学金精准帮扶机制设计研究。基于经济状况识别结果和消费行为特征分析设计分级分类的精准帮扶机制包括临时困难补助、勤工助学岗位推荐、伙食补贴、学业帮扶等多种帮扶方式针对不同群体匹配最优帮扶策略。第四消费数据分析可视化系统实现研究。基于SpringBootVue前后端分离架构开发学生消费数据分析看板实现消费分布统计、贫困生识别结果展示、帮扶效果追踪等可视化功能。引入DeepSeekAI工具实现资助决策的智能解读。四、系统功能设计一系统总体架构本系统采用分层架构设计自下而上分为数据采集层、数据存储层、计算引擎层、业务逻辑层和前端展示层五层。数据采集层负责从校园一卡通系统采集消费流水数据数据存储层基于Hive数据仓库存储历史消费数据MySQL存储学生基本信息计算引擎层以Spark为核心负责特征工程和模型训练业务逻辑层基于SpringBoot提供API服务前端展示层基于VueECharts实现可视化交互界面。系统技术栈选型如下大数据存储采用Hadoop 3.3HDFSHive计算引擎采用Spark 3.2 MLlib机器学习库后端采用SpringBoot 2.7 Java 11前端采用Vue 3 Element Plus ECharts 5数据库采用MySQL 8.0。二核心功能模块数据管理模块 数据管理模块负责校园消费数据的接入、清洗和标准化。系统通过定时任务每日同步前一日的校园一卡通消费流水数据自动完成数据清洗去重、异常值过滤、无关消费类型过滤和特征工程消费统计指标计算将处理后的标准化数据写入Hive数据仓库。模块提供数据质量监控面板展示每日消费记录数、覆盖学生数、异常记录数等指标。贫困生智能识别模块 贫困生智能识别模块是系统的核心功能基于Spark MLlib的随机森林分类算法实现。模块每学期执行一次批量识别输入全校学生的消费特征向量输出每个学生的经济困难程度分类一般困难、特别困难、非困难和置信度。识别结果导入资助管理系统作为助学金评定的参考依据。模型输入特征包括月均食堂消费金额、月均消费频次、早就餐次数占比、校外消费占比、月均消费波动系数、是否经常在低价窗口就餐、节假日消费金额变化等。输出为学生经济困难程度的二分类或三分类结果。消费分析可视化模块 可视化分析模块面向学生资助管理部门提供多维度的消费数据分析和识别结果展示 1学生消费分布柱状图展示全校学生月均消费金额的分布情况。柱状图横轴为消费区间如300元、300-500元、500-800元、800-1200元、1200元纵轴为学生人数。例如某高校全校本科生月均消费分布显示300元以下占比5.2%、300-500元占比18.7%、500-800元占比42.3%、800-1200元占比25.6%、1200元以上占比8.2%。该柱状图的意义在于直观展示学生消费的整体分布识别消费水平偏低的尾部群体为精准资助提供数据依据。2学生经济状况雷达图从月均消费、就餐频次、消费稳定性、就餐时间规律、校外消费占比五个维度绘制不同经济困难程度学生群体的画像雷达图。例如特别困难学生群体的雷达图在月均消费维度得分极低但在就餐频次维度相对较高因为主要在校内食堂就餐减少校外消费而非困难学生群体的雷达图在校外消费占比维度突出。雷达图的意义在于多维度综合刻画不同群体的消费行为特征。3帮扶效果追踪折线图展示受助学生获得资助前后的消费变化趋势。横轴为月份纵轴为月均消费金额对比受助前3个月和受助后6个月的消费曲线。例如某特别困难学生获得助学金后月均消费从320元提升至480元营养状况明显改善。折线图帮助管理部门评估帮扶政策的实际效果。4各学院贫困生比例饼图展示各学院经济困难学生的人数和比例分布。例如计算机学院贫困生占比8.5%、文学院占比15.2%、机械工程学院占比18.7%。饼图帮助学校从宏观层面掌握各学院的资助需求分布合理分配资助名额。智能决策问答模块 智能决策问答模块基于DeepSeekAI大语言模型构建资助老师可以用自然语言向系统提问例如哪些学院的贫困生比例最高“这学期新识别出的特别困难学生有哪些”给这10个学生分别推荐什么帮扶方式比较合适系统自动解析问题调用后端API获取分析结果并以文字图表的形式返回决策建议。该模块按照执行过程结果三段式逻辑运行执行阶段系统接收用户自然语言问题通过意图识别和实体提取确定查询维度和分析对象过程阶段系统调用Spark计算引擎对消费数据进行聚合统计运行贫困识别模型结果阶段DeepSeekAI将分析结果转化为通俗易懂的决策建议同时自动生成对应的可视化图表。五、数据获取与数据分析方案一数据获取方案本研究的数据获取涵盖校内业务数据和外部参考数据两大类具体如下第一类是校园一卡通消费流水数据来源于学校一卡通管理中心。通过数据库视图定期同步包含字段交易流水号、学生学号、消费时间、消费地点食堂/超市/浴室/图书馆等、消费金额、消费类型。历史数据回溯一学年约10个月覆盖全校约1.5万名本科生。这是研究最核心的数据来源预计数据量达到300-500万条消费记录。第二类是学生基本信息数据来源于学校学工系统。包含字段学号、姓名脱敏处理、性别、年龄、学院、专业、年级、生源地、家庭经济困难等级已有认定结果作为模型训练标签。学生敏感信息姓名、身份证号、家庭住址在数据预处理阶段进行脱敏处理仅保留分析所需的维度字段。第三类是奖助学金发放数据来源于学生资助管理中心。包含字段学号、资助类型国家助学金/校级助学金/临时困难补助、资助金额、发放时间。该数据用于验证贫困识别模型的准确性以及追踪帮扶效果。第四类是外部参考数据包括当地最低生活保障标准作为贫困判定的参考阈值、高校学生人均消费支出统计数据作为对比基准、餐饮价格指数用于调整不同时间的消费金额可比性。外部数据从公开统计渠道获取用于校准分析结果。数据获取的技术方案校内业务数据通过DataX工具每日定时同步到HDFS外部参考数据通过Python脚本从公开渠道采集后写入HDFS。所有原始数据按日期分区存储学生敏感信息在采集后立即进行脱敏处理。预计累计数据量达到数百万条消费记录、万级学生基本信息。二数据清洗与特征工程多源数据存在格式不统一、缺失值、异常值等问题需要进行系统化的清洗和特征工程处理分为四个步骤第一步是数据解析与格式统一。将从不同系统采集的数据解析为统一的结构化表格统一字段命名规范如student_id、consume_time、amount、location_type等统一时间格式统一编码为UTF-8。学生姓名、学号等敏感字段进行哈希脱敏处理。第二步是异常值和缺失值处理。对于消费金额为0或负数的记录如退款交易单独标记不纳入消费统计对于单次消费金额异常偏高如超过500元的记录视为非日常消费剔除对于缺少消费地点信息的记录根据消费金额和时间推断消费类型对于长期无消费记录的学生如休学、退学从分析样本中排除。第三步是特征工程构建。从原始消费流水数据中按学生维度聚合提取以下特征月均食堂消费金额、月均消费总金额、月均消费频次、日均就餐次数、早中晚就餐比例、校外消费占比、消费金额标准差衡量消费稳定性、节假日消费变化率、低价窗口就餐次数占比、月末剩余金额比例等。每个学生最终生成约15个消费行为特征。第四步是数据集划分。将清洗后的数据集按学生维度随机划分为训练集和测试集训练集占70%约1万名学生测试集占30%约5000名学生。使用已有的家庭经济困难认定结果作为标签训练集用于模型训练测试集用于模型性能评估。处理后的数据写入Hive数据仓库按ODS、DWD、DWS、ADS四层架构组织。三贫困生识别模型分析本研究采用Spark MLlib中的随机森林分类算法作为贫困生识别主模型同时对比逻辑回归和决策树两种算法。选择随机森林的原因一是随机森林在分类任务上表现稳定对异常值和噪声数据鲁棒性强二是随机森林内置了特征重要性评估可以识别哪些消费特征对贫困识别贡献最大三是SparkMLlib提供了随机森林的分布式实现能够处理万级学生、数十万样本的训练任务。模型训练流程首先从Hive中读取特征数据和标签经济困难等级将分类特征进行One-Hot编码组合成特征向量然后按学生维度划分训练集和测试集接着使用RandomForest类进行模型训练设置树数量100、最大深度8、最小信息增益0.01训练完成后在测试集上评估模型性能使用准确率、精确率、召回率、F1值四个指标。模型分析重点关注一是不同算法的识别精度对比验证随机森林是否最优二是特征重要性排序识别对贫困识别贡献最大的消费特征预期月均食堂消费、就餐频次、校外消费占比是贡献度最高的三个特征三是误分案例分析找出模型识别错误的学生类型分析错误原因针对性补充特征。四消费行为多维度分析在贫困生识别模型基础上开展多维度学生消费行为分析第一是消费水平分布分析。绘制全校学生月均消费金额的直方图观察消费分布的偏态特征。结合学校所在城市的生活成本基准确定消费水平偏低的阈值初步识别需要关注的学生群体。例如某高校学生月均消费均值为780元标准差为220元低于均值减一个标准差560元的学生约占16%这些学生是重点关注对象。第二是消费结构分析。分析学生消费金额在食堂就餐、超市购物、浴室洗澡、打印复印等不同场景的占比。经济困难学生通常食堂就餐占比高85%以上而消费水平较高的学生超市购物和校外消费占比更高。通过消费结构的差异进一步区分学生的消费习惯和经济状况。第三是消费时间规律分析。分析学生的就餐时间分布。经济困难学生通常就餐时间集中在饭点高峰因为低价窗口排队时间长但价格低且早就餐比例高因为早餐价格最便宜。通过时间分布特征辅助判断学生的经济状况。第四是帮扶效果评估分析。对比受助学生获得资助前后的消费变化评估帮扶政策的实际效果。例如国家助学金发放后受助学生的月均消费是否提升营养状况是否改善学习投入是否增加通过前后对比分析不断优化帮扶策略。