1. 引言
中国提前十年完成联合国2030年可持续发展议程的减贫目标,为全球减贫进程的推进作出了突出贡献。然而,各种纷繁复杂的风险冲击不断来袭,返贫风险问题依然存在。据统计,2020至2021年全世界约有0.88亿~1.5亿人重返贫困[1]。人民日报报道,2025全国保障城乡低保对象3910.4万人、特困人员486.1万人,惠及1189.7万困难残疾人和1664万重度残疾人[2]。乡村振兴阶段,在脱贫攻坚的成果上,实现精准扶贫与乡村振兴有效衔接的基础和前提是不发生规模性返贫[3]。由此可见,脱贫摘帽不是奋斗的终点,而是新生活、新气象的起点。后扶贫时代贫困的治理视野应更加宽阔,应逐步实现由绝对贫困到相对贫困,由解决短期问题到建立长效脱贫机制的重点转移。
疾病或是后扶贫时代返贫致贫的首要原因。国家乡村振兴局建档立卡数据显示,近年来我国建档立卡贫困户中因病致贫、因病返贫的约占40%,出现了“广覆盖”的基本医疗保险与“高比例”的因病致贫并存的现象[4]。同时,北京同心圆慈善基金会发现,即使在基本医保和大病保险的保障下,对极重病人进行托底救助依然存在一定缺口,其因病返贫致贫风险尤为突出[5]。而健康风险发生是因病返贫、因病致贫链条的逻辑起点,因病返贫致贫本质上是健康风险冲击下的一种支出型贫困状态[6] [7]。因此,探索如何及早识别健康风险下的潜在返贫人群,并帮助其有效抵御健康风险发生带来的冲击,从而遏制因病返贫致贫风险势必成为我国民生工程建设的重点环节。
长久以来,贫困问题都是学术界探讨的热点,国内外对于贫困影响因素的研究已经较为全面。现有研究已从家庭内部状态、家庭成员情况、家庭所处环境因素等家庭微观方面进行探讨,对于家庭外部因素多从地域、家庭社会网络、政府社会支持等方面探究影响因素[8]-[12]。可见,对于部分脱贫户、低保户,或是边缘户而言,他们自身抵御风险能力不强、地区内生发展能力不足,更易受到外界冲击而返贫致贫。然而,对于潜在返贫风险人群的预测类则相对较少。现有研究主要从贫困脆弱性测度、返贫预测、返贫预警系统展开研究,研究方法多选择传统模型算法、机器学习或深度学习,亦有研究综合比较多种模型预测效能[13]-[17]。
但就现有研究而言,该领域依然存在深入研究必要性。一是大多研究贫困划分标准按较为单一,多为人均年收入低于绝对贫困线[18],忽略了家庭外部因素所带来的影响,难以准确反映现阶段我国潜在返贫风险人群。二是研究针对健康风险这一返贫重要原因进行深入分析和探讨,对因病返贫的风险预测尚不完善,三是研究所用数据大多为小范围家庭调查数据,或是地区监测数据,代表性还有待提升。
本研究以健康风险为主视角,选用中国家庭金融调查数据库(China Household Finance Survey, CHFS),全面筛查潜在影响因素,利用相关性分析及LASSO回归降维剔除高相关性变量,以多因素Logistic回归探究我国潜在返贫风险人群的影响因素、建立Logistic预测模型与XGBoost模型综合比较选取最优风险模型,构建健康风险下的潜在返贫风险预测模型,运用SHAP使模型可视化。以期精准探究我国潜在返贫风险人群的高危因素,精准预测潜在返贫风险人群,为潜在返贫风险人群的早期识别、超前干预提供理论依据。
2. 研究方法
2.1. 数据来源
数据选取中国家庭金融调查(China Household Finance Survey, CHFS) 2019年最新公开数据,CFPS西南财经大学中国家庭金融调查与研究中心自2010年起,截至目前共完成7轮中国家庭金融调查,主要内容包括:住房资产与金融财富、负债与信贷约束、收入与消费、社会保障与保险、代际转移支付、人口特征与就业以及支付习惯等相关信息,对家庭经济、金融行为进行了全面细致的刻画。数据涵盖了全国29个省份,355个县(区、县级市),包含40,011户家庭,在全国具有良好的代表性。CFPS2019年调查数据包含“家庭数据”与“个人数据”两个数据包(下载链接:https://chfser.swufe.edu.cn/datas/Products/Datas/DataList),其中“家庭数据”共含有34,643例样本、2656个变量,“个人数据”包含107,008例样本、423个变量。
2.2. 数据处理
本研究从家庭经济保障、家庭支出、健康风险、社会保障四个维度全面筛选两个数据包,共筛选出68个可能变量,将缺失大于30%的变量予以剔除,变量缺失小于30%的删除缺失样本,最终将变量合并转化剔除相似变量得到26,625例样本28个变量。由于家庭经济类数据离散程度过高且存在极端值,故根据原始数据特征及参考相关文献将这类变量转换为有序多分类变量,具体变量赋值见表1。
Table 1. Variable assignment description table
表1. 变量赋值说明表
变量 |
指标 |
赋值说明 |
变量 |
指标 |
赋值说明 |
X1 |
家庭是否
从事工商业活动 |
是 = 1,否 = 0 |
X2 |
家庭住房属性 |
自有房 = 1,非自有房 = 0 |
X3 |
家庭拥有住房数量 |
—— |
X4 |
家庭是否有拆迁经历 |
是 = 1,否 = 0 |
X5 |
家庭是否拥有汽车 |
是 = 1,否 = 0 |
X6 |
家庭是否有积蓄 |
是 = 1,否 = 0 |
X7 |
户主是否使用智能机 |
是 = 1,否 = 0 |
X8 |
户主户口类型 |
农村 = 1,城镇 = 2 |
X9 |
家庭人数 |
—— |
X10 |
家庭成员
不健康人数比 |
—— |
X11 |
家庭成员最高学历 |
未上学 = 1,
小学 = 2,初中 = 3,
高中 = 4,大学 = 5,
研究生及以上 = 6 |
X12 |
家庭幸福感 |
非常幸福 = 1,幸福 = 2,
一般 = 3,不幸福 = 4,
非常不幸福 = 5 |
X13 |
家庭是否借出资金 |
是 = 1,否 = 0 |
X14 |
家庭是否贷款 |
是 = 1,否 = 0 |
X15 |
家庭去年固定支出 |
0~1万 = 1,1万~2万 = 2,
2万~3万 = 3,3万~4万 = 4,
4万5万 = 5,5万~6万 = 6,
6万~7万 = 7,7万~8万 = 8,
8万~9万 = 9,9万~10万 = 10,10万以上 = 11 |
X16 |
家庭去年
非固定支出 |
0~0.5万 = 1,0.5万~1万 = 2,
1万~1.5万 = 3,1.5万~2万 = 4,
2万~2.5万 = 5,2.5万~3万 = 6,
3万~3.5万 = 7,3.5万~4万 = 8,
4万~4.5万 = 9,4.5万~5万 = 10,
5万以上 = 11 |
X17 |
家庭去年工资性收入 |
0~1万 = 1,1万~2万 = 2,
2万~3万 = 3,3万~4万 = 4,
4万5万 = 5,5万~6万 = 6,
6万~7万 = 7,7万~8万 = 8,
8万~9万 = 9,9万~10万 = 10,10万以上 = 11 |
X18 |
家庭去年人均
年收入 |
0~0.5万 = 1,0.5万~1万 = 2,
1万~1.5万 = 3,1.5万~2万 = 4,
2万~2.5万 = 5,2.5万~3万 = 6,
3万~3.5万 = 7,3.5万~4万 = 8,
4万~4.5万 = 9,4.5万~5万 = 10,
5万以上 = 11 |
X19 |
家庭耐用品价值 |
0~0.5万 = 1,0.5万~1万 = 2,
1万~1.5万 = 3,
1.5万~2万 = 4,
2万以上 = 5 |
X20 |
家庭存款 |
0~0.5万 = 1,0.5万~1万 = 2,
1万~1.5万 = 3,1.5万~2万 = 4,
2万~2.5万 = 5,2.5万~3万 = 6,
3万~3.5万 = 7,3.5万~4万 = 8,
4万~4.5万 = 9,4.5万~5万 = 10,
5万以上 = 11 |
X21 |
家庭是否
拥有大病保险 |
是 = 1,否 = 0 |
X22 |
家庭成员
去年是否住院 |
是 = 1,否 = 0 |
X23 |
家庭去年住院花费 |
0 = 0,1万以下 = 1,
1万以上 = 2 |
X24 |
家庭近五年是否
发生重大不良事件 |
是 = 1,否 = 0 |
X25 |
家庭曾经是否
为贫困户 |
是 = 1,否 = 0 |
X26 |
家庭去年是否享有
政府救助 |
是 = 1,否 = 0 |
X27 |
家庭去年是否
享有生产补贴 |
是 = 1,否 = 0 |
Y |
家庭是否潜在贫困
风险户 |
是 = 1,否 = 0 |
目前大多数研究以经济收入低于绝对贫困线标准为贫困依据,然而我国各地的扶贫标准大多是“两不愁三保障”,外加“一个收入”,“两不愁三保障”即不愁吃、不愁穿,保障其义务教育、基本医疗和住房[15]。然,要精准全面预测潜在返贫风险人群,应适当放宽标准,实现潜在返贫人群的早发现、早干预。基于数据库本身特征与研究所需,本研究以人均年收入低于2019年国家扶贫线3218元[19]、家庭享有住房保障、享有扶贫帮扶或风险边缘人群(低保户、监测户、低收入家庭)作为潜在贫困风险人群判定标准。
2.3. 统计分析
本研究利用Spearman相关性分析,分析变量间的相关性,剔除与因变量无相关性的变量,自变量间相关系数绝对值大于0.7则保留其中一个变量,变量筛选考虑在不改变模型拟合效果情况下,数据尽可能简单化。研究变量属于高维变量,利用LASSO回归对变量进行降维并筛选重要变量,运用Logistic回归进行影响因素的探索,并利用Logistic回归与XGBoost模型进行风险预测模型建模,利用ROC曲线以及混淆矩阵综合评估模型预测效能,最终选择SHAP模型对最优风险模型进行可视化处理。研究采用stata17.0对数据进行预处理,采用R4.4.1对数据进行建模分析,检验水准α = 0.05。
3. 研究结果
3.1. 相关性分析
将28个变量进行Spearman相关分析,结果显示,“家庭人数”与“家庭是否贷款”跟家庭是否为潜在贫困风险户无相关性;“家庭成员去年是否住院”与“家庭去年住院花费”两变量存在高相关性,相关系数为0.96 (P < 0.05),为保证模型尽可能简单,故保留“家庭成员是否住院”纳入研究。见图1。
Figure 1. Variable correlation analysis
图1. 变量相关性分析
3.2. LASSO回归
由图1可见,部分自变量间存在相关性,且相关程度较高,将剩余24个自变量纳入LASSO回归进行变量降维处理。结果显示,随着LASSO回归的惩罚参数λ逐渐增大,自变量系数逐渐压缩为0 (见图2(A)),当λ取lambda.min时,模型筛选变量为24个,此时模型二项偏差最小,模型效能最优,当参数λ取lambda.1se时模型筛选变量17个,此时模型性能较好且拥有变量最少(见图2(B))。
Figure 2. Variable selection based on LASSO regression
图2. 基于LASSO回归的变量筛选
当λ取lambda.1se时模型筛选表2所示工商活动、住房属性、住房数量等17个变量进行后续影响因素研究以及预测模型构建。
Table 2. LASSO variable selection table
表2. LASSO筛选变量表
变量 |
系数 |
变量 |
系数 |
工商活动 |
−0.042 |
住房属性 |
−0.688 |
住房数量 |
−0.012 |
汽车 |
−0.256 |
积蓄 |
−0.267 |
智能手机 |
−0.219 |
户口类型 |
−0.429 |
不健康人数比 |
0.382 |
学历 |
−0.052 |
非固定支出 |
0.003 |
工资性收入 |
−0.026 |
人均年收入 |
−0.567 |
耐用品价值 |
−0.052 |
存款 |
−0.031 |
大病保险 |
0.089 |
曾经贫困户 |
5.441 |
政府救助 |
1.289 |
|
|
3.3. 多因素Logistic回归
以潜在返贫风险户为因变量,将LASSO回归筛选的17个变量作为自变量纳入多因素Logistic回归模型,选择逐步回归训练模型,最终拟合模型排除变量“家庭住房数量”,纳入其余16个变量,模型似然比检验P < 0.001,伪R2 = 0.554,表示模型拟合较好。表3所示,“家庭不健康人数比”、“家庭非固定支出”、“家庭拥有大病保险”、“曾经是贫困户”、“享有过政府帮扶”等因素为潜在返贫风险户的危险因素,其余因素为保护因素。其中,危险因素中,曾经是否为贫困户影响最大,曾经为贫困户的家庭潜在返贫风险是曾经非贫困户家庭的8850.673倍;保护因素中,家庭住房属性最为显著,家庭住房为自有房的潜在返贫风险是非自有房家庭的40.6%。
Table 3. Fitted parameters of the multivariate logistic regression model for households at risk of returning to poverty
表3. 潜在返贫风险户的多因素Logistic回归模型拟合参数
变量 |
偏回归系数 |
标准误 |
Z |
P |
OR |
95% CI |
常数 |
2.084 |
0.125 |
16.670 |
<0.001 |
8.038 |
—— |
工商活动 |
−0.257 |
0.087 |
−2.946 |
0.003 |
0.773 |
(0.650, 0.916) |
住房属性 |
−0.902 |
0.060 |
−15.072 |
<0.001 |
0.406 |
(0.361, 0.456) |
汽车 |
−0.384 |
0.077 |
−5.016 |
<0.001 |
0.681 |
(0.585, 0.790) |
积蓄 |
−0.249 |
0.050 |
−4.969 |
<0.001 |
0.780 |
(0.707, 0.860) |
智能手机 |
−0.211 |
0.049 |
−4.284 |
<0.001 |
0.810 |
(0.735, 0.892) |
户口类型 |
−0.531 |
0.057 |
−9.284 |
<0.001 |
0.588 |
(0.526, 0.658) |
不健康人数比 |
0.389 |
0.064 |
6.069 |
<0.001 |
1.475 |
(1.301, 1.672) |
学历(小学) |
−0.235 |
0.091 |
−2.579 |
0.009 |
0.790 |
(0.662, 0.944) |
学历(初中) |
−0.343 |
0.091 |
−3.773 |
<0.001 |
0.710 |
(0.594, 0.848) |
学历(高中) |
−0.389 |
0.098 |
−3.984 |
<0.001 |
0.678 |
(0.559, 0.821) |
学历(大学) |
−0.230 |
0.107 |
−2.147 |
0.032 |
0.795 |
(0.644, 0.980) |
学历(研究生及以上) |
−0.197 |
0.332 |
−0.593 |
0.553 |
0.821 |
(0.411, 1.526) |
非固定支出 |
0.076 |
0.013 |
5.713 |
<0.001 |
1.079 |
(1.051, 1.107) |
工资性收入 |
−0.050 |
0.011 |
−4.595 |
<0.001 |
0.951 |
(0.930, 0.971) |
人均年收入 |
−0.677 |
0.019 |
−34.790 |
<0.001 |
0.508 |
(0.489, 0.528) |
耐用品价值 |
−0.068 |
0.019 |
−3.543 |
<0.001 |
0.935 |
(0.900, 0.970) |
存款 |
−0.043 |
0.008 |
−5.181 |
<0.001 |
0.958 |
(0.943, 0.974) |
大病保险 |
0.201 |
0.047 |
4.307 |
<0.001 |
1.223 |
(1.116, 1.340) |
曾经贫困户 |
9.088 |
0.765 |
11.879 |
<0.001 |
8850.673 |
(2451.955, 5745.246) |
政府救助 |
1.373 |
0.052 |
26.404 |
<0.001 |
3.949 |
(3.567, 4.373) |
注:变量学历均以未上学作为参照;模型似然比检验P < 0.001,Nagelkerke伪R2 = 0.554。
采用十折交叉验证上述Logistic模型的预测效能,取10次验证数据的平均值评估模型预测效能,由图3(A)可见模型的平均ROC曲线下面积AUC = 0.734,由图3(B)可计算得到模型精确率为0.886、查准率为0.785、灵敏度为0.498、特异度为0.970,F1值为0.609。
Figure 3. Logistic regression model predictive performance
图3. Logistic回归模型预测效能
3.4. XGBoost预测模型
将多因素Logistic回归模型建模的16个变量纳入XGBoost模型。XGBoost模型参数通过网格搜索法与十折交叉验证搜索最优组合,见表4。通过十折交叉验证的平均结果用于评价模型的预测效能,由图4(A)可见,模型10次训练的平均ROC曲线下面积AUC = 0.948,由图4(B)混淆矩阵可计算得到模型精确率为0.905、查准率为0.937、灵敏度为0.949、特异度为0.703,F1值为0.943。
Table 4. XGBoost model parameters
表4. XGBoost模型参数表
参数名 |
参数值 |
参数含义 |
max_depth |
5 |
树的最大深度 |
eta |
0.2 |
学习率 |
gamma |
0.5 |
分裂最小损失 |
min_child_weight |
2 |
最小子节点权重和 |
subsample |
0.7 |
样本子采样率 |
colsample_bytree |
0.4 |
特征子采样率 |
nround |
60 |
迭代次数 |
objective |
binary:logistic |
二分类逻辑回归 |
metrics |
rmse |
均方根误差 |
Figure 4. Predictive performance of the XGBoost model
图4. XGBoost模型预测效能
3.5. 模型评估
两模型采用受试者工作特征(receiver operating characteristic, ROC)曲线混淆矩阵的四个常用指标精确率(Accuracy)、查准率(Precision)、灵敏度(Sensitivity)、特异度(Specificity),以及F1值对模型预测性能进行评估。由表5可知,Logistic回归模型仅特异度高于XGBoost模型,其他评价指标均低于XGBoost模型。拟合模型往往追求灵敏度、特异度都比较高,本研究Logistic回归灵敏度远低于XGBoost,那么Logistic回归模型就会有更高的漏诊率,本研究为了拟合潜在返贫风险模型,为全面尽早筛选高风险人群,故需要模型有更高的灵敏度。图5可见,XGBoost模型的ROC曲线下面积显著高于Logistic回归(P < 0.05)。
Table 5. Evaluation of the logistic regression and XGBoost models
表5. Logistic回归模型与XGBoost模型评估
指标 |
Logistic回归 |
XGBoost模型 |
精确率 |
0.886 |
0.905 |
查准率 |
0.785 |
0.937 |
灵敏度 |
0.498 |
0.949 |
特异度 |
0.970 |
0.703 |
F1值 |
0.609 |
0.943 |
Figure 5. Comparison of the model’s ROC curves
图5. 模型ROC曲线比较
3.6. 模型可视化
选用XGBoost模型作为潜在返贫风险户的预测模型,模型显示“家庭人均年收入”、“是否曾经是贫困户”、“是否享受政府帮扶”、“户主户口类型”、“家庭存款”是对模型贡献度最高的五个变量(图6(A))。其中家庭人均年收入低于5000元潜在返贫风险最大,人均年收入大于10,000元,随着收入增加风险降低幅度变小;曾经是贫困户和享受有政府救助帮扶的家庭返贫风险较高,且对潜在返贫影响较大;农村户口相比城市潜在返贫风险更高;家庭存款25,000元以下,随着存款增加,潜在返贫风险降低,家庭存款高于25,000元,返贫风险有所波动,整体上随着存款增加,潜在返贫风险降低(图6(B))。
4. 讨论
4.1. 潜在返贫风险的影响因素
由相关性结果可知,本研究中“家庭人数”与潜在返贫风险无关,而在其他研究既有发现家庭人数越多返贫风险越高[20],又有数据显示家庭人数多会降低返贫风险[15],家庭规模与潜在返贫风险的关系学术界尚未达成一致。“家庭住房数量”相关性分析显示与潜在返贫风险具有相关性,然而多因素Logistic回归模型却剔除该变量,可能变量“家庭住房属性”与之较为相关,相关系数为0.53 (P < 0.05)。
多因素分析结果与现有研究较为一致,家庭不健康人数比越高、家庭非固定支出越高、家庭拥有大病保险、农村家庭、曾经是贫困户、享有过政府帮扶等家庭面临更高的潜在返贫风险,工资性收入越高、拥有固定资产、积蓄越高的家庭潜在返贫风险越低[15] [21]-[23]。家庭最高学历为小学、初中、高中相对于未上过学的家庭偏回归系数逐渐变小,即学历越高潜在返贫风险越低,这与非洲的一项研究一致[24],该研究发现中等教育能带来经济效益,且农村地区的经济增益高于城市;然而本研究发现家庭最高学历为大学的家庭,相比于未上过学的潜在返贫风险更低,但是偏回归系数有所增加,最高学历为研究生及以上的家庭与未上过学的家庭相比,潜在返贫风险差异无统计学意义(P = 0.553)。这可能是研究生及以上样本量太少的缘故;亦有可能是高等教育需要人力财力的投入,高等教育会增加学习年限,在一定时间范围内、一定程度上降低劳动力的经济创造能力,家庭返贫脆弱性较高的家庭会增加潜在返贫风险[25]。
Figure 6. Visualization of the XGBoost model
图6. XGBoost模型可视化
4.2. 潜在返贫风险预测模型
Logistic回归用于潜在返贫风险的预测,平均AUC为0.734这与Logistic回归预测其他领域效能较为一致[26]。本研究Logistic回归混淆矩阵和ROC曲线下面积均没有XGBoost表现优异,预测效能较XGBoost模型低,这与国内外在其他领域的研究结果大多一致[27]-[29]。而也有研究结果显示,XGBoost模型与Logistic回归预测效能相似,且样本量较小Logistic回归更稳健[30]。故,机器学习并不一定完全优于传统统计方法,研究者亦需要结合数据类型选择合适的方法。
“家庭人均年收入”、“是否曾经是贫困户”、“是否享受政府帮扶”、“户主户口类型”、“家庭存款”是对XGBoost模型贡献度最高的五个变量,且“家庭人均年收入”的贡献度是其他变量的2倍以上这与Logistic回归的结果并非完全一致。XGBoost模型可视化显示潜在返贫风险与家庭人均年收入在1万以下关系更为密切,可见XGBoost模型较Logistic回归能够更准确地发现变量内部变化的模型的影响。
4.3. 局限性分析
本研究数据为横断面数据,因故推断因果关系的能力受限,变量间的时间先后顺序及因果方向难以确定。其次,预测模型验证仅采用内部验证,模型泛化能力还有待进一步考量。此外,部分变量依赖自报数据,可能存在回忆偏倚或社会期许效应,影响数据准确性。下一步,研究可考虑采用纵向追踪数据,运用未来数据对模型进行外部验证,以增强模型的稳健性与解释力,从而为制定更精准的防返贫政策提供科学依据。
5. 结论与建议
从健康风险视角看,家庭成员健康状况,以及家庭拥有大病保险与潜在返贫风险息息相关。家庭成员健康状况不好的家庭不仅有更大的医疗支出,同时因为疾病或伤害而无法工作,家庭的经济状况可能会更加困难[31] [32];家庭拥有大病保险可能本身家庭成员患有或易患有重大疾病,相关政策制定者或研究人员应持续关注因病处于潜在返贫风险中的人群。
从贫困治理视角看,乡村振兴、教育脱贫是后扶贫时代贫困治理的必经之路[33]。已脱贫户与享有政府救助的家庭这些贫困边缘人群抵御返贫风险能力较差,更易面临潜在返贫风险,相关部门不仅要“授人与鱼”,更要“授人以渔”,全面推进乡村振兴,帮助贫困边缘人群,彻底摆脱贫困风险。科教兴国,教育能增加经济效益,相关部门应做好教育保障工作,打破“因贫辍学”、“因教返贫”的恶性循环,为降低潜在返贫风险提供内生动力。
基金项目
2026年度重庆市科卫联合疾控科研项目,项目编号:2026KWJK1014与2027年度重庆市科卫联合疾控科研项目(公共卫生人才项目),项目编号:2027KWJK1012资助。
NOTES
*通讯作者。