Pıer
潮声潮汐灯火船坞漂瓶岸
Pıer

导航

  • 潮声
  • 岸
  • 灯火
  • Agent 接入
  • 更新日志
  • 漂瓶
  • 现在
  • 反馈

外部链接

GitHubCloudborne 独立站 ↗

© 2026 Pier.

阅读原文
arXiv 预印本·Yumiao Li·2026年9月4日 14:24

预测灵活就业者参保行为:面向社保政策评估的领域大模型 FlexPension-LLM

原标题:Can Large Language Models Anticipate Behavioral Responses to Social Policies? A Case of Pension Enrollment Prediction among China's Flexible Workers

论文75

评估社会政策变革的影响是政策制定者公认的一大难题。计量经济学方法在外推至假设情景时可能不够可靠,而实地试点项目的成本又极其高昂。在本文中,我们提出将从通用模型适配而来的大语言模型(LLM)用作政策评估工具。我们推出了 FlexPension-LLM,这是首个面向中国灵活就业人员分层养老保险参保预测任务的领域专用大语言模型,并提出了 DKI-RDistill 方法——该方法将立足于政策的线索(包括源自 Probit 模型的边际效应以及户籍省份的养老保险规则)注入提示词中。随后,该方法利用 LoRA/SFT 将经推理依据增强的监督信号蒸馏至一个开源权重的 MoE 学生模型中,并通过在真实标签下重新生成相应样本来纠正教师模型的错误。在 CHFS 2019 盲测集划分上,FlexPension-LLM 取得了 0.9316 的综合 F1 分数,超越了其教师模型 Claude Sonnet 4.5 以及 17 个基线模型中的 15 个,且在统计学上与 Claude Opus 4.6 无显著差异。在四个外部调查数据集中,该模型的平均综合 F1 达到 0.7549,并在所有顶尖系统中展现出最窄的性能波动范围。组件分析表明,性能增益主要源于基于政策的线索注入以及经过误差过滤的监督信号,而推理依据则提供了可对照政策规则进行核验的决策轨迹。

为什么值得读

将计量经济先验与政策条文融入模型蒸馏,为公共政策制定中的微观行为模拟提供了兼顾准确率与可解释性的新范式。

标签

LLMPolicy SimulationKnowledge DistillationEconometricsPensionMoESocial Science

评分依据

  • 新颖性76
  • 影响力72
  • 实践价值78
  • 可信度80
  • 时效性72