SocietyBench:预测反事实社会世界的演化
原标题:SocietyBench: Forecasting Counterfactual Social-World Evolution
AI 导读
SocietyBench评估大模型预测社会事件演化的能力:从新闻及五个平台的社交媒体内容构建事实与舆论分层时间线,经实体替换和统一日期偏移抑制记忆泄漏。五类事件、125个中英预测点上,六个前沿模型中的最佳成绩为75.0分,三种智能体框架未超过其共享基础模型。
为什么值得读
它把社会预测拆分为概率校准与时间准确性,并以反事实匿名化降低记忆污染,为评测事件推演型智能体提供了可复现基线。
深度解读
1. 发生了什么
原始事实: 论文提出 SocietyBench,用于评估大语言模型预测真实社会事件及公众舆论后续演化的能力。系统从一句事件主题出发,收集网络新闻和五个平台的社交媒体帖子,形成按日期组织的时间线,并为每个截止日期生成经过审计的预测问题。
2. 核心技术
原始事实: 时间线将事实事件层与公众舆论层分开。模型接触数据前,三阶段流程会替换全部命名实体,并按事件使用固定偏移量整体移动日期,从而保留事件结构,同时削弱模型依靠预训练记忆匹配真实事件的可能性。评测分别使用概率校准和时间准确性两个100分维度。
3. 关键证据与数字
原始事实: 数据覆盖5类异质事件,共125个预测点,并提供中文和英文版本。六个前沿LLM中最佳成绩为75.0/100,论文给出的简单锚点为50。三种共享同一基础模型的智能体框架均未超过该基础模型;两种无模型启发式方法落后于全部LLM。单一事件在某一评分轴上的模型差距最高达到21.4分。
4. 为什么重要
分析: 多数智能体基准强调能否完成软件、浏览器或GUI任务,SocietyBench则测试对开放社会过程的概率判断和时间判断。两个评分轴表现可能分离,说明单一总分可能掩盖“方向判断尚可但时间判断较差”等不同故障模式。
5. 实际影响
分析: 公开的匿名时间线、问题库、真实结果与评分代码,可用于比较基础模型、检索增强系统和事件推演智能体。对舆情监测、风险研判或新闻辅助系统而言,该方法也提示开发者分别检查置信度校准与事件发生时间,而不能只看预测是否最终命中。
6. 局限与不确定性
原始事实: 摘要只报告5个事件,事件级差异最高达21.4分,作者据此强调需要多事件评测。分析: 五个事件仍不足以证明结果能够推广到不同国家、语言、平台生态和事件类型;实体替换可能改变社会语境,固定日期偏移也未必消除所有可识别线索。未验证: 所用六个模型、五个平台、审计协议、评分聚合方式及数据授权细节未出现在给定摘要中,本文数值亦未独立复核。
7. 原始来源
- arXiv 摘要页:arXiv:2608.04009
- 本条仅依据用户提供的标题、摘要、链接和发布日期整理;论文正文、代码仓库及数据文件未在此独立核验。