论文

使用大型语言模型构建 Social World Models

使用大型语言模型构建 Social World Models

理解并预测社会信念如何因事件(从政策变化到科学突破)而演变,仍然是社会科学中的基本挑战。鉴于大型语言模型(LLMs)的常识知识与社交智能,我们探究:LLMs 能否建模社会事件后社会信念的动态变化? 本文引入 Social World Model (SWM) 概念,这是一个通用框架,旨在捕捉社会信念对重大事件的响应演变。SWM 通过挖掘社会数据中的时间模式并优化证据下界(Evidence Lower Bound)来学习社会信念的状态转移函数,无需显式人工标注事件与信念变化的关联,也无需昂贵的普查数据。 为评估 SWM,我们构建了基准 SWM-bench,数据源自真实预测市场 Kalshi 和 Polymarket。SWM-bench 包含超过 12,000 个数据点,覆盖政治、金融和加密货币等多个领域的社会信念预测任务。实验结果显示,SWM 显著优于时间序列基础模型,在 Kalshi 数据上达到最佳结果,在 Polymarket 数据上展现竞争性性能,同时为社会信念动态的潜在机制提供可解释的洞见。

论文精读

TL;DR 利用 LLM 构建社会世界模型,无需人工标注即从时序数据中学习社会信念的状态转移,在预测市场任务上超越时序基础模型,并提供可解释性。

问题

问题背景

社会信念(social beliefs)——例如“AGI 是否五年内出现”或“谁将赢得选举”——会因政策、科技突破等事件而发生剧烈变化。捕捉这种集体信念的动态演变,对金融、公共政策、风险监测至关重要。

现有方法局限

传统社会调查成本高、更新慢,无法提供高时间分辨率。时间序列基础模型(如 TimesNet)虽能拟合数值波动,但完全忽略事件文本的语义信息,导致对突发的信念转折点建模失效。基于 NLP 的事件归因方法依赖大量人工标注,将特定事件与信念变动显式关联,标注成本极高且主观性强。直接调用 LLM 虽具备常识和社会智能,却缺乏对信念演化过程的时序监督信号,容易产生“事后解释”而非可验证的预测。

技术挑战与重要性

社会信念系统具有高维、多噪声、多因素干扰的特性:同一事件对不同议题的影响可能非因果、有时延,且信念变动往往由多个协同事件驱动。预测市场数据(如 KalshiPolymarket )提供了高粒度的集体信念代理信号,但从中可靠地分离出事件效应仍是一大难题——既要利用 LLM 的文本理解能力,又必须从时间序列中无监督地学习状态转移规律。该问题横跨计算社会科学、时间序列预测和 LLM 推理,对构建可解释的社会模拟器至关重要,也是业界在舆情分析、智能投研等场景中亟需突破的瓶颈。

行业类比

如同推荐系统中用序列模型捕捉用户兴趣漂移, Social World Model 试图从群体级别的观测序列中学习社会信念状态的转移函数,实现事件驱动的集体决策预测。

核心洞察

  • - **预测市场作为社会信念动态的高频代理**:传统社会信念研究依赖昂贵的普查或滞后调查,而 SWM 直接挖掘 Kalshi、Polymarket 等预测市场的实时合约价格,将金融博弈隐含的集体预期视为信念轨迹。这提供了细粒度的时序监督信号,且无需人工标注事件-信念关联,大幅降低了数据获取成本,并让模型学习到与真实社会反馈同步的动态规律。
  • - **潜在事件归因的自监督学习范式**:SWM 不要求显式标注“哪件事导致了信念变化”,而是通过优化证据下界 (ELBO) 让 LLM 自主推断潜在事件变量,从而捕捉事件与信念转移的因果结构。相比时间序列基础模型仅拟合数值趋势,SWM 在状态转移中显式建模事件语义,这为信念演变提供了可解释的推理过程,且能反事实模拟不同事件序列下的信念走向。

方法

输入: 社会信念时间序列(如预测市场价格概率)与同期事件文本(如新闻标题)。将序列按时间窗切分,每个窗口搭配事件集合,构成无标注训练样本。

关键模块:

  1. 潜在事件归因 – SWM 将事件对社会信念的驱动作用视为隐变量,由 LLM 编码事件并生成事件表征。模型假设当前信念状态由上一时刻状态与事件隐变量共同决定,通过一个轻量状态转移网络继承时序依赖,从而避免人工标注事件-信念偏移对。
  2. 训练与证据下界 (ELBO) – 为从信号中分离事件影响,SWM 同时学习一个后验推断网络(预测信念偏移量)和一个生成模型(重构信念轨迹)。训练目标为 ELBO:先由后验网络从未来窗口中提取事件导致的信念变化,再约束生成模型在给定过往状态与事件时能复现该变化。整个过程采用后验引导,即通过未来信息监督隐变量学习,不依赖显式标签。
  3. LLM 集成 – LLM 提供事件语义编码并充当世界常识先验,其输出经适配层投影到状态转移网络的隐空间,让模型将非结构化文本转化为可计算的驱动力。

输出: 模型可进行滚动一步预测或多步模拟:给定当前信念与未来事件序列,逐步生成信念概率曲线,同时输出事件归因分数,解释事件对社会信念的影响强度与方向。

与同类方法的差异: 相对于直接使用时间序列基础模型(如 PatchTST、TimesFM),SWM 不需要密集历史数据,而是依靠 LLM 的常识推理将事件语义转换为信念动力学信号,在稀疏事件场景下鲁棒性更强,并提供因果归因能力。

实验

实验设计

Social World Model (SWM) 框架通过挖掘社会数据中的时序模式、优化证据下界来学习信念状态转移函数,无需显式人工标注。评估基准 SWM-Bench 从真实预测市场 KalshiPolymarket 构建,包含超过 12k 个数据点,覆盖政治、金融、加密货币等领域,任务为基于历史信念序列与事件文本预测未来信念走向。对比基线主要包括时间序列基础模型 (time-series foundation models)。

关键发现

  • SWM 在 Kalshi 数据集上取得 state-of-the-art 结果,显著超越所有时间序列基线。
  • Polymarket 数据上也展现出有竞争力的性能,表明框架的泛化能力。
  • 通过后验归因机制,SWM 可揭示哪些历史事件对信念转变贡献最大,提供解释性洞察,这是纯时间序列模型难以做到的。

与基线对比的深度解读

传统时间序列模型(如 PatchTST、TimesNet)仅从历史数值序列中学习模式,无法利用事件文本中丰富的语义信息。SWM 引入 LLM 作为事件编码器,并将事件影响建模为潜在变量,通过后验引导学习状态转移函数。这使得 SWM 能捕捉由外部事件驱动的非平稳信念跳变,而时间序列模型常将其视为噪声。实验证明,引入事件语义和潜在归因是性能提升的关键,同时模型输出的归因权重为分析社会信念动力学提供了因果层面的线索,对决策辅助具有实际价值。

行业影响

落地场景

Social World Model (SWM) 的核心能力是对社会信念演变的建模与预测,可直接嵌入需要理解社会动态的产品线:

  • 预测市场平台:如KalshiPolymarket,可利用 SWM 实时更新合约概率,提升定价的准确性,尤其在政治事件、政策变化期间。
  • 社交与内容平台:监控热点事件下的舆论趋势,辅助内容推荐、话题运营和风险预警。例如,预测某个新闻事件对用户情绪的影响,提前调整推荐策略。
  • 金融量化与投研:将 SWM 作为另类数据信号,融入宏观分析或量化策略,预测政策变动、科技突破对资产价格的影响。
  • 企业战略与舆情管理:模拟重大事件(如产品召回、行业法规)对公众品牌认知的冲击,辅助公关决策。

商业价值

  • 降本:SWM 通过挖掘时序模式优化证据下界(ELBO),无需昂贵的人工标注或大规模普查数据,显著降低传统社会信念追踪的数据获取成本。
  • 增收:在预测市场中,更精准的状态转移函数可转化为交易回报;在内容平台,更及时的舆论趋势捕捉能提升用户活跃与广告收入。
  • 体验提升:帮助产品更“懂”社会变化,提供与实时事件关联性更强的服务,如个性化资讯流、市场异动解释,增强用户粘性。

与现有工作流的接口

SWM 可作为时序预测增强模块集成到现有数据管道:

  1. 数据输入:接入结构化事件流(新闻标题、政策文本)与信念时间序列(预言机价格、投票数据)。
  2. 模型服务:以LLM作为编码器,结合潜变量归因后验引导训练,部署为微服务,对外提供信念转移预测 API。
  3. 下游对接
    • 交易决策流中,作为因子或信号生成器;
    • BI 看板中,提供“事件→信念”的可解释因果链;
    • 强化学习环境结合,模拟多智能体信念交互。

具体落地用例

  1. 跨国电商平台:某全球电商在关键市场(如选举期间)利用 SWM 预测消费者购买信心波动,动态调整库存、价格和广告投入。模型每日摄入当地政治新闻,输出下两周的品类消费倾向变化,帮助运营团队提前布局,避免滞销或缺货。
  2. 去中心化预测市场 DeSoc:一家基于 DAO 的预测市场项目集成 SWM 智能合约,自动调整事件合约的流动性激励。当某候选人的支持率出现拐点时,SWM 提供的预测转换概率触发做市商扩大价差,保护资金池,同时为交易者提供更合理的成交价格。

局限

  • **对 LLM 先验知识的深度依赖**:SWM 的状态转移函数本质上依赖于 LLM 对事件与信念之间关系的常识推理,但 LLM 内部知识可能存在时滞、偏见或幻觉。论文未系统分析当 LLM 对社会事件的因果理解错误时,模型预测性能会如何退化,也未与基于明确规则或因果图的方法对比校准程度。工程上这意味着部署时需持续监控 LLM 知识边界,否则在事件罕见或超出预训练分布时容易产生系统性偏差。
  • **预测市场数据作为信念代理的局限**:SWM-Bench 使用 Kalshi 和 Polymarket 的合约价格作为社会信念的代理标签,但这些市场参与者群体偏窄,价格受流动性、风险偏好和投机行为影响,不一定精确反映整体社会信念分布。此外,数据仅覆盖政治、金融、加密货币等少量领域,泛化至公共卫生、科学共识等更广泛的社会信念场景时,模型表现可能显著下降。这让实际应用中对信念度量方式的鲁棒性存疑。
  • **潜变量归因的可解释性与训练稳定性**:SWM 通过优化 ELBO 学习事件对信念变化的潜变量归因,但变分推断中后验近似的质量直接决定归因的因果合理性。论文展示的案例研究虽具启发性,但缺乏对归因一致性的量化评估,也未讨论不同随机种子下归因结果的方差。在工程复现时,训练过程对超参数敏感,可能导致模型学到伪相关而非真实因果,降低长期可靠性。
论文Haofei Yu2026-06-09原文

相关内容