MIT牵头破题:AI能模拟社会,但谁来验证它?

  新智元报道

  下一周,人们对 iPhone、特斯拉等品牌的搜索关注会如何变化?

  AI 能在数据公布之前,预测这些关键词之间的相对热度吗?

  官网:https://socialsim.org/

  GitHub:https://github.com/Social-Atoms/social-sim-arena

  评测与接入文档:https://socialsim.org/docs.html

  常见问题(FAQ):https://socialsim.org/faq.html

  这是 Social Simulation Arena(SSA)的一类真实评测任务,参赛系统需要提前预测五个指定关键词之间的搜索热度分布,封存答案,再由随后公布的数据检验。

  这个具体问题背后,是一个更广泛的研究目标:社会模拟系统对人群行为的判断,能否经得起真实未来的检验?

  模拟越来越逼真

  验证跟上了吗?

  社会模拟正在从学术研究走向商业应用。基于大语言模型的模拟系统,已被用于探索政策分析、公共卫生和计算社会科学等问题;Aaru、Simile 等创业公司也在尝试构建虚拟人群,预演消费者、员工等群体在不同情境下的反应。

  这类技术的吸引力在于:它有望帮助人们在采取现实行动之前,以更低的成本探索不同方案。而这一前景能否实现,取决于模拟对真实人群的刻画是否可靠。

  目前,社会模拟的验证能力尚未跟上系统的发展速度。看似自然的对话、符合直觉的行为,以及接近真实数据的总体均值,都不足以证明系统准确刻画了人群差异与行为规律。

  与此同时,不同研究采用各自的数据、任务和指标,使结果难以比较,能力上的进展也难以积累为可复核的共同认识。当这些系统开始参与商业或公共决策时,验证的缺位可能使看似可信的结果被赋予超出证据范围的信任。

  因此,社会模拟需要在扩大规模、丰富交互之外,建立共享基准、开放数据和可复现的评测流程,明确系统在什么任务、什么人群和什么条件下有效。

  随着模拟结果逐步成为现实决策的依据,一个基础问题也变得更加迫切:模拟结果在多大程度上能够反映真实人群,又应当通过怎样的共同标准接受检验?

  SSA 公开评测看板。左侧展示所选系统与基线的成绩随评测推进的变化,右侧列出得分及参评题目数量。Arena Score 以沿用上一期结果的 persistence 基线为 0 分,以完全准确预测的理想 Oracle 为 100 分,负分表示低于基线。图中数据截至 2026 年 9 月 24 日。

  SSA

  让真实未来检验社会模拟

  Social Simulation Arena(SSA)由 MIT 研究团队牵头发起,联合来自多所高校的研究者共同建设,旨在通过面向真实未来的公开评测,检验社会模拟系统的预测能力。

  一轮评测如何连接社会模拟与真实世界

  SSA 的一轮评测分为三个阶段:开放提交(Open)、预测封存(Locked)和完成评分(Resolved)。题目提前公开,参与者在截止前提交预测;截止后,答案被固定,预测的哈希摘要汇入清单并提交 OpenTimestamps,相关承诺通常在数小时后锚定至比特币区块链,形成可核验的时间证明;待第三方公布观测结果,平台按既定规则评分并公开记录。

  SSA 单轮评测流程。Open 阶段接收并加密保存预测;Locked 阶段固定有效提交并建立时间证明;观测结果公布、核验与评分完成后进入 Resolved。具体时间安排与存证状态以各轮记录为准。

  开放提交:提前出题,加密交卷。

  题目通常在截止前一周公开,明确预测对象、目标人群、结果来源与评分规则。参与者按要求提交答案,并在概率预测任务中表达不确定性。提交后的预测通过 Sealbox 加密封存机制保存,其他参与者在提交窗口内无法查看预测明文。多数轮次在预定结果公布前 48 小时停止接收预测。

  预测封存:固定答案,建立时间证明。

  截止后,平台按规则解封并核验有效提交,将预测及冻结历史数据的哈希摘要写入清单,再提交 OpenTimestamps。相关承诺通常在数小时后锚定至比特币区块链。

  哈希相当于文件的数字指纹,能够帮助外部研究者检查公开内容是否与封存记录一致;时间证明则支持核验相应内容在所锚定区块形成之前已经存在。两者共同为预测的内容与存在时间提供可核验依据,具体证明范围以各轮记录为准。

  完成评分:与现实对照,与基线比较。

  观测结果公布并完成核验与评分后,题目进入 Resolved 状态,成绩更新至榜单。按照平台公布的安排,评分应在结果发布后六小时内完成。

  Arena Score 以两个参照点帮助读者理解成绩:0 分对应 persistence,即沿用上一期观测值的基线;100 分对应预测损失为零的理想 Oracle。正分表示优于 persistence,负分表示低于这一基线。在数值预测任务中,SSA 还提供线性趋势外推、指数加权移动平均(EWMA)和历史均值等统计对照,帮助研究者判断模型及其工作流提供了多少额外预测价值。

  每轮结束后,预测、时间证明、观测结果与成绩共同形成可追溯记录。同一数据来源的下一次发布将对应一道新题,重新从 Open 开始,使评测随真实世界的变化持续进行。

  Sealbox。 提交窗口内,参与者用私钥签名,平台核验后以 age 公钥加密,经 GitHub App 写入 sealed 分支;窗口内无人可读明文。封存时刻,持有 age 私钥的工作流解密并复核签名,将明文预测与哈希清单写入 main 分支,清单经 OpenTimestamps 锚定至比特币区块。此后任何人可用 ots verify 与哈希比对独立核验:预测在区块之前已存在,且此后未改动。

  从总体趋势到群体差异

  SSA 测什么?

  SSA 关注的是现实中的人群及其持续变化的态度与行为。不同数据源按照各自的周期,重复测量特定人群的状态,为模拟结果提供可持续对照的观测依据。

  当前任务从三个方面检验预测能力:总体指标如何变化、不同群体之间有何差异,以及人们的关注流向何处。各类任务采用相应的答题格式与评分规则。

  整体数值:总体状态是否同步。

  题目要求预测即将公布的总体读数,如密歇根大学消费者信心指数、纽约联储家庭通胀预期和 AAII 散户情绪差。

  参与者提交带不确定性的分布,以 CRPS 评分,同时考察预测位置与不确定性表达。题目会写明目标人群(成年人、登记选民或家庭户主),因为同一机构对不同人群的读数可能相差数个百分点。

  不同群体:差异结构是否正确。

  群体画像题要求同时预测按年龄、族裔、性别、学历等划分的 16 个群体,以能量分数(CRPS 的多维形式)整体评分,并拆分为整体水平与群体间结构两部分。模拟器无法依靠猜中总体数字、同时系统性地误判某些群体来取得好成绩;把所有人模拟成「平均选民」的系统,会在这类题上暴露出来。

  集体关注:注意力流向何处。

  这类题关注行为痕迹而非态度表达:下一周英文维基百科阅读量前十的条目及顺序,以及若干品牌在 Google 搜索中的关注份额。前者按排名重合度评分,后者按份额分布评分。

  SSA 已完成评测的题目示例。每张卡片对应同一统计序列的一次数据发布,展示模型预测、上一期观测值与本期公布结果(绿线),便于比较不同轮次的预测偏差,并追溯具体题目与数据来源。

  与已有的预测评测有何不同?

  FutureX、Prophet Arena 与 SSA 都通过尚未揭晓的真实结果检验预测能力,但各自的评测重点有所不同。

  FutureX 面向广泛领域的未来预测,考察智能体的信息搜集、推理与预测能力;Prophet Arena 以真实预测市场事件为主要任务来源,评估系统的概率预测,并与同期市场共识比较。

  SSA 更聚焦于持续存在、被反复观测的现实人群,通过预测其态度、行为及群体差异,检验社会模拟系统对目标人群的刻画是否可靠。当前评测从预测下一次观测结果入手,后续计划拓展至新问题外推、干预情境和跨问题一致性等任务,进一步检验人群建模在不同情境下的有效性。

  面对真实未来,模型表现如何?

  评测范围。

  截至 2026 年 9 月 24 日,SSA 已完成 59 轮真实评测,对应的数据发布日期覆盖 8 月 14 日至 9 月 23 日。

  评测涵盖 GPT、Claude、Gemini、Grok、Qwen、DeepSeek、Kimi 和 GLM 等系列的 16 个底层模型,并比较它们与不同预测工作流(harness)的组合。

  工作流主要在两个方面有所区别:一是信息输入,包括是否提供近期历史数据、固定新闻摘要或网络搜索结果;二是预测引导方式,包括直接作答,或按基准分析、因素拆解与预测失败反思等步骤形成预测。

  简单基线仍是数值预测的重要参照。

  在当前数值题榜单上,模型配置的平均相对得分仍低于沿用上一期结果的 persistence 基线。例如,Gemini3.1 Pro 与 Claude Sonnet 5 的网络搜索配置均完成了 43 道数值题,Arena Score 分别为−22.0 和−23.6 分。

  这表明,在这些已完成的题目上,模型及其工作流尚未取得正的平均预测增益。这一结果不应直接推广至其他任务类型。

  平均水平上的改善,比群体差异上的改善更一致。

  在 9 月 11 日的 Civiqs 人群画像题中,24 个模型配置里有 23 个在各群体数值的平均水平上优于基线,但只有 5 个在群体间差异结构上优于基线。后续两道人群画像题中,结构上的改善有所增加,但并非所有配置都能受益。

  这说明,跟随人群的整体变化与准确刻画不同群体之间的差异,仍是两项需要分别检验的能力。目前人群画像题仅有 3 道,结论仍需更多轮次支持。

  具体任务中,也出现了明显优于基线的预测。

  在 9 月 12 日的品牌搜索份额题中,Kimi 的网络搜索配置预测,iPhone 将占五个指定关键词相对搜索热度的 55.0%;随后公布的观测值为 54.49%,而该轮 persistence 基线为 39.84%。

  在完整的五关键词分布评分中,这一配置的预测损失较基线降低约 89.9%。这一案例展示了模型在特定任务中的预测价值,但能否持续取得类似优势,仍需后续评测检验。

  历史信息有帮助,增加预测流程则未必带来一致改善。

  在保持模型、题目与直接预测方式相同的 262 组配对中,加入近期历史数据后,约 96.2% 的配对获得了更低的预测损失。

  相比之下,在同样使用网络搜索的条件下,额外加入基准分析、因素拆解和预测失败反思等步骤,结果有改善也有退步。对系统设计而言,增加信息或流程的价值,需要通过具体对照来确认。

  评测的价值与边界

  社会模拟的快速发展,使一个问题愈发重要:如何判断模拟结果真实反映了目标人群?

  生动的交互、复杂的系统设计,以及少量符合直觉的案例,都需要进一步的实证支持。

  当不同研究采用各自的任务、数据与评价标准时,结果也难以比较,领域中的进展便难以累积为共同认识。

  SSA 希望为这一验证缺口提供可操作的回应。

  通过明确预测对象、提前封存答案、依据独立观测评分,并与统计基线比较,平台让不同方法接受共同检验,帮助研究者判断新增的模型能力与系统复杂度是否带来了实际预测增益。

  持续公开的评测记录,也使成功与失败都能成为后续研究可复核、可积累的证据。

  这类检验仍有明确边界:总体指标上的准确,未必意味着系统充分刻画了群体差异;预测上的优势,也不能直接证明其还原了社会机制。

  SSA 提供的是特定任务与条件下的预测效度证据。更广泛的行为解释、因果推断与干预应用,仍需相应的验证。

  参考资料:

  [1] Position: Time to Close The Validation Gap in LLM Social Simulations (ICML 2026 Position)

  [2] CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments (CHI 2026 best paper)

  [3] Simulating Society Requires Simulating Thought (NeurIPS 2025 Position)

  [4] YuLan-OneSim: Towards the Next Generation of Social Simulator with Large Language Models (2025)

  [5] Generative Agents: Interactive Simulacra of Human Behavior (UIST 2024 best paper)

  编辑:LRST