清华初创&UIUC学者用7B模型在预测市场上自我蒸馏,跑赢GPT-5.6和Opus 5

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
清华初创&UIUC学者用7B模型在预测市场上自我蒸馏,跑赢GPT-5.6和Opus 5
7902点击    2026-09-21 16:46

在社会变化的洪流中,LLM 能不能不断修正自己对社会的认知?


伊利诺伊大学厄巴纳 - 香槟分校(UIUC)的研究者在名为 Social World Model(ICML 2026:https://arxiv.org/abs/2606.11482)的框架中提出并初步探讨了这一问题。他们以Polymarket 和 Kalshi 等预测市场为天然检验场,观察当突发新闻降临时,市场参与者的信念将如何发生偏移。


但这只是第一步。UIUC 联合来自清华的初创团队 Astraculum 决定发起一项更硬核的挑战并获得了一些初步结果:LLM 的认知更新,能否不仅停留在 “训练时(Train-time)” 阶段,而是真正延伸到 “部署(Deployment-time)” 阶段?


换句话说,当 LLM 被置于持续流动的市场数据与实时新闻中,它能否根据不断到来的真实反馈持续学习,让今天经历过的市场变化,真正改变它明天的判断?为了验证这一点,联合团队在长达 390 天的真实数据上进行了滚动训练与持续回测。结果证明了 “持续进化” 的力量:这个在部署后依然不断更新权重的 Model,在同等测试环境下,一举击败了 GPT-5.6、DeepSeek V4 Pro 以及 Claude Opus 5 等一众前沿模型。


什么是 Social World Model?


如果物理世界模型(Physical World Model)能根据物体的 “当前状态(如速度和位置)” 预测它受力后的轨迹;那么当突发新闻降临时,AI 能不能预测人类社会的集体认知会发生怎样的转移?这就是 Social World Model (SWM) 试图解决的问题。


为了量化 “社会认知”,SWM 将目光投向了 Polymarket 和 Kalshi 等预测市场。这是因为预测市场只围绕尚无定论的问题形成,参与者广泛多样,无数普通人真金白银的押注,能最敏锐地反映大众 “集体信念” 的移动,比问卷和社交媒体都更可靠。


在这个框架下,“社会认知如何更新” 被完美映射成了世界模型中最经典的状态转移(State Transition)。以 “美联储九月是否降息” 为例:


  • 状态(State)即 信念(Belief): 也就是大众当前的集体预判与近期走势。比如合约卖 62 美分,意味着大众用钱投票得出了 “62% 的概率”,这就是当前社会系统的信念。
  • 事件(Event): 真实世界刚刚发生的一条突发新闻。它相当于打破现有状态的输入(Input / Action)。


模型的目标不是去预测美联储到底降不降息,而是预测大众在特定情形下的反应:在当前的状态下,刚发生的新闻会将大众的信念改变多少?换句话说,它学习的是: 当前信念 + 突发事件 → 下一时刻的信念。


如何在真实世界中部署 Social World Model?


为了把 Social World Model 从离线实验推向真实环境,研究团队让 SWM 直接接入实时新闻源和预测市场盘口。具体来说,在每一个预测时刻,LLM 都可以看到此前的市场状态以及刚刚出现的新闻,然后判断接下来市场的集体信念会朝哪个方向移动。


比如,在 2026 年 2 月 13 日下午 2 点的一条样本中,市场正在预测 “标普 500 是否会触及 6000 点”,当时合约价格为 0.525。此时,Agent 可以看到过去 24 小时的价格走势,同时读取过去一小时内刚刚发布的新闻。它需要在下一小时结果真正发生之前判断这些新信息里,有没有尚未被市场价格充分反映的内容?如果有,它会把市场信念推向哪里?


清华初创&UIUC学者用7B模型在预测市场上自我蒸馏,跑赢GPT-5.6和Opus 5


如果模型参数始终被冻结,那么它今天从市场中看到的经验,并不会自动成为明天模型能力的一部分:每一次预测都由同一个模型作答,上一次的对错与下一次无关。真正的长期部署因此带来了下一层问题:模型能否把部署过程中不断获得的真实反馈重新写回参数,让过去的经历持续改变未来的判断?


如何让 Social World Model 在部署中持续学习?


现实世界中的社会认知和市场逻辑并不是静止的。新闻的重要性会变化,市场参与者的反应模式会变化,宏观环境也会变化。这种变化不由我们安排,也不会提前通知:模型自己不会报告它已经跟不上了。一个参数冻结在某个时间点的模型,很难保证能适应之后潜在的变化。因此,对于 Social World Model 来说,持续学习(Continual Learning)并不仅仅是一种训练技巧,而是长期部署中必须具备的能力。


那么,每小时到来的市场反馈,该让模型学什么?面对预测市场的涨跌,最直觉的做法是让模型直接根据 “价差” 来修正权重。但这会掉入噪声的陷阱。对于突发新闻引发的市场剧变,数字只是一种表象。它告诉模型的是:“市场最后动了多少。” 却没有直接告诉模型:“哪些新闻真正重要?”“为什么这条新闻会改变市场参与者的判断?”“市场究竟是在更新哪一种对世界的理解?” 因此,更可靠的路径是:跳过单纯的数值拟合,直接让模型去学习 “新闻事件” 与 “信念变动” 之间的逻辑推理过程。


引入 SDFT 机制:利用 “特权信息” 指导推理


为此,团队采用了类 SDFT(Self-Distillation Enables Continual Learning,https://arxiv.org/abs/2601.19897)的方法来进行推理过程的自蒸馏。这套机制巧妙地利用了 Hindsight 的 “特权信息(Privileged Context)” 来构建师生闭环。特权信息只用来教,不用来答:预测永远由没看过结果的学生独立完成。


具体而言,当一小时后的真实市场结果揭晓时,系统首先会让模型根据真实变化写出一段事后推演。随后,同一个模型在训练中被分为 “老师” 和 “学生” 两角:


  • 老师: 同一个模型,只是上下文里多了这段事后推演(demonstration),作为特权信息(Privileged Context)。它不另外作答,而是用这份上下文给学生的推理逐 Token 打分。
  • 学生: 只能看到当前的新闻和价格,没有任何特权信息的辅助,必须进行直接预测。


在蒸馏阶段,老师逐 Token 地给学生的推理打分,把学生拉向看过结果之后的判断:学生还在说 “继续稳定”,老师已经压向 “正式延期”。这样刻进参数的是 “客观事件 → 大众情绪 → 市场动作” 这条链,而不是某一次的价格数字。


清华初创&UIUC学者用7B模型在预测市场上自我蒸馏,跑赢GPT-5.6和Opus 5


Social World Model 持续学习的效果


为了验证这套机制的实效,团队选取了长达 390 天的真实市场数据,并按月切分为多个窗口。模型在每个月的数据上进行自蒸馏迭代与滚动部署。也就是说,整个实验严格按照时间向前滚动:部署 → 获得真实反馈 → 训练 → 更新模型 → 继续部署。


部署表现:持续学习让 7B 模型跑赢前沿模型  面对真实的资讯洪流,GPT-5.6、DeepSeek V4 Pro 等静态大模型全部跌穿了只看价格、不看新闻的基线。而通过持续自蒸馏的 7B 模型,是全场唯一比价格基线预测得更准的。


清华初创&UIUC学者用7B模型在预测市场上自我蒸馏,跑赢GPT-5.6和Opus 5


制胜关键:跨越周期的稳定性  将全年数据按月拆分后可以看出,性能的提升本质上来源于稳定:静态大模型在遇到特定月份(如 w01、w11)的变动时会集体大幅失分,而 7B 模型十二个月里没有一个月大幅失守。


清华初创&UIUC学者用7B模型在预测市场上自我蒸馏,跑赢GPT-5.6和Opus 5


更新有没有让模型变坏 实验也做了检查:每一轮训练后都冻结一份副本作为对照,并在无关任务上探针;十二轮下来,模型的推理长度和质量没有退化。


Social World Model 背后的基础设施


LLM 在预测市场的部署只是冰山一角。 任何想让大模型跳出实验室、在真实世界的动态数据中实现持续学习的团队,都会不可避免地撞上三堵工程高墙:   


  • 判断时什么是可知的? 在模型下判断的那一刻,如何确保它只能看到 “当下” 的数据,绝对不会提前偷看到可能泄漏的未来?
  • 结果什么时候变得可知? 现实世界的反馈往往是碎片化且延迟的。系统必须精确判定,到底要在哪个时间点把 “真实结果” 收集回来,作为给模型对答案的最终标准。
  • 更新到底有没有帮助? 模型不断在吸收新数据修改自己的参数,如何确信它是在变得更聪明,而不是发生了灾难性遗忘,或者只是在死记硬背?


为了把这套逻辑跑通,研究团队搭建了 TrajOps:一个专为持续学习设计的标准化 MLOps 引擎。从工程落地的角度来看,TrajOps 的核心其实非常务实且简洁:它向上层提供了三个接口:Collect(收集)、Inference(推理)、Train(训练),并直接在底层工作流中适配了标准的 SDFT(Self-Distillation Fine-Tuning,自蒸馏微调)方案。


整个循环在这个引擎上被清晰地串联了起来:


  • Collect 接口负责在事件落定前后,把新闻数据和姗姗来迟的真实市场结果精准抓取回来;
  • Inference 接口负责管理时间视野和持续部署模型;
  • Train 接口则直接调用内置的 SDFT 方案,将抓取回来的结果编译成训练信号,驱动模型权重更新。


目前,这个 7B 模型依然依托于这套 Infra 在真实市场中持续判断,每天写下实盘记录,公开在 trajops.astraculum.com。


以下为这项研究的作者及机构:


  • Haofei Yu、Yining Zhao、Jiaxuan You(伊利诺伊大学厄巴纳 - 香槟分校);
  • Chishang Yang、Junbo Yan、Senquan Gao(Astraculum)


文章来自于"机器之心",作者 "机器之心"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner