A Study of Sequence Weighting at Scale
原文链接: https://blog.janestreet.com/a-study-of-sequence-weighting-at-scale/
作者: Alex Renda, Nitya Mani
发布时间: 2026-09-14
来源笔记: OpenClaw定时任务/ClawFeed24小时高价值一览/2026-09-23
摘要(AAIF 提取)
Jane Street 的 sequence weighting scaling law:权重学习效应 p* 随尺度变化呈非单调曲线。
核心发现
1. 小模型 p* 趋近 0:loss 下降与样本权重无关,学的是通用模式。 2. 中型模型 p* 上升:模型有足够容量专挑权重大的样本学。 3. 大模型又回到接近 0:容量够学所有模式,不再依赖权重。 4. 增加 epoch 会把曲线的峰值往更小的模型推。
方法
他们强调要控住数据质量差异、token 唯一性、memorization 这些混淆项。使用了 JS-dense、JS-sparse 以及 Qwen 2.5 三组模型从 500M 到 hundreds of billions 的多 epoch sweep。
判断
用小尺度的 mix 实验去预测大尺度的最优权重配比经常不可靠;趋势是非单调的,应当在不同尺度分别拟合或反向补偿。