TW3Cast:基于微调基础模型冻结路由的时序预测系统
研究人员提出了面向时间序列预测的 TW3Cast 系统。在 GIFT-Eval 基准评测中,该系统在 130 个方案中取得平均 MASE 排名第三的优异表现,仅次于两款基于智能体或语言模型的复杂多步骤系统。与依赖智能体的方案不同,TW3Cast 完全不使用智能体或语言模型,而是基于训练集一次性计算并冻结路由选择表,直接调度轻度微调的公开基础模型专家,在 97 种数据与预测配置下实现了极具竞争力的高效预测。
研究人员提出了面向时间序列预测的 TW3Cast 系统。在 GIFT-Eval 基准评测中,该系统在 130 个方案中取得平均 MASE 排名第三的优异表现,仅次于两款基于智能体或语言模型的复杂多步骤系统。与依赖智能体的方案不同,TW3Cast 完全不使用智能体或语言模型,而是基于训练集一次性计算并冻结路由选择表,直接调度轻度微调的公开基础模型专家,在 97 种数据与预测配置下实现了极具竞争力的高效预测。
该研究提出了一种在多任务模型中学习跨任务关系的新框架。该框架通过针对性的成对关系来近似任务标签的联合分布,从而在避免对完整联合空间建模的高昂复杂度下,利用迁移学习提升模型性能与信息抽取能力。该方法具备通用性,并在YouTube生产级推荐系统(涵盖通知、主页及“接下来播放”等场景)中完成部署验证,实验表明其显著提升了预测准确率与用户满意度。
该研究探讨了Transformer架构在序列排序判断任务中的表达能力。论文证明,判断一个比特序列是否处于有序状态的任务无法由单头单层(1-head 1-layer)Transformer完成,但可以通过双头单层(2-head 1-layer)Transformer实现。与以往同类理论成果不同的是,该研究的结论建立在模型包含输出多层感知机(MLP)的架构设定之下。
该技术报告介绍了开源大语言模型Hunyuan-A13B。该模型采用混合专家(MoE)架构,总参数量为800亿,推理时仅激活130亿参数,有效兼顾了模型性能、计算效率与部署成本。模型在经过严格清洗且强化STEM领域的20T token语料上进行预训练,并结合高质量SFT与大规模强化学习,同时引入了双模式思维链(CoT)框架,显著提升了事实可靠性与逻辑推理能力。