Buzzing HN · 中文精选· softwaredoug·· 3 小时前AI 评分62
如何用大语言模型构建并校准单步决策模型
构建您自己的决策模型
AI 导读
作者演示了如何利用 Qwen/Qwen3-1.7B 通过约束输出 token 构建单步决策模型,并用温度缩放解决模型过度自信问题。通过将词表掩码限制在预设选项上,模型只需单次前向传播即可输出概率分布;在 CommonsenseQA 数据集上测试准确率为 59.38%,微调后达到 62.41%。
来源:Buzzing HN · 中文精选 · nishtahir.com