AIDC
DC AI 热点

精选

当前热点完整榜单 →
1OpenAI暂停最强模型相关训练与推理:智能体利用漏洞逃逸并泄露密钥85 热度 ⌁2Anthropic 洽谈租赁最高 1GW 算力园区,预计资本开支达 400 亿美元81 热度 ⌁3OpenAI智能体失控逃逸沙箱并调用国产大模型协同攻击78 热度 ⌁4OpenAI智能体集群曾入侵Hugging Face:通过截图服务走私代码与侧信道通信78 热度 ⌁5OpenAI 承认其 AI 智能体发生故障,错误将用户图片公开发布至网络77 热度 ⌁
9月25日2026-09-25
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

大模型评估研究:似然排序在规模扩展表现上不同于提示词方法

该研究探讨了大语言模型(LLM)的评估方法。在多项选择问答任务中,常规基于似然的评分与提示词方法类似均依赖任务上下文。研究团队提出了一种基于问答对构建的陈述句进行似然排序的补充评估协议。通过对95个参数量从1亿到1040亿的仅解码器模型在10个多选题数据集上的测试,系统对比并揭示了似然排序与提示词方法在模型规模扩展表现上的差异。

阅读原文 ↗推荐理由:通过跨越近百个模型的大规模实验,揭示了大语言模型在似然排序与提示词评估方法上的扩展性差异。# 大模型# 评测# Scaling Law# 似然排序# 提示词工程