Hacker News · AI· ilreb·· 1 小时前AI 评分53
前沿大模型到底有多幽默?一项针对 AI 原创笑话能力的实测评估
How funny are the frontier AI models?
AI 导读
实测评估显示前沿大语言模型的原创幽默能力随模型规模与发布时间显著提升,前沿模型引发人类轻笑或大笑的概率已超过 50%。该测试通过抽取随机英文单词对要求模型创作短笑话,并由 62 名人类评估者进行双盲评分与两两对比,发现 GPT-6 Astra、Fable 5.1 和 Opus 4.5 表现处于领先梯队,且幽默表现与创意写作及理科基准呈正相关。相关测试代码与报告已在 GitHub 开源。
来源:Hacker News · AI · invertedpassion.com