跳到正文
热点事件持续更新

前沿AI大模型幽默能力实测评估发布

2 篇报道1 个报道来源18 分钟前更新

先了解这件事

AI 综述

2026年10月6日,关于前沿AI模型幽默水平与搞笑能力的探讨引发关注。同日,一项针对AI原创笑话能力的实测评估公布,结果显示前沿大语言模型的原创幽默能力随模型规模与发布时间显著提升,前沿模型引发人类轻笑或大笑的概率已超过50%。该测试通过抽取随机英文单词对要求模型创作短笑话,并由62名人类评估者进行双盲评分与两两对比。评估发现GPT-6 Astra、Fable 5.1和Opus 4.5处于领先梯队,且幽默表现与创意写作及理科基准呈正相关。目前,相关测试代码与报告已在GitHub开源。

AI 根据报道生成 · 10 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. Hacker News · AI
    前沿大模型到底有多幽默?一项针对 AI 原创笑话能力的实测评估

    实测评估显示前沿大语言模型的原创幽默能力随模型规模与发布时间显著提升,前沿模型引发人类轻笑或大笑的概率已超过 50%。该测试通过抽取随机英文单词对要求模型创作短笑话,并由 62 名人类评估者进行双盲评分与两两对比,发现 GPT-6 Astra、Fable 5.1 和 Opus 4.5 表现处于领先梯队,且幽默表现与创意写作及理科基准呈正相关。相关测试代码与报告已在 GitHub 开源。

  2. Hacker News · AI
    前沿 AI 模型到底有多幽默

    该内容探讨了前沿 AI 模型的幽默水平与搞笑能力,关注前沿大模型在幽默表达方面的实际表现。

本事件热度走势

当前热度 9·可比范围峰值 10(10月6日 22:00)·近 24 小时可比范围变化 –

02.557.51010月6日22:0010月6日23:0010月6日23:0010月7日00:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。