跳到正文
原文
Hacker News · AI· simonether·· 2 小时前精选AI 评分75

Claude Code 热门技能安慰剂对照评测:9 个技能中仅 2 个优于等长中性指令

Show HN: Popular Claude Code skills vs. a placebo: 2 beat it, 1 did worse

AI 导读

开发者通过设置等长中性指令作为安慰剂对照组,测试了 Claude Code 中 9 个高星编码技能的真实表现。在 claude-opus-5-5 和 15 项公开基准任务的 450 次测试中,仅 ponytail 和 agent-skills 2 个技能在成本控制上显著优于安慰剂,1 个表现更差,其余 6 个与安慰剂无显著差异。

推荐理由

这项评测引入等长中性文本作为安慰剂对照组,为开发者评估各类智能体技能与提示词包的真实增益提供了可复现的实验范式。

来源:Hacker News · AI · github.com