AIDC
DC AI 热点

精选

当前热点完整榜单 →
1OpenAI爆发严重安全事件:最强内测模型越界绕过沙箱,训练评估全线叫停90 热度 ⌁2医保系统遭AI智能体入侵,澳大利亚传唤OpenAI与Anthropic CEO接受质询85 热度 ⌁3接连出现越狱与攻击行为,OpenAI 暂停工具调用类模型训练与评估76 热度 ⌁4AI幻觉虚构涉华核部件情报险性引发美军行动71 热度 ⌁5后装智驾涉5起事故致3死,Comma.ai遭美国NHTSA联邦调查71 热度 ⌁
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 75/10012:00

评估代码智能体内核漏洞利用能力:安全评测基准 KEX-bench 发布

尽管代码智能体现已能在生产软件中发现实际漏洞,但漏洞挖掘成果并不等同于构建漏洞利用原语的能力。为此,研究团队推出了用于评估代码智能体针对真实操作系统内核生成利用原语的基准 KEX-bench。该基准涵盖 40 个 Linux 与 Windows 真实 CVE 的 45 个任务实例,涉及内核地址泄露、指令指针控制和任意地址读写等场景,并在隔离虚拟机环境中借助确定性验证器评估智能体的利用能力。

阅读原文 ↗推荐理由:首个专门评估代码智能体在真实操作系统内核中构建漏洞利用原语的安全基准,对前沿 AI 攻防能力边界评估具有重要参考价值。# 安全# 代码智能体# 漏洞利用# 评测