跳到正文
原文
Transluce 研究(网页)·· 22 小时前AI 评分43

Transluce:AI 嵌入式评估的重点领域与应对思路

EssaySome Focus Areas for Embedded Evaluations and How to Approach ThemInitial thoughts on key risks third parties should monitor and a proposal for how to evaluate them.

AI 导读

Transluce 针对前沿实验室未发布 AI 模型的潜在风险,提出让独立第三方“嵌入”实验室开展安全监督的评估方案。该方案重点监控多智能体协作、针对性说服、评测感知与隐蔽推理等行为,并建议对智能体集群及训练实践展开监测。评估员还将利用未发布模型的特权访问权限开展仿真研究,防范网络攻击与内部人员被操纵等威胁。

来源:Transluce 研究(网页) · transluce.org