arXiv 自然语言处理· Xinglin Wang, Zishen Liu, Tong Zheng, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Kan Li·· 6 小时前AI 评分34
从帕累托到偏好:基于摊销智能体策略发现的个性化测试时缩放
From Pareto to Preference: Personalized Test-Time Scaling via Amortized Agentic Policy Discovery
AI 导读
针对大语言模型在准确率、延迟和推理成本上的多维联合需求,研究提出了摊销智能体策略发现框架 PersonTTS。该框架通过需求匹配的控制器初始化与过程指导复用先验搜索经验,实现了高效的个性化测试时缩放。在 AIME 和 HMMT 评测中,PersonTTS 在未见用户画像上的联合需求满足率显著超越强基线,并大幅降低了发现智能体的时间与成本。
来源:arXiv 自然语言处理 · arxiv.org