从政策文档到结构化调查响应:评估大语言模型在政策监测中的应用
科技与创新政策对国家竞争力至关重要,但其多样性与庞大规模使得系统化监测变得极其困难,传统人工调查成本高昂且难以跨国扩展。本研究探索了利用大语言模型从非结构化长政策文本中提取信息的能力,提出将大模型作为“AI受访者”以生成结构化调查响应。研究团队开发了基于长上下文的数据提取流程,用于自动化政策分析与追踪,显著降低了人工监测成本。
科技与创新政策对国家竞争力至关重要,但其多样性与庞大规模使得系统化监测变得极其困难,传统人工调查成本高昂且难以跨国扩展。本研究探索了利用大语言模型从非结构化长政策文本中提取信息的能力,提出将大模型作为“AI受访者”以生成结构化调查响应。研究团队开发了基于长上下文的数据提取流程,用于自动化政策分析与追踪,显著降低了人工监测成本。
针对企业数据智能体需准确保留业务特定语义的需求,研究人员提出了面向自动化“问题到报告”分析的本体驱动系统 UniDataAgent。该系统将语义获取与在线执行解耦,主要包含两个阶段:本体获取与验证阶段(OAV)利用元数据与业务知识构建版本化的企业本体,并经专家评估验证;执行阶段(QRE)则负责具体任务的检索与生成。输入摘要在执行阶段细节处存在文本截断。
本文探讨了生产级智能客服系统中的核心部署问题:针对意图分类、问答、摘要和工具调用等多项技能,究竟应采用多个专用模型,还是通过多任务微调、连续更新或模型合并训练单一模型。研究团队基于 Qwen、Gemma、Llama 和 Mistral 等 5 个模型家族的 13 款模型(涵盖 0.6B 至 32B 参数),在 4 个公开及 4 个专有客服数据集上展开了系统性评测与策略比较。