AIDC
← 返回全部动态
arXiv 自然语言处理AI 评分 62/10009月29日 12:00

RAG系统组件协同效应研究:解析器、分块策略与嵌入模型的交互影响

该研究针对检索增强生成(RAG)流水线中解析器、分块策略与嵌入模型通常被割裂评估的问题,开展了一项控制因子实验。研究结合了3种文档解析器、3种分块策略以及5种稠密嵌入模型(并以BM25为基准),在印度政府监管文档数据集上,通过800个带证据链验证的问答实例,系统评测了不同组件组合对检索效果的综合交互影响。

推荐理由系统化评测了RAG中解析、分块与Embedding的组合交互效应,对企业级复杂文档知识库构建有一定工程参考价值。

原标题:Parser, Chunking, and Embedding Interactions in Retrieval-Augmented Generation over Indian Government Regulatory Documents

阅读 arXiv 自然语言处理 原文 ↗

同一事件的其他来源

arXiv 自然语言处理09月29日 12:00

方言越狱机制解析:表层形式、文化语境与策略空间的消融研究

该研究针对晦涩语言形式削弱大模型拒绝机制的现象,将文言文红队测试框架扩展至上海话和粤语等中文方言语域。研究团队设计了涵盖表层形式、策略库变体和两款目标模型的36单元消融实验,探究越狱成功究竟源于非标准表层形式、文化背景还是提示词策略优化。核心结论具有修正意义:方言表层形式并非导致模型越狱的充要条件,为多语言环境下的模型安全对齐提供了更深入的机理认识。