BRIDGE:双层检索信用感知的智能体强化学习方法
研究提出 BRIDGE,一种基于一阶双层优化的智能体强化学习方法,通过协同自适应检索器与大语言模型策略来解决检索信用分配问题。在 7 个开放域 QA 基准测试中,BRIDGE 在 3B 和 7B 骨干模型上均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 个 EM 点。该方法在医学 QA 基准上也取得了最佳的平均答案准确率与推理质量。
研究提出 BRIDGE,一种基于一阶双层优化的智能体强化学习方法,通过协同自适应检索器与大语言模型策略来解决检索信用分配问题。在 7 个开放域 QA 基准测试中,BRIDGE 在 3B 和 7B 骨干模型上均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 个 EM 点。该方法在医学 QA 基准上也取得了最佳的平均答案准确率与推理质量。
ARCagent 是面向 ME/CFS 等指南存在争议疾病的自适应检索校准临床问答智能体。该系统构建了包含 10 个数据源、1,706 个分块且具备结构化冲突登记的知识库,并通过冲突感知校准流程重排检索证据。在 LLM-as-Judge 评测中,ARCagent 达到 95.3% 的得分,超越所有基础 LLM,相关代码已开源。
研究提出通用框架 LLM 引导图剪枝(LGP),利用 LLM 推理识别并替换低价值邻居节点,直接优化近似最近邻(ANN)图索引结构以解决“几何-语义”不匹配问题。该方法在保留原始图稀疏性与高效导航结构的同时引入关键语义信息。在语义检索基准上的实验表明,LGP 在 DiskANN 和 HNSW 等主流图索引上均优于传统贪心图搜索与 LLM 重排序方法。
PILLAR 是一种基于私有信息检索(PIR)的隐私保护 RAG 系统,能在服务端完全无法获取用户查询词及访问模式的前提下检索相关文档。该系统采用两阶段私有混合检索,先通过预计算 BM25 索引进行稀疏检索过滤候选,再获取候选文档嵌入并在本地重排。系统还提供了单轮低延迟的 PILLAR-Bin 与高检索质量的 PILLAR-Tree 两种协议。
ALLOT 是一种面向大语言模型知识更新的混合内存路由框架,将学习到的写入优先级与硬性参数预算解耦,并在外部内存中保留所有事实。在 CounterFact 基准上,Qwen3-4B 在 20% 参数写入预算下达到 0.760 准确率,参数写入量比全量双写减少 80%。在 Qwen3-0.6B 上仅需 6-14.5% 的参数写入即可达到双写级准确率。
研究人员提出 HyperReCo 框架,利用超图神经网络(HyperGNN)检索互补证据并建立显式关联,以增强大语言模型的多跳推理能力。该框架将文档建模为实体的超边,通过消息传递捕捉查询相关的交互,并利用梯度引导超路径解码(GGHD)将证据转化为显式超路径。在 6 个基准测试中,HyperReCo 在全部 3 个多跳问答数据集上均取得了最佳检索性能。
研究人员构建了一款双语 AI 听力师,在无需微调底层大语言模型的前提下,结合量规引导剧本归纳、多模态听力图解读与 RAG 技术。在包含 58 个模拟病例的双盲对比中,该 AI 在全部 58 个病例及 21 项评估维度的 20 项上均超越 17 位执业听力师,5 分制综合评分平均提升 +1.35 分。
研究人员提出 EngramRAG 智能体记忆架构,通过低延迟清醒反射与异步梦境巩固循环解决多跳依赖和记忆衰减问题。在 LoCoMo 基准测试中,EngramRAG 的 Recall@5 达 53.21%(较稠密向量 RAG 相对提升 38.9%),MRR 达 0.4203。
AdaTutoRank 是一种面向 RAG 和 Deep Research 的集合级文档重排序模型,通过自适应辅导优化(ATO)解决传统重排序中单篇相关性导致的冗余与奖励分配稀疏问题。ATO 依托 9 个维度的三层评分体系提供冷启动标签、强化学习奖励及自适应提示,并将提示效果蒸馏为 token 级优势。在 10 个基准测试中,AdaTutoRank 在减少检索调用的同时取得了最佳综合性能。
新研究指出通过删除段落构建记忆不足样本会泄露标签,并提出消除该捷径的等大小记忆构建方法与 MemSafe 评估器。MemSafe 在 MuSiQue 和 HotpotQA 数据集上分别取得 0.968 和 0.983 的 AUROC。将其作为 7B 阅读器的门控时,在 5% 覆盖率下将回答错误率从 0.850 降至 0.631。
研究人员提出轨迹方差分数(TVS),通过计算独立去噪轨迹间回答嵌入向量的平均成对余弦距离,轻量化检测扩散语言模型中的 RAG 知识冲突。在 LLaDA 模型上,基于 TVS 的线性分类器在四个数据集上达到 70.10% 准确率与 0.7647 AUROC;在 Dream 7B 上将推理轨迹从 2 条增至 5 条可将准确率由 63.91% 提升至 69.62%。
LlamaIndex 推出 Parse Gateway Web 应用,基于 LiteParse 的 is_complex 功能实现页面级别的文档解析智能路由。系统会依据无文本、扫描件、乱码或多列复杂排版等信号及严重程度,将简单页面交给免费进程内运行的 LiteParse 处理,复杂页面则自动升级并路由至不同档位的 LlamaParse。
推荐理由:通过在页面级评估文档复杂度并将不同页面路由至对应解析层级,在保障复杂页面提取质量的同时有效降低了整体延迟与处理成本。
智能 OCR 将传统字符识别与机器学习、版面感知、语义提取及视觉语言模型相结合,直接将企业文档转化为对齐 Schema 的结构化数据。相比传统 OCR 仅输出扁平文本,智能 OCR 能保留表格与键值对等层级关系,并支持字段级置信度评分与规则校验。这推动了文档处理向具备自主推理与验证能力的智能体文档工作流演进。
LlamaIndex 介绍了其文档解析产品 LlamaParse 如何通过引入开源持久化执行运行时 Temporal 替代原有的 RabbitMQ 队列架构,以支持每日数千万页文档的处理能力与 Batch API。
LlamaIndex 探索将 ColBERT 式 MaxSim 晚期交互引入静态嵌入模型,试图在保持极高检索速度的同时解决静态向量缺乏上下文的问题。基于 potion-retrieval-32M,团队引入约 530k 参数(2 MB)的轻量卷积混合器,在 NanoBEIR 基准上取得 0.5258 的平均 NDCG@10 分数,达到 MiniLM-L6 的 94% 表现且速度快约 100 倍。
LlamaIndex 在 LlamaParse 平台推出极低延迟的结构化抽取层 Turbo Beta 版,定价为每页 35 credits。Turbo 省去独立解析步骤并采用多页并行处理,在中长文档场景下单页耗时可降至约 0.5 秒,在 ExtractBench 评测中单页中位数耗时为 3.7 秒且 F1 分数为 0.84。
推荐理由:原文展示了并行页面抽取在长文档场景下的低延迟表现与适用场景,有助于读者评估实时结构化提取方案。
PDF 文件因仅存储字符坐标或图像而缺少行列元数据,导致基于空格切分和固定模板的传统提取方法在复杂布局下极易失效。无边框、多行换行、单元格留空及跨页合并等常见结构,要求解析系统必须具备空间布局推理能力而非单纯提取文本。LlamaIndex 探讨了如何通过 LlamaParse 重构表格行列关系并构建可验证的结构化数据。
LlamaIndex 提出了面向 10 至 100 份文档临时数据室场景的即时智能体 OCR(Just-in-Time Agentic OCR)模式,通过两阶段处理降低 VLM 全量解析的高昂成本与延迟。
推荐理由:文章拆解了即时智能体 OCR 的两阶段处理机制,为百篇内临时文档集的低成本精准解析提供了清晰的落地参考。
多数智能文档处理(IDP)平台在生产环境中常因文档多样性、模板依赖及非文本内容而失效,演示环境与实际生产的准确率差距往往达 10 到 20 个百分点。传统系统无法有效提取图表、架构图和图像中的关键信息,导致后续业务依赖大量人工复核。新一代智能体(Agentic)IDP 则通过 LLM 编排层,将文本、表格与图表分别动态路由至最适配的模型进行解析。
LlamaIndex 发布文章指出,生产级 AI 文档抽取流水线的准确率瓶颈已从 OCR 与解析能力转向 Schema 定义层,未受审计的 Schema 会导致模型在必填字段上生造数据或错误合并重复项。
推荐理由:文章拆解了文档抽取中 Schema 设计不当导致的隐性错误,提供了字段审计与 Agentic 架构的具体实践路径。
LlamaIndex 宣布开源 PDF 解析工具 LiteParse 迎来重要更新,通过在其 PDFium 分支中引入 mimalloc 内存优化与热路径缓存,将文本提取耗时降低 20–25%,在无 OCR 情况下达到平均 2.8ms/页的提取速度和 3.9ms/页的 Markdown 渲染速度。
推荐理由:文章详细拆解了通过改造底层 PDFium 内存分配提升无模型解析吞吐的工程细节,为文档预处理与路由分流提供了实测基准。
现代应付账款自动化正从传统基于模板的 OCR 转向结合视觉语言模型(VLM)与机器学习的智能文档解析。LlamaParse 与 LlamaIndex 将 OCR 整合进统一的解析与索引工作流中,能够精准提取发票行项目及表格结构,完成数据校验后直接对接 ERP 系统。该方案可有效降低人工录入错误、大幅缩短处理周期,并提供可追溯的审计记录。
现代图像 OCR 已从基础字符识别演进为涵盖版面保留与表格提取的文档智能,直接影响下游 LLM 与 RAG 工作流的质量。开源引擎如 Tesseract、PaddleOCR、EasyOCR 和 docTR 适合高可控与私有化部署需求,而 Google Cloud、Amazon Textract 与 Azure 等云端 API 则提供开箱即用的文档理解能力。
表格 OCR 通过结合布局感知与结构解析,将 PDF 或扫描件中的表格转换为 JSON、CSV 或 Excel 等结构化格式。生产级提取流程包含表格检测、结构识别和数据提取三阶段,能解决合并单元格、多行行项及无边框表格等难题。以 LlamaParse 为例,该方案可精准解析发票等文档的表格网格,并将数据映射至指定字段。
智能体文档处理(ADP)利用 AI 智能体自主理解文档上下文与意图、解决异常并触发下游操作,实现端到端自动化。相比传统 IDP 依赖固定模板与人工审核,ADP 结合大语言模型与视觉模型分别解析文本、图表和版式结构。LlamaParse 采用该多智能体协同架构,无需针对格式变化重复训练即可高精度处理复杂文档。
现代非结构化数据提取结合 NLP、命名实体识别(NER)与 LLM,将占企业 90% 的非结构化文档转化为下游可查询的结构化数据。该流程涵盖文档摄取、OCR 与分块预处理、提示词提取、自动化验证及输出集成等环节。这一技术栈让企业摆脱了脆弱的规则解析器,能以零样本方式从各类格式文档中提取精准信息。
LlamaIndex 发布 AI 文档分类指南,阐述如何利用大语言模型实现文档的自动分拣、打标签与工作流路由。流程包含摄入预处理、特征提取、模型分类、打标签评分及下游分发 5 个阶段,支持借助 LlamaParse 解析排版并用 LLM 进行零样本分类。系统通过置信度评分实现高置信度任务自动流转、低置信度任务人工审核。
LlamaIndex 开放智能体文档处理平台 LlamaParse 的定制演示预约,支持文档 OCR、信息提取与索引自动化。平台提供页面级引用、置信度分数与边界框供人机协同审查,并设有成本优化器模式以平衡解析成本与精度。用户还可借助低代码构建器 LlamaAgents,用自然语言开发并部署端到端文档 AI 智能体。
LlamaIndex 公布基于点数的定价方案与功能矩阵,划分 Free、Starter、Pro 和 Enterprise 四档套餐,基础计费为每 1,000 credits 售价 $1.25。
LlamaIndex 展示了 NTT DATA、Experian、KPMG 及 Carlyle 等多家机构利用其框架与 LlamaParse 构建 RAG 和 AI 智能体的落地实践。
LlamaCloud 发布开发者文档与代码示例,支持通过 Python、JavaScript SDK 及 cURL 调用核心文档处理能力。开发者可利用智能体模式(agentic)进行 PDF 解析与基于 Schema 的结构化数据提取。平台还提供了基于自然语言规则的文档分类(classifier)以及将合并文件按类别逻辑拆分(split)的功能。
LlamaIndex 推出面向客户支持场景的解决方案,帮助企业基于 FAQ、知识库、政策合同和产品手册构建 AI 智能体,以实现即时解答并降低支持成本。该方案覆盖自动化问答、故障排除引导与内部坐席辅助,并通过专用的 LlamaParse 解析图表和复杂表格文档。平台提供 Python 与 TypeScript SDK 及 API 支持,同时具备引用追溯和置信度评分等企业级功能。
LlamaIndex 面向工程与研发团队提供技术文档搜索方案,支持基于规范、SOP 和手册构建 AI 智能体,实现复杂文档的即时精准问答。该方案结合专为图表与表格设计的 LlamaParse 工具,支持规格版本比对、架构总结及公式提取,并提供 Python 与 TypeScript SDK 及 API。Salesforce Agentforce 等团队已采用该方案以提升企业 RAG 管道表现。
LlamaIndex 推出发票处理自动化解决方案,帮助财务和运营团队解析发票、提取数据并自动化工作流程。该方案基于 LlamaParse 解析复杂表格与文档,提供发票解析器、验证智能体、审批助手和审计追踪器四大功能模块。系统支持 Python 与 TypeScript SDK 及 API 接入,实现企业级端到端智能体自动化与合规审计。
LlamaIndex 针对投资与审计团队推出财务尽职调查解决方案,利用专用解析工具 LlamaParse 处理合同、财报等文件中包含图表与表格的复杂数据。该方案支持提取关键条款、汇总风险、跨实体对比合同差异并生成结构化尽调报告,同时提供 Python 与 TypeScript SDK、API 及 Agent 工作流以实现端到端自动化。
LlamaIndex 针对医疗与制药领域推出 AI 智能体方案,支持基于临床记录、化验报告及试验文献构建智能体以加速临床研究。该方案涵盖病史总结、自动提取 ICD/CPT 编码的医学编码、文献综合与患者出院支持四大场景。其依托 LlamaParse 解析复杂图表与表格,并提供 Python 和 TypeScript SDK 实现端到端自动化。
LlamaIndex 针对制造业场景推出 AI 智能体解决方案,支持基于技术规范、CAD、SOP 手册及合规文档构建智能体,以减少设备停机时间并优化质检流程。该方案包含 Spec Navigator、合规智能体、供应链分析及维修辅助等功能,依托专为复杂图表设计的 LlamaParse 提升 RAG 检索性能。
LlamaIndex 面向金融机构推出 AI 智能体解决方案,支持基于合同、监管备案文件与研究报告构建端到端自动化工作流。方案结合 LlamaParse 针对复杂图表和嵌套表格的解析能力,覆盖投资研究分析、KYC/AML 校验、合同条款提取及审计风控报告四大场景。系统提供置信度评分与引用溯源,支持通过 API 和仪表盘进行调用与监控。
LlamaIndex 推出基于 AI 智能体的保险自动化解决方案,用于处理发票分类、表单录入与合规审查等繁重文档任务。该方案依托 LlamaParse 解析包含图表的复杂文档,涵盖理赔助手、合规跟踪、保单解答及欺诈监测四大功能,并提供 Python 与 TypeScript SDK 及 API。
LlamaIndex 推出面向金融分析的 AI 解决方案,利用 LlamaParse 高精度解析复杂财报 PDF、图表与嵌套表格,可减少 80% 的研究时间。系统支持自动提取营收、FCF 等关键指标,快速完成 10-K/10-Q 报告摘要、尽职调查与趋势分析,并构建专属 AI 智能体。平台还提供 Python 与 TypeScript SDK 及 API,支持可追溯引用与企业级并行处理。