AIDC
DC AI 热点

全部 AI 动态

全部语言仅中文99 条动态
来源筛选
全部来源AITNT · AI头条(网页)Buzzing HN · 中文精选C114 通信网 · AI与算力(网页)DeepSeek 公众号IDC 圈·云与算力(网页)IT168 服务器存储 · AI与算力(网页)IT之家 · AI 筛选InfoQ · 架构与云计算Solidot · AI 筛选少数派 · AI 筛选智谱 公众号月之暗面 Kimi 公众号爱范儿 · AI 筛选腾讯混元 公众号通义实验室 公众号量子位阮一峰 · AI 筛选阶跃 StepFun 公众号AI Roundup · X AI coding圈日报AWS ArchitectureAWS HPCAWS News · 云基础设施AWS 机器学习Anthropic News(RSS)Apple Machine Learning ResearchArs Technica · AI 筛选Azure Blog · 云基础设施CNCF BlogCerebras 官方博客(网页)Claude Code 更新Claude 官方博客(网页)Cloudflare Blog · 网络基础设施Data Center DynamicsData Center KnowledgeEngineering at MetaEquinix Blog · 互联基础设施Gary MarcusGitHub Blog · AI 与安全Google AIGoogle DeepMindGoogle Developers · AI 筛选Google InfrastructureGoogle ResearchHacker News · AIHugging FaceKubernetes BlogLangChain 官方博客(网页)Last Week in AILlamaIndex 官方博客(网页)MIT News · AIMIT Technology Review AIMicrosoft ResearchNVIDIA Developer BlogNVIDIA · AI 筛选Ollama 更新OpenAI 官方动态OpenStack BlogSebastian RaschkaSemiAnalysis · 算力产业ServeTheHomeSimon WillisonTechCrunch AIThe Batch · DeepLearning.AIThe DecoderThe Next PlatformThe Verge · AI 筛选Transformers 更新Transluce 研究(网页)Vertiv 官方新闻arXiv 人工智能arXiv 机器学习arXiv 自然语言处理vLLM 官方博客(网页)vLLM 更新施耐德电气博客
9月29日2026-09-29
Hacker News · AIAI 评分 68/10001:37

Netflix提出GenRec:基于大语言模型的推荐排序器

arXiv论文介绍了Netflix最新的工业级推荐系统研究成果GenRec。该系统将大语言模型(LLM)引入推荐排序环节(Recommendation Ranker),探索利用大模型的通用语义理解与推理能力来提升流媒体内容推荐的排序效果。具体技术细节与实验评测需进一步参考论文原文。

阅读原文 ↗推荐理由:Netflix将LLM引入核心推荐排序场景的工业级落地实践,对推荐系统与大模型结合具有参考价值。另有 1 家信源报道# 大模型# 智能体# 自然语言处理# Netflix
9月28日2026-09-28
Cloudflare Blog · 网络基础设施AI 评分 70/10021:00

面向AI智能体的浏览器Kitesurf更新:支持WebMCP与终端渲染

基于Workers构建的面向AI智能体浏览器Kitesurf迎来重要更新。新版本引入了WebMCP支持,优化了DOM处理性能,并新增了基于终端的渲染能力。目前该浏览器已通过超过73万个Web平台子测试,显著提升了智能体在复杂网页环境下的导航与交互速度,为Agent自动化执行Web任务提供了更高效的基础设施支持。

阅读原文 ↗推荐理由:聚焦智能体网页交互基础设施,WebMCP与DOM性能优化对构建高可靠Web Agent具有实用参考价值。另有 1 家信源报道# 智能体# MCP# AI编程
arXiv 自然语言处理AI 评分 68/10012:00

并非所有记忆都等价:面向大模型智能体的分层协作记忆检索机制

在多智能体团队协作场景中,记忆具有异质性且持续动态演进。现有记忆增强系统通常将记忆扁平化存储,仅根据语义相似度或时间排序,导致检索到语义相关但已失效或冲突的过时信息。该论文提出一种分层协作记忆架构,区分团队集体共识与个体执行轨迹,建模记忆的层级结构与时效有效性,从而提升多智能体协作中的检索准确性与决策一致性。

阅读原文 ↗推荐理由:针对多智能体协作中记忆扁平化与时效冲突的痛点提出了分层检索机制,对Agent系统架构设计有参考价值。另有 1 家信源报道# 智能体# 记忆# 大模型# 自然语言处理
arXiv 自然语言处理AI 评分 68/10012:00

生产环境Text-to-SQL流水线中LLM作为评判者的失效审计与修复

该研究针对生产级Text-to-SQL流水线中普遍采用但未经严格验证的“LLM-as-a-judge”(大模型充当裁判)机制展开审计。实验发现,部署的gpt-4o-mini评判器与人工标注一致性极低(Cohen's kappa仅0.04至0.42),误将77.1%忠实于意图的SQL过度判定为错误,主要归因于“评分幻觉”(GRADE-HALLUCINATION)。研究通过部署自建的Qwen模型替代,将一致性提升至0.72,媲美Claude顶配模型水平。

阅读原文 ↗推荐理由:直击当前应用工程中盲目迷信LLM裁判的痛点,揭示了严重的过度拦截问题并给出低成本替代方案,极具工程实操参考价值。# 评测# 大模型# AI编程
arXiv 自然语言处理AI 评分 60/10012:00

SlideLab:基于多智能体的学术论文幻灯片自动生成框架

该论文提出了 SlideLab,一个无需训练的多智能体框架,旨在将科学研究论文自动转化为以受众为中心的学术演示幻灯片。SlideLab 首先规划演讲叙事逻辑,随后利用分别负责内容规划、视觉生成、版面微调以及溯源验证的多个智能体协同构建并迭代优化幻灯片。盲测人工评估表明,SlideLab 在生成学术演讲幻灯片的质量上表现优异。

阅读原文 ↗推荐理由:针对学术论文生成演示文稿这一痛点场景设计的多智能体协作框架,具备一定的实用与工程参考价值。# 智能体# 多模态# 自然语言处理
arXiv 自然语言处理AI 评分 58/10012:00

SignTrace:基于自然语言动作描述的中国手语反向查词系统

针对手语学习者“记得手势动作却不知含义”的反向查词难题,研究者提出了 SignTrace 系统。该系统面向包含 6699 个词条的中国手语词典,结合大语言模型进行词典信息丰富化、动作特征抽取与词典风格重写,并通过七通道检索与候选重排机制实现自然语言查词。系统已开展小规模用户试用,并在 500 个动作描述查询的评测集上验证了有效性。

阅读原文 ↗推荐理由:针对手语反向检索这一痛点场景给出了实用的 LLM 结合工程方案,属于垂直领域的落地研究尝试。# 自然语言处理# 大模型# 多模态
arXiv 自然语言处理AI 评分 74/10012:00

Spotify公布对话式推荐Agent冷启动方案:基于合成数据与自我改进循环

Spotify团队在arXiv上发表论文,针对对话式推荐智能体在冷启动阶段缺乏真实用户交互数据的问题,提出了一套多轮合成数据生成流水线与自我改进循环机制。该方案重点优化Agent的规划能力(即如何选择、排序和调用工具),通过将单轮指令转化为多轮对话数据,实现Agent在复杂意图理解与推荐工具链调用上的自主演进。

阅读原文 ↗推荐理由:Spotify公开的工业级对话式推荐Agent落地实践,系统解决了冷启动场景下的Agent规划与工具调用难题,对推荐系统结合Agent开发有参考价值。# 智能体# 合成数据# 大模型# Spotify
arXiv 自然语言处理AI 评分 62/10012:00

基于大模型的因果感知同传语音翻译框架

大语言模型在离线翻译中表现出色,但在同传语音到语音翻译(Simul-S2ST)中,因缺乏高质量且因果对齐的跨语言说话人保真训练数据,且现有方案依赖固定策略或置信度启发式方法,导致翻译质量欠佳且延迟较高。研究团队提出了一种因果感知Simul-S2ST框架,通过新型数据流水线生成高保真、因果对齐的语音片段,以改善同传中的声音迁移和实时翻译效果。

阅读原文 ↗推荐理由:针对大模型在实时同声传译语音翻译中的因果对齐和音色保留难题提出了改进方案,属于常规前沿学术成果。# 语音# 多模态# 大模型# 自然语言处理
arXiv 人工智能AI 评分 62/10012:00

LLM真的理解上下文吗?基于知识图谱的上下文理解评测框架

大语言模型虽然表现出强大的语言能力,但究竟是真正理解上下文还是仅做超大规模的模式匹配仍存争议。上下文理解要求模型能够从给定语境中准确提取信息、构建一致的内部表征并进行事实推理。传统以BLEU和困惑度为主的评估方法往往局限于表面特征,该研究提出了一种基于知识图谱的新型评测框架,旨在更深入、结构化地量化大模型对上下文的真实理解能力。

阅读原文 ↗推荐理由:探讨大模型核心认知能力的学术评测论文,利用知识图谱评估上下文理解度具有一定方法学参考价值。另有 1 家信源报道# 大模型# 评测# 可解释性# 自然语言处理
arXiv 自然语言处理AI 评分 62/10012:00

基于语音大模型的推理期目标说话人遗忘识别技术

该研究针对多说话人场景提出了目标说话人遗忘自动语音识别(TSU-ASR)任务,以满足特定用户不希望自身语音被转录的隐私需求。系统需转录未退出的说话人内容,同时仅标记退出者的发音区间而不转录其文本。研究团队设计了一种轻量级的注册条件门控(ECG)模块,可直接附加到冻结的双流语音大模型上,在推理阶段动态实现对新增退出说话人的选择性遗忘与转录过滤。

阅读原文 ↗推荐理由:提出了一种在语音大模型推理期实现特定说话人隐私擦除的轻量级方案,兼具隐私保护与工程实用性。# 语音# 大模型# 隐私计算
arXiv 自然语言处理AI 评分 62/10012:00

基于检索的长文本医疗事实核查为何失效?错误归因分类体系研究

在大模型高风险临床应用中,基于检索的事实核查已成为检测模型幻觉的主流范式。然而现有系统多依赖F1等汇总指标,遮蔽了核查失败的具体环节与原因,且传统RAG诊断往往依赖昂贵的标准答案或人工标注证据。针对长文本医疗问答的事实核查场景,该研究通过自动归纳构建了双重错误分类体系,能够细粒度剖析检索增强评估系统的具体失效模式,为提升医疗AI可解释性与评测可靠性提供了新工具。

阅读原文 ↗推荐理由:针对医疗大模型事实核查中宏观指标难以诊断具体失效环节的痛点,提出了细粒度错误分类体系,对优化医疗RAG系统评测具备参考价值。# 医疗AI# RAG# 评测# 大模型# 可解释性
arXiv 自然语言处理AI 评分 62/10012:00

打破大模型同质化:通过多样化角色设定激发创意输出

针对大语言模型在开放式任务中输出趋同、易陷入“群体思维”的问题,该研究将角色多样化形式化为集合级条件生成任务。研究探讨了“角色选择与生成”及“空间填充与边界探索多样性”两个核心设计维度,提出了覆盖子集选择、均匀覆盖采样及进化角色生成等四种方法。实验表明,结构化的多样化角色设定能有效打破模型生成的单一性,显著提升发散式思考与创意任务中的输出多样性与质量。

阅读原文 ↗推荐理由:系统性研究了通过角色集合多样化打破LLM输出同质化的问题,对大模型创意激发与提示词工程具有实用参考价值。# 大模型# 提示词工程# 自然语言处理# 评测
arXiv 人工智能AI 评分 68/10012:00

HARDEN:通过约束进化搜索生成高难度且保真答案的大模型评测用例

针对现有基准测试难以反映企业实际部署复杂度的问题,研究人员提出了 HARDEN 方法。该方法利用约束进化搜索技术,在保持预期输出答案不变的前提下,沿特定领域复杂度维度对评估输入进行改造,同时严格遵循任务语义、真实性与执行有效性约束。在 FinQA、PubMedQA、ContractNLI 基准及不同规模 Qwen3.5 模型上的实验表明,该方法能有效提升评测难度并暴露模型在复杂场景下的局限性。

阅读原文 ↗推荐理由:提出了一种自动生成高难度评估样本的进化搜索方法,对大模型企业级落地评测具有一定参考价值。另有 1 家信源报道# 评测# 大模型# 自然语言处理# 合成数据
arXiv 自然语言处理AI 评分 62/10012:00

研究发现语码转换课程训练可促进小语言模型的跨语言表征对齐

一项最新学术研究探讨了语码转换(在单句中混合多种语言)对小型语言模型跨语言对齐的影响。研究人员在包含英文、荷兰文和中文的1亿词多语言语料库(基于BabyBabelLM数据集)上预训练小型Decoder-only Transformer模型,并通过大模型生成词级和句级语码转换数据。实验发现,在语码转换数据上训练能够显著对齐平行文本的特征表征,尤其是在不同文字系统之间效果明显。

阅读原文 ↗推荐理由:探索了多语言混合预训练对表征对齐的影响机制,对多语言小模型训练策略有一定参考价值。# 自然语言处理# 大模型# 对齐# 合成数据
arXiv 自然语言处理AI 评分 68/10012:00

MemProbe:借鉴认知科学实验范式探究智能体记忆的稳定性与可塑性权衡

当前智能体记忆系统的评测往往过于简化为最终回答的准确率,忽视了记忆动态演化的过程。最新研究引入了受认知科学启发的评估框架 MemProbe,旨在诊断智能体记忆中“稳定性与可塑性”的权衡问题。该框架基于认知记忆的重构性特征,结合干扰、信息可靠度、强化与再激活机制,设计了四大可复用的实验范式,为长周期智能体记忆的精准评测与优化提供了新工具。

阅读原文 ↗推荐理由:借鉴认知科学方法评估智能体记忆的稳定性与遗忘/更新动态,为解决长程智能体记忆失真提供了细粒度评测方案。# 智能体# 记忆# 评测# 自然语言处理
arXiv 人工智能AI 评分 63/10012:00

研究探讨音频大模型对其转录可靠性的自我感知能力

该论文研究了音频大语言模型(Audio LLMs)在输入语音严重失真时,能否识别出自身转录结果不可靠。实验发现,如果直接通过提示词让模型评估自身转录的可靠性,模型的判断表现很差,在绝大多数情况下都会盲目自信地预测转录是可靠的,这揭示了语音交互大模型在面对低质量输入时存在自我认知盲区的问题。

阅读原文 ↗推荐理由:探讨语音大模型在退化音频输入下的自我可靠性评估能力,揭示了模型过度自信的盲区,对语音对齐与可靠交互有参考价值。另有 1 家信源报道# 多模态# 语音# 大模型# 评测# 对齐
arXiv 自然语言处理AI 评分 68/10012:00

搜索之后才是难点:全新基准 KNOWS 评估网页智能体的知识综合与呈现能力

现有计算机操作类智能体评测大多局限于信息检索,未能全面评估其实际作为助手的综合能力。针对这一痛点,研究团队推出了全新评测基准 KNOWS,聚焦于开放式、复杂的浏览器端多步工作流。该基准重点评估智能体在跨界面检索后,进行任务拆解、复杂推理、视觉与空间理解,并将多源知识综合整理为文档、演示文稿或表格等高质量交付物的综合能力。

阅读原文 ↗推荐理由:切中了网页智能体从“单纯信息检索”迈向“交付完整成果”的核心痛点,为复杂工作流评测提供了新基准。# 智能体# 评测# 多模态# 推理
arXiv 自然语言处理AI 评分 72/10012:00

利用策略内自蒸馏实现推理能力的递归自我提升

该研究探讨了大模型推理能力的递归自我提升方法。针对传统的策略内蒸馏(OPD)依赖外部教师模型提供密集的token级监督,研究提出了策略内自蒸馏(OPSD)机制。该机制通过复制一份冻结的学生模型,并在其上下文中提供真实标签作为特权教师模型,引导仅接收问题的学生模型进行模仿学习,从而在无需更强外部教师的情况下实现模型的自主迭代强化。

阅读原文 ↗推荐理由:探索了摆脱外部强教师模型的模型自我演化与推理蒸馏路径,对LLM自训练与强化学习研究具参考价值。# 大模型# 推理# 蒸馏# 强化学习
arXiv 自然语言处理AI 评分 62/10012:00

流式视频理解新基准TRACE:引入时序审计与条件感知评测框架

针对流式视频理解评估中忽视证据生效时机、视觉历史维护机制及响应触发条件等问题,研究人员提出了条件感知基准与评测框架 TRACE。该框架结合了带有时序审计的视觉任务,将证据时机与指令依赖条件显式化,从而精准区分模型在不同工作负载和运行机制下的真实表现与失败模式,为流式多模态模型提供了更严格、细致的动态评估标准。

阅读原文 ↗推荐理由:针对流式视频理解中时序与触发机制评估缺失的痛点提出了标准化基准,具有一定学术参考价值。# 多模态# 评测# 计算机视觉# 前沿研究
arXiv 自然语言处理AI 评分 62/10012:00

超越均值注意力:面向大模型 KV Cache 驱逐的多样性感知与分层评分机制

现有如 SnapKV 和 PyramidKV 等 KV Cache 驱逐方法通常仅根据观察窗口内的平均注意力权重对 Token 进行排序。该研究提出了一种统一评分机制,引入了窗口查询中的注意力离散度以及相对于已选 Token 的冗余度惩罚,在无需额外前向传播的情况下平衡相关性与多样性。同时,研究还探索了随网络深度变化的分层评分系数配置,以优化大模型长上下文推理时的缓存保留效果。

阅读原文 ↗推荐理由:针对大模型长文本推理中的 KV Cache 驱逐策略进行了有价值的算法改进,兼顾了多样性与分层特征。# 大模型# 推理# 模型压缩# 前沿研究
arXiv 自然语言处理AI 评分 62/10012:00

面向东南亚语言的轻量图文嵌入模型SEA-CLIP-Tiny推出,参数量不足50M

针对东南亚语言多样性强但多模态数据与算力资源匮乏的问题,研究人员推出了专为该地区设计的紧凑型多模态图文嵌入模型SEA-CLIP-Tiny。该模型参数量不足5000万,采用类似CLIP-KD的知识蒸馏框架,结合区域数据整理与多语言教师模型指导,在7种东南亚语言的跨语言图文检索实验中展现出高效的嵌入表现。

阅读原文 ↗推荐理由:针对低资源语言的多模态轻量化嵌入研究,实用性较强但属于细分领域的常规学术成果。# 多模态# 计算机视觉# 自然语言处理# 蒸馏# 模型压缩
arXiv 自然语言处理AI 评分 62/10012:00

基于随机引导优化串联语音对话模型的自然交互能力

在串联式端到端语音模型(如KAME架构)中,大语言模型作为异步后端,在用户说话期间向响应前端提供候选回复作为引导。然而,常规对话数据缺乏这种实时中间引导信号,若用模拟器大模型生成会带来巨大的数据准备开销。论文提出了“随机中间引导”训练方法,有效解决了全双工自然人机语音交互中的中间上下文对齐与训练成本问题。

阅读原文 ↗推荐理由:针对串联式实时语音对话大模型训练开销过大的技术痛点提出了轻量化引导方案,属于有价值的学术进展。# 语音# 大模型# 自然语言处理# 多模态
arXiv 自然语言处理AI 评分 62/10012:00

探究提示词模板在知识蒸馏安全对齐中的作用机制

已有研究表明在监督微调(SFT)阶段选择的提示词模板会显著影响模型后续安全对齐的鲁棒性,但知识蒸馏(KD)过程中模板选择对学生模型安全性的影响尚未得到充分探讨。本研究分析了教师向学生模型蒸馏时不同模板配置对既有安全对齐的作用,发现不当的聊天模板会导致原本经过指令微调且对齐的基座模型出现显著的安全对齐退化,为蒸馏过程中的安全性保持提供了新视角。

阅读原文 ↗推荐理由:探讨知识蒸馏过程中提示词模板导致安全对齐退化的微观机制,对模型蒸馏落地中的安全防御有一定工程参考价值。# 安全# 对齐# 蒸馏# 大模型# 提示词工程
arXiv 自然语言处理AI 评分 68/10012:00

I-Parakeet:在手机NPU上实现纯整型Conformer语音识别

针对现代Conformer语音识别(ASR)模型因计算敏感算子依赖浮点回退而难以充分利用端侧整数加速器的问题,研究人员提出了I-Parakeet。该工作实现了英伟达0.6B参数Parakeet-CTC模型的纯整型部署,使其能够完全运行在智能手机NPU上,无需任何浮点算子或CPU回退。核心贡献包括推导了相对位置自注意力的纯整数计算公式,为大参数量语音模型在边缘设备的高效部署提供了新路径。

阅读原文 ↗推荐理由:实现了0.6B参数Conformer ASR模型在手机NPU上的纯整型无回退部署,对端侧语音AI落地具有实用工程参考价值。# 端侧AI# 语音# 模型压缩# 推理# 芯片
arXiv 机器学习AI 评分 68/10012:00

余弦相似度并非证据:量化下可解释性迁移的底噪测量研究

该研究针对AI安全与可解释性领域的一种常见做法提出质疑:研究人员常在全精度权重上校准可解释性特征,并部署于量化模型,随后仅凭未报告底噪的尺度不变统计量(如余弦相似度、相关系数等)便宣称特征成功迁移。论文以均值差方向估计器为例,推导了由无量纲数决定的底噪基准,揭示了忽略噪声基准会导致对可解释性在量化模型中有效性的误判。

阅读原文 ↗推荐理由:指出了量化模型可解释性评估中常见的度量陷阱并提供了数学基准,对模型安全与机制可解释性研究具有扎实的参考价值。另有 1 家信源报道# 可解释性# 安全# 模型压缩# 评测# 大模型
arXiv 自然语言处理AI 评分 58/10012:00

基于扰动强度增强大模型解释自洽性评估

该论文针对大语言模型生成解释的自洽性评估问题展开研究。以往基于表面扰动的评测方法未能明确度量和控制扰动强度。对此,研究团队提出了一种利用大模型作为裁判(LLM-as-a-judge)的统一扰动强度度量方法,覆盖输入扰动与思维链(CoT)扰动。通过在可控强度条件下对多种主流大模型生成的解释进行公平横向评测,实验验证了该方法在解释可信度和鲁棒性评估上的有效性。

阅读原文 ↗推荐理由:提出量化扰动强度来公平评估模型解释自洽性的新方法,对大模型可解释性与评测基准有参考价值,但属于较垂直的学术增量工作。# 大模型# 评测# 可解释性# 推理
arXiv 自然语言处理AI 评分 58/10012:00

ARGUS:基于语言模型的气候政策因果推断假设审计框架

在气候政策评估中,双重差分(DID)方法被广泛使用,但验证其识别假设的证据支持一直存在困难。研究人员提出了 ARGUS,一个结构化语言模型工作流,可依据包含 11 个维度的“假设-推论-证据”准则审计论文中的证据,并在无法检索到相关证据时主动弃权。在注入缺陷的测试基准上,ARGUS 检出了 73% 的人为植入缺陷,显著优于传统关键词方法的 18%。

阅读原文 ↗推荐理由:将大语言模型应用于经济学与因果推断论文的假设审计,展示了 AI 在科学审稿与证据核查领域的垂直应用潜力。# 大模型# 评测# 自然语言处理# 可解释性
arXiv 自然语言处理AI 评分 68/10012:00

ToolSearcher:利用强化学习优化大规模智能体工具选择

针对大语言模型在海量工具库中难以高效检索与组合工具的瓶颈,研究团队提出了 ToolSearcher。现有工具学习往往局限于预定义的小型工具集,而在真实场景下面对庞大工具库时,模型常受限于上下文长度与区分能力。该研究探讨了通过强化学习来优化大规模工具选择机制,从而提升 AI 智能体在复杂环境中的工具检索、辨析与调用能力。

阅读原文 ↗推荐理由:针对智能体面对超大规模工具库时的检索瓶颈,提出了基于强化学习的工具选择方案,具备较强的工程实用价值。另有 1 家信源报道# 智能体# 强化学习# 大模型
arXiv 机器学习AI 评分 60/10012:00

融合跨学科理论的虚假新闻计算建模、检测与解释框架

虚假信息检测技术虽准确率不断提升,但往往缺乏可解释性,且与心理学、传播学等传统理论脱节。该研究提出了一种理论驱动的计算框架,通过结构化梳理社会科学、心理学和经济学等领域的虚假新闻理论,利用统计技术与大语言模型将其转化为可量化的特征,旨在实现更具可解释性与理论依据的虚假信息自动化检测与分析。

阅读原文 ↗推荐理由:将跨学科理论与大模型结合以提升虚假新闻检测的可解释性,是AI内容治理领域具有参考价值的研究视角。另有 1 家信源报道# 安全# 治理# 大模型# 自然语言处理# 可解释性
9月25日2026-09-25
arXiv 自然语言处理AI 评分 55/10012:00

基于措辞与选择的二维新闻标题框架审计研究(2022-2025)

该研究针对计算框架分析中常将操作简化为单一评分的问题,提出了一个分离措辞显著性框架与选择框架的二维分析体系。措辞显著性通过诱导性词汇、责任归咎、威胁框架及反问句四个维度衡量,选择框架则通过媒体层面的故事形态与高负荷分布衡量。研究利用三个大语言模型标注结合多数投票和人工仲裁,构建了包含10000条法语新闻标题的监督数据集并进行了系统验证。

阅读原文 ↗推荐理由:提出了一种解耦措辞与选择的媒体框架分析新范式,并利用大模型完成了规模化标注与审计验证。# 计算语言学# 大模型# 文本标注# 自然语言处理# 框架效应