AIDC
DC AI 热点

全部 AI 动态

全部语言仅中文10 条动态
来源筛选
全部来源AITNT · AI头条(网页)Buzzing HN · 中文精选C114 通信网 · AI与算力(网页)DeepSeek 公众号IDC 圈·云与算力(网页)IT168 服务器存储 · AI与算力(网页)IT之家 · AI 筛选InfoQ · 架构与云计算Solidot · AI 筛选少数派 · AI 筛选智谱 公众号月之暗面 Kimi 公众号爱范儿 · AI 筛选腾讯混元 公众号通义实验室 公众号量子位阮一峰 · AI 筛选阶跃 StepFun 公众号AI Roundup · X AI coding圈日报AWS ArchitectureAWS HPCAWS News · 云基础设施AWS 机器学习Anthropic News(RSS)Apple Machine Learning ResearchArs Technica · AI 筛选Azure Blog · 云基础设施CNCF BlogCerebras 官方博客(网页)Claude Code 更新Claude 官方博客(网页)Cloudflare Blog · 网络基础设施Data Center DynamicsData Center KnowledgeEngineering at MetaEquinix Blog · 互联基础设施Gary MarcusGitHub Blog · AI 与安全Google AIGoogle DeepMindGoogle Developers · AI 筛选Google InfrastructureGoogle ResearchHacker News · AIHugging FaceKubernetes BlogLangChain 官方博客(网页)Last Week in AILlamaIndex 官方博客(网页)MIT News · AIMIT Technology Review AIMicrosoft ResearchNVIDIA Developer BlogNVIDIA · AI 筛选Ollama 更新OpenAI 官方动态OpenStack BlogSebastian RaschkaSemiAnalysis · 算力产业ServeTheHomeSimon WillisonTechCrunch AIThe Batch · DeepLearning.AIThe DecoderThe Next PlatformThe Verge · AI 筛选Transformers 更新Transluce 研究(网页)Vertiv 官方新闻arXiv 人工智能arXiv 机器学习arXiv 自然语言处理vLLM 官方博客(网页)vLLM 更新施耐德电气博客
9月29日2026-09-29
arXiv 人工智能AI 评分 68/10012:00

EmailBench:面向企业邮件与办公生产力场景的智能体评测基准

研究团队推出针对大模型智能体企业邮件与生产力任务的评测基准 EmailBench。该基准包含16个任务类别的206个实际场景,结合了类型化邮件API规范与中立命名标准,并构建了基于Enron衍生的确定性合成语料库。其核心目标在于解决此前评测缺乏独立环境的问题,重点检验智能体在信息检索、结构化状态更新、时序推理及多步复杂协同工作流中的执行能力。

阅读原文 ↗推荐理由:聚焦企业邮件这一高频复杂场景的垂直智能体评测工具,填补了端到端办公自动化工作流的评估空缺。另有 1 家信源报道# 智能体# 评测# 大模型# 自然语言处理
arXiv 机器学习AI 评分 60/10012:00

基于智能体技能的自主科研项目管理:谱空间回归案例研究

该研究展示了一种在消费级硬件(如Apple M2 Pro)上运行的端到端自主机器学习科研智能体技能。实验利用DeepSeek Harness套件调度模型,对规则空间网格上的快速傅里叶变换核岭回归(FFT-KRR)求解器进行评估与实验管理,并在纯CPU环境下完成。该方案将长周期任务状态解耦为基于文件的管理模式,验证了智能体在轻量级硬件上自主管理和执行科学计算研究任务的可行性。

阅读原文 ↗推荐理由:探讨利用智能体自主推进机器学习科研流程的落地案例,具有一定工程实践参考价值,但属于常规学术探索。另有 1 家信源报道# 智能体# 自然语言处理# 前沿研究与模型架构# 端侧AI
9月28日2026-09-28
arXiv 自然语言处理AI 评分 68/10012:00

CARGO:面向生产环境智能体的上下文感知检索门控评测框架

针对生产环境中智能体在动态实体(如客服工单、账户等)操作时的评测难题,传统基于参考答案的 LLM-as-a-judge 方案常因参考案例与实际运行实体的标识、日期等不同而误判为幻觉或错误(即参考与实例分歧 RID)。为此,研究人员提出 CARGO 评测框架。该框架将检索到的历史参考样本视作“操作流程范例”,同时结合实时运行上下文进行事实性判定,从而显著提高了生产环境智能体评测的鲁棒性与准确率。

阅读原文 ↗推荐理由:针对生产环境智能体评测中“参考案例与动态上下文不一致导致误判”的实际工程痛点提出了解法,具备落地参考价值。另有 2 家信源报道# 智能体# 评测# 大模型# 自然语言处理
arXiv 自然语言处理AI 评分 68/10012:00

搜索之后才是难点:全新基准 KNOWS 评估网页智能体的知识综合与呈现能力

现有计算机操作类智能体评测大多局限于信息检索,未能全面评估其实际作为助手的综合能力。针对这一痛点,研究团队推出了全新评测基准 KNOWS,聚焦于开放式、复杂的浏览器端多步工作流。该基准重点评估智能体在跨界面检索后,进行任务拆解、复杂推理、视觉与空间理解,并将多源知识综合整理为文档、演示文稿或表格等高质量交付物的综合能力。

阅读原文 ↗推荐理由:切中了网页智能体从“单纯信息检索”迈向“交付完整成果”的核心痛点,为复杂工作流评测提供了新基准。另有 1 家信源报道# 智能体# 评测# 多模态# 推理
9月25日2026-09-25
arXiv 机器学习AI 评分 35/10012:00

针对316L不锈钢氢脆检测的防数据泄漏机器学习评估协议

扫描电子显微镜(SEM)常用于表征结构钢因氢脆引起的微观结构变化。尽管机器学习能自动化此类表征,但现有模型常采用图像级划分,当同一样本区域包含多张图像时易引发数据泄漏。为此,研究人员针对316L不锈钢原始状态与充氢状态的SEM显微图像分类任务,提出了一种基于14个空间区域留一(LORO)交叉验证的区域保留评估协议,以实现对纹理特征与深度特征更可靠的无泄漏评估。

阅读原文 ↗推荐理由:提出了一种解决显微图像分类中数据泄漏问题的空间划分验证方法,属于AI在材料科学领域的具体工程应用。# 机器学习# 材料科学# 计算机视觉# 数据泄漏# 显微图像
arXiv 机器学习✦ 精选AI 评分 75/10012:00

LabFactory:构建与评估可执行AI实验室的全新框架

该研究提出了LabFactory框架,旨在将科学任务需求自动转化为可执行的AI实验室。在该框架中,AI构建器根据科学任务简报,构建并打包一套集成特定模型、知识资源、实用工具和控制器的定制求解系统。整个开发和打包过程在受计量的独立工作区中完成,随后交付给独立宿主环境执行,探索了科学计算与AI系统的自动化端到端构建路径。

阅读原文 ↗推荐理由:提出了一种由AI自主构建、打包并执行特定科学任务求解系统的智能体工程框架。# LabFactory# 智能体# 科学智能# 自动化系统
arXiv 机器学习✦ 精选AI 评分 65/10012:00

基于分布式声波传感与深度学习的高精度城市交通动态监测

本研究探讨利用分布式声波传感(DAS)与深度学习技术进行高时空分辨率城市交通动态监测。DAS通过复用现有的地下光纤电缆作为密集连续的传感器阵列,能够以米级空间分辨率和秒级时间分辨率对道路交通活动进行被动且保护隐私的实时监测。该研究旨在验证DAS结合深度学习在智慧交通感知中的有效性(注:原文摘要信息有所截断,具体实验指标未详述)。

阅读原文 ↗推荐理由:展示了复用现有地下光纤基础设施与深度学习算法相结合进行高精细度智慧交通感知的新应用路径。# 分布式声波传感# 深度学习# 智慧交通# 光纤感知# 时空分析
9月24日2026-09-24
arXiv 机器学习✦ 精选AI 评分 78/10012:00

终端基准测试何以称“难”?研究揭示智能体评测中的“真假难度”陷阱

前沿基准测试常依赖当前模型无法解决的任务来衡量能力边界,但零通过率并不等同于真正的高难度。该研究指出,任务全军覆没既可能源于真实的能力代差,也可能是由缺失上下文、损坏的参考方案或基础设施故障等“虚假难度”导致。基于 Terminal-Bench 3 等基准中涵盖 639 个任务、2.8 万余次试验及逾 10 万美元开销的真实记录,研究系统性厘清了导致智能体任务失败的本质原因,为评测体系纠偏。

阅读原文 ↗推荐理由:通过大规模实证分析揭示了智能体基准评测中零通过率背后的工程与设计缺陷,对规范 Agent 评估体系具有重要参考意义。# 智能体# 评测# Terminal-Bench# Agent评测# 大模型
arXiv 机器学习✦ 精选AI 评分 60/10012:00

结合保形分位数回归的迁移学习框架:应对缺电数据匮乏下的光伏预测

针对频繁停电导致历史观测数据极度匮乏地区的光伏预测难题,本研究提出了一种结合保形分位数回归(CQR)的迁移学习框架。该方法首先基于澳大利亚爱丽斯泉的光伏数据集预训练时序预测模型,随后将其迁移适配到模拟的孟加拉国光伏数据中,以应对不同程度的数据缺失。实验表明,该框架在严重数据稀缺环境下显著提升了光伏功率预测能力,并提供了可靠的不确定性估计。

阅读原文 ↗推荐理由:该研究创新性地将迁移学习与保形分位数回归结合,为极端数据稀缺场景下的新能源电力预测提供了实用的工程解决方案。# 迁移学习# 光伏预测# 保形预测# 时间序列# 应用工程
arXiv 机器学习✦ 精选AI 评分 70/10012:00

ChipMEM:面向电子设计自动化智能体的基于验证记忆机制

基于大语言模型的智能体可利用电子设计自动化(EDA)工具,根据综合与验证反馈生成并修正寄存器传输级(RTL)设计。然而,现有方法通常在产生经验的同一任务上评估提炼的技能或奖励模型,容易诱发针对特定任务的反复修改,而非沉淀出可迁移的复用知识。为此,论文提出了名为 ChipMEM 的基于验证的记忆机制(注:输入摘要在介绍 ChipMEM 具体细节处被截断)。

阅读原文 ↗推荐理由:针对芯片设计自动化智能体中反馈难以迁移为复用经验的痛点,提出了新的记忆架构思路。# EDA# 大模型# 智能体# 芯片设计# RTL