AIDC
DC AI 热点

全部 AI 动态

9月27日2026-09-27
Hacker News · AIAI 评分 82/10004:20

AI幻觉虚构涉华核部件情报险性引发美军行动

据外媒报道,一份由AI幻觉生成的虚假核武器及军备情报,险些导致美军对中国船只采取登船拦截等军事行动。该事件深刻揭示了在军事情报分析与高危防务决策中应用生成式AI的致命隐患,为将大模型引入国防安全领域敲响了警钟,凸显了AI安全对齐与人机协同核验机制的极端重要性。

阅读原文 ↗推荐理由:极具警示意义的AI安全事件,生动展示了生成式AI幻觉进入高危军事决策领域可能带来的灾难性后果。# 安全# 治理# 大模型
Hacker News · AIAI 评分 60/10003:35

AI高管内部言论曝光:我们可能完成了“人类历史上最大规模的劳动力窃取”

根据针对 OpenAI 和微软的版权诉讼披露文件,有 AI 行业高管在内部表达了对训练数据获取方式的尖锐评价,称生成式 AI 的发展模式可能构成了“人类历史上最大规模的劳动力窃取”。该报道聚焦于科技巨头在未经许可情况下使用海量人类创作数据训练模型所面临的版权纠纷与法律危机。由于当前素材信息有限,具体诉讼细节与涉事高管身份尚待进一步披露。

阅读原文 ↗推荐理由:披露了版权诉讼中 AI 高管的敏感情绪与内部言论,直击大模型训练数据合法性痛点,但当前信息量较为单薄。# 治理# 安全# OpenAI# 大模型
The DecoderAI 评分 58/10001:27

三分之二IT主管称AI见效,但鲜有成果值得打扰CEO度假

科技企业家阿齐姆·阿扎尔在拉斯维加斯面向160位IT副总裁开展现场调查。当被问及谁已取得可衡量的AI成果时,约三分之二的人举手;但追问成果是否足以值得打扰CEO的暑假时,仅有8人举手。这一现象揭示了AI当前落地的真实状况:虽然技术在逐步见效,但进展速度与带来的商业突破,仍难以匹配眼下高额的资本投入,进一步引发了业界关于AI是否存在泡沫的讨论。

阅读原文 ↗推荐理由:一场会场小调查生动折射出企业AI落地虽有微小成效,但缺乏重大突破性ROI的现实落差。# 大模型# 投融资
The DecoderAI 评分 68/10000:56

研究发现:使用AI使人类极度抗拒承认“不知道”,盲目自信翻倍但准确率暴跌

一项涉及3000多名参与者的实证研究发现,接入AI工具会显著削弱人类承认无知(说出“我不知道”)的意愿。实验显示,拥有AI辅助后,受试者承认“不知道”的比例从44%暴跌至3%,即便AI提供的内容几乎完全错误。使用AI的人表现出更强的盲目自信,但实际答题正确率仅有未依赖AI组的三分之一左右,揭示了人机交互中严重的过度信任与虚假自信风险。

阅读原文 ↗推荐理由:量化揭示了AI对人类认知和判断力的负面心理影响,对人机协同和AI过度依赖问题提供了有力的实证支持。# 安全# 治理# 评测# 大模型
9月26日2026-09-26
IT之家 · AI 筛选✦ 精选AI 评分 86/10023:44

Anthropic Claude 攻克杨-米尔斯理论九圈散射振幅难题,刷新物理学计算纪录

Anthropic 宣布其大模型 Claude 在理论物理领域取得重大突破。在极少人类干预的情况下,Claude 连续运行数天,攻克了高能物理学界的高难度计算难题——计算出平面 N=4 超杨-米尔斯理论中六粒子振幅的“九圈”散射振幅结果,打破了人类此前保持的八圈纪录。该任务仅通过单个提示词驱动,耗费数千美元计算成本,展现了大模型在顶尖前沿科学与符号推理领域的颠覆性潜力。

阅读原文 ↗推荐理由:AI 首次在顶尖理论物理领域独立打破人类推演纪录,标志着大模型在复杂前沿科学计算中实现实质性突破。# Anthropic# Claude# 大模型# 推理
IT之家 · AI 筛选AI 评分 78/10022:20

Agent 长任务为何半路停工?Anthropic 揭秘模型汇报机制与控制流陷阱

针对开发者在运行 AI Agent 时频繁遭遇模型干活到一半突然停止、必须手动输入“继续”的问题,Anthropic 官方指南给出了排查与解决方案。核心原因在于模型在处理长周期任务时倾向于主动汇报进度,其 API 返回的 end_turn 信号仅代表“单轮发言结束”。若 Agent 控制程序仍沿用“未调用工具即代表任务完成”的旧判定逻辑,就会误将中间汇报当成任务交差,从而过早终止任务循环。

阅读原文 ↗推荐理由:深入剖析了 Agent 开发中常见的“半路停工”控制流 Bug,为长任务自主执行与提示词工程提供了极具实操价值的避坑指南。# 智能体# 大模型# AI编程# 提示词工程# Anthropic
IT之家 · AI 筛选AI 评分 62/10022:12

用户利用去审查版开源大模型自动逆向破解商业软件引发争议

一名 Reddit 用户发帖称,其利用去审查的大语言模型成功逆向破解了下载工具 IDM 6.43 版本的试用验证。该用户租用云 GPU 并向模型输入约 25 万 Token 的二进制及上下文信息,模型在约 30 分钟内自主定位到软件授权验证位置,并通过修改单一字节生成了可用的激活补丁,整个过程无需人工分步指导。此案例展现了 LLM 在自动化逆向工程方面的实际潜力,同时也引发了对模型滥用与软件版权安全的行业讨论。

阅读原文 ↗推荐理由:展示了大模型在无人工干预下自动化逆向工程与破解二进制软件的真实案例,揭示了去审查开源模型的安全治理风险。# 安全# 大模型# 开源# AI编程# 治理
Hacker News · AIAI 评分 78/10022:04

牛津大学允许 OpenAI 使用博德利图书馆馆藏训练 AI 模型

牛津大学已与 OpenAI 达成合作,允许后者使用其著名的博德利图书馆(Bodleian Library)数字化馆藏资源来训练 AI 模型。作为全球历史最悠久、规模最大的学术图书馆之一,博德利图书馆拥有海量珍贵的学术文献和历史典籍。此次合作为 OpenAI 提供了极高质量的训练语料,同时也引发了关于学术文化遗产用于商业 AI 训练的版权与伦理讨论。

阅读原文 ↗推荐理由:顶级学术机构向商业 AI 公司开放海量优质历史文献语料,在训练数据争夺战和学术版权治理方面均具标志性意义。# OpenAI# 大模型# 治理# 合成数据
Hacker News · AIAI 评分 62/10021:05

LLM 水印技术对 AI 智能体行为与性能的影响分析

网络安全机构 Lasso Security 发布分析文章,探讨大语言模型(LLM)水印溯源技术对 AI 智能体(Agent)行为产生的潜在负面影响(即“溯源税”)。研究重点关注在模型输出中嵌入不可见水印信号时,是否会干扰智能体在复杂推理、工具调用和多步规划等任务中的稳定性与准确性。由于输入信息有限,具体评测数据与结论建议参考原文。

阅读原文 ↗推荐理由:探讨了大模型内容溯源与安全合规水印对智能体任务执行造成的潜在性能损耗,具有前瞻性安全工程参考价值。# 安全# 智能体# 大模型# 治理
IT之家 · AI 筛选AI 评分 76/10020:01

牛津大学博德利图书馆藏书被曝用于 OpenAI 模型训练

据英媒报道,英国规模第二大的牛津大学博德利图书馆历史典籍已被用于构建 OpenAI 的模型训练集。牛津大学此前宣布与 OpenAI 合作对藏书进行数字化处理以方便查阅,但当时并未公开披露这些资料将用于 AI 模型训练。内部会议纪要显示,部分教职员工已对声誉风险及高能耗技术对环保承诺的影响表达了顾虑。OpenAI 正通过“NextGenAI”项目与多所顶尖学术与公共机构推进类似语料合作。

阅读原文 ↗推荐理由:揭示了头部 AI 公司在高质量学术语料枯竭背景下的获取路径,以及名校数字化合作中数据训练授权的合规与透明度争议。# OpenAI# 大模型# 治理# 安全
IT之家 · AI 筛选AI 评分 65/10019:07

OpenCode 将 DeepSeek V4.1 Flash 赠送额度永久调整为 60 美元

AI 开发平台 OpenCode 宣布将 DeepSeek V4.1 Flash 的 60 美元免费额度由限时活动转为永久有效。该模型采用 5520 亿总参数的 MoE 架构,输入与输出激活参数分别为 80 亿与 160 亿,采用新的因果编码-解码架构并支持多模态,大幅降低了 KV 缓存的显存与存储占用。数据显示,该模型在 OpenCode 平台使用量中位列第一,占比约 13%。

阅读原文 ↗推荐理由:反映出 DeepSeek 衍生模型在海外开发者平台的受欢迎程度与分发策略,具有一定生态参考价值。# 大模型# AI编程# 多模态# 推理# 投融资
量子位AI 评分 68/10017:07

FSD级团队推出首版物理AI模型Simate-beta并接入RoboDojo

某FSD背景团队公布了其在物理AI(Physical AI)领域的首版模型Simate-beta,并空降RoboDojo平台。该项目将训练、推理与评测全流程接入自研基础设施(Infra),依托任务编排与算力资源调度能力,支持并行推进数十条相互独立的研究路线,加速具身智能研发迭代。

阅读原文 ↗推荐理由:展示了物理AI与自动驾驶团队跨界自研基础设施推动具身智能模型迭代的新进展,具有一定参考价值。# 具身智能# 自动驾驶# 算力# 大模型
量子位AI 评分 60/10017:01

开源项目Colibrì引发关注:尝试将SSD作为虚拟显存以在无GPU设备上运行超大模型

开源项目Colibrì(小蜂鸟)近期在GitHub引发关注。该项目探索通过利用固态硬盘(SSD)充当虚拟显存与内存扩展,旨在降低超大参数语言模型(如GLM等)的硬件运行门槛,尝试实现无独立GPU或低配置笔记本环境下的模型加载与推理探索。素材信息量较少,具体推理延迟与工程实用性仍待实际场景检验。

阅读原文 ↗推荐理由:关注低资源环境下运行大模型的极端工程优化探索,虽实用速度存疑但技术思路具备一定讨论度。# 开源# 推理# 端侧AI# 模型压缩# 大模型
Hacker News · AIAI 评分 68/10016:36

Linux 内核社区拟引入 Agents.md 以规范和引导 AI 编程智能体

据 Phoronix 报道,Linux 内核开发团队正在探讨在代码库中引入 Agents.md 文件的提案。随着大语言模型和 AI 编程智能体(AI Agents)在软件工程中的广泛应用,该文件旨在为 AI 工具提供明确的内核开发指引、规范约束及上下文参考,防止低质量或违规代码流入内核代码树,提升 AI 辅助内核开发的效率与安全性。

阅读原文 ↗推荐理由:顶级开源项目开始主动针对 AI Agent 设立开发指引与约束,体现了 AI 辅助编程对基础设施软件工程的深远影响。# AI编程# 开源# 智能体# 大模型
IT之家 · AI 筛选AI 评分 78/10016:27

美上诉法院维持五角大楼决定:继续因供应链风险禁用Anthropic Claude

美国哥伦比亚特区联邦上诉法院以2:1裁定,维持五角大楼将AI独角兽Anthropic列入国家安全供应链风险名单的决定。此前Anthropic因拒绝将其模型用于自主武器或大规模监控而被五角大楼拉黑,随后提起诉讼主张防务部门系报复行为。法院多数意见认为军方认定有充分依据,驳回了Anthropic的诉求。此判决意味着五角大楼内部将继续禁用Claude,Anthropic正考虑申请全院复审。

阅读原文 ↗推荐理由:AI安全伦理红线与军方采购需求的正面法律博弈,对头部大模型厂商的商业化和军工合规具有标杆意义。# Anthropic# 安全# 治理# 大模型
量子位AI 评分 70/10015:12

谷歌TPU运行Kimi模型性能超英伟达GPU 57%,采用DeepSeek推理优化架构

据vLLM核心成员创办的团队最新测试,谷歌TPU在运行Kimi模型时的推理性能相较英伟达GPU提升达57%。该评测结合了DeepSeek开源的高效推理技术框架,展示了非英伟达硬件生态在适配并加速顶尖大模型推理上的实质进展。原文摘要信息有限,具体TPU版本及测试对比基线等硬件参数细节未详述。

阅读原文 ↗推荐理由:展示了TPU结合DeepSeek开源推理生态挑战英伟达GPU的实际性能表现,对算力多元化落地具有参考价值。# 算力# 芯片# 推理# 大模型# 开源
AITNT · AI头条(网页)AI 评分 78/10015:00

Skild AI让人形机器人在虚拟环境中自我对弈140年,自主习得足球竞技技能

具身智能独角兽企业Skild AI展示了其最新研究进展:借鉴AlphaGo的强化学习自我对弈思路,让人形机器人“Messinator”在仿真虚拟足球场中累计对弈相当于现实中140年的时长。基于其通用的机器人基础模型Skild Brain与S1架构,机器人自主习得了盘带、护球、抢断和射门等高度复杂的全身协调与动态对抗技能,验证了大规模仿真强化学习在复杂物理运动控制中的潜力。

阅读原文 ↗推荐理由:将AlphaGo的自我对弈机制迁移至人形机器人全身高动态对抗,展示了具身大模型在仿真物理控制上的强泛化能力。另有 1 家信源报道# 具身智能# 强化学习# 大模型
AITNT · AI头条(网页)AI 评分 68/10014:59

Meta个人智能体Muse下载量超ChatGPT,国内大厂跟进面临生态与算力双重挑战

Meta推出的个人智能体产品Muse在上线12天内下载量超越同期ChatGPT,引发全球Personal Agent关注热潮。然而,由于中美在移动互联网生态壁垒、数据打通程度以及端云算力成本上的显著差异,字节跳动、阿里巴巴和腾讯等国内科技巨头难以简单照搬其模式,需探索本土化的个人AI原生落地路径。

阅读原文 ↗推荐理由:聚焦个人智能体(Personal Agent)新范式及其在中美生态差异下的落地挑战,具备行业参考价值。# 智能体# Meta# 字节跳动# 阿里巴巴# 大模型
AITNT · AI头条(网页)AI 评分 78/10014:58

对话OpenAI Codex负责人:解析架构决策与个人AGI终极愿景

OpenAI Codex团队负责人在深度访谈中复盘了Codex从内部Python原型演变为头部编程智能体的完整历程。访谈重点拆解了关键工程与生态决策,包括选择Rust重构核心智能体以提升性能与稳定性、开源CLI与SDK以繁荣生态,以及不强行绑定自家模型的中立策略,并指出Codex的长期目标是演进为面向日常任务的个人AGI助手。

阅读原文 ↗推荐理由:一线团队深度复盘Codex的工程架构选型与开源生态策略,对AI编程智能体开发具有极高参考价值。# OpenAI# AI编程# 智能体# 开源# 大模型
AITNT · AI头条(网页)AI 评分 80/10014:57

前华为盘古大模型核心团队创立息壤开物,获数亿元融资探索大物理模型

前华为云盘古大模型CTO李寅与多模态首席科学家张含望联合创办具身与物理AI创企“息壤开物”。公司已完成数亿元种子轮及天使轮融资,估值达到5亿美元。息壤开物旨在研发面向物理世界的大物理模型(LPM),致力于打破现有数字大模型的局限,探索并验证物理世界中的Scaling Law,为具身智能和工业物理场景提供底层模型支撑。

阅读原文 ↗推荐理由:头部大模型技术骨干创业并拿下高估值大额融资,标志着大物理模型与具身智能新赛道正受资本密集关注。# 具身智能# 世界模型# 投融资# 大模型
IT之家 · AI 筛选AI 评分 80/10014:16

美团上线 LongCat-2.5-Preview 大模型:1.6T MoE 架构,支持百万上下文与多模态

美团旗下 LongCat API 开放平台正式上线新一代大模型 LongCat-2.5-Preview,并开放 API 与网页端体验。该模型延续 MoE 混合专家架构,总参数量约 1.6 万亿,单次推理激活约 480 亿参数。模型原生支持 100 万 token 上下文窗口,重点增强了长程任务处理能力与图片理解等多模态能力,并在代码生成、理解以及 Claude Code 等主流开发环境适配上进行了深度优化。

阅读原文 ↗推荐理由:美团大模型体系的重要迭代,1.6T 参数与百万级上下文的 MoE 架构展示了其在长程任务和 AI 编程场景的持续投入。# 大模型# 多模态# AI编程# 美团
Hacker News · AIAI 评分 40/10011:11

开发者推出多平台 AI 额度监控仪表盘 UsageBuddy

该项目是一款面向开发者的仪表盘工具(UsageBuddy),旨在跨 Claude、Codex 和 Cursor 等多种主流 AI 工具与模型服务统一追踪使用额度与配额限制。用户可通过该工具集中监控不同 AI 编程助手和 API 的消耗情况,避免因超出速率或用量限制而中断工作流。

阅读原文 ↗推荐理由:针对开发者在多款 AI 编程与大模型工具间额度监控分散的痛点提供了统一管理方案。# AI编程# 大模型
InfoQ · 架构与云计算✦ 精选AI 评分 72/10009:25

DoorDash 借助多 Agent 大模型系统清理 6 万个特性标志

据报道,外卖巨头 DoorDash 利用多智能体(Multi-Agent)大语言模型系统,成功自动化清理了代码库中累积的 6 万个特性标志(Feature Flags)。该实践展示了多 Agent 协作在复杂软件工程维护、代码重构及技术债务清理中的落地应用。由于原文详情信息不足,具体的技术架构与实现细节有待进一步披露。

阅读原文 ↗推荐理由:展示了多 Agent 系统在大型企业真实软件工程场景中清理技术债务的有效落地实践。# 智能体# 大模型# AI编程# DoorDash
Hacker News · AIAI 评分 45/10009:21

AI时代我们是否仍能享受软件工程?

该文章探讨了在人工智能技术日益普及的背景下,软件工程师对编程与软件开发工作的体验与乐趣变化。由于输入素材仅包含文章标题和链接,具体论点及详细内容不足,主要聚焦于AI工具对传统开发模式及程序员心境的影响。

阅读原文 ↗推荐理由:探讨AI工具对软件工程师日常工作体验和职业乐趣的影响,引发开发者共鸣。# AI编程# 大模型
Hacker News · AIAI 评分 45/10009:00

为什么 AI 正在蓬勃发展,而生产力却未见提升?

该内容探讨了当前人工智能技术投资狂潮与宏观生产力增长之间脱节的现象,重点围绕 AI 的实际投资回报率(ROI)展开分析。由于输入仅包含文章标题和链接,具体分析数据与详细论据不足。文章主要指向 AI 虽处于繁荣期但尚未在广泛产业中实现预期生产力转化的商业与经济学讨论。

阅读原文 ↗推荐理由:探讨了 AI 投资热潮与实际生产力回报之间的结构性矛盾与商业落地问题。# 大模型# 治理# 金融科技
Buzzing HN · 中文精选AI 评分 58/10007:59

Meta Muse被曝疑似调用OpenAI定制模型muse-special

根据最新消息透露,Meta旗下项目Muse疑似在后台调用了一个标记为“muse-special”的OpenAI模型。这一发现引发了外界对Meta与OpenAI之间技术调用及潜在合作关系的关注。由于目前公开信息较为有限,尚不清楚该模型是用于内部评测、特定业务对接还是第三方技术集成,双方官方也暂未对此作出正式回应与详细说明。

阅读原文 ↗推荐理由:披露了Meta产品疑似使用OpenAI定制模型的商业生态动态,引发对头部AI企业技术合作与集成的关注。# Meta# OpenAI# 大模型
Hacker News · AIAI 评分 30/10007:34

批判视角:我们庞大而愚钝的“AI神明”陷入误区

该资讯源自 Hacker News 讨论帖,探讨对当前大型 AI 系统的反思与批判。原文标题直指当下备受追捧的“AI 神明”实际上存在重大误区。由于原始素材仅提供文章链接与社区讨论入口,缺乏具体正文与论点细节,关于其具体讨论的模型缺陷、技术幻觉或产业批判内容尚无法进一步展开。

阅读原文 ↗推荐理由:文章疑似对当前过度推崇 AI/AGI 的现象进行批判反思,但因缺乏正文细节,信息参考价值有限。# 治理# 大模型# 安全
Hacker News · AI✦ 精选AI 评分 75/10006:43

从单一模型迈向复合AI系统:伯克利BAIR探讨AI系统设计新范式

该文源自伯克利人工智能研究实验室(BAIR)博客,探讨了当前人工智能技术的发展趋势正从依赖单一庞大模型,转向由多个交互组件(如检索器、工具调用和多个模型协同)构成的“复合AI系统”(Compound AI Systems)。这种系统级设计范式旨在通过工程化组合提升整体性能、降低成本并增强可控性。因提供素材仅包含链接,更多系统架构细节需参考原文。

阅读原文 ↗推荐理由:阐述了当前AI应用架构从单一LLM向复合系统/智能体演进的核心方法论,具较高启发意义。# 智能体# 大模型# RAG
Hacker News · AI✦ 精选AI 评分 60/10006:37

Wallstreetclaws 平台推出:支持创建与部署交易用 AI 智能体

开发者推出了 Wallstreetclaws.com 交易平台,使用户能够轻松创建和部署用于金融交易的 AI 智能体。该平台主要支持两类智能体:Cortex 采用大语言模型驱动,可结合系统提示词、市场数据、网络搜索及模拟市场 API 执行完全自主的交易策略;Flux 则支持通过指标、进出场条件和风控规则定义高级量化策略并进行回测。此外,平台还支持连接 Robinhood 账户并设有策略排行榜。

阅读原文 ↗推荐理由:展示了结合大语言模型与量化回测的自动化金融交易智能体应用实践。# 智能体# 金融科技# 大模型
IT之家 · AI 筛选AI 评分 55/10006:37

Anthropic 为 Claude 上线限时单次免费额度重置功能

Anthropic 宣布为 Claude 推出“限时免费额度重置”功能,该活动预计开放至 10 月 22 日。每位用户仅可免费手动重置一次每周使用额度,若触及 5 小时使用上限也会一并重置。重置操作不会改变原本的每周刷新周期,中途重置的新额度仍按原时间表到期。分析认为,此项限时福利旨在帮助用户体验模型并促进付费订阅转化。

阅读原文 ↗推荐理由:Anthropic 针对 Claude 用户推出的短期运营策略,可免费补充使用额度以促活和转化订阅。# Anthropic# Claude# 大模型