跳到正文

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

最新精选

第 21–40 条 · 共 72 条
9月30日周三
  1. Google Developers · AI 筛选71

    Google 发布零信任 AI 智能体安全架构实践

    Google 开发者博客发布基于 Agent Development Kit(ADK)与 Gemini 构建零信任 AI 智能体的工程实践方案,并开源了 zero-trust-agents 示例仓库。

    推荐理由:文章给出了密码学写入签名、gVisor 沙箱与确定性语义网关的三层防御方案,展示了如何用硬性工程约束替代脆弱的提示词防护。

  2. Google Developers · AI 筛选63

    如何在 Google ADK 中评测实时语音智能体

    Google 在 ADK 中引入了原生实时评测功能,支持利用模拟用户以音频交互驱动实时语音智能体并自动打分。评测体系支持动态情景模拟与固定脚本两种用例,结合 Gemini TTS 合成多种音色输入,并通过基于规则的 LLM 评委对多轮轨迹和工具调用质量进行判定。开发者可通过 CLI 运行评测将其接入 CI/CD 流程,也可在 ADK Web 中查看逐轮文字转录与可内嵌播放的音频回放。

    推荐理由:文章演示了在 ADK 中通过模拟用户与 LLM 裁判端到端评测实时语音智能体的工作流,便于开发者将语音交互测试接入工程化流水线。

  3. Google Developers · AI 筛选73

    Google 总结 AI 智能体挑战赛优秀作品的 4 个核心工程模式

    Google for Startups 在 AI 智能体挑战赛收官后,总结了表现优异的多智能体方案所采用的 4 项关键工程架构模式。核心模式包括通过双向 MCP 将自身推理能力暴露为供其他智能体调用的服务、采用异步事件总线避免串行调用链累积延迟、对主备降级模型强制执行统一逻辑校验,以及利用低成本判定与正则分流降低推理开销。

    推荐理由:归纳了多智能体工程中双向 MCP 与事件驱动等架构细节,为开发者优化延迟与推理成本提供了可直接复用的方案。

  4. Google Developers · AI 筛选72

    Google 解析 Harness 工程:如何评测、迭代与守护 AI 编码智能体

    Google 开发者团队分享了针对 AI 编码智能体的 Harness 工程实践,主张引入细粒度行为评测(Behavioral Evaluation)来替代单纯依赖端到端大盘基准打分。

    推荐理由:文章拆解了 AI 编码智能体从端到端打分转向中间行为断言的评测框架,为工程团队防范提示词调整与模型升级中的行为退化提供了可落地的方法。

  5. Cerebras 官方博客(网页)77

    Cerebras 如何实现 GPT-5.6 Sol 高达每秒 750 tokens 的高速推理

    Cerebras 通过其 WSE-3 晶圆级芯片支持 OpenAI GPT-5.6 Sol 的 Ultrafast 模式,在不降低精度、不蒸馏且不改变权重的条件下实现了高达 750 output tokens/s 的推理速度。

    推荐理由:文章详细拆解了晶圆级芯片利用片上超大带宽 SRAM 消除显存墙以实现高速大模型推理的硬件架构与工程实现。

  6. Cerebras 官方博客(网页)66

    Cerebras 详解用自然语言 AI 智能体自动化测试云控制台的实践

    Cerebras 详细介绍了其内部构建的端到端测试框架 console-prompt-tests,使用纯自然语言描述测试用例,并由大语言模型智能体通过 Playwright MCP 协议驱动真实浏览器完成交互与校验。

    推荐理由:原文详细拆解了用自然语言智能体驱动浏览器测试与自动修复前端漂移的架构,为研发团队重构端到端测试流程提供了可落地的参考。

  7. vLLM 官方博客(网页)69

    vLLM 在 AMD GPU 上的投机解码实践指南与性能实测

    vLLM 官方发布在 AMD Instinct MI300X 与 MI355X GPU 上实现投机解码的实践指南与评测结果,系统评估了单次目标模型前向验证多个草稿 token 的加速效果。

    推荐理由:文章详细对比了五种投机解码机制在不同模型与负载下的吞吐表现,为大模型推理加速与参数调优提供了可迁移的工程参考。

  8. vLLM 官方博客(网页)69

    vLLM 团队基于 GB300 NVL72 与 Mooncake 训练 Kimi K3 的 DSpark 投机草稿模型

    vLLM 团队通过 Speculators 训练库与 Mooncake 传输引擎,在 Verda 提供的 GB300 NVL72 机架上完成了 2.8T 参数 Kimi K3 模型的 DSpark 投机草稿模型训练与部署。

    推荐理由:原文给出了基于 Mooncake 跨节点传输隐藏状态训练超大模型投机草稿模型的完整拓扑,读者可直接参考其多机训练与部署配置。

  9. vLLM 官方博客(网页)65

    vLLM 详解 Qwen3.8-2.4T 的 PD 分离推理优化实践

    vLLM 在 GB300 NVL72 集群上实现了千问 Qwen3.8-2.4T 的 Prefill-Decode(PD)分离式推理优化,在 8K/1K 负载下达成单 GPU 5000 token/s 吞吐量以及每用户 180 token/s 的交互速率。

    推荐理由:文章系统拆解了超大混合架构模型在显卡上的显存预算计算与拓扑选择,为超大规模模型落地分离式推理提供了可复用的调优方法论。

  10. vLLM 官方博客(网页)66

    深入解析 vLLM:高吞吐大语言模型推理系统的架构剖析

    vLLM 官方博客发布技术长文深度剖析其 V1 推理引擎,系统拆解从单卡底层内核到大规模分布式服务的完整架构。文章详细解读了调度器运行机制、PagedAttention 内存分配与连续批处理流程,并深入探讨分块 Prefill、前缀缓存、基于有限状态机的引导解码、推测解码以及 Prefill/Decode 分离等高级特性。

    推荐理由:文章从单机引擎内核层层拆解到多节点分布式服务,为理解和优化高吞吐大模型推理系统提供了完整清晰的架构参考。

  11. Google Developers · AI 筛选65

    Google 详解如何构建面向意图判断的零信任 AI Agent 运行时安全体系

    Google 发布零信任 AI Agent 系列第二篇指南,介绍如何将安全边界从代码级检查迁移至平台运行时治理。方案通过 Model Armor 在边缘拦截提示词注入与敏感数据,利用基于大模型的语义治理策略(Semantic Governance Policies)在工具调用前校验业务意图,并通过 Agent 异常检测捕获多轮会话攻击并实现无须重构代码的闭环修复。

    推荐理由:原文给出了结合边缘过滤语义治理与多轮异常检测的 Agent 运行时防护架构读者可直接参考开源示例提升系统的安全性。

  12. Google Developers · AI 筛选63

    Google 基于 MaxText 与 TPU 完整复现 Olmo 3 7B 预训练流程

    Google 团队使用基于 JAX 的 MaxText 框架与 Cloud TPU,从头完整复现了 Ai2 的 Olmo 3 7B 第一阶段约 5.9T token 预训练与第二阶段 mid-training 退火训练。

    推荐理由:原文系统复盘了在 TPU 上复现 PyTorch 大模型预训练的工程细节与性能调优,读者可据此参考跨框架对齐与断点续训的验证方法。

9月29日周二
  1. Sebastian Raschka75

    文本分类语言模型发展史:从词袋模型到通用决策模型 Jev

    Sebastian Raschka 系统梳理了从传统词袋模型、RNN、CNN、BERT 到当前通用决策模型 Jev 的文本分类技术演化历程。实测显示 TypeSafe AI 推出的 Jev 在 IMDb 测试集上达到 96.47% 准确率,具备远低于大模型的推理延迟和调用成本,其核心优势来自高质量合成数据训练与面向决策校准的强化学习(RLCD)。

    推荐理由:文章梳理了文本分类架构演进脉络,拆解了通用决策模型实现低延迟与概率校准的技术路径,适合作为分类与 Agent 路由优化的参考。

  2. GitHub Blog · AI 与安全74

    GitHub 团队分享如何用开源 AI 安全智能体挖掘 24 个 Android 漏洞

    GitHub Security Lab 介绍了利用开源 Taskflow Agent 审计 Android 应用并挖掘出 24 个漏洞的实践方法与案例。研究人员通过拆分识别入口点与定向排查漏洞两类 YAML 提示词工作流,成功发现了 OsmAnd 隐私追踪和维基百科应用账户接管等高危漏洞。

    推荐理由:文章分享了利用分步任务流引导大模型挖掘移动端漏洞的实操流程,并客观指出了模型评估漏洞严重性时的局限。

9月26日周六
  1. GitHub Blog · AI 与安全70

    GitHub Copilot 教程:如何使用画布构建自定义工作流

    GitHub Copilot 现支持通过 /create-canvas 技能利用自然语言描述直接生成双向交互画布,用于搭建看板、Issue 分流板或发布清单等工作流界面。用户与 AI 智能体可以实时共享并修改画布状态,无需手动编写布局代码即可同步更新数据。生成的画布支持保存为扩展在团队内复用,社区也已在 Awesome Copilot 中提供了一系列开箱即用的预设模板。

    推荐理由:文章介绍了用自然语言生成双向交互界面的方法,开发者可据此将单向命令交互改造为可实时协同的看板工作流。

9月11日周五
9月10日周四
  1. Hugging Face70

    Hugging Face 展示基于 Storage Bucket 与代理的跨节点 LoRA 异步 GRPO 训练实践

    Hugging Face 在 TRL v1.14 中为 AsyncGRPOTrainer 增加了 LoRA 适配器同步支持,使训练节点与 vLLM 推理副本无需跨机 NCCL 即可跨节点独立运行。

    推荐理由:原文展示了无需 NCCL 跨机通信的异步 GRPO 架构实现与调优细节,读者可据此排查强化学习训练与推理流水线的吞吐瓶颈。

9月9日周三
  1. Sebastian Raschka71

    解析 GPT-6 Astra、循环 Transformer 与隐式推理机制

    Sebastian Raschka 针对 OpenAI GPT-6 Astra 的实测表现、循环 Transformer 架构原理及其对思考链长度的影响展开系统拆解。文章指出循环架构通过重复通过共享 Transformer 块增加有效计算深度而不增加参数量,但并不会节省 KV 缓存。Astra 思考链缩短主要源于模型能力提升减少了回溯与试错,并非架构刻意隐瞒推理过程。

    推荐理由:文章从权重复用与计算图深度拆解循环架构,澄清了内部计算扩展与外显思考链变短的技术机理。