跳到正文
10月4日周日
  1. 美团技术团队62

    美团图灵团队公开 Agent 评测实践:从评测体系到长程 Agent 演进

    美团图灵 Agent 评测团队将内部博客公开,由浅入深讲解 Agent 评测,涵盖评测是什么、如何建立评测体系,以及长程 Agent 框架带来的变化。文章提出观测加评测等于持续迭代的研发公式,主张评测需覆盖结果、过程、效率、风险四层,并给出把模糊指标下钻为二元化 Rubric、追求人人一致与人机一致的实践方法。

    推荐理由:美团图灵团队公开两年 Agent 评测实践,给出从指标下钻到人机对齐的可迁移方法论与落地路径。

  2. 美团技术团队38

    美团智播:数字人直播技术创新与实践

    美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。

  3. 美团技术团队38

    美团技术团队《Agent 评测白皮书》系列01:Agent 评测全览

    美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备的 Agent 评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因相互咬合。四个模块中离线评测作为变更门控,依赖固定评测集与贴近生产的执行环境。

10月3日周六
10月2日周五
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作方式,GitHub 给出三项值得强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。

  2. AWS Machine Learning Blog22

    如何在 AWS 上为 Claude Platform 配置多环境访问

    AWS 博客给出 Claude Platform on AWS(CPonAWS)多环境访问的完整配置方案,采用专用 AI Services 账户加工作负载账户的三账户结构。AWS 工作负载通过跨账户 SigV4 免密钥调用推理,开发者用绑定开发工作区的 API key,外部环境则通过 OIDC 联邦获取短期凭证。生产与开发流量以 workspace 隔离,共享同一订阅。

10月1日周四
9月30日周三
  1. AWS Machine Learning Blog22

    Amazon Quick 提示词工程基础指南

    Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,适用于构建自定义智能体、编写自动化流程和对话式数据分析。文章提出核心原则:以具体细节消除歧义、用业务上下文校准输出、用示例代替描述,并给出适用于复杂请求的 CRISPE 结构化框架。

  2. AWS Machine Learning Blog22

    Amazon Quick 各组件提示词工程:模式与陷阱

    AWS 博客按组件拆解 Amazon Quick 的提示词写法:Quick Research 需明确目标、受众与范围,并自行拆解子问题、限定数据源;Quick Flows 要写清时间、数据源与输出格式,复杂逻辑用编号步骤,并可通过对话迭代修改。Quick Sight 的查询则需包含业务问题、指标、维度与可视化偏好。

9月29日周二
9月26日周六
9月25日周五
9月24日周四
9月17日周四
  1. GitHub Blog · AI & ML78

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 Copilot 应用和 CLI 把 Copilot 智能体运行时从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个 PR 中增量合并,而非一次性切换。

    推荐理由:一位工程师复盘用 Copilot 智能体把运行时从 TypeScript 迁到 Rust 的全过程,含并发会话协作与提示缓存数据。

9月16日周三
9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML30

    GitHub Copilot 应用新手指南:使用 diff、终端与浏览器面板

    GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行并预览 AI 智能体生成的代码改动。diff 面板以绿色和红色高亮显示新增与删除行,支持接受改动、留言或让 Copilot 继续修改;终端面板可直接运行项目命令,浏览器面板则通过 Pick & Polish 工具选中页面元素并让智能体调整。

9月10日周四
9月9日周三
  1. Mistral AI51

    Mistral 用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用自定义解析器生成调用树并派出上百个智能体补文档,再以规划、编码、测试、审查加人工检查点的结构化流程逐模块迁移。Mistral 总结出三条经验:先建对齐测试再写迁移代码、先整理文档再交给智能体、结构化工作流加人工审查优于完全自主。

9月3日周四
8月26日周三
8月25日周二
  1. Hugging Face Blog62

    IBM 发布 Granite 4.2 推理模型家族:3B、8B、30B 三档,Apache 2.0 开源

    IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,基于 Granite-4.1 基座后训练而来,全部以 Apache 2.0 许可开源。

    推荐理由:原文完整披露了 Granite 4.2 的预训练、SFT 数据配比与多阶段 RL 细节,可据此了解推理模型在智能体环境中的训练路径。

  2. Hugging Face Blog66

    Gradio 推出 gr.Workflow,把 AI 流水线变成可拖拽画布与 REST API

    Hugging Face 在 Gradio 中内置 gr.Workflow,把多步 AI 流水线描述为带类型端口的节点图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见。

    推荐理由:Gradio 把多步 AI 流水线做成可拖拽的图,并自动暴露 REST 接口,读者可据此判断现有 Python 脚本的改造方式。

8月21日周五
8月18日周二
  1. Hugging Face Blog60

    Sentence Transformers v6.0 新增 MultiVectorEncoder 支持晚交互检索

    Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。

    推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。