美团图灵团队公开 Agent 评测实践:从评测体系到长程 Agent 演进
美团图灵 Agent 评测团队将内部博客公开,由浅入深讲解 Agent 评测,涵盖评测是什么、如何建立评测体系,以及长程 Agent 框架带来的变化。文章提出观测加评测等于持续迭代的研发公式,主张评测需覆盖结果、过程、效率、风险四层,并给出把模糊指标下钻为二元化 Rubric、追求人人一致与人机一致的实践方法。
推荐理由:美团图灵团队公开两年 Agent 评测实践,给出从指标下钻到人机对齐的可迁移方法论与落地路径。
美团图灵 Agent 评测团队将内部博客公开,由浅入深讲解 Agent 评测,涵盖评测是什么、如何建立评测体系,以及长程 Agent 框架带来的变化。文章提出观测加评测等于持续迭代的研发公式,主张评测需覆盖结果、过程、效率、风险四层,并给出把模糊指标下钻为二元化 Rubric、追求人人一致与人机一致的实践方法。
推荐理由:美团图灵团队公开两年 Agent 评测实践,给出从指标下钻到人机对齐的可迁移方法论与落地路径。
美团搜索团队将 LLM 语义表征引入服务零售精排,用 Query、POI、Deal 的语义向量 cosine 相似度分桶后注入排序模型,三期实践均已完成全量上线。
美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。
美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备的 Agent 评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因相互咬合。四个模块中离线评测作为变更门控,依赖固定评测集与贴近生产的执行环境。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备相应工作流。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提出合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言问题翻译为固定类型操作并叙述结果。
Amazon Bedrock AgentCore Gateway 可将 Claude Desktop 接入 Web Search,突破模型训练知识截止限制,查询流量全程留在 AWS 基础设施内,无需外部 API key。
AWS 团队在 Amazon SageMaker AI 上用多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,仅调整 max_epochs、global_batch_size、rollout_max_concurrency 三个超参数,其余走默认值。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
AWS Professional Services 用四个智能体组成的模式,把每应用 3 到 4 周的 IaC 开发时间缩短到几分钟,该模式基于 Strands Agents SDK 构建、运行在 Amazon Bedrock AgentCore 上,通过 AgentCore Gateway 暴露的 MCP 工具连接源与目标。
NVIDIA NeMo Agent Toolkit(NAT)可将 Amazon S3 Vectors 作为自定义持久记忆后端,实现语义检索、强写一致性和单索引最高 20 亿向量的弹性扩展。
Amazon Payments 在 Amazon SageMaker AI 上用多目标上下文多臂老虎机(LinUCB)做获客漏斗个性化,七周线上 A/B 测试中,一个人群最终漏斗转化率取得高个位数相对提升,另一人群则未见改善。
Amazon Bedrock AgentCore 支持构建"环境智能体"(ambient agent):它监听 Amazon S3 事件通知、EventBridge 规则、Lambda 触发器等事件流并自动执行任务,需要时通过单个 ask_human 工具暂停等待人工审批,再从中断处恢复。
AWS 博客给出 Claude Platform on AWS(CPonAWS)多环境访问的完整配置方案,采用专用 AI Services 账户加工作负载账户的三账户结构。AWS 工作负载通过跨账户 SigV4 免密钥调用推理,开发者用绑定开发工作区的 API key,外部环境则通过 OIDC 联邦获取短期凭证。生产与开发流量以 workspace 隔离,共享同一订阅。
uniopen 通过 Amazon SageMaker AI 对 Amazon Nova 2 Lite 进行监督微调,并做提示词层面的输出优化,使其适配自身零售审核策略。
Amazon Bedrock Knowledge Bases 可通过 AgenticRetrieveStream API 用自然语言查询理赔文档并返回带引用的答案。
AWS 官方博客给出在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线的完整教程,三个智能体分别负责作曲、交付与合规审查,通过同一 runtimeSessionId 共置在一台 GPU 实例上共享文件系统协作。
Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,适用于构建自定义智能体、编写自动化流程和对话式数据分析。文章提出核心原则:以具体细节消除歧义、用业务上下文校准输出、用示例代替描述,并给出适用于复杂请求的 CRISPE 结构化框架。
AWS 博客按组件拆解 Amazon Quick 的提示词写法:Quick Research 需明确目标、受众与范围,并自行拆解子问题、限定数据源;Quick Flows 要写清时间、数据源与输出格式,复杂逻辑用编号步骤,并可通过对话迭代修改。Quick Sight 的查询则需包含业务问题、指标、维度与可视化偏好。
基于 Amazon Quick 与 Amazon Bedrock AgentCore 的合同智能平台,用 AI 智能体从合同 PDF 中提取字段并交叉验证,解决 RAG 无法跨数百份合同做聚合统计的问题。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,并选用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本。
GitHub Copilot app 的 canvases 是一种可自定义界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述工作流,agent 即可生成看板、清单或仪表盘等界面。
GitHub Copilot 提出 canvas 概念:一种运行在 GitHub Copilot app 内、无浏览器外壳的全栈应用,可与 agent 双向通信,也能调用第三方 API 并在本地执行代码。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2,200 个文件、超百万行改动和 400 多条行内评论的开源 PR 做压力测试。它把文档高度拆成确定性的代码几何与动态评论块两套体系,评论高度按需测量并锚定到文件、行和侧,避免滚动跳变。
GitHub 用 Copilot 应用和 CLI 把 Copilot 智能体运行时从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个 PR 中增量合并,而非一次性切换。
推荐理由:一位工程师复盘用 Copilot 智能体把运行时从 TypeScript 迁到 Rust 的全过程,含并发会话协作与提示缓存数据。
OpenAI 介绍如何通过 ChatGPT Work 和 Codex 的分析功能,帮助团队了解 AI 使用量与支出情况、识别培训需求,并将 AI 采用情况与业务成果关联起来。
GitHub 日韩市场负责人用 GitHub Copilot 把活动营销流程自动化:以 GitHub Issue 为工作单元,Issue forms 收集结构化字段,标签触发 GitHub Actions 工作流,自动完成落地页复制、UTM 链接生成、报名名单清洗与 CRM 导出。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,支撑超 10 亿 ChatGPT 用户、每秒 2200 万次请求。
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行并预览 AI 智能体生成的代码改动。diff 面板以绿色和红色高亮显示新增与删除行,支持接受改动、留言或让 Copilot 继续修改;终端面板可直接运行项目命令,浏览器面板则通过 Pick & Polish 工具选中页面元素并让智能体调整。
César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药性感染。
TRL v1.14 的 AsyncGRPOTrainer 现已支持只训练并同步 LoRA adapter 到 vLLM,rank-1 adapter 仅几 MB,可通过挂载在多个 HF Jobs 上的 Storage Bucket 传递,无需 NCCL。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用自定义解析器生成调用树并派出上百个智能体补文档,再以规划、编码、测试、审查加人工检查点的结构化流程逐模块迁移。Mistral 总结出三条经验:先建对齐测试再写迁移代码、先整理文档再交给智能体、结构化工作流加人工审查优于完全自主。
Hugging Face 博主用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型用 p5.brush 写 JavaScript 画水彩画的创意,参考图池、RL 环境、训练脚本和模型全部开源。
一份公开的低成本方案用 TRL 的 GRPO 对 LFM2.5-350M 做微调,仅约 500 条样本、100 个训练步,在 IFStruct 基准上把通过率从 22.6% 提升到 29.7%。微调可在免费版 Colab 或 Kaggle GPU 上完成,评测则通过 llama.cpp 在本地 MacBook 上运行,代码已开源在 GitHub。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,并配套完整训练方案。
推荐理由:原文给出多向量检索模型的完整微调配方与实测对比,读者可据此判断自己领域是否值得自训。
loveholidays 借助 OpenAI Codex 让公司各团队都能参与软件开发,把想法更快变成产品。该案例展示了 Codex 如何降低开发门槛,使非工程岗位也能动手构建。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,基于 Granite-4.1 基座后训练而来,全部以 Apache 2.0 许可开源。
推荐理由:原文完整披露了 Granite 4.2 的预训练、SFT 数据配比与多阶段 RL 细节,可据此了解推理模型在智能体环境中的训练路径。
Hugging Face 在 Gradio 中内置 gr.Workflow,把多步 AI 流水线描述为带类型端口的节点图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见。
推荐理由:Gradio 把多步 AI 流水线做成可拖拽的图,并自动暴露 REST 接口,读者可据此判断现有 Python 脚本的改造方式。
Papers with Code 采用混合搜索系统,用 PostgreSQL 全文检索加 pgvector 向量召回,并通过 RRF 融合两路结果。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。
推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。