跳到正文
今天10月4日周日4 条
  1. 美团技术团队62

    美团图灵团队公开 Agent 评测实践:从评测体系到长程 Agent 演进

    美团图灵 Agent 评测团队将内部博客公开,由浅入深讲解 Agent 评测,涵盖评测是什么、如何建立评测体系,以及长程 Agent 框架带来的变化。文章提出观测加评测等于持续迭代的研发公式,主张评测需覆盖结果、过程、效率、风险四层,并给出把模糊指标下钻为二元化 Rubric、追求人人一致与人机一致的实践方法。

    推荐理由:美团图灵团队公开两年 Agent 评测实践,给出从指标下钻到人机对齐的可迁移方法论与落地路径。

  2. 美团技术团队38

    美团智播:数字人直播技术创新与实践

    美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。

  3. 美团技术团队38

    美团技术团队《Agent 评测白皮书》系列01:Agent 评测全览

    美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备的 Agent 评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因相互咬合。四个模块中离线评测作为变更门控,依赖固定评测集与贴近生产的执行环境。

10月3日周六
  1. 机器之心62

    Karpathy 分享用 40 年前航空规范 ASD-STE100 让大模型输出更清晰

    Karpathy 分享了一组让大模型输出更易读的技巧,核心是把 40 年前欧洲航空业的受控英语规范 ASD-STE100 交给 LLM,其最新 Issue 9 含 53 条写作规则、约 900 个批准基础词和约 1200 个建议避免的词,要求一句指令控制在 20 词以内、一句话只安排一个操作、多用主动语态、同一概念只用同一个名字。

10月2日周五
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作方式,GitHub 给出三项值得强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。

  2. 机器之心22

    将经验存到权重更能帮助 LLM 获得长期记忆吗?清华唐杰团队系统梳理模型内部记忆机制

    清华唐杰团队在「Memory For LLM」工作中,从信息保存形式、更新方式、持续时长三个维度系统梳理了 LLM 模型层面的记忆机制。此前 TTT Layers、Titans、MemoryLLM 分别尝试用快速权重、可更新神经记忆模块和固定大小记忆池将历史信息写入模型内部,但信息写入权重后仍可能被新任务覆盖。

9月26日周六
9月25日周五
9月24日周四
9月17日周四
  1. GitHub Blog · AI & ML78

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 Copilot 应用和 CLI 把 Copilot 智能体运行时从 TypeScript 完全重写为超过 80 万行生产级 Rust,代码主要由 AI 智能体编写,分布在 128 个 PR 中增量合并,而非一次性切换。

    推荐理由:一位工程师复盘用 Copilot 智能体把运行时从 TypeScript 迁到 Rust 的全过程,含并发会话协作与提示缓存数据。

9月12日周六
9月9日周三
  1. Mistral AI51

    Mistral 用 AI 智能体迁移 4 万行 Fortran 77 遗留代码

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用自定义解析器生成调用树并派出上百个智能体补文档,再以规划、编码、测试、审查加人工检查点的结构化流程逐模块迁移。Mistral 总结出三条经验:先建对齐测试再写迁移代码、先整理文档再交给智能体、结构化工作流加人工审查优于完全自主。