跳到正文
今天10月4日周日34 条
  1. 美团技术团队62

    美团图灵团队公开 Agent 评测实践:从评测体系到长程 Agent 演进

    美团图灵 Agent 评测团队将内部博客公开,由浅入深讲解 Agent 评测,涵盖评测是什么、如何建立评测体系,以及长程 Agent 框架带来的变化。文章提出观测加评测等于持续迭代的研发公式,主张评测需覆盖结果、过程、效率、风险四层,并给出把模糊指标下钻为二元化 Rubric、追求人人一致与人机一致的实践方法。

    推荐理由:美团图灵团队公开两年 Agent 评测实践,给出从指标下钻到人机对齐的可迁移方法论与落地路径。

  2. 美团技术团队34

    美团 GeoRA:为 RLVR 设计的 LoRA,获 ACL 2026 杰出论文

    美团与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文。它先用谱先验与欧氏先验定位 RLVR 偏好的稀疏更新区域,再用 SVD 压缩成低秩适配器并冻结残差锚点,在 1.5B 到 32B 的 Qwen 与 Llama 上于数学、医学、代码任务稳定优于低秩基线。

  3. 美团技术团队38

    美团智播:数字人直播技术创新与实践

    美团智播是面向本地生活场景的AI数字人直播解决方案,支持真人1:1复刻与门店实景定制,30秒生成直播素材、3分钟完成开播配置,7×24小时稳定上播。过去一年其月日均GTV同比增长82.12%,月日均观看人次同比增长163.44%,开播场次提升11倍。

  4. 美团技术团队38

    美团技术团队《Agent 评测白皮书》系列01:Agent 评测全览

    美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备的 Agent 评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因相互咬合。四个模块中离线评测作为变更门控,依赖固定评测集与贴近生产的执行环境。

  5. 美团技术团队34

    美团 MTFM:统一推荐基座大模型在外卖多业务场景的落地实践

    美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 通过异构 Tokenizer、动态掩码、混合注意力与 Target Scale-Up 等设计应对规模可扩展性、场景可延展性与架构高效性挑战,外卖多业务订单量提升 2.06%~6.68%,推理成本降低 24%。

  6. 量子位62

    马斯克确认与台积电洽谈Terafab芯片制造合作

    10月3日,马斯克在X上确认正在与台积电讨论Terafab芯片制造合作,称只是讨论但可能会有结果。Terafab由Tesla、SpaceX和xAI共同推进,一期投资168亿美元,长期潜在总投资可达1190亿美元,最终目标年产约1TW AI算力。此前英特尔是唯一被正式点名的合作伙伴,计划提供14A工艺,媒体披露台积电可能以直接运营、SpaceX控股或纯技术合作三种方式参与。

  7. 量子位38

    最火AI岗位FDE:月薪5万,Anthropic投1亿美元培训1万名FDE

    Anthropic宣布投资1亿美元在2027年底前培训1万名FDE(前线部署工程师),OpenAI带40亿美元成立部署公司,AWS拿出10亿美元组建FDE部门。海外公开薪资的FDE岗位基本年薪中位数约20万美元,国内大厂也开出月薪三五万的招聘,Kimi联合IT服务商共建FDE队伍,腾讯云推出FDE工程师认证。

  8. 新智元80

    何恺明团队VISTA论文:让Claude在ARC-AGI-3拿满分

    何恺明团队在arXiv发布VISTA论文,把ARC-AGI-3官方给模型的64×64数字表换成图片,并加入可随时调用的无损视觉记忆相册,Claude Opus 5在25个公开游戏全部183关拿到满分,GPT-5.6 Sol拿到99分。

    推荐理由:何恺明团队用视觉输入加无损视觉记忆替代数字表,让同一模型在ARC-AGI-3上从40分升至满分,可看方法迁移思路。

  9. Simon Willison36

    Simon Willison:按量付费服务需要默认硬性预算上限,AWS 已推出支出限额

    Simon Willison 呼吁按量付费的 API 和服务默认设置硬性预算上限,即达到 $X/月后直接切断并返回错误,而非仅发送警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目达到限额后当月暂停,但该功能目前仅向有限客户开放;Google Cloud 则在 7 月推出类似的 Spend Caps。

  10. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的回答。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非回答文本判分,并给出 20 次重复下的稳定性与成本对比。

  11. Simon Willison8

    Simon Willison 发布九月赞助者专属通讯

    Simon Willison 已发送九月赞助者专属月度通讯,订阅者可通过链接访问。本期内容涵盖更多 Fable 级模型、一场价格战、3D 图形与 Blender、LLM 进军数学领域、更多意外网络攻击、Datasette 漏洞危机、作者当前使用工具、本月软件发布以及 2026 年 LLM 进展回顾。订阅费用为 $10/月,可提前一个月获取免费版内容。

  12. TechCrunch · AI60

    OpenAI 安全员工 David Robinson 离职,称公司文化已崩坏

    在 OpenAI 工作三年半、负责撰写重大产品发布安全报告的 David Robinson 宣布离职,称公司文化已经崩坏。他在 The Atlantic 的文章中表示,OpenAI 依靠试错式迭代部署,这种方式必然带来周期性失败,而随着系统能力提升,失败规模也在扩大,并以 OpenAI 智能体入侵 Hugging Face 系统、发现更多失控智能体为例。

10月3日周六