LEGO-Anything 用编码智能体从单张照片生成 Blender 3D 场景
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片迭代编写可执行的 Blender 程序,从而显式记录物体、几何、布局和相机位置,场景可像代码一样运行、检查和修改。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片迭代编写可执行的 Blender 程序,从而显式记录物体、几何、布局和相机位置,场景可像代码一样运行、检查和修改。
Clay 联合创始人兼 CEO Kareem Amin 将在 TechCrunch Disrupt 2026 的 AI Stage 发表演讲,主题为“GTM 工程师:AI 如何创造科技业下一个大职位类别”。
Circuit Breaker Labs 打造了一支"碰撞测试假人"式的 AI 智能体队伍,模拟不同年龄、背景、语言和文化的用户,对模型进行红队测试,每天运行数万到数十万次模拟对话,并用专有评分方法给出可审计、可解释的分数。
美团正式上线全场景 AI Agent 平台 CatPaw,搭载本月开源的 LongCat 2.0(总参数 1.6T,原生支持 1M 上下文),提供 AI 智能工作台与企业级 Agent 开发托管能力。
推荐理由:原文给出 CatPaw 的多端协作、专家技能与托管能力,读者可据此判断企业级 Agent 平台的落地形态。
美团图灵 Agent 评测团队将内部博客公开,由浅入深讲解 Agent 评测,涵盖评测是什么、如何建立评测体系,以及长程 Agent 框架带来的变化。文章提出观测加评测等于持续迭代的研发公式,主张评测需覆盖结果、过程、效率、风险四层,并给出把模糊指标下钻为二元化 Rubric、追求人人一致与人机一致的实践方法。
推荐理由:美团图灵团队公开两年 Agent 评测实践,给出从指标下钻到人机对齐的可迁移方法论与落地路径。
美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、跨域 ETA 元泛化框架 UME、自动竞价模型 GRAD、生成式推荐训练系统 MTGenRec 等方向。
美团技术团队发布《Agent 评测白皮书》系列第一篇《评测全览》,提出完备的 Agent 评测体系可概括为四个模块、三种能力、两条 Loop、一套资产。两条 Loop 分别为评测体系迭代 Loop 与 Agent 迭代 Loop,二者共享线上真实样本,通过 Case 挖掘与归因相互咬合。四个模块中离线评测作为变更门控,依赖固定评测集与贴近生产的执行环境。
Anthropic宣布投资1亿美元在2027年底前培训1万名FDE(前线部署工程师),OpenAI带40亿美元成立部署公司,AWS拿出10亿美元组建FDE部门。海外公开薪资的FDE岗位基本年薪中位数约20万美元,国内大厂也开出月薪三五万的招聘,Kimi联合IT服务商共建FDE队伍,腾讯云推出FDE工程师认证。
何恺明团队在arXiv发布VISTA论文,把ARC-AGI-3官方给模型的64×64数字表换成图片,并加入可随时调用的无损视觉记忆相册,Claude Opus 5在25个公开游戏全部183关拿到满分,GPT-5.6 Sol拿到99分。
推荐理由:何恺明团队用视觉输入加无损视觉记忆替代数字表,让同一模型在ARC-AGI-3上从40分升至满分,可看方法迁移思路。
新加坡南洋理工大学安波教授团队发布报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》。
量子位报道,AI 3D 生成公司 Meshy 披露其 ARR 从 100 万美元增长至 1 亿美元,用时不到两年,快于 HeyGen 的 29 个月。文章用同一张参考图对比 GPT-6 Astra 与 Meshy 的生成结果,指出通用模型擅长 CAD、参数化建模等几何任务,而角色、复杂道具仍需专业 3D 模型。
DeepSeek Harness 发布 v0.2.1-alpha.1,新增实验性 Claude Code Mods 兼容层,让按 Claude Code Mods 接口编写的扩展有机会接入 DSH 插件系统运行。
Simon Willison 呼吁按量付费的 API 和服务默认设置硬性预算上限,即达到 $X/月后直接切断并返回错误,而非仅发送警告邮件。他指出 AWS 已在 9 月 16 日推出月度支出限额功能,项目达到限额后当月暂停,但该功能目前仅向有限客户开放;Google Cloud 则在 7 月推出类似的 Spend Caps。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的回答。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非回答文本判分,并给出 20 次重复下的稳定性与成本对比。
Capcom 程序员 Satoshi Ishida 在 Capcom Open Conference RE: 2026 上表示,将把 AI 技术整合进开发流程,逐步把 RE Engine 改造成“AI 生成游戏引擎”,目标是实现“与 AI 共同创作游戏”的未来。Capcom 此前称不会在游戏中使用 AI 生成素材,而是用 AI 提升开发效率。
越来越多 AI 智能体无需下载 App,直接通过短信或 iMessage 接收任务并代为执行,涵盖日程安排、预订、邮件和购物等。Instinct 在 9 月完成 10 亿美元融资、估值达 100 亿美元,并开始为用户分配专属邮箱地址、支持代打电话,目前仍处私测阶段。
DeepMind 研究人员提出"人工共生智能"(Artificial Symbiotic Intelligence)概念,主张 AI 研究的核心挑战是协调由智能体、人和连接系统组成的复杂网络,而非构建孤立的机器智能。
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源 harness BootLoops,用于让 Claude 完成精确科学计算,源码已在 GitHub 公开。
AINews 汇总 10 月 1 日至 2 日的 AI 动态:OpenAI 发布 GPT-6.1 Sol,定价为每百万输入/输出 token 2 美元和 10 美元,据称在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分,Agent Arena 中 Sol [Max] 以每任务 0.56 美元中位成本进入第 5 名,比 GPT-6 Sol 便宜 39%。
DeepSeek 弹性计算团队大量招聘,尤其需要资深工程师,并同步公开技术分享《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》。
剑桥大学 AI 科学与政策项目 9 月 28 日发布论文,22 位署名者包括 Geoffrey Hinton、Yoshua Bengio、Andrew Barto 三位图灵奖得主,以及 OpenAI 首席科学家 Jakub Pachocki 与 Anthropic 联合创始人 Jack Clark,警告 AI 研发全面走向 RSI 自动化可能引发智能爆炸。
Karpathy 分享了一组让大模型输出更易读的技巧,核心是把 40 年前欧洲航空业的受控英语规范 ASD-STE100 交给 LLM,其最新 Issue 9 含 53 条写作规则、约 900 个批准基础词和约 1200 个建议避免的词,要求一句指令控制在 20 词以内、一句话只安排一个操作、多用主动语态、同一概念只用同一个名字。
TypeSafe AI 联合创始人兼 CEO Diogo Almeida 在 Latent Space 访谈中表示,Jev 日处理量已突破一万亿 token,夜间流量持续走高,说明大量调用来自机器自动化。
9 月 30 日,上海 AI 公司 StartLux(原点星辉)发布完全开源的决策模型 StartLux-Decision,推出 0.8B、2B、4B、9B 和 27B 五档版本并提供本地部署量化模型。
Meta 发布开源项目 Muse Gadgets,提供开源固件和 Linux SDK,让开发者用 Raspberry Pi 或 ESP32 等低成本硬件连接其个人 AI 智能体 Muse,并给出彩色电子墨水屏、HDMI 电视棒等项目示例,同时开设 Discord 频道支持用户。
Meta 推出开源项目 Muse Gadgets,开发者可用 ESP32 开发板运行 Muse 固件,或通过 Linux SDK 在树莓派 5 等边缘设备上运行 Muse 客户端,并访问 gadgets.muse.ai 领取 API Token。
Meta 开源了相关代码,允许用户自制搭载其新 AI 智能体 Muse 的硬件设备。官方建议的玩法包括把 Muse 装到彩色 E Ink 屏上显示提醒、接入 HDMI 棒在大屏上显示,或放到小尺寸触屏设备上做成类似 DIY Muse Charm 的形态。
Apple 宣布将在 macOS 上为全盘访问权限增加新限制,要求用户通过非常明确的主动操作才能授予应用这一权限。Apple 表示,部分开发者使用全盘访问的方式可能让用户面临风险,暴露文件、邮件、信息和浏览历史,而随着 AI 智能体能力与自主性增强,这类访问带来的风险会大幅上升。该限制的推出时间尚未公布,此前有报道称 Meta 的 Muse AI 在未获明确授权的情况下读取了用户信息内容。
苹果宣布将在 macOS 上为“完全磁盘访问”引入新的控制措施,要求用户在非常明确的操作下才能授予应用这一权限。苹果称该设置原本是为备份功能设计,但 AI 智能体增加了这一访问级别的风险,部分开发者使用该权限的方式可能让用户系统上的所有内容在不知情的情况下暴露。
The Verge 记者 Allison Johnson 实测了 OpenAI 本周发布的智能体平台 Dots,它拥有可自定义名字的拟人化头像,界面与 Meta Muse 类似,但定位更偏企业办公软件。
MIT Technology Review 报告指出,2026 年全球 AI 投资将达 2.5 万亿美元,同比增长 44%,但多数企业仍未能靠 AI 增长收入。报告将 AI 从工具转向运营模式的转变称为“智能体转型”,主张以流程重构为先、建设可组合架构与数据主权,让 AI 智能体能在数据所在处直接查询和准备数据。
AWS 提出 Adjudicated Query 设计模式,让业务用户在 Amazon Quick 聊天界面提出合规问题,实际判定交由确定性规则引擎完成,模型只负责把自然语言问题翻译为固定类型操作并叙述结果。
AWS 团队在 Amazon SageMaker AI 上用多轮强化学习(MTRL)微调 Qwen3.6-27B 搜索智能体,仅调整 max_epochs、global_batch_size、rollout_max_concurrency 三个超参数,其余走默认值。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
Airbnb CTO Ahmad Al-Dahle 披露公司 AI 原生改造进展:60% 代码由 AI 编写,功能交付量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍,约一半客服工单由 AI 独立解决。
生成式 AI 的普及正让服务业员工直面顾客用 ChatGPT 反驳专业判断的困境。纽约服务员 Madison 称有客人以 ChatGPT 为由否认菜品含贝类过敏原,还有顾客拒绝侍酒师、点出不存在的酒;护林员 Jason 遇到游客拿着 AI 编造的露营地和不合理行程质疑地图,幼教 Casey 则见家长坚持 ChatGPT 给出的睡眠方案。Meta 新 AI 智能体 Muse 的推出可能加剧这一问题。
AIBuildAI 团队发布并开源 PostTrain Agent,一个用于自主后训练大语言模型的递归自我改进(RSI)Agent,代码、知识库与技术报告均已公开。
MiniMax 于 9 月 28 日上线 M3.1-Flash-Preview,百万 token 上下文、原生多模态,在 MiniMax Code 首发并可通过 API 订阅套餐调用。
openJiuwen 开源智能路由框架 model-router,并首发 x-router 自演进路由算法,在 Agent 与模型之间增加一层按请求动态选模的决策能力。
Earendil 旗下 Pi 发布 1.0 版本并推出 Pi Durable,两者登上 Hacker News 首页。Pi 1.0 带来 Codemode 原生支持 MCP、Jev 与图像模型,新增虚拟模型扩展、延迟工具加载、Anthropic 模型缓存预热、对话中途系统消息、新 TUI 主题和默认全屏模式。