LEGO-Anything 用编码智能体从单张照片生成 Blender 3D 场景
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片迭代编写可执行的 Blender 程序,从而显式记录物体、几何、布局和相机位置,场景可像代码一样运行、检查和修改。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片迭代编写可执行的 Blender 程序,从而显式记录物体、几何、布局和相机位置,场景可像代码一样运行、检查和修改。
OpenAI 产品负责人 Tibo Sottiaux 预告下一代模型 Astra 6.1「coming soon」,称未来模型会更擅长删除和简化代码。此前《华尔街日报》报道称 OpenAI 原计划 10 月推出 Astra 6.1,因内部安全测试中在权限边界上表现不安分而临时叫停。Tibo 同日还向网友征集 Codex 和侧边栏的更新建议。
智东西用动效视频、鸡尾酒动画和像素巫师三组前端任务实测 MiniMax M3.1-Flash,发现这款国庆前夕上线并开启公测的 Flash 模型能复现不少原本被认为只有旗舰模型才能完成的前端效果,部分细节处理甚至偶有惊喜。
TypeSafe AI 联合创始人兼 CEO Diogo Almeida 在 Latent Space 访谈中表示,Jev 日处理量已突破一万亿 token,夜间流量持续走高,说明大量调用来自机器自动化。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明它用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
爱范儿在 MiniMax Code 中用 Opus 5.5 案例的公开提示词测试 MiniMax M3.1 Flash Preview,覆盖动态作品集、手绘与水墨短片、时间轴交互场景和街机卡丁车等游戏原型。
Chatham Financial 借助 Codex 和 GPT-5.6 构建技术并重构工作流,将交易验证时间从 30 分钟缩短到 4 分钟以内。该机构借此扩展其资本市场专业能力。
谷歌发布新一代旗舰模型 Gemini 4 Argon,面向软件工程、法律金融等企业知识工作与网络安全防御,输出 Token 上限从此前 6.4 万提升至 100 万。
推荐理由:谷歌发布 Gemini 4 Argon,披露了输出上限、基准成绩和 API 定价,可据此判断其企业级 Agent 任务的定位与成本。
Google 发布 Gemini 4 Argon,宣称在编码、知识工作和网络安全方面具备行业领先性能,但目前仅限公司内部工程师广泛使用,尚未对外开放。在软件工程基准 DeepSWE v1.1 上,Gemini 4 Argon 得分 77.9%,高于 GPT-6 Astra、Fable 5.1 和 Opus 5.5。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和内部落地案例,可据此判断前沿模型的能力边界与分阶段开放节奏。
智东西将美团 LongCat 团队 9 月 25 日上线的预览版模型 LongCat-2.5-Preview 接入 Claude Code,连续测试复刻 Meta Muse App、制作 SpaceX 星舰升空动画和开发 3D 赛车游戏三个 Coding 任务,三项均完成可实际运行的项目。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成代码仍需阅读和负责,但审查力度应随风险变化;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准;RAG 并未死亡,检索能让模型更接近答案并减少 token 消耗。节目还讨论了企业招聘中的 AI 使用判断力,以及微调需求可能反映代码库可维护性问题。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件也没有集中文档。团队先搭建数值对齐测试框架,用自定义解析器生成调用树并派出上百个智能体补文档,再以规划、编码、测试、审查加人工检查点的结构化流程逐模块迁移。Mistral 总结出三条经验:先建对齐测试再写迁移代码、先整理文档再交给智能体、结构化工作流加人工审查优于完全自主。