美团 LongCat 发布 MineExplorer:首个开放世界长程任务评测基准,18 款顶级多模态模型集体考砸
美团 LongCat 团队构建了 MineExplorer,一个在《我的世界》动态开放世界中评测多模态大模型的基准,包含 813 个人工验证实例(1-hop 到 4-hop)和规则化里程碑自动评测框架。
美团 LongCat 团队构建了 MineExplorer,一个在《我的世界》动态开放世界中评测多模态大模型的基准,包含 813 个人工验证实例(1-hop 到 4-hop)和规则化里程碑自动评测框架。
美团 LongCat 团队开源搜索智能体评测基准 LoHoSearch,基于覆盖 762 万维基百科实体的知识图谱自动生成题目,含 544 道经人工核验的题目、覆盖 11 个领域。
美团与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文。它先用谱先验与欧氏先验定位 RLVR 偏好的稀疏更新区域,再用 SVD 压缩成低秩适配器并冻结残差锚点,在 1.5B 到 32B 的 Qwen 与 Llama 上于数学、医学、代码任务稳定优于低秩基线。
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
DeepSeek Harness 发布 v0.2.1-alpha.1,新增实验性 Claude Code Mods 兼容层,让按 Claude Code Mods 接口编写的扩展有机会接入 DSH 插件系统运行。
Meta 发布开源项目 Muse Gadgets,让爱好者自行搭建 AI 硬件,包含面向 ESP32 开发板的固件和用于把自制设备接入 Meta AI 智能体 Muse 的 Linux SDK,代码采用 Apache 2.0 许可,并设有 Discord 社区讨论。
哈佛物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源 harness BootLoops,用于让 Claude 完成精确科学计算,源码已在 GitHub 公开。
开源无代码平台 NocoBase 更新,其 AI 员工现已支持知识库文档引用。NocoBase 目前维护 main、next 和 develop 三个分支,其中 main 为最稳定版本,推荐安装;next 包含即将发布的新功能,面向测试用户收集反馈。
Karpathy 分享了一组让大模型输出更易读的技巧,核心是把 40 年前欧洲航空业的受控英语规范 ASD-STE100 交给 LLM,其最新 Issue 9 含 53 条写作规则、约 900 个批准基础词和约 1200 个建议避免的词,要求一句指令控制在 20 词以内、一句话只安排一个操作、多用主动语态、同一概念只用同一个名字。
东南大学魏秀参团队提出 LeaP(Learnable source Prior),用本体感知信息联合预测初始高斯分布的均值与方差,为生成式机器人策略提供状态相关的随机初始化。
9 月 30 日,上海 AI 公司 StartLux(原点星辉)发布完全开源的决策模型 StartLux-Decision,推出 0.8B、2B、4B、9B 和 27B 五档版本并提供本地部署量化模型。
Meta 发布开源项目 Muse Gadgets,提供开源固件和 Linux SDK,让开发者用 Raspberry Pi 或 ESP32 等低成本硬件连接其个人 AI 智能体 Muse,并给出彩色电子墨水屏、HDMI 电视棒等项目示例,同时开设 Discord 频道支持用户。
DepthART 将单目深度基础模型压缩到 6.0M 参数,被 ACM Multimedia 2026 接收,并开源代码与权重。
Meta 推出开源项目 Muse Gadgets,开发者可用 ESP32 开发板运行 Muse 固件,或通过 Linux SDK 在树莓派 5 等边缘设备上运行 Muse 客户端,并访问 gadgets.muse.ai 领取 API Token。
Meta 开源了相关代码,允许用户自制搭载其新 AI 智能体 Muse 的硬件设备。官方建议的玩法包括把 Muse 装到彩色 E Ink 屏上显示提醒、接入 HDMI 棒在大屏上显示,或放到小尺寸触屏设备上做成类似 DIY Muse Charm 的形态。
Ai2 开源 AstaBrief 8B,一个把研究问题与检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,并同步开放训练数据。
推荐理由:原文公开了训练数据构造、引用过滤与评测细节,可供做科学文献合成与RAG报告生成的团队参考。
AIBuildAI 团队发布并开源 PostTrain Agent,一个用于自主后训练大语言模型的递归自我改进(RSI)Agent,代码、知识库与技术报告均已公开。
openJiuwen 开源智能路由框架 model-router,并首发 x-router 自演进路由算法,在 Agent 与模型之间增加一层按请求动态选模的决策能力。
华为、港中文、港科大的研究员联合推出 LegoFlow,一个把造题、答题、筛选、训练、评测全流程自动化的代码数据工程框架,每个环节封装为插件技能供 Claude Code、Codex 等编码智能体调用。
阿里巴巴 TaoLive AIGC 团队开源音视频联合流式生成模型 TaoMate-H3,基于 MiniMax H3,将三步 LoRA 推理与自回归生成结合,可按文本描述连续生成含对白、歌声或环境音的视频,支持分钟级续写和 480p、768p、1080p 横竖屏输出。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,不生成文本而是在预设选项中做选择并给出置信度,可本地运行。该模型由 AWS 杰出工程师 Marc Brooker 在看过 TypeSafe 的 Jev 后自行开发,曾在同规模模型的 Jevbench 排名上短暂登顶,随后由 Strands Labs 整理发布。
何恺明团队提出NAT-ARC,一套不依赖LLM的纯视觉ARC解题方案,用ImageNet上的MAE预训练encoder,再迁移到抽象格子推理。表现最好的单模型为0.6B参数,在ARC-1上取得63.4% pass@2,集成后达70.2%,约为专用LLM方案The ARChitects(8B参数、71.6%)四分之一的参数量。
AWS 官方博客给出在 Amazon Bedrock AgentCore Runtime Instances 上部署三智能体音乐制作流水线的完整教程,三个智能体分别负责作曲、交付与合规审查,通过同一 runtimeSessionId 共置在一台 GPU 实例上共享文件系统协作。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印在数字模型和合成出的实体蛋白质上都能被验证,同时保持其生物功能。
推荐理由:DeepMind 把水印从数字内容延伸到合成生物,公开了方法与代码,可观察生物安全筛查这一新方向。
DeepSeek 将 TileLang 算子开发工具及 DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 五大计算与通信库同步推出昇腾版本,TileLang 官宣原生支持华为昇腾 950 NPU。
推荐理由:原文拆解了 TileLang 前后端解耦架构与昇腾适配路径,可据此判断国产算子工具链的迁移成本。
DeepSeek 于 9 月 30 日开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库和分布式通信库,与此前面向英伟达平台的开源组件一一对应。其中 TileLang 昇腾版本是分量最重的一块,DeepSeek 称建立新一代自主可控的 GPU 软件生态需要先有通用且编程简单的语言工具。
开源知识库 KnowForge 发布 v2026.0.7,新增会员运营、开放平台、双向链接、读者问题洞察和多实例部署等能力。该版本支持将内容接入自有工具,并帮助运营者持续更新文档、了解读者关注的问题。KnowForge 可部署在自己的服务器上。
NVIDIA 发布开源表格基础模型 Kumo Tabular,属于 Kumo Structured 模型集合,在 Hugging Face 上提供权重,可在单次前向传播中完成分类与回归预测,无需训练、调参和特征工程。
推荐理由:NVIDIA 开源表格基础模型,单次前向即可预测,无需训练与特征工程,并给出四个基准的排名与效率对比。
Codeaha v1.0.0 正式发布,这是一款本地优先、对国产大模型友好的 AI 编程 Agent。其会话、消息与代码变更全部落盘本地 SQLite,代码数据不出本机,并基于 Eino Graph 实现 Agent 推理。项目采用 GoFrame、Eino、mark3labs/mcp-go 与纯 Go 无 CGO 的 glebarez/go-sqlite 构建。
开源项目 Jeff 发布,它是 Qwen3.5 和 Gemma 4 的微调版本,定位为零样本分类器,一次前向计算即返回每个选项的校准概率,不生成文本也无需解析。在 RTX PRO 6000 上约 22 毫秒出一次决策,0.8B 微调版本在 benchmark 上逼近 Jev。
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 用同一套权重覆盖 GUI、代码、MCP 与 API 四类接口,并公开全部评测轨迹,便于对照其成本与能力取舍。
Strands 开源了组装完整、可定制的通用 agent harness,接入任意模型只需一行代码。官方称在相同模型下该 harness 可节省 28% 的 token。它面向需要自行搭建 agent 的开发者,省去把各种原语拼到刚好可用的过程。
开源桌面端 AI 额度面板 QuotaPanel 发布 v0.1.0,把 15 种订阅与 API 余额集中到一张界面。覆盖 Claude、ChatGPT / Codex、Cursor、GitHub Copilot、Z.ai、Kimi、MiniMax、OpenRouter、DeepSeek 等服务,解决订阅分散、需逐个登录控制台查询的问题。
DataTalk Studio 开源,定位为面向数据分析师、业务人员和开发团队的 AI-native BI 工作区,目标是用自然语言完成报表的创建、修改、校验、发布和复用。它把数据源管理、指标定义、SQL 编写、图表配置和报表发布等传统 BI 环节组织到同一个工作区中,减少多工具间反复切换。
开源 AI 终端 uniTerm v1.9.5 发布,带来工作区管理、终端体验等 50 余项更新。新版本支持点选创建与拖拽分屏,工作区可保存为连接随时恢复,并新增终端图片显示与 SFTP 传输提速。uniTerm 整合终端、文件传输、远程桌面、数据库客户端、容器 5 大类协议,覆盖 30+ 协议,安装包仅 15MB,内置可自主执行多轮 Shell 命令的 AI Agent。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,解码最高提速 3.13x(端侧)和 2.66x(H100),端到端最高提升 2.62x 和 2.27x。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现并延长续航。
推荐理由:微软研究院对机器人推理负载的系统性测量,给出了把推理从机载 GPU 卸载到边缘或云端的性能与续航数据。
Simon Willison 发布 llm 0.36。该版本是其 LLM 命令行工具的新更新,具体功能与改动细节尚未在正文中披露。
NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04,并免费开源。
推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并给出多家厂商的落地案例,可据此判断开源机器人栈的演进方向。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,由 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 组成,通过学习式集成对两者预测排序。