跳到正文
今天10月4日周日2 条
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用判分,而非看它生成的回答。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非回答文本判分,并给出 20 次重复下的稳定性与成本对比。

10月3日周六
  1. 机器之心62

    Karpathy 分享用 40 年前航空规范 ASD-STE100 让大模型输出更清晰

    Karpathy 分享了一组让大模型输出更易读的技巧,核心是把 40 年前欧洲航空业的受控英语规范 ASD-STE100 交给 LLM,其最新 Issue 9 含 53 条写作规则、约 900 个批准基础词和约 1200 个建议避免的词,要求一句指令控制在 20 词以内、一句话只安排一个操作、多用主动语态、同一概念只用同一个名字。

10月2日周五
10月1日周四
  1. 开源中国42

    团队使用 Codex 和 Claude Code,API Key 与模型权限怎么管?Zentrola 开源

    针对团队使用 Codex 和 Claude Code 时的 API Key 与模型权限管理问题,开发者开源了 Zentrola。它面向从个人到团队的场景,解决真实 API Key 是否分发、新成员可用哪些模型、成员离职后如何撤销权限,以及上游服务商故障时是否需通知所有人临时修改等管理难题。

9月29日周二
  1. Hugging Face Blog34

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"证据池中有支持"与"由答案所指来源支持",专门捕捉跨来源混淆。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在四项对比检查器中得分最高。

9月26日周六
9月25日周五
  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体流水线

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需给出 GitHub 仓库地址,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的建 harness、读覆盖率、崩溃分诊交给 LLM 智能体,并公开了可复用的开源流水线。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读 AI 代码、RAG 已死、Skills 是否杀死 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成代码仍需阅读和负责,但审查力度应随风险变化;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准;RAG 并未死亡,检索能让模型更接近答案并减少 token 消耗。节目还讨论了企业招聘中的 AI 使用判断力,以及微调需求可能反映代码库可维护性问题。

9月12日周六
8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理端点与优先服务层级,并接入第三方开源模型

    Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,同时 Mistral Priority Tier 进入公开预览,提供自定义速率限制和带 SLA 的可用性承诺。

    推荐理由:Mistral 把区域推理、优先服务层级和第三方开源模型接入放在同一套基础设施上,读者可据此判断企业级 AI 部署的区域合规选项。