Anthropic 发布威胁情报报告:Claude 被用于勒索、朝鲜远程求职与勒索软件开发
Anthropic 发布 2025 年 8 月威胁情报报告,披露 Claude 被滥用的三类案例:有攻击者用 Claude Code 对至少 17 家机构实施数据窃取与勒索。
推荐理由:Anthropic 首次系统披露 Claude 被滥用的三类真实案例,为理解智能体时代的安全攻防提供了第一手样本。
技术方向
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
410 条精选近 30 天 129 条共收录 1,555 条
Anthropic 发布 2025 年 8 月威胁情报报告,披露 Claude 被滥用的三类案例:有攻击者用 Claude Code 对至少 17 家机构实施数据窃取与勒索。
推荐理由:Anthropic 首次系统披露 Claude 被滥用的三类真实案例,为理解智能体时代的安全攻防提供了第一手样本。
OpenAI 发布开源权重模型家族 gpt-oss,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,两者均为 MoE 架构并采用 MXFP4 4-bit 量化,激活参数分别为 5.1B 和 3.6B,采用 Apache 2.0 许可。
推荐理由:Hugging Face 汇总了 gpt-oss 两个开源模型的参数、量化方案与各推理框架的适配情况,可据此判断本地部署门槛。
Anthropic 发布 Claude Opus 4.1,在智能体任务、真实编码和推理上对 Opus 4 进行升级,SWE-bench Verified 成绩提升至 74.5%,价格与 Opus 4 相同。
推荐理由:官方给出 Opus 4.1 在 SWE-bench Verified 上的成绩与多家合作方的实测反馈,可据此判断升级幅度。
Mistral AI 发布 Codestral 25.08 代码模型,并推出覆盖补全、语义检索与智能体工作流的企业级编码栈。Codestral 25.08 相比前代补全接受率提升 30%、建议后保留代码增加 10%、失控生成减少 50%,支持云、VPC 与本地部署。
推荐理由:Mistral 官方给出编码栈各组件的能力数字与私有化部署路径,可据此判断企业自建编码助手的可行边界。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 官方一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线的功能覆盖方向。
OpenAI 发布 ChatGPT agent 系统卡,介绍这一智能体模型整合了研究、浏览器自动化和代码工具,并在 Preparedness Framework 下配备安全防护措施。
推荐理由:OpenAI 官方系统卡披露 ChatGPT agent 的能力组合与安全框架,可了解其智能体设计与防护思路。
OpenAI 发布 ChatGPT agent,官方称其能够思考并行动,调用工具完成研究、预订和幻灯片等任务,全程由用户引导。
推荐理由:OpenAI 官方发布 ChatGPT agent,读者可据此了解其可调用工具完成研究、预订和幻灯片等任务的能力定位。
Anthropic 推出面向金融分析的 Claude 解决方案,把市场数据源与 Databricks、Snowflake 等内部数据统一到单一界面,并附带预置 MCP 连接器。
推荐理由:Anthropic 面向金融行业推出的整合方案,列出数据源、合作方与客户实测数字,可据此判断金融场景的落地路径。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1,两款模型均强调对不同提示词和智能体框架的泛化能力。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。
Hugging Face 发布 ScreenEnv,一个可在 Docker 容器中创建隔离 Ubuntu 桌面环境的 Python 库,用于测试和部署 GUI 智能体(Computer Use 智能体),支持 AMD64 与 ARM64,环境部署时间不到 10 秒。
推荐理由:ScreenEnv 把桌面智能体的运行环境收敛到 Docker 沙箱,并同时提供 MCP 与直连 API 两种接入方式,便于对照现有智能体框架的部署路径。
Hugging Face 发布 ScreenSuite,一个面向 GUI Agent 的评测套件,整合 13 项基准,覆盖感知、定位、单步动作和多步智能体四类能力。
推荐理由:Hugging Face 开源 GUI Agent 评测套件,读者可了解其 13 项基准覆盖的能力维度与纯视觉评测设定。
H Company 发布 Holo1 系列 Action VLM,包含 Holo1-3B 和 Holo1-7B,基于 Qwen2.5-VL 架构并已在 Hugging Face 开源,同时发布含 1,639 个类人 UI 任务的 WebClick 多模态定位基准。
推荐理由:原文给出开源模型规格、基准成绩与单任务成本,读者可据此判断网页自动化方案的落地门槛。
Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、Web 搜索等内置连接器以及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:官方给出 Agents API 的连接器、记忆与多智能体编排能力,可据此判断企业级智能体平台的搭建方式。
Hugging Face 将 JS 版 Tiny Agents 移植到 Python,并扩展 huggingface_hub 客户端 SDK 使其充当 MCP Client,可从 MCP 服务器拉取工具并在推理时传给 LLM。
推荐理由:原文给出约 70 行代码实现 MCP 智能体的完整路径,读者可据此理解工具调用循环的最小结构。
Anthropic 发布下一代 Claude 模型 Claude Opus 4 和 Claude Sonnet 4,主打编码、高级推理与 AI 智能体能力。
推荐理由:官方给出 Claude Opus 4 与 Sonnet 4 的基准成绩、定价和 API 新能力,可据此判断编码与智能体场景的选型。
Mistral AI 与 All Hands AI 合作发布智能体 LLM Devstral,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SOTA 高出 6 个百分点以上,并以 Apache 2.0 许可开源。
推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。
OpenAI 发布 o3 和 o4-mini 系统卡的补充说明,介绍云端编码智能体 Codex。Codex 由 codex-1 驱动,后者是 OpenAI o3 针对软件工程优化的版本,通过强化学习在多种环境的真实编码任务上训练,以生成贴近人类风格和 PR 偏好的代码、精确遵循指令,并反复运行测试直至通过。
推荐理由:官方系统卡补充说明 Codex 由 o3 衍生模型 codex-1 驱动,可了解其训练方式与编码定位。
Mistral 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,提供企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内逐步上线。
推荐理由:Mistral 官方发布企业版助手,列出企业搜索、Agent 构建与混合部署等能力,可据此判断其企业落地路径。
Hugging Face 发布 Tiny Agents 教程,用约 50 行 TypeScript 代码在 InferenceClient 之上实现 MCP 客户端和智能体,智能体本质是工具调用循环。
推荐理由:作者以 Hugging Face 官方身份给出可运行的 MCP 客户端与智能体实现,读者可据此理解工具调用如何串起一个最小智能体。
Anthropic 发布面向高等教育机构的 Claude for Education,并推出 Learning mode,引导学生自己推理而非直接给出答案。该版本包含与东北大学、伦敦政治经济学院和 Champlain College 的全校接入协议,东北大学 13 个全球校区的 5 万名学生、教师和员工将获得 Claude 访问权限。
推荐理由:Anthropic 面向高校推出专用版本并给出 Learning mode 与三所大学的全校接入案例,可了解教育场景的落地方式。