毕树超称 Meta 的 Muse Spark 半年协助破解 6 大数学开放难题
Meta 超级智能实验室的毕树超宣布,其模型 Muse Spark 1.1 和 1.2 在过去 6 个月内协助数学家攻克概率论、微分方程、群论、优化理论、算术物理学、非结合代数六大领域的开放问题,产出 6 篇论文,其中 5 篇给出悬而未决问题的答案,并推翻了群论中一项 2024 年提出的猜想。
推荐理由:Meta 用网页端对话模型在 6 个月内参与解决 6 个数学开放问题,可观察 AI 辅助科研的实际边界。
Meta 超级智能实验室的毕树超宣布,其模型 Muse Spark 1.1 和 1.2 在过去 6 个月内协助数学家攻克概率论、微分方程、群论、优化理论、算术物理学、非结合代数六大领域的开放问题,产出 6 篇论文,其中 5 篇给出悬而未决问题的答案,并推翻了群论中一项 2024 年提出的猜想。
推荐理由:Meta 用网页端对话模型在 6 个月内参与解决 6 个数学开放问题,可观察 AI 辅助科研的实际边界。
Hugging Face 发布 GAIA 的后续基准 Gaia2,并配套开源 Meta Agents Research Environments(ARE)框架,用于运行、调试和评测智能体。
推荐理由:Gaia2 把智能体评测从只读检索扩展到读写交互,并给出可复现的开源环境与调试轨迹。
Meta 发布 CyberSecEval 2,用于评估 LLM 生成不安全代码、协助网络攻击、被提示词注入操纵以及滥用代码解释器的风险。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。测试还显示提示词注入仍是未解决问题,LLM 目前难以可靠完成端到端漏洞利用。
Hugging Face 对 Llama 2 在 Amazon SageMaker 上的 60 种部署配置进行了基准测试,覆盖 7B、13B、70B 三种规模、四种 EC2 实例(含 NVIDIA A10G 与 A100 40GB)及 1/5/10/20 并发请求,并对比了 GPTQ 4-bit 量化效果。
红队测试通过构造自然语言提示词诱导大语言模型暴露有害输出,与对抗攻击不同,其提示词对人类可读。GPT3 早期版本曾表现出性别歧视与针对穆斯林的偏见,微软 Tay 和 Bing 的 Sydney 是缺乏红队评估导致灾难性后果的真实案例。