OpenAI o1 贡献者名单
OpenAI 公布了 o1 模型的贡献者名单。o1 是 OpenAI 推出的推理模型系列。
OpenAI 公布了 o1 模型的贡献者名单。o1 是 OpenAI 推出的推理模型系列。
经济学家 Tyler Cowen 解读 OpenAI o1 如何解答复杂的经济学问题。
遗传学家 Catherine Brownstein 展示了 OpenAI o1 如何加速罕见医学难题的诊断流程。该演示聚焦于将 o1 用于基因数据解读,以缩短罕见病确诊所需时间。
量子物理学家 Mario Krenn 使用 OpenAI o1 协助回答量子物理领域的重大问题。
Cognition CEO 兼联合创始人 Scott Wu 解释了 OpenAI o1 如何以更接近人类的方式做出编程决策。
Ada 借助 GPT-4 提升客户服务标准。该案例展示了 GPT-4 在客户服务场景中的实际应用。
Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积降至原始版本的 14%,最佳情况可达 0.2%,同时保持完整训练能力。解码单帧耗时与加载压缩图片相当,连续多帧解码仅为后者的 25%-50%,并原生集成 Hub 与可视化工具。
亚利桑那州立大学将 ChatGPT 推广至全校范围,用于个性化学习、推进研究并帮助学生为未来做准备。这是 OpenAI 与该校合作推进教育场景落地的举措。
Hugging Face Hub 拥有超 85 万个公开模型、每月新增约 5 万个,但其中 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 五项工具常被忽视。
Hugging Face 在 Transformers 中推出 DataCollatorWithFlattening,让无 padding 的打包指令微调与 Flash Attention 2 兼容,训练吞吐最高提升 2 倍。
Upwork 正将 AI 用于整合团队成员、运营与产品开发。OpenAI 与 Upwork 合作,把 AI 引入其内部工作流程与产品开发环节。
OpenAI 宣布 GPT-4o 现已支持微调。
Hugging Face 发布教程,介绍如何在 Google Cloud Vertex AI 上以 FP8 量化版本部署 Meta Llama 3.1 405B Instruct,运行于配备 8 块 H100 GPU 的 A3 节点,并使用 Text Generation Inference(TGI)与 Hugging Face 深度学习容器(DLC)。
Indeed 利用 OpenAI 为其全球最大求职网站提供情境化职位匹配,服务每月超 3.5 亿独立访客,连接逾 350 万雇主和超 3200 万个职位。平台上每三秒就有一人成功入职。
OpenAI 与 The Met 服装学院合作推出展览"Sleeping Beauties: Reawakening Fashion",借助 AI 展现艺术与创意潜力。该展览旨在通过 AI 丰富人们的生活体验。
Hugging Face 团队复现 Google 的 Infini-Attention 后发现,随着记忆压缩次数增加,模型性能持续下降,该实验被判定为失败。团队认为 ring attention、YaRN 和 rope scaling 仍是扩展预训练模型上下文长度的最佳方案,并开源了训练 checkpoint 供测试。
OpenAI 发布 SWE-bench Verified,这是 SWE-bench 中经人工校验的子集,用于更可靠地评估 AI 模型解决真实软件问题的能力。
推荐理由:OpenAI 发布经人工校验的 SWE-bench 子集,可用于更可靠地比较模型解决真实软件问题的能力。
Hugging Face 发布 ggml 入门指南,介绍这个用 C/C++ 编写、专注 Transformer 推理的开源机器学习库。
Hugging Face 在 Transformers 中推出统一的工具调用 API,同一份代码可在 Mistral、Cohere、NousResearch 和 Llama 等模型家族间通用,几乎无需针对模型做改动。
推荐理由:原文给出跨模型统一工具调用接口与 Transformers 辅助函数,读者可据此判断迁移成本与复用方式。
阿布扎比 TII 发布 Falcon Mamba 7B,称其为首个大规模通用纯 Mamba 模型,采用开放许可并已上线 Hugging Face 生态。该模型基于原始 Mamba 架构并加入额外 RMS 归一化层以稳定大规模训练,用约 5500GT 数据训练,可处理任意长度序列且生成每个 token 耗时恒定,单张 A10 24GB GPU 即可运行。
推荐理由:TII 发布首个大规模纯 Mamba 架构 7B 模型,并给出与同规模 Transformer 的基准和长序列内存对比。
Zico Kolter 加入 OpenAI 董事会,并将同时加入安全与安保委员会。OpenAI 表示,此举旨在以 AI 安全与对齐领域的专业能力强化公司治理。
Hugging Face 宣布收购西雅图公司 XetHub,其 12 人团队将加入,创始人此前在 Apple 构建并扩展内部 ML 基础设施。XetHub 的技术让 Git 可扩展到 TB 级仓库,HF CTO Julien Chaumond 表示团队将帮助 Hub 把存储后端换成自研的 LFS 替代方案。
推荐理由:Hugging Face 收购 XetHub 并计划替换 Hub 的 Git LFS 存储后端,读者可了解大文件版本管理将如何变化。
OpenAI 发布 GPT-4o 系统卡,用于说明该模型在安全与风险方面的评估情况。原文正文未能抓取,仅标题可用。
乐天(Rakuten)将数据与 AI 结合,用于挖掘客户洞察并释放价值。该案例展示了通过 API 把数据接入 AI 能力,从而把数据转化为面向客户的价值。
Mistral AI 在 La Plateforme 上线模型定制功能,支持对 Mistral Large 2 和 Codestral 等旗舰及专用模型进行 base prompt、few-shot 提示或微调,并可自带数据集。
OpenAI 在 API 中推出结构化输出(Structured Outputs),模型输出现在可以可靠地遵循开发者提供的 JSON Schema。
推荐理由:OpenAI 在 API 中引入结构化输出,模型输出可稳定遵循开发者提供的 JSON Schema,便于判断对现有集成方式的影响。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的 TextImage 数据增强流程,可同时修改图像与文本标注,用于视觉语言模型微调。该流程支持随机插入、删除、交换及停用词替换等文本增强,并配合图像修复,避免缩放、模糊等常规变换损害文字提取精度。初版已移除同义词替换以降低时间开销,可通过 pip 安装 albumentations 使用。
Hugging Face 梳理了截至 2024 年 8 月 6 日 Hub 上的安全功能:面向所有用户的细粒度 token、2FA、commit 签名、组织访问控制,以及基于 ClamAV、picklescan、trufflehog 的自动化安全扫描。Enterprise Hub 用户还可使用 SAML 2.0 与 OIDC 协议的 SSO、Resource Groups 等高级控制。
Google 在 Gemma 2 发布一个月后扩充模型阵容,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版),适合端侧使用,并可与 Gemma 2 27B 搭配做辅助生成,官方称可获得最高 3 倍加速且不损失质量。
推荐理由:Gemma 2 新增 2B 小模型与安全分类器、可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。
Hugging Face 展示如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散管线显存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至约 8.2 GB,质量几乎无损、延迟略增。
Hugging Face 面向 Enterprise Hub 组织推出 NVIDIA NIM API(无服务器),可在 Hugging Face Hub 内用标准化 API 对 Llama、Mistral 等开源模型运行推理。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,用 Llama-2-Chat-7b 以 1-3 分制对候选答案打分,在 Docmatix 的 200 张图像子集上评估 MPLUGDocOwl1.5 的零样本表现。
OpenAI 正在测试 SearchGPT,这是新搜索功能的临时原型,可提供快速及时的答案并附上清晰相关的来源。
推荐理由:OpenAI 官方披露搜索原型 SearchGPT 的测试状态,可据此了解其搜索产品的早期形态与定位。
Mistral AI 发布 Mistral Large 2,参数规模 123B,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并针对减少幻觉和指令遵循做了优化。
推荐理由:Mistral Large 2 以 123B 参数实现单节点高吞吐,并给出与 GPT-4o、Claude 3 Opus 的对比数据,便于判断开源模型的性能成本位置。
OpenAI 开发并应用了基于规则奖励(RBRs)的新方法,让模型在无需大量人工数据采集的情况下对齐到安全行为。该方法旨在提升模型的安全表现,减少对人工标注数据的依赖。
Meta 发布 Llama 3.1 系列开源模型,包含 8B、70B、405B 三种规模,各有基础版和指令微调版,上下文长度从 8K 提升到 128K token,支持英语、德语、法语、意大利语、葡萄牙语、印地语、西班牙语和泰语 8 种语言。
推荐理由:Meta 发布 Llama 3.1 三档开源模型,128K 上下文与工具调用能力配合更宽松的许可证,读者可据此判断开源模型在合成数据与蒸馏上的可用边界。
Hugging Face 发布教程,介绍如何借助 WWDC 24 的新 Core ML 特性在 Mac 上运行 Mistral 7B,并用不到 4GB 内存完成推理。
推荐理由:原文给出把 Mistral 7B 转成 Core ML 并在 Mac 上以不到 4GB 内存运行的完整步骤,可迁移到其他模型转换。
OpenAI 发布 GPT-4o mini,定位为更具成本效益的智能模型。原文正文抓取失败,仅标题可用。
Mistral AI 与 NVIDIA 合作发布 12B 模型 Mistral NeMo,支持最高 128k token 上下文窗口,并以 Apache 2.0 许可开放预训练基础版和指令微调版权重。
推荐理由:Mistral 与 NVIDIA 联合发布的 12B 模型,给出 128k 上下文、Apache 2.0 权重和 FP8 推理等可对比细节。
Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的数据集,包含 240 万张图像和 950 万对 Q/A,规模是此前数据集的 240 倍。该数据集由 PDFA 的 210 万份 PDF 转录文本经 Phi-3-small 生成 Q/A,并过滤掉 15% 的幻觉样本。用其微调 Florence-2 后,DocVQA 性能相对提升近 20%。