3D 资产生成:AI 用于游戏开发 #3
Hugging Face 博客"AI for Game Development"系列第 3 篇指出,text-to-3D 目前还无法实际用于游戏开发,生成的 mesh 无法直接用于游戏,仍需大量人工后处理。
Hugging Face 博客"AI for Game Development"系列第 3 篇指出,text-to-3D 目前还无法实际用于游戏开发,生成的 mesh 无法直接用于游戏,仍需大量人工后处理。
Mask2Former 和 OneFormer 两款统一图像分割模型现已集成到 Hugging Face 开源库 transformers 中。Mask2Former 用同一架构解决实例、语义和全景分割,但需分任务训练;OneFormer 仅在全景数据上训练一次即可在三个任务上达到 SOTA,代价是额外的文本编码器带来更高延迟。作者已发布 30 个基于不同数据集训练的 checkpoint。
Hugging Face 博客推出"AI for Game Development"系列教程,演示如何在 5 天内用 AI 工具做出一个完整农场游戏。
Hugging Face 发布图解 RLHF 的教程文章,把训练流程拆成预训练语言模型、收集偏好数据训练奖励模型、用 PPO 微调语言模型三个核心步骤。文章指出奖励模型输出标量奖励,训练时用 KL 散度惩罚约束策略偏离初始模型,并介绍了 TRL、TRLX、RL4LMs 等开源 RLHF 工具。文中还提到人类标注成本高、标注者意见不一致等局限,以及离线 RL、ILQL 等尚未充分探索的方向。
推荐理由:把 RLHF 拆成预训练、奖励模型、PPO 微调三步,并梳理了开源实现与已知局限,适合作为入门框架参考。
Hugging Face 发布面向生物学家与机器学习者的蛋白质深度学习入门文章,并附上微调蛋白质语言模型(PyTorch、TensorFlow)和用 ESMFold 做蛋白质折叠(仅 PyTorch)的示例 notebook。文章从 2018 年 ULMFiT 与 BERT 讲起,说明迁移学习如何把预训练知识复用到新任务,并指出其效果常相当于 100 倍以上的训练数据。
Hugging Face 与 Jonathan Whitaker 合作的扩散模型课程将于 11 月 28 日发布,配套社区直播活动定于 11 月 30 日举行。
Hugging Face 发文梳理 Document AI 的六大用例及对应开源模型,涵盖 OCR、文档图像分类、版面分析、文档解析等任务。文档图像分类中,LayoutLMv3 和 Donut 等多模态模型在 RVL-CDIP 上可达 95% 准确率,优于 BERT-base 的 89% 和纯视觉 DiT 的 92%。
Hugging Face 与 arXiv 合作,将 Spaces 通过 arXivLabs 集成到论文页面,新增 Demo 标签页,可直接链接社区或作者创建的开源演示。自 2021 年 10 月上线以来,Spaces 已托管超过 12,000 个开源机器学习演示,基于 Gradio 和 Streamlit 构建。以 BERT 论文为例,其 arXiv 页面已可找到 200 多个相关演示。
Hugging Face 发布教程,介绍如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖 Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估及 Gradio 演示的完整代码。
推荐理由:原文给出用 Transformers 微调 Whisper 的完整代码流程,并附 8 小时数据把 WER 从 63.5% 降到 32.0% 的实测结果。
Hugging Face 发布教程,演示如何通过三个递进抽象层级实现多 GPU 分布式训练:原生 PyTorch DDP(torch.distributed)、🤗 Accelerate 轻量封装(无需改代码即可支持单 GPU 和 TPU)、以及 🤗 Transformer 的 Trainer API。
Hugging Face 分享了 BLOOM(176B 参数、bf16 下 352GB)推理服务的优化过程,数周内将延迟降低 5 倍、吞吐提升 50 倍。团队先用 Megatron-Deepspeed 训练,再由 Younes 耗时近一个月、200 次 commit 移植到 transformers,并借助 accelerate 的 device_map="auto" 做流水线并行分片。
Hugging Face 宣布用户可直接在 Hub 上为模型或数据集生成 DOI,该功能与 DataCite 合作实现,注册用户填写元数据后即可获得,他人可通过模型或数据集页面的“Cite this model/dataset”按钮引用。DOI 绑定对象的 URL、版本、创建日期等元数据,提供永久链接,模型或数据集新版本发布时 DOI 可更新,旧版本 DOI 随之失效。
Hugging Face 发布首期 Ethics and Society 通讯,计划按季节在春分、秋分、夏至、冬至发布,由公司内部跨部门开放小组“Ethics and Society regulars”以平等身份共同编写。该通讯围绕协作、责任与透明等原则,分享 Hugging Face 在机器学习伦理落地方面的思考与项目实践,并明确不设统一价值观清单,而是持续输出项目层面的具体讨论。
OpenAI 宣布训练并开源神经网络 Whisper,称其在英文语音识别上接近人类水平的鲁棒性与准确率。
推荐理由:OpenAI 开源语音识别模型 Whisper,读者可据此了解其在英文语音识别上的鲁棒性与准确率定位。
Hugging Face 发布教程,演示如何用 transformers 库的 Trainer 和自定义 Data Collator,从零训练一个离线 Decision Transformer,让 HalfCheetah 机器人学会奔跑。
RAIL Initiative 推出、Hugging Face 支持的 OpenRAIL 是一类 AI 专用许可,允许免版税获取、下游使用与再分发,同时嵌入针对特定关键场景的用途限制。它借鉴 BigScience、开源与 Creative Commons 的做法,试图在广泛开放与防范有害使用之间划出界线,并赋予许可方在模型被滥用时的执行能力。
Hugging Face 发布教程,介绍如何用 3Dmol.js 和 Gradio 的 HTML block 在 Hugging Face Spaces 中可视化蛋白质结构,应用可接受 4 位 PDB 代码或上传 PDB 文件,从 RCSB 蛋白数据库获取并展示结构。
Hugging Face 发布教程,介绍如何用 diffusers 库运行 Stable Diffusion,并解释其潜空间扩散模型的工作原理。
推荐理由:Hugging Face 官方给出 Stable Diffusion 在 diffusers 中的完整用法与原理拆解,可据此理解潜空间扩散的组件分工。
Hugging Face 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等大模型显存占用减半且推理性能几乎无损。
推荐理由:Hugging Face 官方详解 LLM.int8() 量化原理与 transformers 集成细节,可了解大模型显存减半的落地方式。
Hugging Face 阐述了其 transformers 库对 TensorFlow 的设计理念:所有 TensorFlow 模型都是 Keras Model 对象,所有层都是 Keras Layer 对象,用户可直接调用 fit()、compile() 和 predict()。
Hugging Face 发布 Sentence Transformers 训练与微调教程,讲解如何从零构建或从 Hub 加载模型,并以 distilroberta-base 加池化层为例说明其两层结构。
Hugging Face 深度强化学习课程第 8 单元讲解 Proximal Policy Optimization(PPO),通过裁剪当前与旧策略的概率比至 [1−ϵ,1+ϵ] 区间来限制策略更新幅度,避免训练不稳定。
Hugging Face 发布 Private Hub(PH),为机器学习全生命周期提供统一工具,支持以安全合规的方式协作开发与部署。PH 基于拥有 60K+ 模型、6K 数据集和 6K 演示应用的 Hugging Face Hub,模型、数据集和 Space 均为 Git 仓库,支持版本控制、pull request 和讨论。
Hugging Face 于 2022 年 6 月下旬就美国白宫 OSTP 与 NSF 的 NAIRR 实施路线图征询提交回应,建议任命技术与伦理专家担任顾问、制定模型与数据文档标准、为跨学科非技术专家提供低代码或无代码工具,并投资 Responsible AI Licenses 以应对资源滥用。
Hugging Face 详解 176B 参数多语言模型 BLOOM 的训练技术:基于 Megatron-DeepSpeed 的 3D 并行方案,使用 384 张 80GB A100 GPU、350B token 的 46 种语言数据,训练耗时约 3.5 个月。模型架构接近 GPT3 并做了若干改进,词表规模 250,680,训练在法国 Jean Zay 超算上完成。
作者用 Sentence Transformers 的语义搜索功能搭建了一个歌单生成器:将提示词编码为嵌入向量,在预生成的歌词嵌入中检索,再通过 Gradio Blocks 构建多步交互应用并托管在 Hugging Face Spaces。
Hugging Face 发布入门指南,以 Sentence Transformers(ST)为例讲解如何从零启动第一个机器学习项目。ST 可将句子、段落和图像转为嵌入向量,并用 util.cos_sim 计算余弦相似度,支持语义搜索、聚类和模型蒸馏等应用。该库在 GitHub 已获近 8,000 stars,超过 3,000 个项目依赖它。
Hugging Face 博客介绍了三种将 Transformers 模型转为 ONNX 的方式,从底层 torch.onnx、中层 transformers.onnx 到高层 Optimum,均以 distilbert-base-uncased-finetuned-sst-2-english 文本分类模型为例。
Graphcore 与 Hugging Face 在开源库 Optimum 中新增一批针对 Graphcore IPU 优化的 Transformer 模型,可用的模型从 BERT 扩展到 10 个,覆盖 NLP、语音和计算机视觉。
Hugging Face Hub 上线 Pull Requests 和 Discussions,所有模型、数据集和 Spaces 仓库的社区标签页均可使用,任何社区成员都能发起和参与。其 PR 不依赖 fork 和分支,而是使用直接存储在源仓库上的自定义 ref 分支,并将 issue 与 PR 合并展示在同一列表中。
Hugging Face 深度强化学习课程第二单元第二部分讲解 Q-Learning 算法,并从头实现首个 RL 智能体。该算法属于 off-policy 的基于价值方法,采用 TD 方式训练动作价值函数,内部维护一张 Q-table 存储每个状态-动作对的价值。智能体将在 Frozen Lake v1 和自动驾驶出租车两个环境中训练,为第三单元的 Deep Q-Learning 打基础。
Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期的起点。章程列出了内容政策中要防止的滥用场景,包括生成虚假信息、生成个人身份信息以及在医疗、法律、金融等高风险领域的不谨慎使用。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项项目价值观,并承认这些价值观之间可能存在冲突,需逐案权衡。
Hugging Face 宣布启动 Fellowship 计划,由团队或现任 Fellow 提名,面向推动开源机器学习民主化的贡献者。计划按个人需求提供算力资源、周边物料和官方认可,首批 Fellow 包括创建西语 NLP 社区的 María Grandury 和向 Hub 贡献超 300 个模型的 Manuel Romero。
Hugging Face 开放首届 Student Ambassador Program 申请,截止日期为 2022 年 6 月 13 日,计划于 6 月 30 日启动、12 月 31 日结束。
Hugging Face 宣布完成 1 亿美元 C 轮融资,由 Lux Capital 领投,Sequoia、Coatue 等参与。官方称平台已托管 10 万个预训练模型和 1 万个数据集,超过 1 万家公司使用其产品,团队在过去 12 个月从 30 人增至 120 多人。资金将用于加大研究、开源、产品投入以及负责任地推动 AI 民主化。
推荐理由:Hugging Face 官方披露 C 轮融资规模、投资方与平台模型数据集数量,可据此了解其开源生态位置。
Hugging Face 推出免费深度强化学习课程,第一单元讲解深度强化学习基础,涵盖 RL 框架、马尔可夫决策过程、策略与价值方法等核心概念。课程使用 Stable Baselines3、RL Baselines3 Zoo 和 RLlib 等库,并让学员训练首个登月着陆器智能体并上传至 Hugging Face Hub。
Hugging Face 介绍如何用 Accelerate 库无需改代码即可调用 PyTorch FullyShardedDataParallel(FSDP)训练大模型。
Hugging Face 发布教育计划,目标在 2023 年底前教会 500 万人机器学习。该计划面向所有人、初学者和教师三类人群,提供 NLP、深度强化学习、Gradio 交互式 demo 等免费课程,以及已翻译成 8 种语言的教师工具包。此前 3 月的 ML demo.cratization tour 已为 16 个国家超 1000 名学生授课。
Hugging Face 机器学习工程师 Lewis Tunstall 在播客中介绍了与 Leandro von Werra、Thom Wolf 合著的《NLP with Transformers》,并讲述自己在 transformers 库中推动 ONNX 导出功能,让用户只需一行代码即可将 PyTorch 模型转换格式,从而获得更低延迟和更高吞吐。
Habana Labs 与 Hugging Face 宣布合作,将 Habana 的 SynapseAI 软件套件与 Hugging Face 的 Optimum 开源库集成,开发者只需几行代码即可在 Habana Gaudi 处理器上加速 Transformer 训练。