Vallée Duhamel 如何用 Sora 构建新世界
电影制作双人组 Vallée Duhamel 解释了 Sora 如何帮助他们构建新的世界。
电影制作双人组 Vallée Duhamel 解释了 Sora 如何帮助他们构建新的世界。
OpenAI 发布 Sora 系统卡,介绍这是其视频生成模型,可接收文本、图像和视频输入并生成新视频。Sora 基于 DALL-E 和 GPT 系列模型的经验构建,定位是为用户提供更丰富的叙事与创意表达工具。
推荐理由:OpenAI 官方系统卡披露 Sora 的输入输出形态与模型来源,可据此了解其视频生成能力边界。
跨学科艺术家 Minne Atairu 讲述 Sora 如何帮助她实现自己的创作构想。
电影制作人 Lyndon Barrois 分享了如何将 Sora 用作叙事工具来创造新世界。
Hugging Face 的 83 个开源模型现已通过 Amazon Bedrock Marketplace 提供给 AWS 客户部署,底层由 Amazon SageMaker JumpStart 管理端点。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本到图像偏好数据集,覆盖多种图像生成类别与不同模型家族。
OpenAI 宣布推出 ChatGPT Pro,官方称此举旨在扩大前沿 AI 的使用范围。目前公开信息仅有这一句说明,具体功能、定价与可用范围尚未披露。
OpenAI 发布 o1 系统卡,说明在发布 o1 和 o1-mini 之前开展的安全工作,包括外部红队测试以及依据 Preparedness Framework 进行的前沿风险评估。
推荐理由:系统卡披露了 o1 与 o1-mini 发布前的外部红队测试和前沿风险评估流程,可了解其安全评估框架。
Hugging Face 用 Keras、JAX 和 TPU 搭建了一个 chatbot arena,测试 LLM 在被指出错误后能否修正代码。实验在 TPU v5e 2x4 上以 bfloat16 同时加载了 7 个模型(5 个约 8B 参数、3 个约 2B 参数),场景是把自然语言日历请求翻译成 Python API 调用。
Google 发布新一代视觉语言模型 PaliGemma 2,用 Gemma 2 替换前代的文本解码器,保留 SigLIP 图像编码器,提供 3B、10B、28B 三种参数规模,均支持 224x224、448x448、896x896 三种输入分辨率,而前代 PaliGemma 仅有 3B 版本。
推荐理由:Google 开源视觉语言模型 PaliGemma 2 提供 3B 到 28B 多规格与三种分辨率,读者可据此判断微调选型空间。
OpenAI 与全球专业媒体平台 Future 宣布战略合作,将 Future 旗下 200 多家媒体品牌的内容带给 OpenAI 用户。
Morgan Stanley 正借助 AI 评估(AI evals)推动金融服务领域的变革。该机构将 AI 评估用于塑造金融服务的未来方向。
Hugging Face 发布 AraGen,一个面向阿拉伯语 LLM 的生成式任务基准与排行榜,采用新的 3C3H 评估指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度打分。该排行榜采用动态评估策略,数据集与评估代码先进行三个月盲测再公开,随后更换新数据集,以缓解数据污染问题。
Capital Fund Management(CFM)借助 Hugging Face Inference Endpoints 部署 Llama 3.1-70b-Instruct 生成标注、再用 Argilla 人工复核,微调出的小模型在金融命名实体识别上准确率最高提升 6.4%,推理成本较大模型低至 80 倍。
Hugging Face 发布开源开发者指南,解读已正式生效的欧盟 AI 法案(EU AI Act)。法案按风险分级监管,仅通用目的 AI(GPAI)模型被直接监管,训练算力超 10^25 FLOPs 的模型被认定存在系统性风险。多数开源项目只需提供清晰文档、模型信息披露并遵守现有版权与隐私规则,Hugging Face 提供模型卡、数据集卡、Gradio 水印及个人数据脱敏等工具协助合规。
Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方与工具均以 Apache 2.0 协议开源。
推荐理由:原文给出 2B 视觉语言模型的显存占用、吞吐对比和完整开源训练流程,便于判断端侧多模态的落地空间。
Hugging Face 正为 Hub 重新设计上传与下载架构,引入内容寻址存储(CAS)并构建自定义传输协议,采用"读路径简单、写路径智能"的思路,按字节级分析文件以加速大文件传输。
Hugging Face 博客通过逐步改进位置编码方案,推导出 Llama 3.2 及多数现代 Transformer 使用的旋转位置编码(RoPE)。文章以 Llama 3.2 1B 为例,演示无位置信息时自注意力对同一 token 在不同位置输出完全相同,并提出位置编码应满足唯一性、线性关系、长度泛化、确定性生成和可扩展至多维等五项理想属性。
OpenAI 发布文章阐述如何结合人类与 AI 推进红队测试。原文未披露具体模型版本、参数规模或评测数据。
OpenAI 发布案例,展示如何用 GPT-4o 的视觉微调能力构建更智能的地图。
Hugging Face 博客介绍 LayerSkip 提出的自推测解码,用同一 LLM 的浅层生成 draft token、深层负责验证,无需额外小模型即可加速文本生成并降低显存占用。
BAAI 推出 FlagEval Debate 平台,让大模型以辩论形式正面对抗,目前支持中文、英文、阿拉伯文和韩文四种语言。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义参数功能,以解决静态评测和 Chatbot Arena 类平台缺乏区分度、模型孤立生成及投票偏差等问题。2024 年 Q3 的实验显示,当前多数模型已具备参与辩论的能力。
Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件在 16 项任务上评估日语大语言模型,涵盖自然语言推理、机器翻译、摘要、问答、代码生成、数学推理和考试题等,任务以 4-shot 方式运行。数据集由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译调整,部分任务需要长上下文推理。
Hugging Face 的 Xet 团队正用内容定义分块(CDC)把文件拆成可变大小的块,只传输和存储被修改的块,从而提升存储效率与迭代速度。在 CORD-19 数据集基准中,Xet 后端相比 Git LFS 平均下载时间从 51 分钟降至 19 分钟、上传从 47 分钟降至 24 分钟,存储占用从 8.9 GB 降至 3.52 GB。
Rox 宣布"all in"OpenAI,将其商业经验与深厚的大语言模型专业能力同 OpenAI 的模型结合,目标是让每一位销售都成为排名前 1% 的销售。
Hugging Face 博客发布 Judge Arena,一个让用户对两个 LLM 裁判的评分和理由进行投票对比的平台,投票结果汇总为 Elo 排行榜并每小时更新。
Mistral AI 为免费生成式 AI 助手 le Chat 推出多项 beta 新功能,包括带引用的联网搜索、用于构思与就地编辑和导出的 Canvas、文档与图像理解、图像生成以及可共享的 Agent。
推荐理由:官方列出 le Chat 新增的联网搜索、Canvas、文档图像理解与图像生成,并给出与主流助手的逐项对比。
Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 构建的 124B 开放权重多模态模型,含 1B 参数视觉编码器和 128K 上下文窗口,可容纳至少 30 张高分辨率图像。
推荐理由:官方给出 Pixtral Large 的基准成绩与开放权重,读者可据此判断开源多模态模型与闭源前沿的差距。
OpenAI 在法国开设了其在欧洲大陆的首个办公室。这是 OpenAI 在欧洲大陆的第一处办公据点,此前其欧洲布局仅涉及其他地区。
雅诗兰黛集团借助 ChatGPT Enterprise 和自定义 GPT 分析消费者数据、挖掘洞察,以加速美妆创新。该案例展示了企业级 ChatGPT 在数据驱动决策与产品研发环节的具体用法。
Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用。
Mistral AI 在 La Plateforme 上线 Batch API,处理高并发请求的成本比同步 API 调用低 50%。该 API 面向批量数据处理场景,支持客户反馈分析、文档批量摘要与翻译、向量嵌入及数据标注等用途,适用于平台上的所有模型,每个工作区最多 100 万个进行中的请求。
Mistral AI 发布新的内容审核 API,即其 Le Chat 审核服务所用的同一套接口,现开放给用户按自身应用和安全标准使用。该模型是一个 LLM 分类器,将文本输入分为 9 个类别,提供原始文本和对话内容两个端点,并针对对话场景分类最后一条消息。模型原生支持多语言,训练语言包括阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。
Hugging Face 与 PyCharm 完成集成,开发者可在代码中右键选择 "Insert HF Model",直接调用 Hugging Face Hub 上的模型。
Argilla 2.4 推出无需代码的数据集构建功能,用户可直接从 Hugging Face Hub 导入数据集、定义问题并收集人工反馈。该功能支持公开数据集导入,默认启用 Hugging Face OAuth,社区用户可直接参与标注,整个流程不到 5 分钟。Argilla 是 Hugging Face 旗下免费开源的数据中心工具,目前仅支持公开数据集,私有数据集支持仍在征询反馈中。
OpenAI 发布 ChatGPT 搜索功能,可快速给出带相关网络来源链接的及时回答。
推荐理由:OpenAI 官方发布 ChatGPT 搜索功能,读者可了解其以链接形式给出实时网络来源的定位。
Promega 自上而下在全公司推广 ChatGPT,用于加速生产、销售和营销环节。该公司将 ChatGPT 引入制造、销售与营销等业务,以提升整体运营效率。
OpenAI 发布名为 SimpleQA 的事实性基准,用于衡量语言模型回答简短事实型问题的能力。该基准聚焦短小、寻求事实的提问场景,评估模型的事实准确性。
Decagon 与 OpenAI 合作,实现大规模、全自动的高性能客户支持。双方结合各自能力,让客户支持流程无需人工介入即可完成。
Intel Labs 与 Hugging Face 提出 Universal Assisted Generation(UAG),通过双向 tokenizer 转换让目标模型与任意模型族的助手模型配对,从而加速推理。
推荐理由:Intel Labs 与 Hugging Face 提出跨 tokenizer 的通用辅助生成方法,读者可了解其如何让任意小模型充当助手并带来 1.5x-2.0x 推理加速。