Summer Health 借助 OpenAI 提升儿科就诊记录准确率
Summer Health 利用 OpenAI 技术重新构想儿科就诊流程,提升就诊记录的准确性。
Summer Health 利用 OpenAI 技术重新构想儿科就诊流程,提升就诊记录的准确性。
OpenAI 推出总额 1000 万美元的 Superalignment Fast Grants,资助超人类 AI 系统对齐与安全的技术研究。研究方向包括弱到强泛化、可解释性和可扩展监督等。
OpenAI 提出"弱到强泛化"这一超级对齐新研究方向,探索能否利用深度学习的泛化特性,用弱监督者控制更强的模型,并给出了初步的积极结果。
Axel Springer 成为全球首家与 OpenAI 深度合作、把新闻业整合进 AI 技术的出版机构。双方将推动 AI 在新闻领域的良性应用。
Mistral AI 开放其首个平台服务 la plateforme 的 beta 访问,提供三个对话端点和一个嵌入端点。
推荐理由:Mistral AI 开放首个平台服务测试,给出三个对话端点和嵌入端点的模型、价格与基准表现,可据此判断其早期 API 能力边界。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型,在多数基准上超过 Llama 2 70B,推理速度快 6 倍,并在多数标准基准上追平或超过 GPT3.5。
推荐理由:官方给出稀疏 MoE 架构的参数量与推理成本对比,可据此判断开源模型在性价比上的位置。
Hugging Face 发布《Mixture of Experts Explained》长文,系统讲解 MoE 的构成、训练方式与推理权衡。文章指出 MoE 用稀疏层加门控网络替代部分 FFN 层,预训练更快、推理比同参数量稠密模型更快,但需把全部专家载入显存,例如 Mixtral 8x7B 需容纳 47B 稠密参数。
Mistral 发布 Mixtral 8x7B,采用 MoE 架构,含基础版与 Instruct 版,支持 32k token 上下文,以 Apache 2.0 许可开放商用。
推荐理由:Hugging Face 官方给出 Mixtral 的架构说明、基准对比与量化部署路径,可据此判断 MoE 开源模型的落地成本。
Hugging Face 与 Intel Labs 推出 SetFitABSA,一个用于少样本训练领域特定方面级情感分析(ABSA)模型的框架,在少样本场景下表现优于 Llama2 和 T5 等生成式模型。
Hugging Face 与 AMD 宣布在 AMD Instinct GPU 上实现开箱即用支持,所有 Transformers 模型和任务无需修改代码即可运行,示例代码与 NVIDIA GPU 上完全一致。
推荐理由:原文给出 AMD GPU 上无需改代码运行 Transformers 的支持范围与实测对比数据,可据此判断迁移成本。
Hugging Face 在 Hub 推理 API 中实现 LoRA 动态加载,让基础模型保持常驻、按请求即时加载和卸载适配器,把冷启动时间从 25 秒降到 3 秒,用户请求响应从 35 秒降到 13 秒。
Hugging Face 发布 Optimum-NVIDIA 推理库,只需将 transformers 的 pipeline 导入改为 optimum.nvidia 一行代码,即可在 NVIDIA 平台获得最高 28 倍吞吐提升和 1200 tokens/秒,首 token 延迟最高降低 3.3 倍。
推荐理由:Hugging Face 与 NVIDIA 联合推出的推理库,用一行代码替换即可获得最高 28 倍吞吐提升,适合关注 LLM 部署成本的读者。
Hugging Face 对 Open LLM Leaderboard 新增的 DROP 基准进行深度排查,发现多数模型 f1-score 低于 10 分源于评测实现问题:数字后跟非空格空白字符时归一化失效,且以 . 作为停止符会截断浮点答案、让高质量模型因生成过长反而得分更低。改用 \n 作为停止符重新计算后,分数与模型整体表现的相关性明显改善。
OpenAI 宣布 Sam Altman 回归担任 CEO,Mira Murati 继续任 CTO,Greg Brockman 回归担任总裁,公司同时组建新的初始董事会。公告还附有 CEO Sam Altman 与董事会主席 Bret Taylor 的致辞。
推荐理由:OpenAI 官方确认 Sam Altman 回归 CEO 并公布新一届初始董事会,读者可据此了解这场人事风波的最终安排。
OpenAI 宣布领导层变动,官方页面仅给出这一标题,未提供正文细节。
OpenAI 启动数据合作计划,与各方共同创建用于 AI 训练的开源和私有数据集。
Hugging Face 发布 Latent Consistency LoRA,通过训练少量 LoRA 适配层而非蒸馏整个模型,让 SDXL 和 Stable Diffusion 从原本 25 到 50 步降到 4 到 8 步生成图像。
推荐理由:原文给出了 LCM LoRA 的推理代码、速度对比表和已发布权重,读者可据此判断少步生成的可用性。
Hugging Face 的 optimum-neuron 现已支持在 AWS Inferentia2 上部署 Llama 2 等 LLM 进行文本生成。用户可将 Llama-2-7b-hf 编译导出为 Neuron 格式,并选择 budget、latency、throughput 等不同配置,其中 7B 与 13B 模型均提供预编译版本,最大序列长度为 2048。
Explosion 发布 Prodigy-HF 插件,让 Prodigy 标注工具直接集成 Hugging Face 生态。
一项对比实验用 LoRA 微调 RoBERTa-large、Llama-2-7b 和 Mistral-7B-v0.1 三个模型,在灾难推文分类任务上评测性能。实验在单张 48GB A6000 GPU 上进行,统一将最大序列长度设为 512 以保证公平比较,其中 RoBERTa-large 为 355M 参数基线,另两个模型均为 7B 参数规模。
OpenAI 发布 GPTs,用户现在可以创建自定义版本的 ChatGPT,将指令、额外知识和任意技能组合在一起。
推荐理由:OpenAI 官方发布 GPTs,用户可组合指令、额外知识和技能定制 ChatGPT 版本。
OpenAI 在 DevDay 上发布 GPT-4 Turbo,支持 128K 上下文且价格更低,同时推出 GPT-4 Turbo with Vision。开发者产品方面新增 Assistants API,并开放 DALL·E 3 API。
推荐理由:OpenAI 在 DevDay 一次性公布模型与开发者产品更新,可据此了解其 API 能力与定价方向的变化。
Hugging Face 面向 Enterprise Hub 客户推出 Storage Regions,允许组织选择模型和数据集的存储位置。目前支持 US 和 EU 两个区域,Asia-Pacific 即将上线;存储在欧洲的仓库可获得约 4-5 倍的上传和下载速度提升,并满足 GDPR 合规需求。非默认区域的仓库会直接显示 Region 标签。
Hugging Face 发布教程,展示如何用其 GitHub 组织前 10 个公开仓库的代码微调 StarCoder,训练出名为 HugCoder 的代码补全助手。
推荐理由:完整复现了从数据采集、QLoRA 微调到 VS Code 本地部署的全流程,并给出成本与效果对比,可迁移到自有代码库。
OpenAI 正在构建应对灾难性风险的前沿准备工作方法,包括组建 Preparedness 团队并发起一项挑战赛,以支持高能力 AI 系统的安全。
OpenAI 联合 Anthropic、Google 和 Microsoft 宣布 Frontier Model Forum 新任执行董事,并设立 1000 万美元 AI 安全基金。该论坛由上述四家公司共同推进,此次更新聚焦于治理层人事与安全资金投入。
Renumics Spotlight 现可直接读取 Hugging Face datasets,只需一行 spotlight.show(ds) 即可对数据集做交互式可视化,无需复制或预处理数据。Spotlight 支持加载预测结果与嵌入向量,通过相似度图、混淆矩阵等布局定位关键数据簇与模型失败模式,并可在 GUI 或 Python API 中自定义检查流程。
Hugging Face 在 A100 40GB 上实测了 SDXL 的多种推理优化,未优化管线占用 28GB 显存、耗时 72.2 秒,改用 fp16 后降至 21.7GB 和 14.8 秒。
推荐理由:Hugging Face 官方给出 SDXL 在 Diffusers 中的显存与延迟实测数据,可直接对照选择优化组合。
作者复现了 OpenAI 2019 年的 RLHF 代码库 openai/lm-human-preferences,在情感和描述性任务上得到与原始代码几乎一致的学习曲线,并整理出一份实现细节清单。
推荐理由:作者复现 OpenAI 原始 RLHF 代码并逐条列出实现细节,其中 PyTorch 与 TensorFlow 版 Adam 的差异会直接影响训练稳定性。
Hugging Face 发布教程,介绍如何通过 Text Embeddings Inference(TEI)将开源嵌入模型部署到 Hugging Face Inference Endpoints。
OpenAI 宣布 DALL·E 3 现已在 ChatGPT Plus 和 Enterprise 中可用。官方表示为更广泛发布开发了一套安全缓解方案,并同步分享了内容溯源研究方面的进展。
推荐理由:OpenAI 官方宣布 DALL·E 3 在 ChatGPT Plus 和 Enterprise 上线,并说明为扩大发布准备了安全缓解措施。
Hugging Face 发布 @gradio/lite,一个借助 Pyodide 让 Gradio 应用完全在浏览器中运行的 JavaScript 库,无需服务端基础设施。
推荐理由:Gradio 官方给出浏览器端无服务器运行方案,读者可据此判断前端部署与隐私场景的可行性。
Retool 借助 GPT-4 为企业提供快速、安全的 AI 应用构建方式。该方案面向商业场景,强调速度与安全性。
Typeform 借助 GPT-3.5 和 GPT-4,把在线表单升级为动态、对话式的数据收集体验。
Ironclad 利用 GPT-4 简化合同审查流程。
Hugging Face 上已有超过 13 万个支持 ONNX 的模型可借助 ONNX Runtime 加速,其中包含众多 LLM 和云端模型。ONNX Runtime 已支持 90 多个 Hugging Face 模型架构,覆盖 BERT、GPT2、T5、Whisper、Stable-Diffusion 等最热门架构。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与风险方面的评估情况。原文正文未能抓取,仅标题可用。
Hugging Face Diffusers 现已支持使用 JAX 在 Cloud TPU 上部署 SDXL,实现高性能、低成本的推理。演示运行在多个 TPU v5e-4 实例上,约 4 秒生成四张 1024×1024 图像,其中实际生成时间约 2.3 秒。
Hugging Face 的 tokenizers 新增 chat_template 属性,用 Jinja 模板保存模型训练时使用的对话格式,把消息列表转成正确格式的字符串。
推荐理由:Hugging Face 把聊天格式从硬编码改为随 tokenizer 保存的模板,读者可据此理解格式错配为何会静默拖垮模型表现。
Hugging Face 发布教程,介绍如何通过 Inference API 将 AI Comic Factory 复制并部署到自己的私有 Space,以避免官方 Space 的长时间等待。