Hugging Face 与 Atla 推出 Judge Arena,用投票评测 LLM 裁判能力
Hugging Face 博客发布 Judge Arena,一个让用户对两个 LLM 裁判的评分和理由进行投票对比的平台,投票结果汇总为 Elo 排行榜并每小时更新。
Hugging Face 博客发布 Judge Arena,一个让用户对两个 LLM 裁判的评分和理由进行投票对比的平台,投票结果汇总为 Elo 排行榜并每小时更新。
OpenAI 在法国开设了其在欧洲大陆的首个办公室。这是 OpenAI 在欧洲大陆的第一处办公据点,此前其欧洲布局仅涉及其他地区。
雅诗兰黛集团借助 ChatGPT Enterprise 和自定义 GPT 分析消费者数据、挖掘洞察,以加速美妆创新。该案例展示了企业级 ChatGPT 在数据驱动决策与产品研发环节的具体用法。
OpenAI 发布 ChatGPT 搜索功能,可快速给出带相关网络来源链接的及时回答。
推荐理由:OpenAI 官方发布 ChatGPT 搜索功能,读者可了解其以链接形式给出实时网络来源的定位。
Promega 自上而下在全公司推广 ChatGPT,用于加速生产、销售和营销环节。该公司将 ChatGPT 引入制造、销售与营销等业务,以提升整体运营效率。
OpenAI 发布名为 SimpleQA 的事实性基准,用于衡量语言模型回答简短事实型问题的能力。该基准聚焦短小、寻求事实的提问场景,评估模型的事实准确性。
Decagon 与 OpenAI 合作,实现大规模、全自动的高性能客户支持。双方结合各自能力,让客户支持流程无需人工介入即可完成。
CGIAR 与 Digital Green 在 Hugging Face 专家支持下为农业问答机器人 Farmer.chat 搭建了 LLM-as-a-Judge 评估体系,用于衡量 RAG 回答的质量、简洁度与准确性。
OpenAI 简化、稳定并扩展了连续时间一致性模型,仅用两步采样即可达到与领先扩散模型相当的样本质量。
OpenAI 与 Lenfest Institute 联合推出 AI Collaborative and Fellowship 计划。该计划旨在支持新闻编辑室探索 AI 应用,具体参与方式、资助金额及时间安排尚未在原文中披露。
OpenAI 分析了 ChatGPT 如何根据用户姓名做出不同回应,并借助 AI 研究助手来保护隐私。
OpenAI 推出 MLE-bench,用于衡量 AI 智能体在机器学习工程任务上的表现。该基准测试评估智能体完成机器学习工程工作的能力。
OpenAI 与 Hearst 达成内容合作,将 Hearst 旗下品牌精选的生活方式与本地新闻内容引入 OpenAI 产品。
OpenAI 发布 canvas,一种在 ChatGPT 中写作和编码的新方式。官方页面仅给出这一介绍,未披露具体功能细节与开放范围。
推荐理由:OpenAI 官方公布 ChatGPT 的写作与编码新界面 canvas,可据此了解其交互形态的调整方向。
OpenAI 宣布获得新一轮融资,用于推进让通用人工智能惠及全人类的使命,并扩大 AI 带来的效益。
OpenAI 发布 Realtime API,开发者可将其接入应用,构建快速的语音到语音交互体验。
推荐理由:OpenAI 官方发布 Realtime API,开发者可据此判断语音到语音交互的接入方式。
OpenAI 宣布微调 API 支持视觉能力,开发者现在可以用图像和文本对 GPT-4o 进行微调,以提升视觉表现。
推荐理由:OpenAI 把图像纳入微调 API,开发者可据此判断视觉定制能力的开放范围。
OpenAI 在 API 中推出 Prompt Caching,对模型近期已见过的输入自动提供折扣。官方说明该机制面向重复出现的输入内容,具体折扣幅度与适用条件未在摘要中给出。
推荐理由:OpenAI 在 API 层面对近期出现过的输入自动打折,读者可据此判断长提示词与重复上下文的成本变化。
OpenAI 在 API 平台上线模型蒸馏功能,可用大型前沿模型的输出微调出高性价比的小模型,全部流程在 OpenAI 平台上完成。
Altera 借助 GPT-4o 构建了一个智能体与人类协作的新领域。该方向聚焦于让 AI 智能体与人类协同工作,拓展人机协作的交互形式。
OpenAI 封禁了一批利用 AI 起草滥用举报和投诉的账号,这些举报针对越南公众人物及平台。
OpenAI 封禁了一批伊朗来源的 STORM-2035 账号,这些账号利用 AI 生成美国和英国选举相关内容并发布到多个网站。
OpenAI 封禁了一批与伊朗关联的 STORM-0817 账号,这些账号利用 AI 调试 Android 恶意软件、抓取社交平台内容并翻译工具。
OpenAI 封禁了一批通过一家以色列初创公司访问其模型、用于生成对话并在 X 上发送赌博网站链接的账号。这些账号借助该初创公司调用 OpenAI 模型,批量生成内容并附带赌博站点链接进行传播。
OpenAI 封禁了一个疑似源自美国的账号,该账号利用 AI 生成虚假的 ChatGPT 报错信息,声称能检测“俄罗斯水军”活动。
OpenAI 封禁了一批源自俄罗斯的"Stop News"账号,这些账号利用 AI 生成多语言文章和帖子,针对乌克兰及西方国家开展影响力活动。
OpenAI 封禁了一批账号,这些账号使用 AI 生成针对一家俄罗斯反腐基金会及相关人物的批评评论。
OpenAI 封禁了名为“A2Z”的账号网络,这些账号利用 AI 在多个平台生成涉及选举、乌克兰和政治的多语言影响力内容。
OpenAI 封禁了一批疑似属于 CyberAv3ngers 的账号,这些账号利用 AI 研究工业控制系统、默认凭据和攻击目标。该组织被指与伊朗有关联。
OpenAI 封禁了一批疑似属于中国关联黑客组织 SweetSpecter 的账号,该组织利用 AI 研究漏洞、编写代码并支持鱼叉式钓鱼攻击。
OpenAI 封禁了一批源自卢旺达的账号,这些账号在该国选举前使用 AI 生成党派性评论内容。
OpenAI 推出基于 GPT-4o 构建的新多模态审核模型,可更准确地检测有害文本和图像,帮助开发者构建更稳健的审核系统。该模型已用于升级 Moderation API。
明尼苏达州企业翻译办公室借助 ChatGPT 弥合语言鸿沟。
OpenAI 与 GEDI 宣布达成战略合作,将意大利语新闻内容引入 ChatGPT。
Mercado Libre 推出 AI 开发平台 Verdi,由 GPT-4o 驱动。该平台面向开发者,具体功能与可用性尚未披露。
生物技术公司 Genmab 启动“AI Everywhere”计划,全面采用 ChatGPT Enterprise,并获 OpenAI 在安全与隐私方面的支持。
OpenAI 发布安全与安保实践更新。原文未披露具体措施、模型版本或数据细节。
OpenAI 发布 o1 模型,官方页面标题为 Introducing OpenAI o1。抓取失败,暂无更多正文信息。
OpenAI 发布 o1-mini,官方将其定位为面向高性价比推理的模型。该页面标题为 OpenAI o1-mini,副标题为 Advancing cost-efficient reasoning,正文未提供更多细节。
OpenAI 公布了 o1 模型的贡献者名单。o1 是 OpenAI 推出的推理模型系列。