跳到正文
Together AI Blog·· 2026-02-06精选AI 评分60

Together AI 研究:不告诉 LLM 想什么时,它们会生成什么

What do LLMs think when you don't tell them what to think about?

AI 导读

Together AI 发布研究,用「Actually」「Let's think step by step」甚至标点等中性种子提示词、去掉 chat template 和 system prompt,考察 LLM 的近乎无约束生成行为。

推荐理由

研究用近乎无约束的生成实验揭示各模型家族的语义偏好与退化模式,为模型审计和指纹识别提供了基准之外的新视角。

正文 · AI 翻译

我们研究什么?

大多数 LLM 行为分析都受到限制:提示词在很大程度上塑造了模型能说什么 [1,2]。这很有用——但它也有很大的局限性。

提示词就像过滤器。一道数学题会强制进行数学推理;一个聊天模板会迫使模型进入助手角色。模型生成空间中的很大一部分从未被触及。我们观察到的不是模型的自然行为,而是我们的指令所诱导出的行为。因此,我们提出一个更基本的问题:

当你告诉语言模型不要生成什么时,它会生成什么?

为了回答这个问题,我们研究近乎无约束的生成。我们使用话题中立、开放式的种子提示词,例如“Actually,”“Let's think step by step,”,甚至只是像“.”这样的标点符号。我们完全移除聊天模板——没有系统提示词,没有角色——并使用标准解码。这种设置近似于模型的下意识行为:在对齐和提示词接管之前,一窥其习得的生成先验。

为什么这很重要

如果你关心模型审计、行为监控、LLM 指纹识别或安全与隐私风险,仅靠条件基准是不够的。我们需要深入原始模型生成,看看 LLM 在多样化的输入和提示条件下如何表现。 

作为一个尚未被充分探索但在科学上颇具吸引力的场景,近乎无约束的生成让我们能够观察模型偏好谈论什么、它们过度呈现哪些类型的内容,以及当固定的聊天模板和特殊标签被移除时它们如何失败。至关重要的是,这些信号最终被证明是系统性的,而非个例。

结果:当你不告诉 LLM 该想什么时,它们会想什么?

结果 1:模型家族具有不同的知识先验

图 1. 近乎无约束 LLM 生成的嵌入可视化。每个点代表一个生成样本;颜色表示事后推断的语义类别;虚线表示高密度区域。即使没有明确的话题,模型输出也会聚类成清晰的区域,并且每个模型家族形成不同的语义偏好。交互式图表见 https://tinyurl.com/mzr5cckz。

如图 1(a) 所示,尽管提示词中缺乏明确的指令或话题,LLM 仍会生成广泛的话题。LLM 会生成各种类别,包括人文学科(例如文学、哲学和教育)、科学与工程(例如物理、数学和编程),以及法律、金融、音乐、体育、烹饪、农业、考古、军事和时尚等领域。

更令人惊讶的是,如图 1(b) 所示,不同模型家族倾向于语义空间的不同部分——即使给定相同的最小提示词。GPT-OSS 绝大多数情况下默认生成编程(27.1%)和数学(24.6%)内容。一个模型家族超过一半的输出集中在这两个领域!Llama 生成的文学和叙事文本要多得多(9.1%),对技术领域的侧重较少(见图 2)。DeepSeek 生成宗教内容的频率往往远高于其他家族。Qwen 经常输出多项选择题,并附有答案选项。 

图 2. 近乎无约束生成下按模型家族划分的顶级语义类别。每个家族都表现出稳定且可解释的话题分布。

这里引人注目的是其一致性。这些分布在不同提示词、嵌入模型和语义标注器之间持续存在。这种行为看起来不像噪声,更像是一种群体层面的指纹。图3展示了代表性示例。

图3. 无约束设置下模型输出的示例。更多示例见论文。

结果2:深度也是先验的一部分

差异不仅在于模型谈论什么以及谈论的频率,还在于它们谈论的深度。我们在图4中评估了编程和数学文本的复杂度。 

我们发现,GPT-OSS频繁生成高级或专家级内容(68.2%),例如深度优先搜索、广度优先搜索或动态规划(见图3)。Llama和Qwen则更偏向基础或中级材料。即使在控制标注模型和评估设置的情况下,这些深度差异依然存在。

图4. 数学和编程文本中难度级别的分布。难度标签由Claude‑4.5‑Opus标注。高级和专家级内容在GPT-OSS输出中出现得远为频繁。

结果3:退化文本是一种信号,而不仅仅是噪声

最后,遵循先前工作[3,4],我们还观察到模型有时会陷入重复或退化模式,尤其是在移除约束时。这种行为通常被当作胡言乱语而丢弃。我们将其视为数据。

通过分析退化从何处开始、发生频率以及其表现形式,我们发现了鲜明的模型特异性差异。GPT-OSS倾向于重复简短的格式伪影,例如代码块分隔符(```\n\n```\n\n)。Qwen会产生长篇对话短语、表情符号和中文文本。Llama有时会输出指向真实个人Facebook和Instagram账户的URL(图6)。深入分析见论文。

Bar charts comparing GPT-OSS, DeepSeek, Llama, Qwen on degeneration ratio, start index, and repeated phrase length.

图5.(上)不同模型家族中的退化文本行为。退化频率、起始位置和重复长度在模型家族之间存在显著差异。(下)退化文本示例。我们对Llama中的文本进行了遮蔽,因为这些链接可访问个人社交账户。 

退化文本恰恰是洞察安全和隐私风险的最清晰窗口之一,因为它反映了不受控的生成。这些行为很少出现在标准基准测试中,却极具揭示性。

为何这让我们感到意外以及要点

鉴于所有被评估的模型在数学、编程和通用任务上都具有广泛竞争力,我们最初预期它们在近乎无约束的生成中会在不同模型家族之间表现出相似的语义分布。然而,我们观察到在不同家族之间持续存在的鲜明且系统性的偏差。我们未曾预料到GPT-OSS生成数学和编程内容的比例会超过50%,也未曾预料到Qwen会生成如此大比例的多项选择题考试题目。 

这些行为在各种实验设置下都显得相当稳健。无论我们如何改变提示、嵌入或标注者,相同的模式都不断重现。也许最令人惊讶的是,退化并不是一种随机的失败模式。相反,退化的生成内容展现出一致的结构和风格,在某些情况下还包含可能可识别个人身份的信息。这些输出常常类似于训练分布的片段,尽管其出现的机制仍不清楚。

我们在本工作中所考虑的近无约束生成并不能取代标准的基准评估。但它揭示了基准测试系统性地遗漏的东西:当没有人告诉语言模型该说什么时,它们倾向于说什么。如果我们想把LLM理解为系统,而不仅仅是应试者,我们就需要研究它们的默认行为——而不仅仅是它们的最佳答案或提示诱导的输出。更多详细解释和实验请参见我们的论文。

参考文献

[1] Alejandro Salinas, Amit Haim, and Julian Nyarko. What’s in a name? auditing large language models for race and gender bias. arXiv preprint arXiv:2402.14875, 2024.

[2] Tiancheng Hu, Yara Kyrychenko, Steve Rathje, Nigel Collier, Sander van der Linden, and Jon Roozenbeek. Generative language models exhibit social identity biases. Nature Computational Science, 5(1):65–75, 2025.

[3] Sean Welleck, Ilia Kulikov, Stephen Roller, Emily Dinan, Kyunghyun Cho, and Jason Weston. Neural text generation with unlikelihood training. arXiv preprint arXiv:1908.04319, 2019.

[4] Ari Holtzman, Jan Buys, Li Du, Maxwell Forbes, and Yejin Choi. The curious case of neural text degeneration. arXiv preprint arXiv:1904.09751, 2019.

‍

来源:Together AI Blog · together.ai