后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。
来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。
如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度。
论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。
从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。
CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。
1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。
2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。
3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。
# 伪代码:CreativeInstruct 数据构建核心逻辑
def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):
# Step 1: 生成指令变体
variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)
# Step 2: 对每个变体采样多个响应
all_candidates = []
for variant in variants:
responses = sample_responses(teacher_model, variant, num_samples=8)
for resp in responses:
quality = quality_scorer.score(resp, base_instruction)
diversity = diversity_scorer.score(resp, existing_candidates)
all_candidates.append({
"instruction": variant,
"response": resp,
"quality": quality,
"diversity": diversity
})
# Step 3: 重加权选择
selected = []
for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):
if len(selected) >= top_k:
break
if is_sufficiently_different(cand, selected, threshold=0.7):
selected.append(cand)
return selected
这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。
作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:
更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。
CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?
在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。
当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。
但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”
或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。
🏷️ 大语言模型 · 后训练 · 创造性AI · 数据合成 · 多样性优化
⚡ 快手短视频脚本 | 时长:30-40秒
【封面字幕】(大号字体,居中)
当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡
【口播文案】(接地气风格,口语化)
老铁们,今天聊个硬核的——后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
核心就三点:
① (从正文提取第一个关键信息)
② (从正文提取第二个关键信息)
③ (从正文提取第三个关键信息)
懂的点个赞,不懂的评论区问我,下条见!💪
🏷️ 推荐标签:大语言模型, 后训练, 创造性AI, 数据合成, 多样性优化
【微博短帖 | 140字以内核心版】
当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡:后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
#大语言模型 #后训练 #创造性AI
【微博长帖 | 可配图 9 宫格版】
当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
#大语言模型 #后训练 #创造性AI 🔗 https://arxiv.org/abs/2608.07460v1
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。
来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。
如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度。
论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。
从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。
CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。
1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。
2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。
3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。
# 伪代码:CreativeInstruct 数据构建核心逻辑
def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):
# Step 1: 生成指令变体
variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)
# Step 2: 对每个变体采样多个响应
all_candidates = []
for variant in variants:
responses = sample_responses(teacher_model, variant, num_samples=8)
for resp in responses:
quality = quality_scorer.score(resp, base_instruction)
diversity = diversity_scorer.score(resp, existing_candidates)
all_candidates.append({
"instruction": variant,
"response": resp,
"quality": quality,
"diversity": diversity
})
# Step 3: 重加权选择
selected = []
for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):
if len(selected) >= top_k:
break
if is_sufficiently_different(cand, selected, threshold=0.7):
selected.append(cand)
return selected
这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。
作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:
更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。
CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?
在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。
当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。
但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”
或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。
本文梳理了相关技术/事件的核心脉络。如有错误欢迎在评论区指正。
📂 分类:大语言模型 · 后训练 · 创造性AI · 数据合成 · 多样性优化
© 本文由彩虹洋葱 AI 自动聚合,转载请注明出处。
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。
来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。
如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度。
论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。
从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。
CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。
1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。
2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。
3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。
# 伪代码:CreativeInstruct 数据构建核心逻辑
def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):
# Step 1: 生成指令变体
variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)
# Step 2: 对每个变体采样多个响应
all_candidates = []
for variant in variants:
responses = sample_responses(teacher_model, variant, num_samples=8)
for resp in responses:
quality = quality_scorer.score(resp, base_instruction)
diversity = diversity_scorer.score(resp, existing_candidates)
all_candidates.append({
"instruction": variant,
"response": resp,
"quality": quality,
"diversity": diversity
})
# Step 3: 重加权选择
selected = []
for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):
if len(selected) >= top_k:
break
if is_sufficiently_different(cand, selected, threshold=0.7):
selected.append(cand)
return selected
这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。
作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:
更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。
CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?
在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。
当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。
但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”
或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。
以上为当前进展的梳理。欢迎在评论区交流技术细节和不同观点。
🏷️ 标签:大语言模型 · 后训练 · 创造性AI · 数据合成 · 多样性优化
👍 如果对你有帮助,请点赞收藏支持
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。
来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。
如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度。
论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。
从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。
CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。
1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。
2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。
3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。
# 伪代码:CreativeInstruct 数据构建核心逻辑
def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):
# Step 1: 生成指令变体
variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)
# Step 2: 对每个变体采样多个响应
all_candidates = []
for variant in variants:
responses = sample_responses(teacher_model, variant, num_samples=8)
for resp in responses:
quality = quality_scorer.score(resp, base_instruction)
diversity = diversity_scorer.score(resp, existing_candidates)
all_candidates.append({
"instruction": variant,
"response": resp,
"quality": quality,
"diversity": diversity
})
# Step 3: 重加权选择
selected = []
for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):
if len(selected) >= top_k:
break
if is_sufficiently_different(cand, selected, threshold=0.7):
selected.append(cand)
return selected
这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。
作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:
更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。
CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?
在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。
当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。
但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”
或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。
大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性……
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。
来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。
如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度。
论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。
从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。
CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。
1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。
2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。
3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。
# 伪代码:CreativeInstruct 数据构建核心逻辑
def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):
# Step 1: 生成指令变体
variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)
# Step 2: 对每个变体采样多个响应
all_candidates = []
for variant in variants:
responses = sample_responses(teacher_model, variant, num_samples=8)
for resp in responses:
quality = quality_scorer.score(resp, base_instruction)
diversity = diversity_scorer.score(resp, existing_candidates)
all_candidates.append({
"instruction": variant,
"response": resp,
"quality": quality,
"diversity": diversity
})
# Step 3: 重加权选择
selected = []
for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):
if len(selected) >= top_k:
break
if is_sufficiently_different(cand, selected, threshold=0.7):
selected.append(cand)
return selected
这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。
作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:
更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。
CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?
在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。
当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。
但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”
或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。
📌 来源:arXiv | 标签:大语言模型 · 后训练 · 创造性AI · 数据合成 · 多样性优化
本文由彩虹洋葱 AI 自动聚合生成,仅供参考,不构成任何投资或决策建议。后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。
来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。
如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度。
论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。
从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。
CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。
1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。
2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。
3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。
# 伪代码:CreativeInstruct 数据构建核心逻辑
def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):
# Step 1: 生成指令变体
variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)
# Step 2: 对每个变体采样多个响应
all_candidates = []
for variant in variants:
responses = sample_responses(teacher_model, variant, num_samples=8)
for resp in responses:
quality = quality_scorer.score(resp, base_instruction)
diversity = diversity_scorer.score(resp, existing_candidates)
all_candidates.append({
"instruction": variant,
"response": resp,
"quality": quality,
"diversity": diversity
})
# Step 3: 重加权选择
selected = []
for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):
if len(selected) >= top_k:
break
if is_sufficiently_different(cand, selected, threshold=0.7):
selected.append(cand)
return selected
这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。
作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:
更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。
CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?
在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。
当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。
但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”
或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。
📎 参考来源:arXiv:2608.07460v1
🔗 原文链接:https://arxiv.org/abs/2608.07460v1
📺 B站视频脚本 | 时长:3-5分钟
【片头 0:00-0:15】BGM起 → 标题字幕弹出
当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡
【引子 0:15-0:45】制造悬念
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
【时间轴分镜】
├ [00:02] 后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。……
├ [02:04] 大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符……
├ [04:06] 来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativit……
├ [06:08] 如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相……
├ [08:10] 论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就……
├ [结尾] 总结 + 求三连关注
【弹幕互动引导】
🏷️ 标签:大语言模型, 后训练, 创造性AI, 数据合成, 多样性优化
🎬 抖音口播脚本 | 时长:45-60秒
【0-5秒 黄金Hook】
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
【5-35秒 核心信息(口语化表达,每句一行)】
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。 大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性
【35-50秒 深度扩展】
当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡
【50-60秒 强CTO结尾】
觉得有用的话,双击点赞 + 关注,下期继续带你读懂 AI!🔥
📐 拍摄建议:竖屏 9:16 · 科技感电子背景乐 · 关键数据配文字弹幕 · 表情自然语速适中
(正文见下)
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。
来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。
如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度。
论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。
从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。
CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。
1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。
2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。
3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。
# 伪代码:CreativeInstruct 数据构建核心逻辑
def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):
# Step 1: 生成指令变体
variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)
# Step 2: 对每个变体采样多个响应
all_candidates = []
for variant in variants:
responses = sample_responses(teacher_model, variant, num_samples=8)
for resp in responses:
quality = quality_scorer.score(resp, base_instruction)
diversity = diversity_scorer.score(resp, existing_candidates)
all_candidates.append({
"instruction": variant,
"response": resp,
"quality": quality,
"diversity": diversity
})
# Step 3: 重加权选择
selected = []
for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):
if len(selected) >= top_k:
break
if is_sufficiently_different(cand, selected, threshold=0.7):
selected.append(cand)
return selected
这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。
作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:
更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。
CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?
在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。
当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。
但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”
或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。
当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡 🔥
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。
来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。
📌 来源:arXiv
#大语言模型 #后训练 #创造性AI #数据合成 #多样性优化
#科技资讯 #彩虹洋葱AI
点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。
| 平台 | 状态 | 操作 |
|---|---|---|
| 简书 | 📋 手动复制 | |
| 快手 | 📋 手动复制 | |
| 微博 | 🔑 待配置密钥 | |
| CSDN | 📋 手动复制 | |
| 掘金 | 📋 手动复制 | |
| 公众号 | 🔑 待配置密钥 | |
| 今日头条 | 🔑 待配置密钥 | |
| 知乎 | 📋 手动复制 | |
| B站 | 📋 手动复制 | |
| 抖音 | 📋 手动复制 | |
| 百家号 | 🔑 待配置密钥 | |
| 小红书 | 📋 手动复制 |