creativeinstruct-scalably-teaching-llms-to-balance-quality-c

2026年08月11日 | 来源:
信息源:

📋 多平台草稿预览 (12平台差异化改编)

当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡

后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。


后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。

来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。

后训练的“隐形代价”:多样性塌缩

如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度

论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。

从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。

CreativeInstruct:用合成数据重写“创造力基因”

CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。

方法拆解:三步走

1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。

2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。

3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。

# 伪代码:CreativeInstruct 数据构建核心逻辑

def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):

# Step 1: 生成指令变体

variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)

# Step 2: 对每个变体采样多个响应

all_candidates = []

for variant in variants:

responses = sample_responses(teacher_model, variant, num_samples=8)

for resp in responses:

quality = quality_scorer.score(resp, base_instruction)

diversity = diversity_scorer.score(resp, existing_candidates)

all_candidates.append({

"instruction": variant,

"response": resp,

"quality": quality,

"diversity": diversity

})

# Step 3: 重加权选择

selected = []

for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):

if len(selected) >= top_k:

break

if is_sufficiently_different(cand, selected, threshold=0.7):

selected.append(cand)

return selected

这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。

实验验证:创造力回来了,但质量没掉

作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:

    • 多样性指标提升显著:在Self-BLEU(越低越好)上,CreativeInstruct训练的模型比基线低了约18%,意味着输出重复率大幅降低。
    • 质量保持稳定:在AlpacaEval的GPT-4评分上,CreativeInstruct模型仅比纯质量优化的基线低0.3分(满分5分),差距在统计上不显著。
    • 隐性创造力任务受益:在一个模拟的强化学习探索任务中,使用CreativeInstruct模型作为策略网络的Agent,其发现新状态的比例比基线高出22%。

更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。

平衡的艺术:走向“可控创造力”

CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?

在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。

当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。

但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”

或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。



写于彩虹洋葱 AI 聚合平台 · 如果你也对科技趋势感兴趣,欢迎交流。

🏷️ 大语言模型 · 后训练 · 创造性AI · 数据合成 · 多样性优化

快手短视频脚本 | 时长:30-40秒

【封面字幕】(大号字体,居中)

当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡

【口播文案】(接地气风格,口语化)

老铁们,今天聊个硬核的——后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

核心就三点:

① (从正文提取第一个关键信息)

② (从正文提取第二个关键信息)

③ (从正文提取第三个关键信息)

懂的点个赞,不懂的评论区问我,下条见!💪


🏷️ 推荐标签:大语言模型, 后训练, 创造性AI, 数据合成, 多样性优化

【微博短帖 | 140字以内核心版】

当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡:后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

#大语言模型 #后训练 #创造性AI


【微博长帖 | 可配图 9 宫格版】

当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡

后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

#大语言模型 #后训练 #创造性AI 🔗 https://arxiv.org/abs/2608.07460v1

当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡

前言

后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。


后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。

来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。

后训练的“隐形代价”:多样性塌缩

如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度

论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。

从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。

CreativeInstruct:用合成数据重写“创造力基因”

CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。

方法拆解:三步走

1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。

2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。

3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。

# 伪代码:CreativeInstruct 数据构建核心逻辑

def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):

# Step 1: 生成指令变体

variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)

# Step 2: 对每个变体采样多个响应

all_candidates = []

for variant in variants:

responses = sample_responses(teacher_model, variant, num_samples=8)

for resp in responses:

quality = quality_scorer.score(resp, base_instruction)

diversity = diversity_scorer.score(resp, existing_candidates)

all_candidates.append({

"instruction": variant,

"response": resp,

"quality": quality,

"diversity": diversity

})

# Step 3: 重加权选择

selected = []

for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):

if len(selected) >= top_k:

break

if is_sufficiently_different(cand, selected, threshold=0.7):

selected.append(cand)

return selected

这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。

实验验证:创造力回来了,但质量没掉

作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:

    • 多样性指标提升显著:在Self-BLEU(越低越好)上,CreativeInstruct训练的模型比基线低了约18%,意味着输出重复率大幅降低。
    • 质量保持稳定:在AlpacaEval的GPT-4评分上,CreativeInstruct模型仅比纯质量优化的基线低0.3分(满分5分),差距在统计上不显著。
    • 隐性创造力任务受益:在一个模拟的强化学习探索任务中,使用CreativeInstruct模型作为策略网络的Agent,其发现新状态的比例比基线高出22%。

更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。

平衡的艺术:走向“可控创造力”

CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?

在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。

当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。

但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”

或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。



总结

本文梳理了相关技术/事件的核心脉络。如有错误欢迎在评论区指正。


📂 分类:大语言模型 · 后训练 · 创造性AI · 数据合成 · 多样性优化

© 本文由彩虹洋葱 AI 自动聚合,转载请注明出处。

当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡

后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。

来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。

后训练的“隐形代价”:多样性塌缩

如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度

论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。

从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。

CreativeInstruct:用合成数据重写“创造力基因”

CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。

方法拆解:三步走

1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。

2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。

3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。

# 伪代码:CreativeInstruct 数据构建核心逻辑

def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):

# Step 1: 生成指令变体

variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)

# Step 2: 对每个变体采样多个响应

all_candidates = []

for variant in variants:

responses = sample_responses(teacher_model, variant, num_samples=8)

for resp in responses:

quality = quality_scorer.score(resp, base_instruction)

diversity = diversity_scorer.score(resp, existing_candidates)

all_candidates.append({

"instruction": variant,

"response": resp,

"quality": quality,

"diversity": diversity

})

# Step 3: 重加权选择

selected = []

for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):

if len(selected) >= top_k:

break

if is_sufficiently_different(cand, selected, threshold=0.7):

selected.append(cand)

return selected

这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。

实验验证:创造力回来了,但质量没掉

作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:

    • 多样性指标提升显著:在Self-BLEU(越低越好)上,CreativeInstruct训练的模型比基线低了约18%,意味着输出重复率大幅降低。
    • 质量保持稳定:在AlpacaEval的GPT-4评分上,CreativeInstruct模型仅比纯质量优化的基线低0.3分(满分5分),差距在统计上不显著。
    • 隐性创造力任务受益:在一个模拟的强化学习探索任务中,使用CreativeInstruct模型作为策略网络的Agent,其发现新状态的比例比基线高出22%。

更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。

平衡的艺术:走向“可控创造力”

CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?

在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。

当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。

但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”

或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。



总结 & 思考

以上为当前进展的梳理。欢迎在评论区交流技术细节和不同观点。


🏷️ 标签:大语言模型 · 后训练 · 创造性AI · 数据合成 · 多样性优化

👍 如果对你有帮助,请点赞收藏支持

当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡

后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。

来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。

后训练的“隐形代价”:多样性塌缩

如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度

论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。

从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。

CreativeInstruct:用合成数据重写“创造力基因”

CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。

方法拆解:三步走

1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。

2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。

3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。

# 伪代码:CreativeInstruct 数据构建核心逻辑

def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):

# Step 1: 生成指令变体

variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)

# Step 2: 对每个变体采样多个响应

all_candidates = []

for variant in variants:

responses = sample_responses(teacher_model, variant, num_samples=8)

for resp in responses:

quality = quality_scorer.score(resp, base_instruction)

diversity = diversity_scorer.score(resp, existing_candidates)

all_candidates.append({

"instruction": variant,

"response": resp,

"quality": quality,

"diversity": diversity

})

# Step 3: 重加权选择

selected = []

for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):

if len(selected) >= top_k:

break

if is_sufficiently_different(cand, selected, threshold=0.7):

selected.append(cand)

return selected

这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。

实验验证:创造力回来了,但质量没掉

作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:

    • 多样性指标提升显著:在Self-BLEU(越低越好)上,CreativeInstruct训练的模型比基线低了约18%,意味着输出重复率大幅降低。
    • 质量保持稳定:在AlpacaEval的GPT-4评分上,CreativeInstruct模型仅比纯质量优化的基线低0.3分(满分5分),差距在统计上不显著。
    • 隐性创造力任务受益:在一个模拟的强化学习探索任务中,使用CreativeInstruct模型作为策略网络的Agent,其发现新状态的比例比基线高出22%。

更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。

平衡的艺术:走向“可控创造力”

CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?

在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。

当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。

但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”

或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。



信息源:arXiv:2608.07460v1 标签:大语言模型, 后训练, 创造性AI, 数据合成, 多样性优化

当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡

摘要:后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性……


后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。

来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。

后训练的“隐形代价”:多样性塌缩

如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度

论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。

从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。

CreativeInstruct:用合成数据重写“创造力基因”

CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。

方法拆解:三步走

1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。

2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。

3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。

# 伪代码:CreativeInstruct 数据构建核心逻辑

def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):

# Step 1: 生成指令变体

variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)

# Step 2: 对每个变体采样多个响应

all_candidates = []

for variant in variants:

responses = sample_responses(teacher_model, variant, num_samples=8)

for resp in responses:

quality = quality_scorer.score(resp, base_instruction)

diversity = diversity_scorer.score(resp, existing_candidates)

all_candidates.append({

"instruction": variant,

"response": resp,

"quality": quality,

"diversity": diversity

})

# Step 3: 重加权选择

selected = []

for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):

if len(selected) >= top_k:

break

if is_sufficiently_different(cand, selected, threshold=0.7):

selected.append(cand)

return selected

这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。

实验验证:创造力回来了,但质量没掉

作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:

    • 多样性指标提升显著:在Self-BLEU(越低越好)上,CreativeInstruct训练的模型比基线低了约18%,意味着输出重复率大幅降低。
    • 质量保持稳定:在AlpacaEval的GPT-4评分上,CreativeInstruct模型仅比纯质量优化的基线低0.3分(满分5分),差距在统计上不显著。
    • 隐性创造力任务受益:在一个模拟的强化学习探索任务中,使用CreativeInstruct模型作为策略网络的Agent,其发现新状态的比例比基线高出22%。

更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。

平衡的艺术:走向“可控创造力”

CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?

在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。

当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。

但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”

或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。



📌 来源:arXiv | 标签:大语言模型 · 后训练 · 创造性AI · 数据合成 · 多样性优化

本文由彩虹洋葱 AI 自动聚合生成,仅供参考,不构成任何投资或决策建议。

问题:如何看待「当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡」?

后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。


后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。

来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。

后训练的“隐形代价”:多样性塌缩

如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度

论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。

从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。

CreativeInstruct:用合成数据重写“创造力基因”

CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。

方法拆解:三步走

1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。

2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。

3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。

# 伪代码:CreativeInstruct 数据构建核心逻辑

def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):

# Step 1: 生成指令变体

variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)

# Step 2: 对每个变体采样多个响应

all_candidates = []

for variant in variants:

responses = sample_responses(teacher_model, variant, num_samples=8)

for resp in responses:

quality = quality_scorer.score(resp, base_instruction)

diversity = diversity_scorer.score(resp, existing_candidates)

all_candidates.append({

"instruction": variant,

"response": resp,

"quality": quality,

"diversity": diversity

})

# Step 3: 重加权选择

selected = []

for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):

if len(selected) >= top_k:

break

if is_sufficiently_different(cand, selected, threshold=0.7):

selected.append(cand)

return selected

这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。

实验验证:创造力回来了,但质量没掉

作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:

    • 多样性指标提升显著:在Self-BLEU(越低越好)上,CreativeInstruct训练的模型比基线低了约18%,意味着输出重复率大幅降低。
    • 质量保持稳定:在AlpacaEval的GPT-4评分上,CreativeInstruct模型仅比纯质量优化的基线低0.3分(满分5分),差距在统计上不显著。
    • 隐性创造力任务受益:在一个模拟的强化学习探索任务中,使用CreativeInstruct模型作为策略网络的Agent,其发现新状态的比例比基线高出22%。

更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。

平衡的艺术:走向“可控创造力”

CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?

在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。

当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。

但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”

或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。



总结: 以上分析基于公开信息整理。核心在于理解这一事件/技术背后的驱动力,而非停留在表面叙事。欢迎在评论区交流你的看法。

📎 参考来源:arXiv:2608.07460v1

🔗 原文链接:https://arxiv.org/abs/2608.07460v1

📺 B站视频脚本 | 时长:3-5分钟

【片头 0:00-0:15】BGM起 → 标题字幕弹出

当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡

【引子 0:15-0:45】制造悬念

后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

【时间轴分镜】

├ [00:02] 后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。……

├ [02:04] 大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符……

├ [04:06] 来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativit……

├ [06:08] 如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相……

├ [08:10] 论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就……

├ [结尾] 总结 + 求三连关注

【弹幕互动引导】

  • "觉得有用的扣 1"
  • "不同观点的弹幕见"
  • 结尾设置投票:你看好这个方向吗?A.看好 B.观望 C.不看好

🏷️ 标签:大语言模型, 后训练, 创造性AI, 数据合成, 多样性优化

🎬 抖音口播脚本 | 时长:45-60秒

【0-5秒 黄金Hook】

后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

【5-35秒 核心信息(口语化表达,每句一行)】

后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。 大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性

【35-50秒 深度扩展】

当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡

【50-60秒 强CTO结尾】

觉得有用的话,双击点赞 + 关注,下期继续带你读懂 AI!🔥


📐 拍摄建议:竖屏 9:16 · 科技感电子背景乐 · 关键数据配文字弹幕 · 表情自然语速适中

当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡

【导语】 后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。
本文目录:

(正文见下)


后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。

来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。

后训练的“隐形代价”:多样性塌缩

如果你使用过GPT-4或Claude这类顶级模型,可能会注意到一个现象:让它们写十个不同版本的同一个故事,前几个还像模像样,到后面几个就开始出现结构雷同、情节相似的情况。这并非偶然——RLHF等后训练方法本质上是在优化“期望值”,而期望值的最大化天然会牺牲分布的广度

论文作者指出,这种多样性下降不仅影响创意写作等“显性”创造力任务,更会波及那些“隐性”需要创造力的场景。比如在强化学习中,如果策略模型的输出过于单一,探索空间就会被严重压缩,导致Agent难以发现新策略。再比如代码生成,如果模型总是倾向于输出同一种解决方案,那么在多智能体协作或测试用例生成时就会陷入“思维定势”。

从技术角度看,后训练中的KL散度惩罚、奖励模型的“安全倾向”以及指令微调中的“对齐偏好”,都在无形中把模型推向“平均化”的输出分布。这就像一个作家被编辑反复修改后,所有作品都带上了同一个编辑的“口音”。

CreativeInstruct:用合成数据重写“创造力基因”

CreativeInstruct的核心思路并不复杂,但执行起来颇有巧思。它不试图修改后训练算法本身,而是在数据层面注入“创造力多样性”——通过构建高质量的合成指令数据,让模型在微调阶段就接触到“同题多解”的范例,从而在输出分布上保留更多可能性。

方法拆解:三步走

1. 指令变体生成:针对同一个基础指令(如“写一个关于AI觉醒的短篇科幻”),使用教师模型生成多个语义等价但表达不同的指令变体。这一步的关键在于“语义等价”的约束——不能变成完全不同的任务,而是要在“任务内核”不变的前提下,变化提问角度、语气风格和上下文细节。

2. 多候选响应采样:对每个指令变体,从教师模型中采样多个响应,并通过一个“多样性评分器”筛选出质量高且彼此差异大的候选。这里的评分器不是简单看BLEU或ROUGE,而是综合了语义相似度(如使用Sentence-BERT编码后的余弦距离)和结构差异度。

3. 平衡重加权:在最终训练集构建中,对质量分和多样性分进行加权组合,确保高多样性但不牺牲基础质量。作者设计了一个自适应的权重公式,让那些“质量足够高且多样性贡献大”的样本获得更高采样权重。

# 伪代码:CreativeInstruct 数据构建核心逻辑

def creative_instruct_pipeline(base_instruction, teacher_model, diversity_scorer, quality_scorer, top_k=5):

# Step 1: 生成指令变体

variants = generate_semantic_variants(base_instruction, teacher_model, num_variants=3)

# Step 2: 对每个变体采样多个响应

all_candidates = []

for variant in variants:

responses = sample_responses(teacher_model, variant, num_samples=8)

for resp in responses:

quality = quality_scorer.score(resp, base_instruction)

diversity = diversity_scorer.score(resp, existing_candidates)

all_candidates.append({

"instruction": variant,

"response": resp,

"quality": quality,

"diversity": diversity

})

# Step 3: 重加权选择

selected = []

for cand in sorted(all_candidates, key=lambda x: x["quality"] + 0.3 * x["diversity"], reverse=True):

if len(selected) >= top_k:

break

if is_sufficiently_different(cand, selected, threshold=0.7):

selected.append(cand)

return selected

这种方法的最大优势在于可扩展性——它不依赖昂贵的人工标注,而是通过教师模型+自动化评分器实现全流程合成,理论上可以无限生成训练数据。

实验验证:创造力回来了,但质量没掉

作者在多个基准上进行了验证,包括创意写作(StoryBench)、指令跟随(AlpacaEval)和开放域生成多样性(Distinct-N、Self-BLEU)。结果显示:

    • 多样性指标提升显著:在Self-BLEU(越低越好)上,CreativeInstruct训练的模型比基线低了约18%,意味着输出重复率大幅降低。
    • 质量保持稳定:在AlpacaEval的GPT-4评分上,CreativeInstruct模型仅比纯质量优化的基线低0.3分(满分5分),差距在统计上不显著。
    • 隐性创造力任务受益:在一个模拟的强化学习探索任务中,使用CreativeInstruct模型作为策略网络的Agent,其发现新状态的比例比基线高出22%。

更值得注意的是,作者还发现多样性数据不会“污染”指令遵循能力。通过精心设计的指令变体,模型反而学会了从多个角度理解用户意图,反而提升了在模糊指令下的表现。

平衡的艺术:走向“可控创造力”

CreativeInstruct的意义不仅在于一个具体方法,更在于它揭示了一个更深层的问题:我们是否过度优化了“对齐”而牺牲了“智能的广度”?

在AGI的讨论中,创造力被视为人类智能的核心组成部分。如果后训练过程系统性地削弱模型的创造力,那么即便模型在基准测试上分数再高,也只是一个“高性能复读机”。

当然,CreativeInstruct并非完美。作者也坦言,多样性评分器的设计仍有主观性,且教师模型本身的能力上限会影响合成数据的质量天花板。此外,如何在不同任务间动态调节“质量-多样性”的平衡点,仍是开放问题。

但这条路的方向是对的——未来的对齐技术,应该追求“可控的创造力”而非“单一的正确答案”。正如一位研究者所言:“我们不希望AI只会写八股文,我们希望AI能写出《哈姆雷特》,同时也能写出《百年孤独》。”

或许,下一轮大模型竞赛的胜负手,不在于谁的参数更多,而在于谁能让模型在“聪明”与“有趣”之间找到更好的平衡。CreativeInstruct给了我们一个值得深思的起点。



关键词:大语言模型, 后训练, 创造性AI, 数据合成, 多样性优化 声明:本文由彩虹洋葱 AI 智能聚合生成,仅供信息参考。

当后训练扼杀了创造力:CreativeInstruct如何让大模型在质量、创意与多样性之间找到平衡 🔥

后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。


后训练让大模型更听话,却也让它们失去了“想象力”。当输出多样性成为强化学习、创意写作等任务的隐形瓶颈,一场关于“如何让AI既聪明又有趣”的平衡术正在上演。

大语言模型(LLM)的后训练阶段——无论是监督微调(SFT)、人类反馈强化学习(RLHF),还是基于AI反馈的强化学习(RLAIF)——本质上都是为了让模型更符合人类的期望。但一个被忽视的副作用是:这些优化过程正在系统性地压低模型的输出多样性。换句话说,我们教会了模型“正确”地说话,却忘了怎么让它们“自由”地思考。

来自arXiv的最新论文《CreativeInstruct: Scalably Teach LLMs to Balance Quality, Creativity, and Diversity》直接切入这一痛点,提出了一种可扩展的合成数据方法,试图在保持输出质量的同时,恢复甚至增强模型的创造力和多样性。


📌 来源:arXiv

#大语言模型 #后训练 #创造性AI #数据合成 #多样性优化

#科技资讯 #彩虹洋葱AI

🚀 多平台发布

点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。

平台状态操作
✍️ 简书📋 手动复制
快手📋 手动复制
🐦 微博🔑 待配置密钥
💻 CSDN📋 手动复制
⛏️ 掘金📋 手动复制
💬 公众号🔑 待配置密钥
📰 今日头条🔑 待配置密钥
🤔 知乎📋 手动复制
📺 B站📋 手动复制
🎵 抖音📋 手动复制
📝 百家号🔑 待配置密钥
📕 小红书📋 手动复制