AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月7日 · Recipes for Creativity

Recipes for Creativity: Iterative Generation and Evaluation in Large Language Models

发生了什么

一项针对大型语言模型(LLM)的试点研究将 FunSearch 方法应用于 2024 年 Pillsbury Bake-Off 的食谱生成,并通过基于 TTCT 的 LLM 评估与人类基准进行比较。实验表明,迭代生成-选择可产生与人类基准相当的创造力分数,但增加迭代次数本身并不提升创造力;较小的选择评分器在多数 TTCT 维度上显著提高分数,而温度影响有限。

EVENT STORY

发展脉络

  1. 首次出现Recipes for Creativity: Iterative Generation and Evaluation in Large Language ModelsarXiv cs.AI
  2. 当前判断该研究为创意生成类 AI 产品(如食谱、文案、设计)提供了设计指导:优化评估器可能比增加迭代次数更有效。这可能导致行业从单纯追求生成模型能力转向关注评估与筛选机制,从而影响相关产品的开发策略。Agent Pulse · 分析
改变了什么

该研究将 FunSearch 的迭代生成与评估方法应用于食谱生成,以探索 LLM 的创造力。通过两个实验,研究者测试了迭代次数、生成器温度和循环内选择评分器大小的影响。结果显示,迭代生成-选择能够产生与人类基准相当的创造力分数,但仅增加迭代次数并不能提升创造力。关键发现是,循环内评估器的设计(尤其是选择评分器的大小)是影响创造力的首要因素:较小的评分器在多数 TTCT 维度上显著提高分数,而温度仅对原创性有有限影响。这表明在主观创造性搜索中,评估器的设计是第一阶设计变量。

能力边界怎么变了

该研究将 FunSearch 的进化搜索框架应用于开放式创意任务,并强调评估器设计的重要性。较小的选择评分器可能通过引入更多随机性或更宽松的筛选标准,从而保留更多多样性,进而提升创造力分数。这提示在构建生成-评估循环时,评估器的选择应被视为关键超参数,而非仅关注生成器。

为什么重要

该研究为创意生成类 AI 产品(如食谱、文案、设计)提供了设计指导:优化评估器可能比增加迭代次数更有效。这可能导致行业从单纯追求生成模型能力转向关注评估与筛选机制,从而影响相关产品的开发策略。

对谁有影响

对于开发创意生成工具的企业,该研究表明通过调整评估器设计(如使用较小的模型)可以在不增加计算成本的情况下提升输出创造力,从而改善产品竞争力。这为优化生成-评估流程提供了低成本高收益的改进方向。

接下来观察

未来研究可能进一步探索不同评估器设计(如评分器大小、提示策略)对创造力各维度的影响,并验证在更广泛创意任务中的适用性。可验证的信号包括:后续研究是否在更多领域复现评估器大小效应,以及产品是否开始采用更小的评估模型。