为什么 AI 生成的餐厅菜单看起来令人不安地相似且过于精致
目录
你可能想知道
为什么 AI 生成的菜单插图常常看起来几乎正确但又以某种方式错误?
模型训练做法和反复编辑如何导致食物图像变得过于光滑且趋于一致?
主要议题
当你第一次注意到它时,通常会有一种轻微的迷失感。你打开一家咖啡馆的菜单,看到一排贝果三明治或几碗冰淇淋被渲染得令人不安地完美:每个元素都精确对称,表面异常光滑,比例感觉微妙地不对。你怀疑自己是不是过于苛刻,但这种感觉仍然存在。这种感觉并非单纯的主观偏执——它反映了许多生成式 AI 系统的训练方式以及它们如何再现一种狭窄的美学理想。
现代图像与语言生成系统——包括扩散模型和大型语言模型 (LLM)——通过摄取大量视觉与文本数据并提取统计模式来学习。当被提示“为一家汉堡店创建菜单”时,此类模型并不是从第一性原理发明;它是根据在训练示例中看到的模式预测一个合适的输出。如果那些示例主要是某种商业或“悦目”的外观,模型就会回响那种风格。在实践中,这会产生类似连锁餐厅广告的视觉:一致的照明、整洁的构图和超吸引人的摆盘。
造成相似性和不安感的原因有若干相互作用。首先,训练语料本身会使输出产生偏差。如果大量可用的训练图像反映特定时代、风格或商业摄影标准,模型的输出将朝该风格收敛。正如一位从业者所指出,有些输出看起来像某个连锁或某个年份的菜单——因为那些内容构成了数据集的一大部分。
其次,模型训练中使用的优化目标经常偏好“悦目性”并避免冒犯或令人震惊的内容。这些目标鼓励模型平滑掉异常和边缘情况,产生经过净化、讨喜的结果。 这种平滑会去除那些让真实食物显得有质感和可口的视觉不规则性与纹理复杂性——从而产生一种微妙但强烈的错位感。 真实的烘焙食品会显示小瑕疵、融化的奶酪有随机的拉丝,或蔬菜有不规则的形状和斑点,而 AI 的输出常常呈现理想化、统一的形状,我们的感知会将其标记为不自然。
第三,迭代编辑会放大这一效应。设计师和操作者常对 AI 生成的菜单做微小修改——更新价格、替换项目名或做少量版面调整——然后重新运行生成或应用连续编辑。每次编辑都可能把图像向模型的均值预测推动,逐步抹去区分性的细节。重复编辑生成菜单的研究者和爱好者观察到,图像在每次迭代后变得越来越圆润、越来越光滑且越来越不真实。累积效应可能令人不安:一张乍看几乎成功地像真实的图像,最终落入“不可思议的谷”(uncanny valley),在近似真实时反而引发比明显风格化更强的不适感。
还有一个与数据卫生相关的重要现象称为模型崩溃。当生成模型的输出大量被并入训练数据时,模型可能开始从自身的输出而非多样的人类创作示例中学习。虽然完全崩溃——有用变异性的完全退化——是极端且相对罕见的,但一种较温和的形式称为收敛会发生。收敛降低多样性并将输出驱向更狭窄的特征集合,强化了相似性问题而非解决它。
对这些图像的情绪反应并非纯粹文化性的;实验证据支持一种心理机制。研究显示,近乎真实的食物图像会引发“可怖谷”反应:当图像接近真实但未能捕捉关键微妙之处时,观察者会感到不适甚至厌恶。这一效应又被文化语境所放大:AI 被广泛讨论为既有前景又有问题,使观众更可能审视媒体以寻找操纵迹象,并在发现时作出负面反应。
超越菜单范围,更广泛的影响是显著的。视觉和音频证据在法律、新闻和社会语境中历来具有特殊权威。随着生成模型改进并其产物大量涌现,这种信任被动摇。虚假或细微改动的图像可以影响决策和感知,而同质化、AI 优化的美学的普及也改变了人们对图像应有外观的期望。这些变化提出了关于真实性、来源以及采用 AI 工具为面向公众的内容的企业所应承担责任的问题。
可以采取一些实用应对措施。谨慎策划训练数据、避免将模型输出重新摄入未来训练以及采用重视多样性和纹理而不仅仅是技术上“悦目性”的评估指标,都能缓解同质化。人类监督——不仅为了事实准确性,也为了美学忠实度——可以帮助保留那些表明真实性的小不规则性。对餐厅和设计师而言,这可能意味着将实际菜品的摄影与 AI 协助的版面工作结合,而不是完全依赖合成图像。
简言之,你在看许多 AI 生成菜单时感到的不安,源自当前模型的训练与迭代使用方式:对偏向精致商业影像的数据集进行的统计式模式匹配、去除纹理与不规则性的平滑化目标,以及会放大模型偏好美学的重复编辑。结果是一种同质化的视觉语言,乍看悦目但常常触发一种本能的錯覺:某處不對勁。
关键见解表
| 面向 | 说明 |
|---|---|
| 训练数据偏差 | 模型从大型数据集中学习主导模式;如果以商业化、精致的影像为主,输出将反映该美学。 |
| 偏向悦目性的优化 | 优先非冒犯性、吸引人的结果的目标趋向平滑纹理并移除不规则性,导致同质化。 |
| 迭代编辑效应 | 重复的编辑与再生成会将图像推向模型的平均输出,逐步降低真实感与独特性。 |
| 模型收敛/崩溃 | 将模型输出回填到训练中会降低变异并强化跨代的风格收敛。 |
| 心理反应 | 近乎真实但不完美的图像常触发“可怖谷”反应,造成观者不适或厌恶。 |
| 更广泛的影响 | 同质化的 AI 影像影响对视觉证据的信任,并重塑广告与媒体中对真实性的期望。 |
随后……
展望未来,有几条技术和程序路径值得关注。首先,更好的数据治理至关重要:保护训练集的多样性与来源,并防止过度回收 AI 生成的输出,将有助于维持模型行为的多样性。其次,研究能奖励纹理、不对称和自然不完美——而不仅仅是广泛吸引力——的目标函数,可能产生更具真实感的图像。最后,来源追溯、浮水印和内容验证工具可以帮助受众与平台识别合成素材并维护视觉媒体的信任。
这些方向并非纯技术性的。它们需要技术人员、设计师、心理学家与法律专家的跨学科合作,以在创新与文化與伦理考量间取得平衡。对保留真实性的微妙强调——例如有意保留食物摄影中的某些不规则性——可能与算法修正同样重要。随着我们将生成工具整合到日常工作流程中,应优先采取尊重人类感知并维护公众生活中影像可信度的方法。 探索来源系统、数据集多样性方法和感知度量是有前景的下一步。