1. 笔记/

Drifting Model vs Diffusion:复杂指令理解能力对比

Drifting Model vs Diffusion:复杂指令理解能力对比 #

原文链接:https://zhuanlan.zhihu.com/p/2004759114652332877 作者:Cheza(Upenn NLPer)


核心结论 #

Drifting Model 在复杂指令理解上存在劣势,主要瓶颈在于数据稀疏性缺乏推理缓冲机制


一、生成机制对比 #

维度Diffusion (扩散模型)Drifting Model (漂移模型)
生成方式多步迭代去噪一步直接生成
类比做复杂数学题,可以写步骤背答案,必须直接写出结果
推理过程将复杂指令拆解为几十个小步骤,逐步修正无中间步骤,一次性输出最终结果

示例:Prompt「画一只戴眼镜在火星吃拉面的猫」 #

Diffusion

  • Step 1:先画个猫的轮廓(去噪 10%)
  • Step 2:给猫加上眼镜(去噪 20%)
  • Step 3:把背景涂红像火星(去噪 50%)
  • Step 4:修正细节,把碗里的东西画成拉面(去噪 90%)

Drifting Model

  • 必须在看到 Prompt 的瞬间,大脑里直接计算出像素的最终排列,然后一次性输出

二、复杂指令理解的优劣 #

Diffusion 的优势 #

  1. 持续引导:文本可多次注入到生成的每个阶段
  2. 细粒度学习:学习的是 ∇ log p(x|text)(分数函数),即「在这个时刻如何根据文本修改图片」
  3. 容错性强:中间步骤出错,后续有机会修补

Drifting Model 的劣势 #

  1. 数据稀疏问题

    • 依赖正样本群定义「拉力场」
    • ImageNet 分类中,所有猫的图片都可作为正样本
    • 但复杂 Prompt(如「火星吃拉面的猫」)可能只有一张对应图,无法定义密集的目标分布
  2. 映射能力要求极高

    • 需将所有推理内化到权重里
    • 处理否定句、空间关系、多物体互动等复杂逻辑时难度指数级上升
  3. 训练机制限制

    • 学习的是 x → x + V(x, text)(漂移场)
    • 缺乏足够样本时,漂移场计算不稳定,容易过拟合到单张图片

三、关键瓶颈总结 #

复杂 Prompt → 对应样本稀疏 → 无法定义密集场 → 漂移方向不明确/不稳定
                    ↓
        一步生成缺乏迭代修正机制
                    ↓
              生成质量下降

四、评论区补充观点 #

  • 工程 trick 问题:Drifting Model 需要大量工程技巧(特征 patch 聚合、二阶矩、温度参数等),缺乏理论完美性,且缺少消融实验验证
  • 步数与梯度:推理时间步数支撑更细腻的梯度响应,步数多才能实现合理的内插外推;否则需要更大参数空间硬换

五、结论 #

场景推荐模型
简单概念(如「猫」)Drifting Model ✓(速度快)
复杂逻辑组合(多物体、空间关系、否定句)Diffusion ✓(推理缓冲优势)

Diffusion 的迭代过程本质上充当了一种 Latent Reasoning(隐式推理),而 Drifting Model 需要一次性完成全部推理,对模型容量和数据密度要求极高。