Drifting Model vs Diffusion:复杂指令理解能力对比
Drifting Model vs Diffusion:复杂指令理解能力对比 #
原文链接:https://zhuanlan.zhihu.com/p/2004759114652332877 作者:Cheza(Upenn NLPer)
核心结论 #
Drifting Model 在复杂指令理解上存在劣势,主要瓶颈在于数据稀疏性和缺乏推理缓冲机制。
一、生成机制对比 #
| 维度 | Diffusion (扩散模型) | Drifting Model (漂移模型) |
|---|---|---|
| 生成方式 | 多步迭代去噪 | 一步直接生成 |
| 类比 | 做复杂数学题,可以写步骤 | 背答案,必须直接写出结果 |
| 推理过程 | 将复杂指令拆解为几十个小步骤,逐步修正 | 无中间步骤,一次性输出最终结果 |
示例:Prompt「画一只戴眼镜在火星吃拉面的猫」 #
Diffusion:
- Step 1:先画个猫的轮廓(去噪 10%)
- Step 2:给猫加上眼镜(去噪 20%)
- Step 3:把背景涂红像火星(去噪 50%)
- Step 4:修正细节,把碗里的东西画成拉面(去噪 90%)
Drifting Model:
- 必须在看到 Prompt 的瞬间,大脑里直接计算出像素的最终排列,然后一次性输出
二、复杂指令理解的优劣 #
Diffusion 的优势 #
- 持续引导:文本可多次注入到生成的每个阶段
- 细粒度学习:学习的是
∇ log p(x|text)(分数函数),即「在这个时刻如何根据文本修改图片」 - 容错性强:中间步骤出错,后续有机会修补
Drifting Model 的劣势 #
数据稀疏问题:
- 依赖正样本群定义「拉力场」
- ImageNet 分类中,所有猫的图片都可作为正样本
- 但复杂 Prompt(如「火星吃拉面的猫」)可能只有一张对应图,无法定义密集的目标分布
映射能力要求极高:
- 需将所有推理内化到权重里
- 处理否定句、空间关系、多物体互动等复杂逻辑时难度指数级上升
训练机制限制:
- 学习的是
x → x + V(x, text)(漂移场) - 缺乏足够样本时,漂移场计算不稳定,容易过拟合到单张图片
- 学习的是
三、关键瓶颈总结 #
复杂 Prompt → 对应样本稀疏 → 无法定义密集场 → 漂移方向不明确/不稳定
↓
一步生成缺乏迭代修正机制
↓
生成质量下降
四、评论区补充观点 #
- 工程 trick 问题:Drifting Model 需要大量工程技巧(特征 patch 聚合、二阶矩、温度参数等),缺乏理论完美性,且缺少消融实验验证
- 步数与梯度:推理时间步数支撑更细腻的梯度响应,步数多才能实现合理的内插外推;否则需要更大参数空间硬换
五、结论 #
| 场景 | 推荐模型 |
|---|---|
| 简单概念(如「猫」) | Drifting Model ✓(速度快) |
| 复杂逻辑组合(多物体、空间关系、否定句) | Diffusion ✓(推理缓冲优势) |
Diffusion 的迭代过程本质上充当了一种 Latent Reasoning(隐式推理),而 Drifting Model 需要一次性完成全部推理,对模型容量和数据密度要求极高。