1
00:00:00,000 --> 00:00:06,640
图像生成器会作出一连串数值选择。提示描述部分目标，随机状态提供起点，训练好的模型引导输出。任何一项改变，都可能改变图片。

2
00:00:06,640 --> 00:00:10,920
图像生成器会作出一连串数值选择。提示描述部分目标，随机状态提供起点，训练好的模型引导输出。任何一项改变，都可能改变图片。

3
00:00:10,920 --> 00:00:19,780
这节课把这些机制与图像制作联系起来，内容包括扩散、压缩表示、注意力、种子、引导、采样和编辑，后面再延伸到视频、助手、世界模型与机器人动作。

4
00:00:19,780 --> 00:00:24,920
这节课把这些机制与图像制作联系起来，内容包括扩散、压缩表示、注意力、种子、引导、采样和编辑，后面再延伸到视频、助手、世界模型与机器人动作。

5
00:00:24,920 --> 00:00:33,400
艺术部分包括机位透视、深度线索、明暗与颜色、角色连续性和局部修复。小计算说明设置改变了什么，论文图片提供例子，受控比较帮助区分设置效果与偶然结果。

6
00:00:33,400 --> 00:00:40,015
艺术部分包括机位透视、深度线索、明暗与颜色、角色连续性和局部修复。小计算说明设置改变了什么，论文图片提供例子，受控比较帮助区分设置效果与偶然结果。

7
00:00:40,315 --> 00:00:48,375
第一个问题是为什么一个提示能产生很多图片。答案包括指令不完整和随机性：一句话很少规定所有位置、表面和灯光条件，所以可能有很多符合要求的图。

8
00:00:48,375 --> 00:00:51,595
第一个问题是为什么一个提示能产生很多图片。答案包括指令不完整和随机性：一句话很少规定所有位置、表面和灯光条件，所以可能有很多符合要求的图。

9
00:00:51,595 --> 00:01:00,375
第二个问题是为什么更强引导可能降低质量。引导改变预测的组合方式，强化要求的特征时，也可能放大不需要的特征或减少变化。先用简单计算解释，再看样本网格。

10
00:01:00,375 --> 00:01:05,755
第二个问题是为什么更强引导可能降低质量。引导改变预测的组合方式，强化要求的特征时，也可能放大不需要的特征或减少变化。先用简单计算解释，再看样本网格。

11
00:01:05,755 --> 00:01:13,495
第三个问题是哪种控制对应哪种问题。布局错误、局部细节损坏和角色不一致，是不同失败。种子、参考图、空间控制、蒙版和训练适配器作用位置不同，分清它们，测试才更有信息。

12
00:01:13,495 --> 00:01:21,653
第三个问题是哪种控制对应哪种问题。布局错误、局部细节损坏和角色不一致，是不同失败。种子、参考图、空间控制、蒙版和训练适配器作用位置不同，分清它们，测试才更有信息。

13
00:01:21,953 --> 00:01:30,013
图像要求有几个部分。内容规定物体与关系，布局规定位置和占据的空间，外观包括边缘、颜色、光线与材质，用途则决定哪些细节必须清楚。

14
00:01:30,013 --> 00:01:35,533
图像要求有几个部分。内容规定物体与关系，布局规定位置和占据的空间，外观包括边缘、颜色、光线与材质，用途则决定哪些细节必须清楚。

15
00:01:35,533 --> 00:01:42,633
例如，海报需要标题留白，动画帧需要服装与前一镜头一致，小缩略图可能需要简单轮廓。主体可以相似，构图要求却不同。

16
00:01:42,633 --> 00:01:48,813
例如，海报需要标题留白，动画帧需要服装与前一镜头一致，小缩略图可能需要简单轮廓。主体可以相似，构图要求却不同。

17
00:01:48,813 --> 00:01:55,233
车站图只用于部分比较。黄色外套、红色道具和长站台，方便识别颜色、身份和透视。这些是可以分别规定、改变和检查的变量。

18
00:01:55,233 --> 00:02:01,435
车站图只用于部分比较。黄色外套、红色道具和长站台，方便识别颜色、身份和透视。这些是可以分别规定、改变和检查的变量。

19
00:02:01,735 --> 00:02:07,435
先看这三张图。它们都来自同一段“宇航员骑马”的描述。

20
00:02:07,435 --> 00:02:14,935
主体基本相同，但很多选择变了。看看马的姿势、背景，以及骑手在画面中的位置。

21
00:02:14,935 --> 00:02:20,255
文字没有确定所有这些选择，所以多张不同的图片都可能符合要求。

22
00:02:20,255 --> 00:02:25,915
这些是较早发表的例子，但问题仍然值得问：提示词到底明确规定了什么？

23
00:02:25,915 --> 00:02:33,335
先描述差异，不急着说好坏。一张把旅人放在边缘，另一张把站台画得更宽。先说出改变了什么，再判断哪些变化对故事重要，而不是只凭第一印象选择。

24
00:02:33,335 --> 00:02:39,383
先描述差异，不急着说好坏。一张把旅人放在边缘，另一张把站台画得更宽。先说出改变了什么，再判断哪些变化对故事重要，而不是只凭第一印象选择。

25
00:02:39,683 --> 00:02:46,783
识别图片和生成图片是不同的任务。给你看一把椅子，你可能会说：“这是一把红椅子。”

26
00:02:46,783 --> 00:02:52,503
但让你画一把椅子，你就要选择它的形状、观看角度、光线和背景。

27
00:02:52,503 --> 00:02:55,883
生成器也要补上这些没有说清的选择。

28
00:02:55,883 --> 00:03:04,783
识别时，许多细节可以不作决定。一个标签不需要描述车站每扇窗户；生成图片时，即使我们没提窗户，模型也得画出些什么。这就是简短提示词会留下大量选择空间的原因之一。

29
00:03:04,783 --> 00:03:12,509
识别时，许多细节可以不作决定。一个标签不需要描述车站每扇窗户；生成图片时，即使我们没提窗户，模型也得画出些什么。这就是简短提示词会留下大量选择空间的原因之一。

30
00:03:12,809 --> 00:03:18,389
“车站里的一位旅人”留下很多空白。离得近不近，能否看清脸？是早晨还是傍晚？车站忙不忙？

31
00:03:18,389 --> 00:03:19,589
“车站里的一位旅人”留下很多空白。离得近不近，能否看清脸？是早晨还是傍晚？车站忙不忙？

32
00:03:19,589 --> 00:03:27,009
模型从训练样本中学到了规律，这些规律会影响结果。增加文字可以缩小可能的范围。

33
00:03:27,009 --> 00:03:31,669
但文字仍然没有描述画面的每一部分，模型也可能漏掉某些要求。

34
00:03:31,669 --> 00:03:40,889
加上“安静”和“孤独”，可能影响颜色、留白、姿势或灯光，却没有规定唯一布局。如果某种布局很重要，就直接描述它，再判断图片是否遵循要求，以及是否产生了想要的感觉。

35
00:03:40,889 --> 00:03:49,560
加上“安静”和“孤独”，可能影响颜色、留白、姿势或灯光，却没有规定唯一布局。如果某种布局很重要，就直接描述它，再判断图片是否遵循要求，以及是否产生了想要的感觉。

36
00:03:49,860 --> 00:03:55,160
文字适合说出我们想要什么，参考图则可以直接展示。

37
00:03:55,160 --> 00:04:04,220
比如，“让旅人小一点”仍有解释空间。在角落画一个小人的草图，更直接地说明了布局。

38
00:04:04,220 --> 00:04:11,580
这些额外输入叫作条件。它们引导生成，但不能保证每个细节都原样保留。

39
00:04:11,580 --> 00:04:16,920
文字与参考图也需要一致。参考图是近景，提示词却要求远处的小人物，系统就收到相互冲突的要求。添加更多文字前，先检查输入是否指向同一张图片。有时简化输入能让测试更清楚。

40
00:04:16,920 --> 00:04:25,180
文字与参考图也需要一致。参考图是近景，提示词却要求远处的小人物，系统就收到相互冲突的要求。添加更多文字前，先检查输入是否指向同一张图片。有时简化输入能让测试更清楚。

41
00:04:25,180 --> 00:04:26,099
文字与参考图也需要一致。参考图是近景，提示词却要求远处的小人物，系统就收到相互冲突的要求。添加更多文字前，先检查输入是否指向同一张图片。有时简化输入能让测试更清楚。

42
00:04:26,399 --> 00:04:35,939
透视取决于机位与场景的相对位置。其他条件相似时，近处物体占据更多画面。移动机位会改变距离关系，因此近距离视角可能夸张脸、手或建筑前部的比例。

43
00:04:35,939 --> 00:04:44,599
透视取决于机位与场景的相对位置。其他条件相似时，近处物体占据更多画面。移动机位会改变距离关系，因此近距离视角可能夸张脸、手或建筑前部的比例。

44
00:04:44,599 --> 00:04:54,199
简单针孔相机中，投影大小与焦距成正比，与距离成反比。物体和焦距不变时，距离翻倍，投影大小减半。这是几何关系，不是艺术规则。

45
00:04:54,199 --> 00:05:01,179
简单针孔相机中，投影大小与焦距成正比，与距离成反比。物体和焦距不变时，距离翻倍，投影大小减半。这是几何关系，不是艺术规则。

46
00:05:01,179 --> 00:05:10,159
固定机位下裁切，只改变取景，不改变透视。后退并使用更长焦距，可以保持前景主体大小相近，同时改变它与背景的关系。生成图可能模仿这种效果，但提示中的镜头词不保证精确的光学模拟。

47
00:05:10,159 --> 00:05:19,742
固定机位下裁切，只改变取景，不改变透视。后退并使用更长焦距，可以保持前景主体大小相近，同时改变它与背景的关系。生成图可能模仿这种效果，但提示中的镜头词不保证精确的光学模拟。

48
00:05:20,042 --> 00:05:28,182
平面图像无需包含明确三维模型，也能表现深度。遮挡建立前后关系：一个形状挡住另一个时，通常会被理解为更近。这提供的是顺序，不是测量距离。

49
00:05:28,182 --> 00:05:32,682
平面图像无需包含明确三维模型，也能表现深度。遮挡建立前后关系：一个形状挡住另一个时，通常会被理解为更近。这提供的是顺序，不是测量距离。

50
00:05:32,682 --> 00:05:40,482
假设物体实际大小相近时，相对尺寸提供另一条线索。重复立柱逐渐缩小，可以暗示远近；如果物体实际大小不同，这个判断就可能错误。线索既依赖图像几何，也依赖对物体的预期。

51
00:05:40,482 --> 00:05:48,062
假设物体实际大小相近时，相对尺寸提供另一条线索。重复立柱逐渐缩小，可以暗示远近；如果物体实际大小不同，这个判断就可能错误。线索既依赖图像几何，也依赖对物体的预期。

52
00:05:48,062 --> 00:05:58,282
线性透视增加方向结构。平行线的投影可以向消失点汇聚，轨道、地板边缘和屋顶梁都能围绕这些方向组织画面。不同组平行线可能有不同消失点。

53
00:05:58,282 --> 00:06:02,782
线性透视增加方向结构。平行线的投影可以向消失点汇聚，轨道、地板边缘和屋顶梁都能围绕这些方向组织画面。不同组平行线可能有不同消失点。

54
00:06:02,782 --> 00:06:12,022
生成场景中的线索可能冲突：道具遮挡正确，尺度却不合理；走廊漂亮，汇聚方向却不一致。分别检查遮挡、尺度和线条方向，比笼统说“空间奇怪”更准确。

55
00:06:12,022 --> 00:06:19,529
生成场景中的线索可能冲突：道具遮挡正确，尺度却不合理；走廊漂亮，汇聚方向却不一致。分别检查遮挡、尺度和线条方向，比笼统说“空间奇怪”更准确。

56
00:06:19,829 --> 00:06:24,889
得到想保留的图片时，也要保存它的制作过程。提示词只是记录的一部分。

57
00:06:24,889 --> 00:06:29,569
还需要记录模型、参考图、随机种子和生成设置。

58
00:06:29,569 --> 00:06:33,809
想象把图片交给同学，请他接着做。

59
00:06:33,809 --> 00:06:37,269
如果他只有那句话，很多设置就只能靠猜。

60
00:06:37,269 --> 00:06:42,349
模型检查点，就是模型学到的数值的一个保存版本。它的名称也要记下来。

61
00:06:42,349 --> 00:06:47,569
记录要让别人也能照着操作。给图片编号，保存准确的提示词，同时保留原始输出和最终修改版。否则，之后可能会把模型原图与经过大量编辑的图片误当成同类结果来比较。

62
00:06:47,569 --> 00:06:54,769
记录要让别人也能照着操作。给图片编号，保存准确的提示词，同时保留原始输出和最终修改版。否则，之后可能会把模型原图与经过大量编辑的图片误当成同类结果来比较。

63
00:06:54,769 --> 00:06:56,068
记录要让别人也能照着操作。给图片编号，保存准确的提示词，同时保留原始输出和最终修改版。否则，之后可能会把模型原图与经过大量编辑的图片误当成同类结果来比较。

64
00:06:56,368 --> 00:07:03,808
继续之前，先区分训练和生成单张图片。训练时，模型从样本中学习，内部数值会改变。

65
00:07:03,808 --> 00:07:09,708
正常生成图片时，这些数值通常固定不变。变化的是正在生成的图像。

66
00:07:09,708 --> 00:07:17,008
所以，增加采样步数，并没有让模型学到更多手部或人脸知识，只是让生成过程多做几次更新。

67
00:07:17,008 --> 00:07:19,588
这会影响结果，但属于另一种变化。

68
00:07:19,588 --> 00:07:26,948
这两个阶段所需时间也不同。训练可能使用大量图片并更新很多次；生成一张图则使用已经训练好的模型，进行较短的计算。在普通生成工具中换种子，并不是让模型重新学习这个主体。

69
00:07:26,948 --> 00:07:33,781
这两个阶段所需时间也不同。训练可能使用大量图片并更新很多次；生成一张图则使用已经训练好的模型，进行较短的计算。在普通生成工具中换种子，并不是让模型重新学习这个主体。

70
00:07:34,081 --> 00:07:39,621
从左向右看这组图。开始时图片清楚可辨，随后加入越来越多的噪声。

71
00:07:39,621 --> 00:07:47,561
最后，很难认出原来是什么。这里的噪声指图像数值的随机变化，训练时我们会主动加入它。

72
00:07:47,561 --> 00:07:52,281
为什么要制造这个问题？因为我们有原图，也知道加入了什么噪声。

73
00:07:52,281 --> 00:07:56,481
这样，就能让模型做预测，并用已知答案检查它的预测。

74
00:07:56,481 --> 00:08:03,081
噪声少时，还能认出车站；噪声多时，就很难判断原来有什么。不同噪声水平带来的学习问题不同。恢复边缘的小细节，与视觉信息几乎消失后作出有用预测，并不是同一种难度。

75
00:08:03,081 --> 00:08:10,981
噪声少时，还能认出车站；噪声多时，就很难判断原来有什么。不同噪声水平带来的学习问题不同。恢复边缘的小细节，与视觉信息几乎消失后作出有用预测，并不是同一种难度。

76
00:08:10,981 --> 00:08:11,515
噪声少时，还能认出车站；噪声多时，就很难判断原来有什么。不同噪声水平带来的学习问题不同。恢复边缘的小细节，与视觉信息几乎消失后作出有用预测，并不是同一种难度。

77
00:08:11,815 --> 00:08:18,515
这个公式表示给干净图像加入噪声：一部分干净图像，加上一部分随机噪声。a 和 b 控制当前噪声水平下两者的权重。图像权重为零、噪声权重为一时，只剩噪声；噪声权重较小时，还能看见更多图像。这个公式适用于这里的扩散设置，其他生成方法可能使用不同的状态表示。

78
00:08:18,515 --> 00:08:23,055
这个公式表示给干净图像加入噪声：一部分干净图像，加上一部分随机噪声。a 和 b 控制当前噪声水平下两者的权重。图像权重为零、噪声权重为一时，只剩噪声；噪声权重较小时，还能看见更多图像。这个公式适用于这里的扩散设置，其他生成方法可能使用不同的状态表示。

79
00:08:23,055 --> 00:08:28,615
这个公式表示给干净图像加入噪声：一部分干净图像，加上一部分随机噪声。a 和 b 控制当前噪声水平下两者的权重。图像权重为零、噪声权重为一时，只剩噪声；噪声权重较小时，还能看见更多图像。这个公式适用于这里的扩散设置，其他生成方法可能使用不同的状态表示。

80
00:08:28,615 --> 00:08:32,895
这个公式表示给干净图像加入噪声：一部分干净图像，加上一部分随机噪声。a 和 b 控制当前噪声水平下两者的权重。图像权重为零、噪声权重为一时，只剩噪声；噪声权重较小时，还能看见更多图像。这个公式适用于这里的扩散设置，其他生成方法可能使用不同的状态表示。

81
00:08:32,895 --> 00:08:39,315
取一个坐标，干净值为 0.8，噪声为 −0.2。若权重分别为 0.6 和 0.8，结果就是 0.6×0.8 加 0.8×(−0.2)，等于 0.32。这两个权重的平方和为 1，是此类例子中常见的归一化。计算发生在每个坐标上，不只是一颗可见像素。

82
00:08:39,315 --> 00:08:45,355
取一个坐标，干净值为 0.8，噪声为 −0.2。若权重分别为 0.6 和 0.8，结果就是 0.6×0.8 加 0.8×(−0.2)，等于 0.32。这两个权重的平方和为 1，是此类例子中常见的归一化。计算发生在每个坐标上，不只是一颗可见像素。

83
00:08:45,355 --> 00:08:51,475
取一个坐标，干净值为 0.8，噪声为 −0.2。若权重分别为 0.6 和 0.8，结果就是 0.6×0.8 加 0.8×(−0.2)，等于 0.32。这两个权重的平方和为 1，是此类例子中常见的归一化。计算发生在每个坐标上，不只是一颗可见像素。

84
00:08:51,475 --> 00:08:53,046
取一个坐标，干净值为 0.8，噪声为 −0.2。若权重分别为 0.6 和 0.8，结果就是 0.6×0.8 加 0.8×(−0.2)，等于 0.32。这两个权重的平方和为 1，是此类例子中常见的归一化。计算发生在每个坐标上，不只是一颗可见像素。

85
00:08:53,346 --> 00:09:01,646
每个训练样本的噪声程度都可以选择。有的只有少量噪声，有的几乎全是噪声。

86
00:09:01,646 --> 00:09:07,786
不必先生成之前的每个阶段，可以直接计算出所需噪声程度的样本。

87
00:09:07,786 --> 00:09:15,026
模型因此能在不同噪声程度下练习。这不代表生成完整图片总能一步完成。

88
00:09:15,026 --> 00:09:22,486
网络需要知道噪声水平，否则在不同阶段，同一块模糊区域可能有不同含义。噪声水平告诉模型预计有多大程度的扰动，但模型仍需根据图片和其他输入作出预测。

89
00:09:22,486 --> 00:09:28,886
网络需要知道噪声水平，否则在不同阶段，同一块模糊区域可能有不同含义。噪声水平告诉模型预计有多大程度的扰动，但模型仍需根据图片和其他输入作出预测。

90
00:09:28,886 --> 00:09:29,863
网络需要知道噪声水平，否则在不同阶段，同一块模糊区域可能有不同含义。噪声水平告诉模型预计有多大程度的扰动，但模型仍需根据图片和其他输入作出预测。

91
00:09:30,163 --> 00:09:35,763
沿着图看。先取左边的清晰图片，加入噪声，再把带噪图片送入网络。

92
00:09:35,763 --> 00:09:41,463
在这种训练任务中，网络预测我们加入的噪声，然后把预测与真实噪声比较。

93
00:09:41,463 --> 00:09:49,843
预测错了，训练就调整模型内部的数值。这个过程会在许多样本上重复。模型还会收到噪声程度的信息。

94
00:09:49,843 --> 00:09:53,743
为了让主流程更容易看懂，图里省略了这个输入。

95
00:09:53,743 --> 00:10:02,443
训练时，网络看到图像结构在噪声下保留下来的各种情况，预测错误时就调整内部数值。没有人为每件外套、每座站台分别编写规则；它的行为来自对训练例子中规律的学习。

96
00:10:02,443 --> 00:10:09,261
训练时，网络看到图像结构在噪声下保留下来的各种情况，预测错误时就调整内部数值。没有人为每件外套、每座站台分别编写规则；它的行为来自对训练例子中规律的学习。

97
00:10:09,561 --> 00:10:15,521
噪声预测训练中，我们知道加入了什么噪声。用这个已知答案减去模型预测，将差值平方后求平均。平方使较大误差受到更重惩罚，训练试图降低大量例子的平均误差。这个分数衡量的是噪声预测误差，并不直接评价图片是否讲好了故事，或构图是否适合用途；这些需要另外判断。

98
00:10:15,521 --> 00:10:23,341
噪声预测训练中，我们知道加入了什么噪声。用这个已知答案减去模型预测，将差值平方后求平均。平方使较大误差受到更重惩罚，训练试图降低大量例子的平均误差。这个分数衡量的是噪声预测误差，并不直接评价图片是否讲好了故事，或构图是否适合用途；这些需要另外判断。

99
00:10:23,341 --> 00:10:30,341
噪声预测训练中，我们知道加入了什么噪声。用这个已知答案减去模型预测，将差值平方后求平均。平方使较大误差受到更重惩罚，训练试图降低大量例子的平均误差。这个分数衡量的是噪声预测误差，并不直接评价图片是否讲好了故事，或构图是否适合用途；这些需要另外判断。

100
00:10:30,341 --> 00:10:32,001
噪声预测训练中，我们知道加入了什么噪声。用这个已知答案减去模型预测，将差值平方后求平均。平方使较大误差受到更重惩罚，训练试图降低大量例子的平均误差。这个分数衡量的是噪声预测误差，并不直接评价图片是否讲好了故事，或构图是否适合用途；这些需要另外判断。

101
00:10:32,001 --> 00:10:38,001
两个坐标的已知噪声为 1 和 −1，预测为 0.8 和 −0.5。误差是 0.2 和 −0.5，平方为 0.04 和 0.25，平均得到 0.145。真实训练会使用更多坐标和样本，但这个计算清楚展示了误差分数的含义。

102
00:10:38,001 --> 00:10:44,701
两个坐标的已知噪声为 1 和 −1，预测为 0.8 和 −0.5。误差是 0.2 和 −0.5，平方为 0.04 和 0.25，平均得到 0.145。真实训练会使用更多坐标和样本，但这个计算清楚展示了误差分数的含义。

103
00:10:44,701 --> 00:10:50,515
两个坐标的已知噪声为 1 和 −1，预测为 0.8 和 −0.5。误差是 0.2 和 −0.5，平方为 0.04 和 0.25，平均得到 0.145。真实训练会使用更多坐标和样本，但这个计算清楚展示了误差分数的含义。

104
00:10:50,815 --> 00:10:57,995
这个训练例子与生成新图有一个重要区别：训练时，我们从已知图片开始。

105
00:10:57,995 --> 00:11:05,175
生成时，可以从随机噪声开始。噪声里没有藏着一张特定照片等我们找出来。

106
00:11:05,175 --> 00:11:09,095
模型利用学到的规律，生成一种可能的图像。

107
00:11:09,095 --> 00:11:14,195
这并不排除复制或记忆训练样本的情况，只是在解释这个生成过程做了什么。

108
00:11:14,195 --> 00:11:20,635
所以生成并不是揭开一张藏在噪声里的图片。开始时有很多可能结果，训练好的模型与输入共同引导一连串选择，最后形成某种具体的物体、表面和光线安排。

109
00:11:20,635 --> 00:11:27,355
所以生成并不是揭开一张藏在噪声里的图片。开始时有很多可能结果，训练好的模型与输入共同引导一连串选择，最后形成某种具体的物体、表面和光线安排。

110
00:11:27,355 --> 00:11:28,462
所以生成并不是揭开一张藏在噪声里的图片。开始时有很多可能结果，训练好的模型与输入共同引导一连串选择，最后形成某种具体的物体、表面和光线安排。

111
00:11:28,762 --> 00:11:34,182
区分两个动作：第一，用新的图片集训练模型；第二，同一个已训练模型换种子再生成图片。两种情况下，改变的数值分别是什么？

112
00:11:34,182 --> 00:11:39,062
区分两个动作：第一，用新的图片集训练模型；第二，同一个已训练模型换种子再生成图片。两种情况下，改变的数值分别是什么？

113
00:11:39,062 --> 00:11:48,082
训练改变学到的权重；生成通常固定权重，改变当前采样状态。新种子改变随机起点，不会自动把输出加入训练集，也不会单独教会模型一个新主体。

114
00:11:48,082 --> 00:11:52,482
训练改变学到的权重；生成通常固定权重，改变当前采样状态。新种子改变随机起点，不会自动把输出加入训练集，也不会单独教会模型一个新主体。

115
00:11:52,482 --> 00:12:00,982
选择干预方法时，这个区别很重要。换样本可能偶然解决某次构图，主体适配则试图改变未来样本中的学习行为。它们成本和用途不同，后面的 LoRA 与参考条件例子会具体展开。

116
00:12:00,982 --> 00:12:08,372
选择干预方法时，这个区别很重要。换样本可能偶然解决某次构图，主体适配则试图改变未来样本中的学习行为。它们成本和用途不同，后面的 LoRA 与参考条件例子会具体展开。

117
00:12:08,672 --> 00:12:15,292
主要区别是：训练改变模型，采样利用模型改变当前图像。

118
00:12:15,292 --> 00:12:21,812
更多步数可能改变生成过程，但不会直接告诉模型把旅人放得更远。

119
00:12:21,812 --> 00:12:26,732
要解决这个问题，更宽的视角描述或布局参考图，可能更值得测试。

120
00:12:26,732 --> 00:12:30,472
错误构图变得更清晰，仍然是错误的构图。

121
00:12:30,472 --> 00:12:36,452
“更新”这个词容易让两个阶段听起来相似。训练更新的是网络学到的内容；采样通常更新当前生成状态。看到技术图时，追问到底在更新什么，可以避免很多混淆。

122
00:12:36,452 --> 00:12:44,252
“更新”这个词容易让两个阶段听起来相似。训练更新的是网络学到的内容；采样通常更新当前生成状态。看到技术图时，追问到底在更新什么，可以避免很多混淆。

123
00:12:44,252 --> 00:12:45,594
“更新”这个词容易让两个阶段听起来相似。训练更新的是网络学到的内容；采样通常更新当前生成状态。看到技术图时，追问到底在更新什么，可以避免很多混淆。

124
00:12:45,894 --> 00:12:52,334
现在沿着生成图像的方向看。这张图左边是噪声状态，右边是更清晰的图像。

125
00:12:52,334 --> 00:12:57,354
从噪声开始，让模型预测，再用预测更新状态，然后重复。

126
00:12:57,354 --> 00:13:00,834
不必逐个看懂符号，跟着状态的变化看就好。

127
00:13:00,834 --> 00:13:04,554
每次预测都取决于当前状态，以及过程进行到了哪里。

128
00:13:04,554 --> 00:13:08,254
终点并没有提供一张完成的图片让模型照着复制。

129
00:13:08,254 --> 00:13:15,354
不要期待每张中间结果都能当草稿，尤其早期状态常常很难看懂。做设计评审时，最终结果通常更容易比较；只有研究计算过程怎样变化时，中间图才特别有用。

130
00:13:15,354 --> 00:13:23,554
不要期待每张中间结果都能当草稿，尤其早期状态常常很难看懂。做设计评审时，最终结果通常更容易比较；只有研究计算过程怎样变化时，中间图才特别有用。

131
00:13:23,554 --> 00:13:24,032
不要期待每张中间结果都能当草稿，尤其早期状态常常很难看懂。做设计评审时，最终结果通常更容易比较；只有研究计算过程怎样变化时，中间图才特别有用。

132
00:13:24,332 --> 00:13:29,892
模型和采样器分工不同。模型根据当前带噪状态做预测。

133
00:13:29,892 --> 00:13:33,092
采样器利用预测，计算下一个状态。

134
00:13:33,092 --> 00:13:38,172
正因为计算方式不同，即使模型不变，更换采样器也可能改变结果。

135
00:13:38,172 --> 00:13:42,252
使用的仍是同一个学好的网络，改变的是如何根据预测向前推进。

136
00:13:42,252 --> 00:13:49,232
可以把网络理解成指出移动方向，采样器决定如何迈出这一步。换采样器时，网络可以不变，但经过的中间状态会不同。因此，使用相似模型的工具也可能有不同的生成表现。

137
00:13:49,232 --> 00:13:57,672
可以把网络理解成指出移动方向，采样器决定如何迈出这一步。换采样器时，网络可以不变，但经过的中间状态会不同。因此，使用相似模型的工具也可能有不同的生成表现。

138
00:13:57,672 --> 00:13:58,587
可以把网络理解成指出移动方向，采样器决定如何迈出这一步。换采样器时，网络可以不变，但经过的中间状态会不同。因此，使用相似模型的工具也可能有不同的生成表现。

139
00:13:58,887 --> 00:14:04,447
生成过程中，噪声量会变化。接近纯噪声的一端时，能看出的图像信息很少。

140
00:14:04,447 --> 00:14:09,807
接近结束时，图片更容易辨认。调度方式决定经过哪些噪声程度。

141
00:14:09,807 --> 00:14:13,347
所以，一种设置的第十步，未必等同于另一种设置的第十步。

142
00:14:13,347 --> 00:14:18,067
不要认为每个模型都固定遵循“先构图、后细节”的顺序。

143
00:14:18,067 --> 00:14:26,947
步数相同，并不代表噪声水平之间间隔相同。一种调度可能在某个阶段安排更多更新，从而改变模型在哪些位置进行预测。调度选项改变的不只是步数计数器上的名称。

144
00:14:26,947 --> 00:14:35,703
步数相同，并不代表噪声水平之间间隔相同。一种调度可能在某个阶段安排更多更新，从而改变模型在哪些位置进行预测。调度选项改变的不只是步数计数器上的名称。

145
00:14:36,003 --> 00:14:41,323
前面用预测噪声的模型来解释。这是一种常见的训练选择。

146
00:14:41,323 --> 00:14:48,903
其他模型可以预测清晰图像，或预测当前状态应改变的方向。不必记住所有版本。

147
00:14:48,903 --> 00:14:54,143
关键是采样器要按模型受训时的含义使用预测。这些输出不是能随意互换的名称。

148
00:14:54,143 --> 00:14:56,823
关键是采样器要按模型受训时的含义使用预测。这些输出不是能随意互换的名称。

149
00:14:56,823 --> 00:15:03,343
知道噪声水平和相关公式后，有些预测目标可以互相换算。但网络是针对特定目标训练的。不检查目标就照搬其他模型的公式，可能让更新的含义与预想完全不同。

150
00:15:03,343 --> 00:15:10,963
知道噪声水平和相关公式后，有些预测目标可以互相换算。但网络是针对特定目标训练的。不检查目标就照搬其他模型的公式，可能让更新的含义与预想完全不同。

151
00:15:10,963 --> 00:15:12,242
知道噪声水平和相关公式后，有些预测目标可以互相换算。但网络是针对特定目标训练的。不检查目标就照搬其他模型的公式，可能让更新的含义与预想完全不同。

152
00:15:12,542 --> 00:15:19,682
直接处理每个像素可能需要大量计算。有些模型在更小的图像表示中完成大部分工作。

153
00:15:19,682 --> 00:15:24,122
这种表示叫作潜变量，是模型学到的一组数值。

154
00:15:24,122 --> 00:15:32,082
这个较早的 Stable Diffusion 例子展示了图像与工作表示的尺寸。较小的表示包含的数值少得多。

155
00:15:32,082 --> 00:15:38,022
这减少了图像模型要处理的信息，但不能仅凭这些数字算出实际加速了多少。

156
00:15:38,022 --> 00:15:44,582
较小的表示减少计算，但也改变了计算发生的位置。输入图片仍需编码，输出仍需解码。去噪循环快，不代表其他环节消失了。做互动作品时，应测量观众实际经历的完整等待时间。

157
00:15:44,582 --> 00:15:52,387
较小的表示减少计算，但也改变了计算发生的位置。输入图片仍需编码，输出仍需解码。去噪循环快，不代表其他环节消失了。做互动作品时，应测量观众实际经历的完整等待时间。

158
00:15:52,687 --> 00:15:59,307
编码器把图像变成较小的表示，解码器再把它变回像素。看看图的中间。

159
00:15:59,307 --> 00:16:02,467
这个小网格只是用来说明模型处理的是数字。

160
00:16:02,467 --> 00:16:07,727
它不是这张图片的真实数据，也不是某个格子代表“外套”、另一个代表“行李箱”。

161
00:16:07,727 --> 00:16:14,987
潜空间扩散模型在这种较小的表示中反复更新，最后用解码器得到可见的图片。

162
00:16:14,987 --> 00:16:22,847
可以把解码器理解成一种学会了的转换方法，把压缩信息变成可见结构。它不是简单放大图中的每个色块。真实表示把信息分散在数字中，解码器利用训练学到的规律把它们组合起来。

163
00:16:22,847 --> 00:16:31,422
可以把解码器理解成一种学会了的转换方法，把压缩信息变成可见结构。它不是简单放大图中的每个色块。真实表示把信息分散在数字中，解码器利用训练学到的规律把它们组合起来。

164
00:16:31,722 --> 00:16:35,662
重建已有图片和生成新图片，检验的是不同的事情。

165
00:16:35,662 --> 00:16:41,602
把图片编码后再解码，可以检查保留了多少信息。这是在测试压缩部分。

166
00:16:41,602 --> 00:16:45,642
这不能证明任意一组随机数字都能变成好图片。

167
00:16:45,642 --> 00:16:50,882
生成模型仍需产生一种适合解码器使用的表示。

168
00:16:50,882 --> 00:17:01,782
可以分开做两个检查：先压缩并重建已有图片，再看新生成的样本。如果第一个测试丢失细字，它就可能解释第二个测试中的部分文字问题。虽然解释不了所有错误，但问题范围更明确了。

169
00:17:01,782 --> 00:17:08,601
可以分开做两个检查：先压缩并重建已有图片，再看新生成的样本。如果第一个测试丢失细字，它就可能解释第二个测试中的部分文字问题。虽然解释不了所有错误，但问题范围更明确了。

170
00:17:08,901 --> 00:17:17,441
VAE 指变分自编码器。完整名称不如它为压缩增加的想法重要：编码器描述较小表示的一组可能值。训练既要求重建图片，也希望这些值的组织方式有利于采样。两项目标可能冲突，保留每个细节与构建有用的表示空间并不是同一任务。实际图像模型可能使用额外损失，所以这里介绍的是基本想法，而不是所有系统的完整结构。

171
00:17:17,441 --> 00:17:26,761
VAE 指变分自编码器。完整名称不如它为压缩增加的想法重要：编码器描述较小表示的一组可能值。训练既要求重建图片，也希望这些值的组织方式有利于采样。两项目标可能冲突，保留每个细节与构建有用的表示空间并不是同一任务。实际图像模型可能使用额外损失，所以这里介绍的是基本想法，而不是所有系统的完整结构。

172
00:17:26,761 --> 00:17:34,581
VAE 指变分自编码器。完整名称不如它为压缩增加的想法重要：编码器描述较小表示的一组可能值。训练既要求重建图片，也希望这些值的组织方式有利于采样。两项目标可能冲突，保留每个细节与构建有用的表示空间并不是同一任务。实际图像模型可能使用额外损失，所以这里介绍的是基本想法，而不是所有系统的完整结构。

173
00:17:34,581 --> 00:17:41,821
VAE 指变分自编码器。完整名称不如它为压缩增加的想法重要：编码器描述较小表示的一组可能值。训练既要求重建图片，也希望这些值的组织方式有利于采样。两项目标可能冲突，保留每个细节与构建有用的表示空间并不是同一任务。实际图像模型可能使用额外损失，所以这里介绍的是基本想法，而不是所有系统的完整结构。

174
00:17:41,821 --> 00:17:50,221
重建项检查解码图是否接近输入，正则项则比较编码器分布与选定先验分布，避免每张图都被放进任意孤立的区域。两者平衡会影响潜空间的用途。实际图像系统还可能使用感知或对抗损失，所以简单 VAE 目标只是理解这个想法的起点。

175
00:17:50,221 --> 00:17:59,141
重建项检查解码图是否接近输入，正则项则比较编码器分布与选定先验分布，避免每张图都被放进任意孤立的区域。两者平衡会影响潜空间的用途。实际图像系统还可能使用感知或对抗损失，所以简单 VAE 目标只是理解这个想法的起点。

176
00:17:59,141 --> 00:18:09,732
重建项检查解码图是否接近输入，正则项则比较编码器分布与选定先验分布，避免每张图都被放进任意孤立的区域。两者平衡会影响潜空间的用途。实际图像系统还可能使用感知或对抗损失，所以简单 VAE 目标只是理解这个想法的起点。

177
00:18:10,032 --> 00:18:14,052
想想细栏杆、小标志，或者行李箱的提手。

178
00:18:14,052 --> 00:18:20,252
如果只是编码再解码，这些细节就已经消失了，改提示词也很难解释问题出在哪里。

179
00:18:20,252 --> 00:18:23,832
我们已经知道，信息在系统的这个环节丢失了一部分。

180
00:18:23,832 --> 00:18:28,972
先检查问题在哪一步出现，不要把所有失败都当成措辞问题。

181
00:18:28,972 --> 00:18:37,912
作品以不同尺寸观看时，这一点尤其重要。行李箱提手即使生成成功，投影时也可能看不见。既要看原文件，也要看实际展示尺寸。重要细节在展示现场能否被看见，也是图像质量的一部分。

182
00:18:37,912 --> 00:18:46,392
作品以不同尺寸观看时，这一点尤其重要。行李箱提手即使生成成功，投影时也可能看不见。既要看原文件，也要看实际展示尺寸。重要细节在展示现场能否被看见，也是图像质量的一部分。

183
00:18:46,392 --> 00:18:47,167
作品以不同尺寸观看时，这一点尤其重要。行李箱提手即使生成成功，投影时也可能看不见。既要看原文件，也要看实际展示尺寸。重要细节在展示现场能否被看见，也是图像质量的一部分。

184
00:18:47,467 --> 00:18:54,747
边缘帮助组织画面。硬边形成清楚界限，软边让相邻形状或色调融合，消失边缘则让边界难以与周围区分。艺术家可以在一张图里同时使用这三种处理。

185
00:18:54,747 --> 00:19:00,867
边缘帮助组织画面。硬边形成清楚界限，软边让相邻形状或色调融合，消失边缘则让边界难以与周围区分。艺术家可以在一张图里同时使用这三种处理。

186
00:19:00,867 --> 00:19:09,167
剪纸例子强调分开的形状，绘画例子使用柔和过渡，墨线例子强调线条轻重和笔触。这些差异影响小尺寸下哪些形状仍清楚，以及哪些区域因对比而突出。

187
00:19:09,167 --> 00:19:14,207
剪纸例子强调分开的形状，绘画例子使用柔和过渡，墨线例子强调线条轻重和笔触。这些差异影响小尺寸下哪些形状仍清楚，以及哪些区域因对比而突出。

188
00:19:14,207 --> 00:19:21,427
风格提示可以同时影响这些属性。若目标是清晰轮廓，增加表面细节反而可能不利。应明确需要的边缘处理或明暗分离。这三张图是教学示例，并非对某个风格设置的受控测量。

189
00:19:21,427 --> 00:19:29,936
风格提示可以同时影响这些属性。若目标是清晰轮廓，增加表面细节反而可能不利。应明确需要的边缘处理或明暗分离。这三张图是教学示例，并非对某个风格设置的受控测量。

190
00:19:30,236 --> 00:19:36,436
这张图把图像生成器的各个部分连起来了。最初的随机数由设置了种子的随机数生成器产生。

191
00:19:36,436 --> 00:19:42,776
文本编码器把提示词变成图像网络可以使用的信息。网络作出预测，采样器据此更新。

192
00:19:42,776 --> 00:19:49,696
最后，解码器生成像素。请看中间的循环，那是反复进行的步骤。后来的模型可以替换其中一些部分。

193
00:19:49,696 --> 00:19:55,216
这张图帮助我们找到控制项进入系统的位置，但并不是所有产品都完全采用这个结构。

194
00:19:55,216 --> 00:20:04,136
结果失败时，这张图提供了排查位置。误解提示可能与文本条件有关；细节丢失可能涉及压缩或解码；比较不稳定可能与随机设置有关。单张图片不能诊断所有问题，但可以帮助选择更有针对性的下一步测试。

195
00:20:04,136 --> 00:20:10,785
结果失败时，这张图提供了排查位置。误解提示可能与文本条件有关；细节丢失可能涉及压缩或解码；比较不稳定可能与随机设置有关。单张图片不能诊断所有问题，但可以帮助选择更有针对性的下一步测试。

196
00:20:11,085 --> 00:20:17,665
模型不能像我们读句子那样直接使用文字。它先把句子拆成小片段，叫作词元，也就是 token。

197
00:20:17,665 --> 00:20:23,285
一个词元可能是一个词，也可能只是词的一部分。文本编码器把它们变成数字特征，供图像模型使用。

198
00:20:23,285 --> 00:20:25,365
一个词元可能是一个词，也可能只是词的一部分。文本编码器把它们变成数字特征，供图像模型使用。

199
00:20:25,365 --> 00:20:31,125
但有了“红色”和“行李箱”的信息，并不保证红色一定会出现在正确的物体上。

200
00:20:31,125 --> 00:20:41,165
增加词语也会改变输入表示。词更多不一定更清楚。如果一些短语反复表达同一意思，另一些又相互冲突，结果就很难解释。先写重要的主体、位置和外观，再有理由地加入细节。

201
00:20:41,165 --> 00:20:49,052
增加词语也会改变输入表示。词更多不一定更清楚。如果一些短语反复表达同一意思，另一些又相互冲突，结果就很难解释。先写重要的主体、位置和外观，再有理由地加入细节。

202
00:20:49,352 --> 00:20:54,292
CLIP 是连接文字和图片的一种方法。它用配有文字说明的图片来学习。

203
00:20:54,292 --> 00:21:00,792
训练时，它学习让匹配的图片和文字具有相近的数字表示，同时与不匹配的组合拉开距离。

204
00:21:00,792 --> 00:21:08,872
一些图像生成器用 CLIP 的文本编码器理解提示词，另一些使用其他编码器。CLIP 本身并不画图。

205
00:21:08,872 --> 00:21:14,172
它帮助连接文字描述和视觉信息。图片仍由生成器来制作。

206
00:21:14,172 --> 00:21:21,572
匹配图片和说明文字能学到有用联系，但文字并没有完整描述图片。它可能提到人物，却没提栏杆。这有助于理解：系统能够把握整体主题，却仍可能遗漏某个难以准确描述的关系。

207
00:21:21,572 --> 00:21:29,047
匹配图片和说明文字能学到有用联系，但文字并没有完整描述图片。它可能提到人物，却没提栏杆。这有助于理解：系统能够把握整体主题，却仍可能遗漏某个难以准确描述的关系。

208
00:21:29,347 --> 00:21:34,027
图片可能整体上符合提示词，却在一个重要细节上出错。

209
00:21:34,027 --> 00:21:38,907
我们可能得到了车站、旅人和行李箱，但行李箱在错误的一侧。

210
00:21:38,907 --> 00:21:46,647
也可能要求两个物体，结果出现三个。不要只看“差不多像了”，要检查作品依赖的具体细节。

211
00:21:46,647 --> 00:21:54,807
对海报来说，小小的关系也可能决定图片能否使用。手拿着车票，与车票飘在手旁，意思不同。检查表除了列出应出现的物体，也要包括真正传达含义的关系。

212
00:21:54,807 --> 00:22:02,408
对海报来说，小小的关系也可能决定图片能否使用。手拿着车票，与车票飘在手旁，意思不同。检查表除了列出应出现的物体，也要包括真正传达含义的关系。

213
00:22:02,708 --> 00:22:10,228
注意力是一种利用不同位置的信息的方法。在自注意力中，同一个输入的各部分交换信息。

214
00:22:10,228 --> 00:22:16,848
图片的一个区域可以使用另一个区域的信息，比如物体和它的倒影之间的关系。

215
00:22:16,848 --> 00:22:22,928
交叉注意力则从另一个输入中获取信息。例如，图像区域可以使用提示词中的信息。

216
00:22:22,928 --> 00:22:29,488
这些名称听起来复杂，但区别很简单：信息来自同一个输入内部，还是另一个输入。

217
00:22:29,488 --> 00:22:36,228
这里的注意力并不表示模型意识到了物体，而是一种选择和混合信息的计算。对设计来说，局部特征可以依赖远处区域或文字，所以改一条指令可能影响的不只是你想改的小区域。

218
00:22:36,228 --> 00:22:42,937
这里的注意力并不表示模型意识到了物体，而是一种选择和混合信息的计算。对设计来说，局部特征可以依赖远处区域或文字，所以改一条指令可能影响的不只是你想改的小区域。

219
00:22:43,237 --> 00:22:45,937
这张图粗略地展示了交叉注意力。

220
00:22:45,937 --> 00:22:53,237
外套附近的区域可以使用与“黄色”相关的信息，也会使用提示词中的其他信息。不同信息在计算中的权重不同。

221
00:22:53,237 --> 00:22:55,377
这里的连线只是用来解释这个想法。

222
00:22:55,377 --> 00:22:59,777
它们不是从模型中测量出来的，不能证明哪个词造成了某个像素。

223
00:22:59,777 --> 00:23:05,817
现在只要记住：文字可以在生成过程中影响图像特征，并不是读一遍就放到一边。

224
00:23:05,817 --> 00:23:11,570
“外套”这个词不一定只影响外套内部的像素，它还可以通过后面的网络层影响形状、阴影和附近区域。交叉注意力图提供的是计算线索，并不是精确的选区。只改外套时，明确的区域蒙版提供了另一种控制。因此，改几个词也可能意外改变脸或背景。

225
00:23:11,570 --> 00:23:17,217
“外套”这个词不一定只影响外套内部的像素，它还可以通过后面的网络层影响形状、阴影和附近区域。交叉注意力图提供的是计算线索，并不是精确的选区。只改外套时，明确的区域蒙版提供了另一种控制。因此，改几个词也可能意外改变脸或背景。

226
00:23:17,217 --> 00:23:24,148
“外套”这个词不一定只影响外套内部的像素，它还可以通过后面的网络层影响形状、阴影和附近区域。交叉注意力图提供的是计算线索，并不是精确的选区。只改外套时，明确的区域蒙版提供了另一种控制。因此，改几个词也可能意外改变脸或背景。

227
00:23:24,448 --> 00:23:33,048
这里把注意力表示为加权混合。假设权重为 0.7、0.2、0.1，将对应特征乘以权重再相加，这些权重和为一。模型混合的是数字信息，不一定只选择一个词而忽略其他词。这些数字只是方便计算的示例，不是外套图片的实测值。真实网络会在不同区域和层中进行大量这种计算。

228
00:23:33,048 --> 00:23:41,788
这里把注意力表示为加权混合。假设权重为 0.7、0.2、0.1，将对应特征乘以权重再相加，这些权重和为一。模型混合的是数字信息，不一定只选择一个词而忽略其他词。这些数字只是方便计算的示例，不是外套图片的实测值。真实网络会在不同区域和层中进行大量这种计算。

229
00:23:41,788 --> 00:23:49,348
这里把注意力表示为加权混合。假设权重为 0.7、0.2、0.1，将对应特征乘以权重再相加，这些权重和为一。模型混合的是数字信息，不一定只选择一个词而忽略其他词。这些数字只是方便计算的示例，不是外套图片的实测值。真实网络会在不同区域和层中进行大量这种计算。

230
00:23:49,348 --> 00:23:54,188
这里把注意力表示为加权混合。假设权重为 0.7、0.2、0.1，将对应特征乘以权重再相加，这些权重和为一。模型混合的是数字信息，不一定只选择一个词而忽略其他词。这些数字只是方便计算的示例，不是外套图片的实测值。真实网络会在不同区域和层中进行大量这种计算。

231
00:23:54,188 --> 00:24:02,240
用标量可以直接算出混合结果。三个值为 10、20、30，权重为 0.7、0.2、0.1，得到 7+4+3，也就是 14。网络通常混合特征向量。权重来自查询与键的比较，被加权的信息则来自值。

232
00:24:02,240 --> 00:24:10,928
用标量可以直接算出混合结果。三个值为 10、20、30，权重为 0.7、0.2、0.1，得到 7+4+3，也就是 14。网络通常混合特征向量。权重来自查询与键的比较，被加权的信息则来自值。

233
00:24:10,928 --> 00:24:18,089
用标量可以直接算出混合结果。三个值为 10、20、30，权重为 0.7、0.2、0.1，得到 7+4+3，也就是 14。网络通常混合特征向量。权重来自查询与键的比较，被加权的信息则来自值。

234
00:24:18,389 --> 00:24:26,089
顺序很重要。“狗咬人”和“人咬狗”用了相同的词，却描述了不同事件。图像中的位置也一样重要。

235
00:24:26,089 --> 00:24:33,349
从观众角度看，左边的行李箱和右边的行李箱位置不同。模型需要知道词语顺序和图像位置。

236
00:24:33,349 --> 00:24:38,389
这些信息帮助模型表示关系，但它仍然可能弄错关系。

237
00:24:38,389 --> 00:24:43,979
对镜头来说，左右通常指画面方向；对人物来说，左右可能指身体自己的方向。面对我们的人，右手在我们左边。这种简单反转经常造成指令歧义。重要时应写明视角，例如“行李箱在观众左侧，由旅人的右手提着”，然后分别检查这两个关系。

238
00:24:43,979 --> 00:24:50,229
对镜头来说，左右通常指画面方向；对人物来说，左右可能指身体自己的方向。面对我们的人，右手在我们左边。这种简单反转经常造成指令歧义。重要时应写明视角，例如“行李箱在观众左侧，由旅人的右手提着”，然后分别检查这两个关系。

239
00:24:50,229 --> 00:24:55,769
对镜头来说，左右通常指画面方向；对人物来说，左右可能指身体自己的方向。面对我们的人，右手在我们左边。这种简单反转经常造成指令歧义。重要时应写明视角，例如“行李箱在观众左侧，由旅人的右手提着”，然后分别检查这两个关系。

240
00:24:55,769 --> 00:24:57,871
对镜头来说，左右通常指画面方向；对人物来说，左右可能指身体自己的方向。面对我们的人，右手在我们左边。这种简单反转经常造成指令歧义。重要时应写明视角，例如“行李箱在观众左侧，由旅人的右手提着”，然后分别检查这两个关系。

241
00:24:58,171 --> 00:25:03,651
接下来检查这个要求：黄色外套、左边的红色行李箱，以及右边的车站屋顶。

242
00:25:03,651 --> 00:25:09,211
和同伴列一张简短的检查表，写下你会检查什么。要具体到别人也能照着检查。

243
00:25:09,211 --> 00:25:13,511
比较一下你们的清单。一张图片能不能很漂亮，却仍然有一项不合格？

244
00:25:13,511 --> 00:25:16,531
还有，我们说“左边”时，指的是谁的左边？

245
00:25:16,531 --> 00:25:22,831
答案可以包括四项检查：一位旅人、黄色外套、一个红箱子、屋顶在指定一侧。第五项可以检查手与提手的关系。这些是可观察的要求。“安静”则不同，可以用留白、低对比或姿势作为依据。分开这些类别，大家就能讨论情绪差异，同时不忽略明确的物体错误。

246
00:25:22,831 --> 00:25:29,531
答案可以包括四项检查：一位旅人、黄色外套、一个红箱子、屋顶在指定一侧。第五项可以检查手与提手的关系。这些是可观察的要求。“安静”则不同，可以用留白、低对比或姿势作为依据。分开这些类别，大家就能讨论情绪差异，同时不忽略明确的物体错误。

247
00:25:29,531 --> 00:25:37,248
答案可以包括四项检查：一位旅人、黄色外套、一个红箱子、屋顶在指定一侧。第五项可以检查手与提手的关系。这些是可观察的要求。“安静”则不同，可以用留白、低对比或姿势作为依据。分开这些类别，大家就能讨论情绪差异，同时不忽略明确的物体错误。

248
00:25:37,548 --> 00:25:45,008
色相和明度描述颜色的不同属性。黄色和红色是不同色相，明度描述颜色看起来有多亮或多暗。两个不同色相也可能有相近明度，在某些观看条件下，边界就不够清楚。

249
00:25:45,008 --> 00:25:50,328
色相和明度描述颜色的不同属性。黄色和红色是不同色相，明度描述颜色看起来有多亮或多暗。两个不同色相也可能有相近明度，在某些观看条件下，边界就不够清楚。

250
00:25:50,328 --> 00:25:56,408
灰度图有助于检查构图的明暗结构。如果外套与身后墙壁变成相近灰色，轮廓可能需要其他分离方式，例如加深背景、提亮人物，或增加受控的边缘光。

251
00:25:56,408 --> 00:26:03,748
灰度图有助于检查构图的明暗结构。如果外套与身后墙壁变成相近灰色，轮廓可能需要其他分离方式，例如加深背景、提亮人物，或增加受控的边缘光。

252
00:26:03,748 --> 00:26:11,588
这是检查方法，不是要求所有作品都高对比。低对比可以是有意选择。关键在于区分有意柔化的边界和意外消失的边界。单纯提高饱和度，并不一定解决明暗问题。

253
00:26:11,588 --> 00:26:19,206
这是检查方法，不是要求所有作品都高对比。低对比可以是有意选择。关键在于区分有意柔化的边界和意外消失的边界。单纯提高饱和度，并不一定解决明暗问题。

254
00:26:19,506 --> 00:26:27,086
Transformer 可以用在扩散模型中。先看图的左边：带噪声的表示被分成小块。

255
00:26:27,086 --> 00:26:34,166
这些小块变成词元，经过 Transformer 层，再转成预测。“Transformer”是网络类型，“扩散”是生成方法。

256
00:26:34,166 --> 00:26:36,726
这些小块变成词元，经过 Transformer 层，再转成预测。“Transformer”是网络类型，“扩散”是生成方法。

257
00:26:36,726 --> 00:26:44,086
两者可以一起使用。这张论文原图用的是物体类别等标签，原本不是文本提示模型。

258
00:26:44,086 --> 00:26:48,266
我们用它来理解网络结构，不需要掌握它原始任务的全部细节。

259
00:26:48,266 --> 00:26:57,506
图块序列既包含图像信息，也包含位置信息。没有位置，同一组图块可以组成不同布局。Transformer 层在序列之间交换信息，因此能连接画面中相距很远的部分。但序列越长，完整注意力越昂贵。视频还增加了时间维度，这个成本尤其重要。

260
00:26:57,506 --> 00:27:05,906
图块序列既包含图像信息，也包含位置信息。没有位置，同一组图块可以组成不同布局。Transformer 层在序列之间交换信息，因此能连接画面中相距很远的部分。但序列越长，完整注意力越昂贵。视频还增加了时间维度，这个成本尤其重要。

261
00:27:05,906 --> 00:27:15,006
图块序列既包含图像信息，也包含位置信息。没有位置，同一组图块可以组成不同布局。Transformer 层在序列之间交换信息，因此能连接画面中相距很远的部分。但序列越长，完整注意力越昂贵。视频还增加了时间维度，这个成本尤其重要。

262
00:27:15,006 --> 00:27:16,539
图块序列既包含图像信息，也包含位置信息。没有位置，同一组图块可以组成不同布局。Transformer 层在序列之间交换信息，因此能连接画面中相距很远的部分。但序列越长，完整注意力越昂贵。视频还增加了时间维度，这个成本尤其重要。

263
00:27:16,839 --> 00:27:23,679
小块越小，模型要处理的词元越多。在完整的自注意力中，每个词元都要与其他词元比较。

264
00:27:23,679 --> 00:27:29,679
所以比较次数增长很快。词元数量翻倍，两两比较得到的分数数量就变成四倍。

265
00:27:29,679 --> 00:27:37,479
这并不意味着整个程序一定慢四倍，但可以解释为什么这个计算环节会很耗资源。

266
00:27:37,479 --> 00:27:45,259
假设潜变量网格每边有 64 个位置。用 4×4 图块，会得到 16×16，也就是 256 个词元；用 2×2 图块，会得到 32×32，也就是 1024 个。词元变成四倍，完整注意力中的两两分数变成十六倍。这只是一个注意力计算的规模，不是整个模型的运行时间。

267
00:27:45,259 --> 00:27:52,639
假设潜变量网格每边有 64 个位置。用 4×4 图块，会得到 16×16，也就是 256 个词元；用 2×2 图块，会得到 32×32，也就是 1024 个。词元变成四倍，完整注意力中的两两分数变成十六倍。这只是一个注意力计算的规模，不是整个模型的运行时间。

268
00:27:52,639 --> 00:27:58,796
假设潜变量网格每边有 64 个位置。用 4×4 图块，会得到 16×16，也就是 256 个词元；用 2×2 图块，会得到 32×32，也就是 1024 个。词元变成四倍，完整注意力中的两两分数变成十六倍。这只是一个注意力计算的规模，不是整个模型的运行时间。

269
00:27:59,096 --> 00:28:05,596
生成输出也有不同的方法。自回归模型根据前面已有的词元，预测下一个词元。

270
00:28:05,596 --> 00:28:09,476
文字生成中就有这个过程，比如“杯子在……上”，然后预测一个可能接下来的词。

271
00:28:09,476 --> 00:28:14,236
扩散模型则经过多个步骤，更新带噪声的状态。两者都可以使用 Transformer。

272
00:28:14,236 --> 00:28:19,216
阅读模型介绍时，要区分它使用什么网络，以及按什么顺序生成结果。这些名称回答的是不同问题。

273
00:28:19,216 --> 00:28:21,216
阅读模型介绍时，要区分它使用什么网络，以及按什么顺序生成结果。这些名称回答的是不同问题。

274
00:28:21,216 --> 00:28:26,996
它们回答两个不同的工程问题。网络描述一次调用中怎样处理信息；生成方法描述怎样安排这些调用以得到输出。Transformer 可以预测下一个文字词元、图像词元，或带噪声图像的更新。因此，只看到模型介绍中的 Transformer 一词，还不能知道产品采用哪种生成过程。

275
00:28:26,996 --> 00:28:32,536
它们回答两个不同的工程问题。网络描述一次调用中怎样处理信息；生成方法描述怎样安排这些调用以得到输出。Transformer 可以预测下一个文字词元、图像词元，或带噪声图像的更新。因此，只看到模型介绍中的 Transformer 一词，还不能知道产品采用哪种生成过程。

276
00:28:32,536 --> 00:28:38,756
它们回答两个不同的工程问题。网络描述一次调用中怎样处理信息；生成方法描述怎样安排这些调用以得到输出。Transformer 可以预测下一个文字词元、图像词元，或带噪声图像的更新。因此，只看到模型介绍中的 Transformer 一词，还不能知道产品采用哪种生成过程。

277
00:28:38,756 --> 00:28:39,943
它们回答两个不同的工程问题。网络描述一次调用中怎样处理信息；生成方法描述怎样安排这些调用以得到输出。Transformer 可以预测下一个文字词元、图像词元，或带噪声图像的更新。因此，只看到模型介绍中的 Transformer 一词，还不能知道产品采用哪种生成过程。

278
00:28:40,243 --> 00:28:43,343
图像也可以表示为一串词元。

279
00:28:43,343 --> 00:28:48,063
有一类图像生成器逐个预测这些词元，并把前面的词元作为上下文。

280
00:28:48,063 --> 00:28:52,183
得到整个序列后，再由另一部分把它转成像素。这就是基本思路。

281
00:28:52,183 --> 00:28:56,963
这并不意味着所有图像生成器都从左上角到右下角逐像素作画。

282
00:28:56,963 --> 00:29:04,643
序列模型学习下一个词元的条件分布，在每个位置给不同选择分配概率。采样根据某种规则选取；每次都取最高概率是另一种规则，可能减少变化。图像系统中的词元可能表示学到的视觉单元，而不是普通词语。因此，预测顺序与词元含义都很重要。

283
00:29:04,643 --> 00:29:12,343
序列模型学习下一个词元的条件分布，在每个位置给不同选择分配概率。采样根据某种规则选取；每次都取最高概率是另一种规则，可能减少变化。图像系统中的词元可能表示学到的视觉单元，而不是普通词语。因此，预测顺序与词元含义都很重要。

284
00:29:12,343 --> 00:29:20,259
序列模型学习下一个词元的条件分布，在每个位置给不同选择分配概率。采样根据某种规则选取；每次都取最高概率是另一种规则，可能减少变化。图像系统中的词元可能表示学到的视觉单元，而不是普通词语。因此，预测顺序与词元含义都很重要。

285
00:29:20,559 --> 00:29:28,599
流匹配提供了另一种学习生成过程的描述。训练时，可以构造从噪声通向已知图像的路径，在路径上选一个点，请模型预测该处移动方向。生成时不会提供最终图像，而是沿模型从许多训练例子学到的方向前进。这个公式中，时间从噪声走向图像，与前面向图像加噪声的时间方向相反，需要注意约定变化。

286
00:29:28,599 --> 00:29:33,679
流匹配提供了另一种学习生成过程的描述。训练时，可以构造从噪声通向已知图像的路径，在路径上选一个点，请模型预测该处移动方向。生成时不会提供最终图像，而是沿模型从许多训练例子学到的方向前进。这个公式中，时间从噪声走向图像，与前面向图像加噪声的时间方向相反，需要注意约定变化。

287
00:29:33,679 --> 00:29:41,079
流匹配提供了另一种学习生成过程的描述。训练时，可以构造从噪声通向已知图像的路径，在路径上选一个点，请模型预测该处移动方向。生成时不会提供最终图像，而是沿模型从许多训练例子学到的方向前进。这个公式中，时间从噪声走向图像，与前面向图像加噪声的时间方向相反，需要注意约定变化。

288
00:29:41,079 --> 00:29:48,899
流匹配提供了另一种学习生成过程的描述。训练时，可以构造从噪声通向已知图像的路径，在路径上选一个点，请模型预测该处移动方向。生成时不会提供最终图像，而是沿模型从许多训练例子学到的方向前进。这个公式中，时间从噪声走向图像，与前面向图像加噪声的时间方向相反，需要注意约定变化。

289
00:29:48,899 --> 00:29:51,359
流匹配提供了另一种学习生成过程的描述。训练时，可以构造从噪声通向已知图像的路径，在路径上选一个点，请模型预测该处移动方向。生成时不会提供最终图像，而是沿模型从许多训练例子学到的方向前进。这个公式中，时间从噪声走向图像，与前面向图像加噪声的时间方向相反，需要注意约定变化。

290
00:29:51,359 --> 00:29:59,299
直线训练路径可以写成：状态等于 (1−时间)×起始噪声，加上 时间×目标数据。对时间求导，就得到目标数据减起始噪声，作为已知训练方向。生成时，模型使用从大量例子学到的方向场，并不会得到目标图片。路径和预测目标都是训练设计的一部分。

291
00:29:59,299 --> 00:30:07,179
直线训练路径可以写成：状态等于 (1−时间)×起始噪声，加上 时间×目标数据。对时间求导，就得到目标数据减起始噪声，作为已知训练方向。生成时，模型使用从大量例子学到的方向场，并不会得到目标图片。路径和预测目标都是训练设计的一部分。

292
00:30:07,179 --> 00:30:16,579
直线训练路径可以写成：状态等于 (1−时间)×起始噪声，加上 时间×目标数据。对时间求导，就得到目标数据减起始噪声，作为已知训练方向。生成时，模型使用从大量例子学到的方向场，并不会得到目标图片。路径和预测目标都是训练设计的一部分。

293
00:30:16,579 --> 00:30:17,848
直线训练路径可以写成：状态等于 (1−时间)×起始噪声，加上 时间×目标数据。对时间求导，就得到目标数据减起始噪声，作为已知训练方向。生成时，模型使用从大量例子学到的方向场，并不会得到目标图片。路径和预测目标都是训练设计的一部分。

294
00:30:18,148 --> 00:30:25,948
模型预测方向后，还需要一种沿方向前进的方法。简单更新把当前状态加上“预测方向乘以小步长”，再从新状态重新预测，重复进行。真实系统可以使用更复杂的求解器，但核心相同：模型作预测，数值方法用预测计算下一个状态。

295
00:30:25,948 --> 00:30:34,268
模型预测方向后，还需要一种沿方向前进的方法。简单更新把当前状态加上“预测方向乘以小步长”，再从新状态重新预测，重复进行。真实系统可以使用更复杂的求解器，但核心相同：模型作预测，数值方法用预测计算下一个状态。

296
00:30:34,268 --> 00:30:42,508
模型预测方向后，还需要一种沿方向前进的方法。简单更新把当前状态加上“预测方向乘以小步长”，再从新状态重新预测，重复进行。真实系统可以使用更复杂的求解器，但核心相同：模型作预测，数值方法用预测计算下一个状态。

297
00:30:42,508 --> 00:30:45,928
模型预测方向后，还需要一种沿方向前进的方法。简单更新把当前状态加上“预测方向乘以小步长”，再从新状态重新预测，重复进行。真实系统可以使用更复杂的求解器，但核心相同：模型作预测，数值方法用预测计算下一个状态。

298
00:30:45,928 --> 00:30:54,968
当前坐标为 2，预测速度为 3，步长为 0.1，欧拉更新得到 2+0.1×3=2.3，再从新位置重新预测方向。步子太大可能忽略方向场的弯曲；小步能减少这种数值误差，却需要更多计算，而且不能消除模型方向本身的错误。

299
00:30:54,968 --> 00:31:02,948
当前坐标为 2，预测速度为 3，步长为 0.1，欧拉更新得到 2+0.1×3=2.3，再从新位置重新预测方向。步子太大可能忽略方向场的弯曲；小步能减少这种数值误差，却需要更多计算，而且不能消除模型方向本身的错误。

300
00:31:02,948 --> 00:31:10,509
当前坐标为 2，预测速度为 3，步长为 0.1，欧拉更新得到 2+0.1×3=2.3，再从新位置重新预测方向。步子太大可能忽略方向场的弯曲；小步能减少这种数值误差，却需要更多计算，而且不能消除模型方向本身的错误。

301
00:31:10,809 --> 00:31:17,929
随机性可以出现在多个位置：开始时可能加入随机噪声，一些采样器还会在运行中继续加入噪声。

302
00:31:17,929 --> 00:31:21,529
另一些采样器在起点固定后，就按固定的计算过程运行。

303
00:31:21,529 --> 00:31:26,929
因此，即使采样过程固定，只要起始值不同，生成的图片仍然可以不同。

304
00:31:26,929 --> 00:31:29,549
要重复一个结果，就需要知道完整的设置。

305
00:31:29,549 --> 00:31:37,849
可以区分随机起点和随机运动。常微分方程采样器可以从随机噪声出发，再沿确定路径前进；随机采样器还会沿途加入随机性。两者都能生成不同图片。“确定”描述的是初始状态固定后的路径，并不表示每次运行起点相同，或输出相同图片。

306
00:31:37,849 --> 00:31:46,009
可以区分随机起点和随机运动。常微分方程采样器可以从随机噪声出发，再沿确定路径前进；随机采样器还会沿途加入随机性。两者都能生成不同图片。“确定”描述的是初始状态固定后的路径，并不表示每次运行起点相同，或输出相同图片。

307
00:31:46,009 --> 00:31:50,035
可以区分随机起点和随机运动。常微分方程采样器可以从随机噪声出发，再沿确定路径前进；随机采样器还会沿途加入随机性。两者都能生成不同图片。“确定”描述的是初始状态固定后的路径，并不表示每次运行起点相同，或输出相同图片。

308
00:31:50,335 --> 00:31:58,595
这个表把术语分开了。Transformer 或 U-Net 说明网络类型；像素或潜变量说明它处理什么表示。

309
00:31:58,595 --> 00:32:06,315
扩散或流匹配说明生成模型的训练方法；采样器或求解器说明如何计算更新。

310
00:32:06,315 --> 00:32:11,915
花一点时间，向旁边的人解释其中一行。今天不需要记住所有名称。

311
00:32:11,915 --> 00:32:17,475
我希望大家知道，它们指的是系统中不同的部分，并不是同一件事的几种竞争叫法。

312
00:32:17,475 --> 00:32:27,375
一个模型可以同时使用 Transformer 网络、潜变量表示、流匹配训练和某个数值求解器。另一个模型可能保留其中三项，只改第四项。分清这些术语，就不必把每个新名称都当成全新发明，也能理解为什么某个系统的设置不能直接搬到另一个系统。

313
00:32:27,375 --> 00:32:36,935
一个模型可以同时使用 Transformer 网络、潜变量表示、流匹配训练和某个数值求解器。另一个模型可能保留其中三项，只改第四项。分清这些术语，就不必把每个新名称都当成全新发明，也能理解为什么某个系统的设置不能直接搬到另一个系统。

314
00:32:36,935 --> 00:32:44,830
一个模型可以同时使用 Transformer 网络、潜变量表示、流匹配训练和某个数值求解器。另一个模型可能保留其中三项，只改第四项。分清这些术语，就不必把每个新名称都当成全新发明，也能理解为什么某个系统的设置不能直接搬到另一个系统。

315
00:32:45,130 --> 00:32:49,270
种子设定一串可重复随机数的起点。

316
00:32:49,270 --> 00:32:53,730
更换种子可以改变初始状态，从而得到不同图片。

317
00:32:53,730 --> 00:33:00,990
这些插图展示了我们可能关心的构图变化，并不是某些具体种子值的实测输出。

318
00:33:00,990 --> 00:33:10,670
种子数字没有固定的艺术含义。42 不代表“远景”，43 也不代表“更远一点”。种子可以用来探索不同结果。

319
00:33:10,670 --> 00:33:13,530
需要特定构图时，请使用明确的指令或参考图。

320
00:33:13,530 --> 00:33:22,810
种子是在可重复随机过程中确定起点的编号，不是外观指令。相邻种子不一定产生相似构图。研究引导时，可以让多个引导值使用同一组种子，每个种子提供匹配的起始条件。如果只是不断换种子直到图片好看，那是在挑选结果，而不是测量引导的影响。

321
00:33:22,810 --> 00:33:31,310
种子是在可重复随机过程中确定起点的编号，不是外观指令。相邻种子不一定产生相似构图。研究引导时，可以让多个引导值使用同一组种子，每个种子提供匹配的起始条件。如果只是不断换种子直到图片好看，那是在挑选结果，而不是测量引导的影响。

322
00:33:31,310 --> 00:33:39,219
种子是在可重复随机过程中确定起点的编号，不是外观指令。相邻种子不一定产生相似构图。研究引导时，可以让多个引导值使用同一组种子，每个种子提供匹配的起始条件。如果只是不断换种子直到图片好看，那是在挑选结果，而不是测量引导的影响。

323
00:33:39,519 --> 00:33:44,659
要重复结果，光保存种子还不够，还要保存模型、提示词、参考图和其他设置。

324
00:33:44,659 --> 00:33:52,379
用代码做对照实验时，每次对应运行前都要重置随机数生成器，否则它可能接着用下一批随机数。

325
00:33:52,379 --> 00:33:58,459
能否完全重复还可能受软件和硬件影响。种子只是记录的一部分，并不是全部。

326
00:33:58,459 --> 00:34:06,339
显示的种子不变，软件变化仍可能改变计算过程。新采样器、不同模型版本或随机数实现，都可能产生影响。课堂实验中，保存工作流文件通常比只截取种子输入框更有用。记录模型版本和完整输入设置，并把实际输出与记录一起保存。

327
00:34:06,339 --> 00:34:13,359
显示的种子不变，软件变化仍可能改变计算过程。新采样器、不同模型版本或随机数实现，都可能产生影响。课堂实验中，保存工作流文件通常比只截取种子输入框更有用。记录模型版本和完整输入设置，并把实际输出与记录一起保存。

328
00:34:13,359 --> 00:34:18,724
显示的种子不变，软件变化仍可能改变计算过程。新采样器、不同模型版本或随机数实现，都可能产生影响。课堂实验中，保存工作流文件通常比只截取种子输入框更有用。记录模型版本和完整输入设置，并把实际输出与记录一起保存。

329
00:34:19,024 --> 00:34:22,564
讲故事时，我们经常需要同一个角色出现在多个镜头里。

330
00:34:22,564 --> 00:34:27,024
先决定哪些特征必须保留：外套、头发、行李箱，也可能包括用哪只手提着它。

331
00:34:27,024 --> 00:34:33,664
机位和姿势可以改变，但这些特征仍要能被认出来。重复使用一个种子，不能完整定义一个角色。

332
00:34:33,664 --> 00:34:38,904
参考图可以帮助保持一致，但仍要逐张比较，找出会破坏场景连贯性的变化。

333
00:34:38,904 --> 00:34:46,524
角色连续性有多个层次：轮廓仍可辨认，脸却变了；脸很像，外套却多了口袋；道具颜色不变，却换了一只手。角色设定表把这些要求分开呈现。生成一组镜头之前先定义稳定细节，可以避免每个镜头都重新发明这些部分。

334
00:34:46,524 --> 00:34:53,684
角色连续性有多个层次：轮廓仍可辨认，脸却变了；脸很像，外套却多了口袋；道具颜色不变，却换了一只手。角色设定表把这些要求分开呈现。生成一组镜头之前先定义稳定细节，可以避免每个镜头都重新发明这些部分。

335
00:34:53,684 --> 00:34:59,466
角色连续性有多个层次：轮廓仍可辨认，脸却变了；脸很像，外套却多了口袋；道具颜色不变，却换了一只手。角色设定表把这些要求分开呈现。生成一组镜头之前先定义稳定细节，可以避免每个镜头都重新发明这些部分。

336
00:34:59,766 --> 00:35:07,746
角色设定表定义主体在不同视图中需要保留的特征。这里用三个方向展示同一服装与道具，目的是在生成序列之前明确要求，而不是镜头完成后才决定哪些细节应该稳定。

337
00:35:07,746 --> 00:35:15,326
角色设定表定义主体在不同视图中需要保留的特征。这里用三个方向展示同一服装与道具，目的是在生成序列之前明确要求，而不是镜头完成后才决定哪些细节应该稳定。

338
00:35:15,326 --> 00:35:23,406
轮廓包括外套长度、肩部形状和整体比例；表面细节包括纽扣、口袋、头发和道具形状；归属关系包括哪只手拿道具。这些特征在正面、侧面和背面的可见程度不同。

339
00:35:23,406 --> 00:35:28,886
轮廓包括外套长度、肩部形状和整体比例；表面细节包括纽扣、口袋、头发和道具形状；归属关系包括哪只手拿道具。这些特征在正面、侧面和背面的可见程度不同。

340
00:35:28,886 --> 00:35:36,806
参考方法有助于保留特征，但参考本身也要一致。如果两张源图的服装冲突，模型就会收到矛盾信息。清楚的参考集能减少歧义，却不保证每个新视图都正确。

341
00:35:36,806 --> 00:35:44,646
参考方法有助于保留特征，但参考本身也要一致。如果两张源图的服装冲突，模型就会收到矛盾信息。清楚的参考集能减少歧义，却不保证每个新视图都正确。

342
00:35:44,646 --> 00:35:51,726
评价时，要区分合理视角变化与身份漂移。镜头移动时，箱子可见的侧面应该改变，但提手结构不应无故变化。这样才能允许变化，同时保持主体可辨认。

343
00:35:51,726 --> 00:35:58,485
评价时，要区分合理视角变化与身份漂移。镜头移动时，箱子可见的侧面应该改变，但提手结构不应无故变化。这样才能允许变化，同时保持主体可辨认。

344
00:35:58,785 --> 00:36:04,725
现在来看引导。在经典的无分类器引导中，我们比较有条件和无条件时的两个预测。

345
00:36:04,725 --> 00:36:10,125
条件可以是文本提示，也可以是类别标签。引导沿着两个预测的差异方向，把结果推得更远。

346
00:36:10,125 --> 00:36:15,265
这可能让指定的主体更明显，但提高强度并不会让指令变得更精确。

347
00:36:15,265 --> 00:36:19,805
如果模型给出的方向不够准确，更强的推动也可能让问题更明显。

348
00:36:19,805 --> 00:36:26,705
经典训练方法会有时去掉条件，使同一个网络同时学会有条件和无条件预测。采样时，两种预测之差提供引导方向。这把训练选择与用户控制项联系起来。强度滑块不是衡量语言理解能力的通用分数，而是控制预测的某种组合。

349
00:36:26,705 --> 00:36:33,425
经典训练方法会有时去掉条件，使同一个网络同时学会有条件和无条件预测。采样时，两种预测之差提供引导方向。这把训练选择与用户控制项联系起来。强度滑块不是衡量语言理解能力的通用分数，而是控制预测的某种组合。

350
00:36:33,425 --> 00:36:40,208
经典训练方法会有时去掉条件，使同一个网络同时学会有条件和无条件预测。采样时，两种预测之差提供引导方向。这把训练选择与用户控制项联系起来。强度滑块不是衡量语言理解能力的通用分数，而是控制预测的某种组合。

351
00:36:40,508 --> 00:36:48,528
这个公式可以用一句话来读：从无提示预测出发，加上有提示和无提示预测之差的某个倍数。

352
00:36:48,528 --> 00:36:55,568
系数为 1 时，得到有提示的预测；大于 1 时，就沿这个方向继续往外推。这不是简单取平均。

353
00:36:55,568 --> 00:36:58,828
不同论文和工具有时会使用不同的数值定义。

354
00:36:58,828 --> 00:37:05,128
稍后练习所用的论文中，引导数值的定义与这个公式相差 1。

355
00:37:05,128 --> 00:37:08,768
所以比较数值之前，先检查它的定义。

356
00:37:08,768 --> 00:37:15,968
公式中的方向位于高维数字空间，并不是专门控制黄色、锐度或真实感的单一滑块。改变系数时，多个视觉属性可能一起变化。下一页的一维例子清楚展示了外推：从一个预测出发，越过另一个预测。在完整图像中，这会同时发生在许多坐标上。

357
00:37:15,968 --> 00:37:26,228
公式中的方向位于高维数字空间，并不是专门控制黄色、锐度或真实感的单一滑块。改变系数时，多个视觉属性可能一起变化。下一页的一维例子清楚展示了外推：从一个预测出发，越过另一个预测。在完整图像中，这会同时发生在许多坐标上。

358
00:37:26,228 --> 00:37:34,000
公式中的方向位于高维数字空间，并不是专门控制黄色、锐度或真实感的单一滑块。改变系数时，多个视觉属性可能一起变化。下一页的一维例子清楚展示了外推：从一个预测出发，越过另一个预测。在完整图像中，这会同时发生在许多坐标上。

359
00:37:34,300 --> 00:37:40,900
用一个数字说明引导公式。假设无提示预测是二，有提示预测是三，差值为一。系数为一时，结果是二加一，等于三；系数为四时，结果是二加四，等于六。结果越过了有提示预测，不是二与三之间的平均值。这些是假设的一维数字，不是真实图像测量，用来说明大系数如何放大方向。

360
00:37:40,900 --> 00:37:46,900
用一个数字说明引导公式。假设无提示预测是二，有提示预测是三，差值为一。系数为一时，结果是二加一，等于三；系数为四时，结果是二加四，等于六。结果越过了有提示预测，不是二与三之间的平均值。这些是假设的一维数字，不是真实图像测量，用来说明大系数如何放大方向。

361
00:37:46,900 --> 00:37:55,460
用一个数字说明引导公式。假设无提示预测是二，有提示预测是三，差值为一。系数为一时，结果是二加一，等于三；系数为四时，结果是二加四，等于六。结果越过了有提示预测，不是二与三之间的平均值。这些是假设的一维数字，不是真实图像测量，用来说明大系数如何放大方向。

362
00:37:55,460 --> 00:38:01,380
用一个数字说明引导公式。假设无提示预测是二，有提示预测是三，差值为一。系数为一时，结果是二加一，等于三；系数为四时，结果是二加四，等于六。结果越过了有提示预测，不是二与三之间的平均值。这些是假设的一维数字，不是真实图像测量，用来说明大系数如何放大方向。

363
00:38:01,380 --> 00:38:10,740
系数为 4 时，结果超出了 2 到 3 的范围，所以引导会放大特征，而不只是混合两个合理答案。数字空间有很多坐标，因此多种属性可能同时放大。放大破坏颜色或细节时，较低系数可能有用；具体设置仍取决于模型训练和软件的引导定义。

364
00:38:10,740 --> 00:38:21,260
系数为 4 时，结果超出了 2 到 3 的范围，所以引导会放大特征，而不只是混合两个合理答案。数字空间有很多坐标，因此多种属性可能同时放大。放大破坏颜色或细节时，较低系数可能有用；具体设置仍取决于模型训练和软件的引导定义。

365
00:38:21,260 --> 00:38:27,216
系数为 4 时，结果超出了 2 到 3 的范围，所以引导会放大特征，而不只是混合两个合理答案。数字空间有很多坐标，因此多种属性可能同时放大。放大破坏颜色或细节时，较低系数可能有用；具体设置仍取决于模型训练和软件的引导定义。

366
00:38:27,516 --> 00:38:33,496
看看引导变强后，外观会怎样变化。主体可能更容易辨认。

367
00:38:33,496 --> 00:38:41,896
但颜色也可能过强，细节变得奇怪，不同样本越来越相似。是否有用，要看作品需要什么。

368
00:38:41,896 --> 00:38:49,416
醒目的海报和平静的场景，可能需要不同选择。这些是论文中以图像类别为条件的示例。

369
00:38:49,416 --> 00:38:54,756
它们展示了值得检查的取舍，但不能给所有当前模型提供一个通用的最佳数值。

370
00:38:54,756 --> 00:39:04,996
插画中，夸张对比可能让小尺寸下的轮廓更清楚；同样的对比也可能破坏雾气或黄昏所需的柔和过渡。因此，要区分意外错误和有意的图形效果。问题不在于颜色强烈本身，而在于是否还能控制被强调的形状，以及效果是否符合创作目的。

371
00:39:04,996 --> 00:39:12,876
插画中，夸张对比可能让小尺寸下的轮廓更清楚；同样的对比也可能破坏雾气或黄昏所需的柔和过渡。因此，要区分意外错误和有意的图形效果。问题不在于颜色强烈本身，而在于是否还能控制被强调的形状，以及效果是否符合创作目的。

372
00:39:12,876 --> 00:39:19,835
插画中，夸张对比可能让小尺寸下的轮廓更清楚；同样的对比也可能破坏雾气或黄昏所需的柔和过渡。因此，要区分意外错误和有意的图形效果。问题不在于颜色强烈本身，而在于是否还能控制被强调的形状，以及效果是否符合创作目的。

373
00:39:20,135 --> 00:39:24,435
在一些图像生成器中，负面提示词会改变比较的另一端。

374
00:39:24,435 --> 00:39:30,235
系统可以把负面提示中的文字作为比较对象，代替空提示。

375
00:39:30,235 --> 00:39:36,905
计算会远离这个预测，朝正面提示的预测方向移动。但它不是精确的删除工具。

376
00:39:36,905 --> 00:39:45,115
负面提示写“人”，并不保证房间里没有人。如果仍有不想要的内容，就检查结果，再作出明确修改。

377
00:39:45,115 --> 00:39:49,095
堆上一长串负面词，反而会更难判断到底哪一项起了作用。

378
00:39:49,095 --> 00:39:58,695
负面提示改变条件输入，蒙版定义空间区域，两者解决不同问题。如果只是不想要角落的一块标牌，局部编辑可能比长串负面词更直接；如果整张图都有不想要的倾向，改提示或模型设置可能更合适。控制方式应与问题的位置和范围对应。

379
00:39:58,695 --> 00:40:07,735
负面提示改变条件输入，蒙版定义空间区域，两者解决不同问题。如果只是不想要角落的一块标牌，局部编辑可能比长串负面词更直接；如果整张图都有不想要的倾向，改提示或模型设置可能更合适。控制方式应与问题的位置和范围对应。

380
00:40:07,735 --> 00:40:14,843
负面提示改变条件输入，蒙版定义空间区域，两者解决不同问题。如果只是不想要角落的一块标牌，局部编辑可能比长串负面词更直接；如果整张图都有不想要的倾向，改提示或模型设置可能更合适。控制方式应与问题的位置和范围对应。

381
00:40:15,143 --> 00:40:23,363
这里是论文中三个不同引导设置的示例。提示描述的是丛林中的宇航员，要求冷色、低饱和度。

382
00:40:23,363 --> 00:40:27,483
看看颜色、主体大小，以及周围环境带来的感觉。

383
00:40:27,483 --> 00:40:33,043
这个比较缺少一项信息：图中的示例没有记录是否使用了对应的相同种子。

384
00:40:33,043 --> 00:40:39,643
所以我们可以描述差异，却不能确定每一处差异都由引导造成。请记住这个区别。

385
00:40:39,643 --> 00:40:43,483
即使比较看起来很有用，也要清楚记录改变了什么。

386
00:40:43,483 --> 00:40:51,843
这也是阅读论文图片的一课。页面可能展示明显差异，却没提供复现所需的全部设置，不能自行补全这些空缺。我们可以说某张颜色更强、主体更大；若要归因于一个变量，则需要缺失的控制信息。外观描述是一类证据，因果解释需要更严格的比较。

387
00:40:51,843 --> 00:40:59,003
这也是阅读论文图片的一课。页面可能展示明显差异，却没提供复现所需的全部设置，不能自行补全这些空缺。我们可以说某张颜色更强、主体更大；若要归因于一个变量，则需要缺失的控制信息。外观描述是一类证据，因果解释需要更严格的比较。

388
00:40:59,003 --> 00:41:06,643
这也是阅读论文图片的一课。页面可能展示明显差异，却没提供复现所需的全部设置，不能自行补全这些空缺。我们可以说某张颜色更强、主体更大；若要归因于一个变量，则需要缺失的控制信息。外观描述是一类证据，因果解释需要更严格的比较。

389
00:41:06,643 --> 00:41:09,829
这也是阅读论文图片的一课。页面可能展示明显差异，却没提供复现所需的全部设置，不能自行补全这些空缺。我们可以说某张颜色更强、主体更大；若要归因于一个变量，则需要缺失的控制信息。外观描述是一类证据，因果解释需要更严格的比较。

390
00:41:10,129 --> 00:41:12,969
外套是黄色的，但画面感觉生硬、拥挤。

391
00:41:12,969 --> 00:41:18,249
物体正确，情绪却不对。和同伴讨论如何测试不同的引导设置。哪些条件保持不变？

392
00:41:18,249 --> 00:41:19,249
物体正确，情绪却不对。和同伴讨论如何测试不同的引导设置。哪些条件保持不变？

393
00:41:19,249 --> 00:41:24,949
你会在结果中检查什么？再谈谈判断：怎样解释某一版更安静或不那么拥挤？

394
00:41:24,949 --> 00:41:29,409
请指出可见的内容，比如对比度、人物大小，或者旅人周围的空间。

395
00:41:29,409 --> 00:41:38,089
考虑两种改动：降低引导，测试生硬颜色是否与预测组合有关；缩小旅人，测试构图。两者同时做，结果可能改善，却难以解释。两人可以分别测试一种改动，保持起始条件匹配，再比较每项改动真正解决了哪个可见问题。

396
00:41:38,089 --> 00:41:43,969
考虑两种改动：降低引导，测试生硬颜色是否与预测组合有关；缩小旅人，测试构图。两者同时做，结果可能改善，却难以解释。两人可以分别测试一种改动，保持起始条件匹配，再比较每项改动真正解决了哪个可见问题。

397
00:41:43,969 --> 00:41:49,867
考虑两种改动：降低引导，测试生硬颜色是否与预测组合有关；缩小旅人，测试构图。两者同时做，结果可能改善，却难以解释。两人可以分别测试一种改动，保持起始条件匹配，再比较每项改动真正解决了哪个可见问题。

398
00:41:50,167 --> 00:41:56,847
测试时，保持模型、提示词、图像尺寸、采样器和步数不变。只改变引导，并在每个数值下使用同一组种子。

399
00:41:56,847 --> 00:42:01,567
多个种子比一个更好，因为某个设置可能只对某个起点表现好，对另一个却不好。

400
00:42:01,567 --> 00:42:07,407
然后分开比较：是否画出了要求的内容、外观是否合适，以及整组结果是否有用地呈现了不同选择。

401
00:42:07,407 --> 00:42:10,307
你可能会发现，没有任何一个设置在所有方面都最好。

402
00:42:10,307 --> 00:42:17,087
一个小实验可以用三个引导值和四个种子，共十二张图片，让每个引导值都与每个种子配对。这比三张无关的精选图更容易区分设置效果和偶然起点。再分别记录提示错误、可见瑕疵和构图变化。十二只是课堂示例，不代表足以支持所有研究结论。

403
00:42:17,087 --> 00:42:23,667
一个小实验可以用三个引导值和四个种子，共十二张图片，让每个引导值都与每个种子配对。这比三张无关的精选图更容易区分设置效果和偶然起点。再分别记录提示错误、可见瑕疵和构图变化。十二只是课堂示例，不代表足以支持所有研究结论。

404
00:42:23,667 --> 00:42:31,612
一个小实验可以用三个引导值和四个种子，共十二张图片，让每个引导值都与每个种子配对。这比三张无关的精选图更容易区分设置效果和偶然起点。再分别记录提示错误、可见瑕疵和构图变化。十二只是课堂示例，不代表足以支持所有研究结论。

405
00:42:31,912 --> 00:42:40,772
现在比较 15 步和 50 步。这是较早的 Stable Diffusion 示例中两次已经完成的运行，提示词和种子相同。

406
00:42:40,772 --> 00:42:49,572
它们不是同一次运行中的两张过程图。看看马和宇航员的衣服。哪里变了？哪些变化才算改善？

407
00:42:49,572 --> 00:42:56,292
更多步骤意味着不同的生成路径。它可能有帮助，但不保证每个物体都更正确。

408
00:42:56,292 --> 00:43:00,532
这个旧示例也不能说明新模型就应该使用 50 步。

409
00:43:00,532 --> 00:43:08,012
对合适的求解器和模型，更多更新可能减少数值近似误差，但模型本身的预测仍可能错误。更准确地沿着一个不完美的预测方向前进，不保证物体数量或身体结构正确。这里要区分：执行模型预测的误差，以及模型表示目标图像的误差。增加步数不能解决后者的所有局限。

410
00:43:08,012 --> 00:43:14,812
对合适的求解器和模型，更多更新可能减少数值近似误差，但模型本身的预测仍可能错误。更准确地沿着一个不完美的预测方向前进，不保证物体数量或身体结构正确。这里要区分：执行模型预测的误差，以及模型表示目标图像的误差。增加步数不能解决后者的所有局限。

411
00:43:14,812 --> 00:43:22,112
对合适的求解器和模型，更多更新可能减少数值近似误差，但模型本身的预测仍可能错误。更准确地沿着一个不完美的预测方向前进，不保证物体数量或身体结构正确。这里要区分：执行模型预测的误差，以及模型表示目标图像的误差。增加步数不能解决后者的所有局限。

412
00:43:22,112 --> 00:43:26,983
对合适的求解器和模型，更多更新可能减少数值近似误差，但模型本身的预测仍可能错误。更准确地沿着一个不完美的预测方向前进，不保证物体数量或身体结构正确。这里要区分：执行模型预测的误差，以及模型表示目标图像的误差。增加步数不能解决后者的所有局限。

413
00:43:27,283 --> 00:43:30,003
步数告诉我们进行多少次更新。

414
00:43:30,003 --> 00:43:35,603
采样器决定怎样计算更新，调度方案决定经过哪些噪声水平。

415
00:43:35,603 --> 00:43:40,603
这些选择彼此相关，但并不是同一个选择。可以想象沿着一条路线前进。

416
00:43:40,603 --> 00:43:45,863
只知道停靠次数，并不知道在哪里停、怎样移动。比较速度时，要测量实际耗时。

417
00:43:45,863 --> 00:43:47,923
只知道停靠次数，并不知道在哪里停、怎样移动。比较速度时，要测量实际耗时。

418
00:43:47,923 --> 00:43:53,963
不同系统中，一步所需的计算量可能不同，所以不能只看步数。

419
00:43:53,963 --> 00:44:02,443
一些数值方法计算一次更新时需要多个模型预测，另一些会复用之前的信息。因此，只比较界面上的步数可能误导。实验应同时记录设置和实际耗时；实现层面还可以记录网络评估次数，因为网络往往占据大量计算成本。

420
00:44:02,443 --> 00:44:11,503
一些数值方法计算一次更新时需要多个模型预测，另一些会复用之前的信息。因此，只比较界面上的步数可能误导。实验应同时记录设置和实际耗时；实现层面还可以记录网络评估次数，因为网络往往占据大量计算成本。

421
00:44:11,503 --> 00:44:19,239
一些数值方法计算一次更新时需要多个模型预测，另一些会复用之前的信息。因此，只比较界面上的步数可能误导。实验应同时记录设置和实际耗时；实现层面还可以记录网络评估次数，因为网络往往占据大量计算成本。

422
00:44:19,539 --> 00:44:26,539
过程图来自一次运行的中途；步数比较则是多次分别完成的运行。

423
00:44:26,539 --> 00:44:32,199
这个区别很重要，因为总步数改变后，从第一步开始的调度方案也可能改变。

424
00:44:32,199 --> 00:44:38,099
完成的 15 步图片，不一定等于 50 步运行到第 15 步时的样子。

425
00:44:38,099 --> 00:44:47,139
展示比较时，请标清楚：是在看一张图片逐渐生成，还是在比较不同设置的最终结果？

426
00:44:47,139 --> 00:44:49,759
这两类图片回答的是不同问题。

427
00:44:49,759 --> 00:44:57,119
假设一次运行经过二十个噪声水平，另一次经过五十个。它们的第十五次更新可能位于不同噪声水平，因此不是同一阶段。过程图应标明所属运行，最终结果网格应记录每次完整设置，避免把两种不同证据混在一起。

428
00:44:57,119 --> 00:45:04,359
假设一次运行经过二十个噪声水平，另一次经过五十个。它们的第十五次更新可能位于不同噪声水平，因此不是同一阶段。过程图应标明所属运行，最终结果网格应记录每次完整设置，避免把两种不同证据混在一起。

429
00:45:04,359 --> 00:45:12,339
假设一次运行经过二十个噪声水平，另一次经过五十个。它们的第十五次更新可能位于不同噪声水平，因此不是同一阶段。过程图应标明所属运行，最终结果网格应记录每次完整设置，避免把两种不同证据混在一起。

430
00:45:12,339 --> 00:45:13,137
假设一次运行经过二十个噪声水平，另一次经过五十个。它们的第十五次更新可能位于不同噪声水平，因此不是同一阶段。过程图应标明所属运行，最终结果网格应记录每次完整设置，避免把两种不同证据混在一起。

431
00:45:13,437 --> 00:45:21,797
步数不总等于计算成本。经典无分类器引导的一次更新使用有条件和无条件两个预测。二十步、每步一对预测，简单计算就是四十次网络评估。

432
00:45:21,797 --> 00:45:26,577
步数不总等于计算成本。经典无分类器引导的一次更新使用有条件和无条件两个预测。二十步、每步一对预测，简单计算就是四十次网络评估。

433
00:45:26,577 --> 00:45:33,737
实现可以把这对预测合批计算，相比两次单独调用可能更快，但计算内容仍然不同于一次无条件预测。其他求解器可能需要更多评估，蒸馏模型也可能采用不同的引导方式。

434
00:45:33,737 --> 00:45:40,617
实现可以把这对预测合批计算，相比两次单独调用可能更快，但计算内容仍然不同于一次无条件预测。其他求解器可能需要更多评估，蒸馏模型也可能采用不同的引导方式。

435
00:45:40,617 --> 00:45:45,937
互动显示真正相关的是从输入到可见结果的完整等待，包括文字编码、采样、解码和额外处理。图像尺寸、模型大小与硬件都会影响耗时。比较速度时，应同时报告实测秒数、采样器和步数。

436
00:45:45,937 --> 00:45:54,257
互动显示真正相关的是从输入到可见结果的完整等待，包括文字编码、采样、解码和额外处理。图像尺寸、模型大小与硬件都会影响耗时。比较速度时，应同时报告实测秒数、采样器和步数。

437
00:45:54,257 --> 00:45:56,375
互动显示真正相关的是从输入到可见结果的完整等待，包括文字编码、采样、解码和额外处理。图像尺寸、模型大小与硬件都会影响耗时。比较速度时，应同时报告实测秒数、采样器和步数。

438
00:45:56,675 --> 00:46:02,015
一些模型专门训练成只需要很少步骤，SD-Turbo 就是一个例子。

439
00:46:02,015 --> 00:46:07,875
它的文生图文档设置使用 1 到 4 步，并关闭常规的无分类器引导。

440
00:46:07,875 --> 00:46:11,095
这是这个模型经过训练后，在其预期设置中的特性。

441
00:46:11,095 --> 00:46:15,395
不能直接把这些设置搬到旧模型上，就认为会有同样效果。

442
00:46:15,395 --> 00:46:20,735
一种叫作蒸馏的训练方法，可以帮助模型学会更短的生成过程。

443
00:46:20,735 --> 00:46:28,255
记住：训练成一步生成的模型，与把另一个模型运行一步就停下来，是不同的。

444
00:46:28,255 --> 00:46:36,015
蒸馏改变模型在有限调用次数内学会完成的任务。它可能利用高成本教师模型的信息训练学生，也可能使用相关目标缩短生成过程。得到的模型可能需要不同采样器和引导设置，应先遵循文档范围。一步模型与五十步模型是不同的训练系统，不只是同一系统运行时间不同。

445
00:46:36,015 --> 00:46:45,035
蒸馏改变模型在有限调用次数内学会完成的任务。它可能利用高成本教师模型的信息训练学生，也可能使用相关目标缩短生成过程。得到的模型可能需要不同采样器和引导设置，应先遵循文档范围。一步模型与五十步模型是不同的训练系统，不只是同一系统运行时间不同。

446
00:46:45,035 --> 00:46:52,002
蒸馏改变模型在有限调用次数内学会完成的任务。它可能利用高成本教师模型的信息训练学生，也可能使用相关目标缩短生成过程。得到的模型可能需要不同采样器和引导设置，应先遵循文档范围。一步模型与五十步模型是不同的训练系统，不只是同一系统运行时间不同。

447
00:46:52,302 --> 00:47:00,322
换模型可能改变的不只是外观。训练图片、网络、文本编码器和训练方法都可能不同。

448
00:47:00,322 --> 00:47:06,102
即使设置名称相同，作用也可能不同。在自己的作品中，先决定究竟要比较什么。

449
00:47:06,102 --> 00:47:13,082
你想知道哪个完整工具更适合制作场景？还是想知道哪一项技术变化带来了改善？

450
00:47:13,082 --> 00:47:18,162
前者是有用的设计问题，后者则需要更严谨的实验。

451
00:47:18,162 --> 00:47:22,382
每个模型只挑一张最喜欢的图片，无法充分回答任何一个问题。

452
00:47:22,382 --> 00:47:29,502
比较模型与比较完整工作流也不同。工作流可能包括更好的参考界面、自动缩放、人脸修复或放大阶段。即使基础模型不变，这些环节对设计师也很重要。研究哪个工具更适合完成海报时应考虑它们；研究哪项网络改动提升质量时，则要把它们分开。

453
00:47:29,502 --> 00:47:37,942
比较模型与比较完整工作流也不同。工作流可能包括更好的参考界面、自动缩放、人脸修复或放大阶段。即使基础模型不变，这些环节对设计师也很重要。研究哪个工具更适合完成海报时应考虑它们；研究哪项网络改动提升质量时，则要把它们分开。

454
00:47:37,942 --> 00:47:44,242
比较模型与比较完整工作流也不同。工作流可能包括更好的参考界面、自动缩放、人脸修复或放大阶段。即使基础模型不变，这些环节对设计师也很重要。研究哪个工具更适合完成海报时应考虑它们；研究哪项网络改动提升质量时，则要把它们分开。

455
00:47:44,242 --> 00:47:46,498
比较模型与比较完整工作流也不同。工作流可能包括更好的参考界面、自动缩放、人脸修复或放大阶段。即使基础模型不变，这些环节对设计师也很重要。研究哪个工具更适合完成海报时应考虑它们；研究哪项网络改动提升质量时，则要把它们分开。

456
00:47:46,798 --> 00:47:54,078
LoRA 把权重更新表示为两个较小矩阵的乘积，在基础权重上加入学到的调整。秩规定中间维度；较小的秩减少训练数值数量，也限制更新形式。

457
00:47:54,078 --> 00:48:00,778
LoRA 把权重更新表示为两个较小矩阵的乘积，在基础权重上加入学到的调整。秩规定中间维度；较小的秩减少训练数值数量，也限制更新形式。

458
00:48:00,778 --> 00:48:01,518
LoRA 把权重更新表示为两个较小矩阵的乘积，在基础权重上加入学到的调整。秩规定中间维度；较小的秩减少训练数值数量，也限制更新形式。

459
00:48:01,518 --> 00:48:07,278
对于一个 1000×1000 权重矩阵，完整更新有一百万个数值。秩为 8 时，两个因子各有八千个，总计一万六千，比这个矩阵的完整更新少 62.5 倍。

460
00:48:07,278 --> 00:48:14,538
对于一个 1000×1000 权重矩阵，完整更新有一百万个数值。秩为 8 时，两个因子各有八千个，总计一万六千，比这个矩阵的完整更新少 62.5 倍。

461
00:48:14,538 --> 00:48:21,498
这个计算不是实际模型的全部参数，只解释一个权重的节省。风格或主体 LoRA 仍需匹配训练时的基础模型。秩、训练数据和更新位置都会影响学到的内容。

462
00:48:21,498 --> 00:48:27,389
这个计算不是实际模型的全部参数，只解释一个权重的节省。风格或主体 LoRA 仍需匹配训练时的基础模型。秩、训练数据和更新位置都会影响学到的内容。

463
00:48:27,689 --> 00:48:39,529
参考条件输入与主体适配是不同方法。IP-Adapter 通过学到的图像条件通道输入特征，将文字和图像注意力分开。适配器训练好后，输入新参考图不需要为这个主体重新训练。

464
00:48:39,529 --> 00:48:46,249
参考条件输入与主体适配是不同方法。IP-Adapter 通过学到的图像条件通道输入特征，将文字和图像注意力分开。适配器训练好后，输入新参考图不需要为这个主体重新训练。

465
00:48:46,249 --> 00:48:57,129
DreamBooth 则用特定主体的例子微调文生图模型，将主体与特殊标识关联，使它能在其他场景中被调用。训练是方法的一部分，不只是生成时临时提供参考图。

466
00:48:57,129 --> 00:49:03,829
DreamBooth 则用特定主体的例子微调文生图模型，将主体与特殊标识关联，使它能在其他场景中被调用。训练是方法的一部分，不只是生成时临时提供参考图。

467
00:49:03,829 --> 00:49:12,789
LoRA 是紧凑表示权重更新的方法，本身不是某个角色或风格。这些方法可以组合，类别不一定互斥。重点是分清：哪些信息在生成时输入，哪些信息已经改变了模型权重。

468
00:49:12,789 --> 00:49:22,461
LoRA 是紧凑表示权重更新的方法，本身不是某个角色或风格。这些方法可以组合，类别不一定互斥。重点是分清：哪些信息在生成时输入，哪些信息已经改变了模型权重。

469
00:49:22,761 --> 00:49:30,221
ControlNet 为预训练文生图扩散模型加入空间条件。原论文研究边缘、深度、分割和人体姿态等控制图，以比一般外观描述更明确的形式规定结构。

470
00:49:30,221 --> 00:49:35,761
ControlNet 为预训练文生图扩散模型加入空间条件。原论文研究边缘、深度、分割和人体姿态等控制图，以比一般外观描述更明确的形式规定结构。

471
00:49:35,761 --> 00:49:43,781
边缘图可以保留建筑轮廓而不固定材质，深度图表达表面远近而不规定颜色，姿态图定位关节而保留服装与脸部细节的自由。应该根据需要控制的属性选择控制图。

472
00:49:43,781 --> 00:49:49,741
边缘图可以保留建筑轮廓而不固定材质，深度图表达表面远近而不规定颜色，姿态图定位关节而保留服装与脸部细节的自由。应该根据需要控制的属性选择控制图。

473
00:49:49,741 --> 00:49:57,101
附加网络经过训练，把空间信息与文字条件一起使用。控制图并不是直接贴进输出，而是影响生成过程。结构因此更容易规定，但身份、纹理和精细几何仍需单独检查。

474
00:49:57,101 --> 00:50:04,569
附加网络经过训练，把空间信息与文字条件一起使用。控制图并不是直接贴进输出，而是影响生成过程。结构因此更容易规定，但身份、纹理和精细几何仍需单独检查。

475
00:50:04,869 --> 00:50:09,169
生成并不总要从随机噪声开始，也可以从一张画开始。

476
00:50:09,169 --> 00:50:15,589
一种常见做法是先表示这张画，加入一些噪声，再从这个起点生成。

477
00:50:15,589 --> 00:50:23,169
原图仍提供了一些结构。一个接近原来的布局，另一个改动更大。

478
00:50:23,169 --> 00:50:29,649
选择结果之前，先决定想保留什么：姿势、屋顶线条，还是留白？

479
00:50:29,649 --> 00:50:33,609
细节更多的图片，也可能丢掉你最在意的那部分原画。

480
00:50:33,609 --> 00:50:40,689
草图能同时显示形状和位置，例如屋顶轮廓、人物大小，以及箱子与长椅的间距，这些关系用文字可能很难描述。但粗略草图未必规定灯光或材质，模型仍需在这些部分作出选择。因此，保留结构与创造外观是不同任务。

481
00:50:40,689 --> 00:50:47,089
草图能同时显示形状和位置，例如屋顶轮廓、人物大小，以及箱子与长椅的间距，这些关系用文字可能很难描述。但粗略草图未必规定灯光或材质，模型仍需在这些部分作出选择。因此，保留结构与创造外观是不同任务。

482
00:50:47,089 --> 00:50:56,569
草图能同时显示形状和位置，例如屋顶轮廓、人物大小，以及箱子与长椅的间距，这些关系用文字可能很难描述。但粗略草图未必规定灯光或材质，模型仍需在这些部分作出选择。因此，保留结构与创造外观是不同任务。

483
00:50:56,569 --> 00:50:57,955
草图能同时显示形状和位置，例如屋顶轮廓、人物大小，以及箱子与长椅的间距，这些关系用文字可能很难描述。但粗略草图未必规定灯光或材质，模型仍需在这些部分作出选择。因此，保留结构与创造外观是不同任务。

484
00:50:58,255 --> 00:51:06,335
在这种图像编辑中，加入的噪声较少，通常会保留更多原图；噪声较多，通常允许更大的改动。

485
00:51:06,335 --> 00:51:12,055
但提示词和模型仍然重要，而且“强度”的含义取决于具体工具。

486
00:51:12,055 --> 00:51:15,155
对于这张草图，我会先决定什么必须保留。

487
00:51:15,155 --> 00:51:21,755
如果旅人的位置很重要，我会先比较位置，再判断衣服纹理。

488
00:51:21,755 --> 00:51:27,355
这样就有明确的理由接受或放弃一个修改，而不是只挑细节最多的版本。

489
00:51:27,355 --> 00:51:33,915
忠于原画与自由修改之间存在取舍。起始姿势错误时，保留太强会保留错误；姿势正确时，噪声过多又可能破坏想留下的结构。可以用同一张画测试多个强度，并在选择前明确需要保留哪些结构。

490
00:51:33,915 --> 00:51:42,275
忠于原画与自由修改之间存在取舍。起始姿势错误时，保留太强会保留错误；姿势正确时，噪声过多又可能破坏想留下的结构。可以用同一张画测试多个强度，并在选择前明确需要保留哪些结构。

491
00:51:42,275 --> 00:51:49,678
忠于原画与自由修改之间存在取舍。起始姿势错误时，保留太强会保留错误；姿势正确时，噪声过多又可能破坏想留下的结构。可以用同一张画测试多个强度，并在选择前明确需要保留哪些结构。

492
00:51:49,978 --> 00:51:56,598
蒙版规定图像编辑出现的位置。简单合成中，1 选择编辑图，0 选择原图，中间值混合两者。页面公式描述的就是这种混合操作。

493
00:51:56,598 --> 00:52:03,898
蒙版规定图像编辑出现的位置。简单合成中，1 选择编辑图，0 选择原图，中间值混合两者。页面公式描述的就是这种混合操作。

494
00:52:03,898 --> 00:52:10,178
某像素蒙版值为四分之一时，合成使用四分之一编辑图和四分之三原图，可以在边缘形成柔和过渡。但过宽的软边也可能产生光晕，或混合不一致的灯光。

495
00:52:10,178 --> 00:52:17,978
某像素蒙版值为四分之一时，合成使用四分之一编辑图和四分之三原图，可以在边缘形成柔和过渡。但过宽的软边也可能产生光晕，或混合不一致的灯光。

496
00:52:17,978 --> 00:52:26,878
修复模型把区域规定作为生成输入，这与把完成的编辑直接合成到原像素上不同。一些工具内部仍可能改变未蒙版区域。需要精确保留时，应比较区域外的输出，或明确使用原图像素。

497
00:52:26,878 --> 00:52:36,338
修复模型把区域规定作为生成输入，这与把完成的编辑直接合成到原像素上不同。一些工具内部仍可能改变未蒙版区域。需要精确保留时，应比较区域外的输出，或明确使用原图像素。

498
00:52:36,338 --> 00:52:45,798
艺术问题仍集中在边界。修复区域需要一致的透视、边缘处理、颜色和光线。即使蒙版技术上正确，这些属性不一致，仍会显得像贴上去的。

499
00:52:45,798 --> 00:52:49,166
艺术问题仍集中在边界。修复区域需要一致的透视、边缘处理、颜色和光线。即使蒙版技术上正确，这些属性不一致，仍会显得像贴上去的。

500
00:52:49,466 --> 00:52:56,686
分层工作流把不同任务交给不同操作。构图可从草图、深度图或空间参考开始；生成提供外观与细节；局部蒙版修复区域；颜色调整和文字可保留在可编辑图层中。

501
00:52:56,686 --> 00:53:04,446
分层工作流把不同任务交给不同操作。构图可从草图、深度图或空间参考开始；生成提供外观与细节；局部蒙版修复区域；颜色调整和文字可保留在可编辑图层中。

502
00:53:04,446 --> 00:53:11,546
精确文字或对齐很重要时，这种方式尤其有用。海报标题可以独立排版，道具修改可以合成到生成底图上，最终图像因此结合了生成元素与直接控制的元素。

503
00:53:11,546 --> 00:53:18,046
精确文字或对齐很重要时，这种方式尤其有用。海报标题可以独立排版，道具修改可以合成到生成底图上，最终图像因此结合了生成元素与直接控制的元素。

504
00:53:18,046 --> 00:53:25,806
技术上的关键是保留。每次都重新生成整图，所有区域都可能变化；分层编辑限制了修改范围，但仍需检查接缝、灯光和颜色一致性。保留底图、蒙版和最终合成，便于后续修改。

505
00:53:25,806 --> 00:53:33,193
技术上的关键是保留。每次都重新生成整图，所有区域都可能变化；分层编辑限制了修改范围，但仍需检查接缝、灯光和颜色一致性。保留底图、蒙版和最终合成，便于后续修改。

506
00:53:33,493 --> 00:53:42,373
视频增加了一个问题：事物需要随时间保持一致。上排中，外套和行李箱在不同镜头里保持了外观。

507
00:53:42,373 --> 00:53:48,493
下排中，它们发生了变化。每帧单看可能都不错，放在一起却破坏了场景的连贯性。

508
00:53:48,493 --> 00:53:51,653
视频模型可以使用跨帧的信息。

509
00:53:51,653 --> 00:53:57,433
即便如此，仍要留意物体消失、人脸改变，或者镜头移动时墙壁弯曲等问题。

510
00:53:57,433 --> 00:54:02,173
这些图用来说明问题，并不是某个视频模型的测试结果。

511
00:54:02,173 --> 00:54:05,013
关键是：看真实输出时，我们应该检查什么？

512
00:54:05,013 --> 00:54:16,353
时间一致性有几种含义。身份一致性关注人物或道具能否持续辨认；几何一致性关注表面形状和位置；运动一致性关注位置如何随帧变化。模型可能做好一项，却在另一项失败，例如脸始终可辨认，身后的墙却弯曲了。分开这些错误，比单一真实感分数更有信息。

513
00:54:16,353 --> 00:54:23,273
时间一致性有几种含义。身份一致性关注人物或道具能否持续辨认；几何一致性关注表面形状和位置；运动一致性关注位置如何随帧变化。模型可能做好一项，却在另一项失败，例如脸始终可辨认，身后的墙却弯曲了。分开这些错误，比单一真实感分数更有信息。

514
00:54:23,273 --> 00:54:31,785
时间一致性有几种含义。身份一致性关注人物或道具能否持续辨认；几何一致性关注表面形状和位置；运动一致性关注位置如何随帧变化。模型可能做好一项，却在另一项失败，例如脸始终可辨认，身后的墙却弯曲了。分开这些错误，比单一真实感分数更有信息。

515
00:54:32,085 --> 00:54:39,205
来看看 2026 年的一些例子。Google 的 Nano Banana 2 包含图中文字和翻译功能。

516
00:54:39,205 --> 00:54:46,025
这个官方示例把标牌改成了另一种语言。对设计师来说，它可能有助于尝试不同版本的海报。

517
00:54:46,025 --> 00:54:51,285
但更换语言也会改变文字长度、换行和版面的感觉。

518
00:54:51,285 --> 00:54:56,665
所以不能只检查有没有出现字母，还要逐字阅读、核对意思，并检查间距。

519
00:54:56,665 --> 00:55:00,565
我们的车站场景中的标牌、车票和告示，也有同样的问题。

520
00:55:00,565 --> 00:55:09,225
字体排版同时有语言和视觉要求。标牌文字可能正确，间距却不好；也可能版面平衡，却改了一个重要词。海报应分开检查文字准确性、换行、对齐和层级。图内生成文字可以帮助构思，最终版保留可编辑文字则便于修改，不必重新生成整张图。

521
00:55:09,225 --> 00:55:20,005
字体排版同时有语言和视觉要求。标牌文字可能正确，间距却不好；也可能版面平衡，却改了一个重要词。海报应分开检查文字准确性、换行、对齐和层级。图内生成文字可以帮助构思，最终版保留可编辑文字则便于修改，不必重新生成整张图。

522
00:55:20,005 --> 00:55:28,521
字体排版同时有语言和视觉要求。标牌文字可能正确，间距却不好；也可能版面平衡，却改了一个重要词。海报应分开检查文字准确性、换行、对齐和层级。图内生成文字可以帮助构思，最终版保留可编辑文字则便于修改，不必重新生成整张图。

523
00:55:28,821 --> 00:55:36,041
另一个有用的发展，是让角色在一组画面中保持可辨认。这是 Google 发布的分镜示例。

524
00:55:36,041 --> 00:55:43,701
看看反复出现的角色，虽然姿势和位置变了，仍能认出来。这比单张漂亮图片更接近讲故事的需要。

525
00:55:43,701 --> 00:55:47,981
不同镜头需要变化，同时角色仍要让人认得出。

526
00:55:47,981 --> 00:55:56,081
对于我们的旅人，我会比较外套形状、头发和行李箱。Google 报告一致性有所改善，但我们仍需逐镜头检查。

527
00:55:56,081 --> 00:56:02,761
角色乍看相似，但切换画面时，一点小变化也可能很显眼。

528
00:56:02,761 --> 00:56:10,461
主体一致性不等于像素相同。背面与正面本来就不应有相同像素。目标是在视角合理变化时，保留识别主体的特征。分镜中应比较服装结构、身体比例和道具归属。仅仅重复一张脸，不足以让整组镜头保持连续。

529
00:56:10,461 --> 00:56:16,821
主体一致性不等于像素相同。背面与正面本来就不应有相同像素。目标是在视角合理变化时，保留识别主体的特征。分镜中应比较服装结构、身体比例和道具归属。仅仅重复一张脸，不足以让整组镜头保持连续。

530
00:56:16,821 --> 00:56:25,492
主体一致性不等于像素相同。背面与正面本来就不应有相同像素。目标是在视角合理变化时，保留识别主体的特征。分镜中应比较服装结构、身体比例和道具归属。仅仅重复一张脸，不足以让整组镜头保持连续。

531
00:56:25,792 --> 00:56:37,352
OpenAI 官方文档列出了 2026 年 9 月 8 日的 GPT Image 2.5 Sunburst 和 Flare 快照。Sunburst 被描述为能力最强的图像模型，Flare 面向更快的日常图像工作，两者都用于生成和编辑。

532
00:56:37,352 --> 00:56:44,712
OpenAI 官方文档列出了 2026 年 9 月 8 日的 GPT Image 2.5 Sunburst 和 Flare 快照。Sunburst 被描述为能力最强的图像模型，Flare 面向更快的日常图像工作，两者都用于生成和编辑。

533
00:56:44,712 --> 00:56:52,512
设计比较应使用相同任务和参考图。产品的能力标签不能直接告诉我们：它能否保留特定标志、保持跨镜头角色，或准确生成版面文字。这些都需要检查实际输出。

534
00:56:52,512 --> 00:57:00,572
设计比较应使用相同任务和参考图。产品的能力标签不能直接告诉我们：它能否保留特定标志、保持跨镜头角色，或准确生成版面文字。这些都需要检查实际输出。

535
00:57:00,572 --> 00:57:10,932
速度在不同阶段的作用也不同。快速方案有利于选择构图，复杂最终编辑可能值得更慢的结果，但差异要看得见且有用。公开模型介绍不是独立排名，也没有揭示所有内部架构选择。

536
00:57:10,932 --> 00:57:20,692
速度在不同阶段的作用也不同。快速方案有利于选择构图，复杂最终编辑可能值得更慢的结果，但差异要看得见且有用。公开模型介绍不是独立排名，也没有揭示所有内部架构选择。

537
00:57:20,992 --> 00:57:29,452
视频工具也开始接受更多类型的参考。2026 年 2 月发布的 Seedance 2.0 可以输入文字、图片、声音和视频。

538
00:57:29,452 --> 00:57:31,152
视频工具也开始接受更多类型的参考。2026 年 2 月发布的 Seedance 2.0 可以输入文字、图片、声音和视频。

539
00:57:31,152 --> 00:57:33,532
它可以生成带声音的短视频。

540
00:57:33,532 --> 00:57:39,452
假设我们喜欢某张图中旅人的外观，同时另有一段视频展示想要的镜头运动。

541
00:57:39,452 --> 00:57:46,472
这些参考分别表达场景的不同部分。当运动难以用语言描述时，这可能很有用。

542
00:57:46,472 --> 00:57:52,112
仍要检查结果：它是否遵循了运动参考？这种运动是否产生了我们想要的感觉？

543
00:57:52,112 --> 00:58:00,332
不同参考规定不同变量。角色图描述外观，运动视频描述时序和镜头行为，音频描述节奏或事件顺序。明确这些分工，组合参考才更有用。参考冲突时仍需作出选择，例如慢镜头参考与快速节拍可能暗示不同剪辑方式；仅有文件本身，并不能确定创作意图。

544
00:58:00,332 --> 00:58:08,192
不同参考规定不同变量。角色图描述外观，运动视频描述时序和镜头行为，音频描述节奏或事件顺序。明确这些分工，组合参考才更有用。参考冲突时仍需作出选择，例如慢镜头参考与快速节拍可能暗示不同剪辑方式；仅有文件本身，并不能确定创作意图。

545
00:58:08,192 --> 00:58:16,512
不同参考规定不同变量。角色图描述外观，运动视频描述时序和镜头行为，音频描述节奏或事件顺序。明确这些分工，组合参考才更有用。参考冲突时仍需作出选择，例如慢镜头参考与快速节拍可能暗示不同剪辑方式；仅有文件本身，并不能确定创作意图。

546
00:58:16,512 --> 00:58:17,471
不同参考规定不同变量。角色图描述外观，运动视频描述时序和镜头行为，音频描述节奏或事件顺序。明确这些分工，组合参考才更有用。参考冲突时仍需作出选择，例如慢镜头参考与快速节拍可能暗示不同剪辑方式；仅有文件本身，并不能确定创作意图。

547
00:58:17,771 --> 00:58:25,911
另一个变化，是可以用语言描述对已有视频的修改。Google 在 2026 年 6 月公开预览了 Gemini Omni Flash。

548
00:58:25,911 --> 00:58:32,911
官方示例包括用语音或文字改变灯光、替换物体。对于我们的场景，可以说：“保留旅人，

549
00:58:32,911 --> 00:58:38,911
把车站灯光调暖。”然后完整看一遍：脸变了吗？物体消失了吗？声音还对吗？

550
00:58:38,911 --> 00:58:40,051
把车站灯光调暖。”然后完整看一遍：脸变了吗？物体消失了吗？声音还对吗？

551
00:58:40,051 --> 00:58:43,211
某一帧中看起来成功的修改，可能在其他地方产生问题。

552
00:58:43,211 --> 00:58:48,491
另外，演示中展示的控制功能，与我们实际能用到的版本也可能不同。

553
00:58:48,491 --> 00:58:55,631
视频编辑带来保留问题：指令说明要改什么，其余部分同样重要。重新打光应检查移动表面和阴影，不只看第一帧；替换物体应保留前方物体经过时的遮挡关系。这些是具体测试，比假设自然语言指令能保证局部修改更有用。

554
00:58:55,631 --> 00:59:04,731
视频编辑带来保留问题：指令说明要改什么，其余部分同样重要。重新打光应检查移动表面和阴影，不只看第一帧；替换物体应保留前方物体经过时的遮挡关系。这些是具体测试，比假设自然语言指令能保证局部修改更有用。

555
00:59:04,731 --> 00:59:13,332
视频编辑带来保留问题：指令说明要改什么，其余部分同样重要。重新打光应检查移动表面和阴影，不只看第一帧；替换物体应保留前方物体经过时的遮挡关系。这些是具体测试，比假设自然语言指令能保证局部修改更有用。

556
00:59:13,632 --> 00:59:21,472
视频质量需要在多个时间尺度上检查。单帧检查物体数量、身体结构、文字和构图，类似静态图检查；序列层面则看物体是否持续存在，以及运动是否连续。

557
00:59:21,472 --> 00:59:29,372
视频质量需要在多个时间尺度上检查。单帧检查物体数量、身体结构、文字和构图，类似静态图检查；序列层面则看物体是否持续存在，以及运动是否连续。

558
00:59:29,372 --> 00:59:36,712
镜头运动能检验几何。墙在单帧中合理，却可能随视角变化弯曲。遮挡也是测试：物体经过前景遮挡后重新出现，身份和位置应保持一致。

559
00:59:36,712 --> 00:59:42,392
镜头运动能检验几何。墙在单帧中合理，却可能随视角变化弯曲。遮挡也是测试：物体经过前景遮挡后重新出现，身份和位置应保持一致。

560
00:59:42,392 --> 00:59:52,072
声音增加了事件时序。可见碰撞与声音应有明确关系，对话需要语音时序与嘴部运动对应。目标不只是拥有音轨，而是让视听事件符合场景需要。

561
00:59:52,072 --> 00:59:57,752
声音增加了事件时序。可见碰撞与声音应有明确关系，对话需要语音时序与嘴部运动对应。目标不只是拥有音轨，而是让视听事件符合场景需要。

562
00:59:57,752 --> 01:00:04,352
剪辑处，画面方向和道具位置影响连续性。物体前一镜头向右、后一镜头向左，可能暗示掉头。这可以是有意选择，但应有空间安排支持，而不是生成造成的意外变化。

563
01:00:04,352 --> 01:00:11,391
剪辑处，画面方向和道具位置影响连续性。物体前一镜头向右、后一镜头向左，可能暗示掉头。这可以是有意选择，但应有空间安排支持，而不是生成造成的意外变化。

564
01:00:11,691 --> 01:00:21,531
FLUX 3 展示了从分别生成画面与声音，转向联合视听生成的方向。Black Forest Labs 于 2026 年 8 月 4 日发布初始视频版本，公告介绍了最长二十秒、带音频、支持图片输入、关键帧和续接等功能。

565
01:00:21,531 --> 01:00:30,551
FLUX 3 展示了从分别生成画面与声音，转向联合视听生成的方向。Black Forest Labs 于 2026 年 8 月 4 日发布初始视频版本，公告介绍了最长二十秒、带音频、支持图片输入、关键帧和续接等功能。

566
01:00:30,551 --> 01:00:39,851
关键帧规定重要时刻的画面，模型生成中间过渡，比风格形容词提供更具体的时间控制。但中间运动仍由模型生成，所以首尾帧正确，不代表过渡动作正确。

567
01:00:39,851 --> 01:00:48,491
关键帧规定重要时刻的画面，模型生成中间过渡，比风格形容词提供更具体的时间控制。但中间运动仍由模型生成，所以首尾帧正确，不代表过渡动作正确。

568
01:00:48,491 --> 01:00:56,731
该公司八月的放大工具公告还展示了一种取舍：更具创造性的修复模式可能改变身份。因此，提高分辨率、加强重建与保留原貌，是不同选择。这些是开发者说明，独立比较仍需匹配输入并记录输出。

569
01:00:56,731 --> 01:01:07,807
该公司八月的放大工具公告还展示了一种取舍：更具创造性的修复模式可能改变身份。因此，提高分辨率、加强重建与保留原貌，是不同选择。这些是开发者说明，独立比较仍需匹配输入并记录输出。

570
01:01:08,107 --> 01:01:15,967
OpenAI 的 GPT-6 Astra 是用于推理、编程和工具工作的通用助手模型，可以接收文字和图片。设计中的一个用途是根据明确要求搭建互动作品，再检查和修改结果。

571
01:01:15,967 --> 01:01:22,927
OpenAI 的 GPT-6 Astra 是用于推理、编程和工具工作的通用助手模型，可以接收文字和图片。设计中的一个用途是根据明确要求搭建互动作品，再检查和修改结果。

572
01:01:22,927 --> 01:01:30,547
助手可以编写灯光过渡代码、检查截图，并根据反馈调整时间。工作流中的图像生成工具可以是另一个模型。需要区分组织工作的助手与实际生成图片的专用工具。

573
01:01:30,547 --> 01:01:36,747
助手可以编写灯光过渡代码、检查截图，并根据反馈调整时间。工作流中的图像生成工具可以是另一个模型。需要区分组织工作的助手与实际生成图片的专用工具。

574
01:01:36,747 --> 01:01:44,287
这也不同于世界模型预测下一视图，或 VLA 输出机器人指令。它们输出不同，测试也不同。下一例子将互动要求变成可观察的行为，具体说明助手的作用。

575
01:01:44,287 --> 01:01:49,103
这也不同于世界模型预测下一视图，或 VLA 输出机器人指令。它们输出不同，测试也不同。下一例子将互动要求变成可观察的行为，具体说明助手的作用。

576
01:01:49,403 --> 01:01:55,983
互动可以规定为输入、状态变化和随时间产生的输出。这里输入是点击道具，输出是持续两秒的灯光渐变，过程中镜头和角色应固定。

577
01:01:55,983 --> 01:02:02,303
互动可以规定为输入、状态变化和随时间产生的输出。这里输入是点击道具，输出是持续两秒的灯光渐变，过程中镜头和角色应固定。

578
01:02:02,303 --> 01:02:08,683
Astra 可以借助工具编写和修改行为代码。重要测试是实际作品：一次点击是否只开始一次过渡？最终亮度是否符合要求？再次点击会重启、反向还是不响应？

579
01:02:08,683 --> 01:02:14,923
Astra 可以借助工具编写和修改行为代码。重要测试是实际作品：一次点击是否只开始一次过渡？最终亮度是否符合要求？再次点击会重启、反向还是不响应？

580
01:02:14,923 --> 01:02:16,703
Astra 可以借助工具编写和修改行为代码。重要测试是实际作品：一次点击是否只开始一次过渡？最终亮度是否符合要求？再次点击会重启、反向还是不响应？

581
01:02:16,703 --> 01:02:26,343
这些是状态设计决定，应明确规定。否则，生成实现可能在截图中正确，重复使用时却行为不定。静态图片无法展示互动的所有状态。

582
01:02:26,343 --> 01:02:31,083
这些是状态设计决定，应明确规定。否则，生成实现可能在截图中正确，重复使用时却行为不定。静态图片无法展示互动的所有状态。

583
01:02:31,083 --> 01:02:40,563
助手帮助搭建和检查实现，测试仍需可观察的输入输出。这样才能区分“解释得像真的”与“实际能够工作”，把语言助手连接到具体设计流程。

584
01:02:40,563 --> 01:02:46,629
助手帮助搭建和检查实现，测试仍需可观察的输入输出。这样才能区分“解释得像真的”与“实际能够工作”，把语言助手连接到具体设计流程。

585
01:02:46,929 --> 01:02:54,669
世界模型预测环境如何变化，通常以动作作为条件。表示方式可以不同：有的预测紧凑状态，有的生成未来视频，有的使用可从不同视角渲染的明确三维场景。

586
01:02:54,669 --> 01:03:01,029
世界模型预测环境如何变化，通常以动作作为条件。表示方式可以不同：有的预测紧凑状态，有的生成未来视频，有的使用可从不同视角渲染的明确三维场景。

587
01:03:01,029 --> 01:03:10,469
CMU 的世界模型课程区分这些方法，因为它们支持的操作不同。潜在状态可用于控制而不生成图片；互动视频提供可见视图，却未必有可编辑三维几何；场景表示可以支持渲染，物理行为仍需另外建模。

588
01:03:10,469 --> 01:03:18,869
CMU 的世界模型课程区分这些方法，因为它们支持的操作不同。潜在状态可用于控制而不生成图片；互动视频提供可见视图，却未必有可编辑三维几何；场景表示可以支持渲染，物理行为仍需另外建模。

589
01:03:18,869 --> 01:03:21,469
CMU 的世界模型课程区分这些方法，因为它们支持的操作不同。潜在状态可用于控制而不生成图片；互动视频提供可见视图，却未必有可编辑三维几何；场景表示可以支持渲染，物理行为仍需另外建模。

590
01:03:21,469 --> 01:03:29,669
所以“世界模型”不是一种固定架构。实际要问：表示什么状态、接受什么动作、预测什么结果。逼真图片是外观证据，并不自动证明距离、动力学或环境持续性准确。

591
01:03:29,669 --> 01:03:39,098
所以“世界模型”不是一种固定架构。实际要问：表示什么状态、接受什么动作、预测什么结果。逼真图片是外观证据，并不自动证明距离、动力学或环境持续性准确。

592
01:03:39,398 --> 01:03:51,438
这里的 Astra 是 ICLR 2026 的世界模型研究，预印本最早发表于 2025 年 12 月。它与 OpenAI 的 GPT-6 Astra 是不同项目。

593
01:03:51,438 --> 01:03:59,618
看左边带绿框的图片，它们是起始图像。后面几列是生成的视图，上面标注了移动控制。

594
01:03:59,618 --> 01:04:03,998
模型使用之前的观察和动作输入，预测接下来的一段视频。

595
01:04:03,998 --> 01:04:12,178
这与前面讨论的条件相连：现在，移动指令帮助引导生成。互动场景既需要响应，也需要保持一致。

596
01:04:12,178 --> 01:04:15,458
我们发出指令后，视图改变了吗？改变后的空间仍然合理吗？

597
01:04:15,458 --> 01:04:24,938
带动作条件的视频模型接收运动意图和之前的观察，因此预测既要合理，也要响应动作。预录视频只需播放下一帧；互动模型却需要从同一视图响应不同动作。所以评估除了视觉质量，还应测试响应、重复动作和返回之前视角的移动。

598
01:04:24,938 --> 01:04:32,478
带动作条件的视频模型接收运动意图和之前的观察，因此预测既要合理，也要响应动作。预录视频只需播放下一帧；互动模型却需要从同一视图响应不同动作。所以评估除了视觉质量，还应测试响应、重复动作和返回之前视角的移动。

599
01:04:32,478 --> 01:04:40,357
带动作条件的视频模型接收运动意图和之前的观察，因此预测既要合理，也要响应动作。预录视频只需播放下一帧；互动模型却需要从同一视图响应不同动作。所以评估除了视觉质量，还应测试响应、重复动作和返回之前视角的移动。

600
01:04:40,657 --> 01:04:47,537
往返测试可以检查生成环境随时间是否一致。从门外进入、转开、转回，再走出去，会重新访问先前几何，而不是只生成无需与过去一致的新视图。

601
01:04:47,537 --> 01:04:54,837
往返测试可以检查生成环境随时间是否一致。从门外进入、转开、转回，再走出去，会重新访问先前几何，而不是只生成无需与过去一致的新视图。

602
01:04:54,837 --> 01:05:02,957
模型可能每一帧都合理，却逐渐改变门的大小或位置。自身生成帧成为后续输入时，小误差会累积。因此，短期真实感和长期一致性是不同评估目标。

603
01:05:02,957 --> 01:05:09,977
模型可能每一帧都合理，却逐渐改变门的大小或位置。自身生成帧成为后续输入时，小误差会累积。因此，短期真实感和长期一致性是不同评估目标。

604
01:05:09,977 --> 01:05:18,597
物体持续性也相关。椅子移出镜头，不应该就不存在；转回去能测试模型保留了什么。明确三维场景、视频历史和学习到的隐状态，可以通过不同方式支持持续性。

605
01:05:18,597 --> 01:05:25,817
物体持续性也相关。椅子移出镜头，不应该就不存在；转回去能测试模型保留了什么。明确三维场景、视频历史和学习到的隐状态，可以通过不同方式支持持续性。

606
01:05:25,817 --> 01:05:32,637
这个测试不能证明所有物理能力，只检查短动作序列中的时空一致。接触、材质行为和控制精度需要额外测试，测试应与声称的能力对应。

607
01:05:32,637 --> 01:05:39,418
这个测试不能证明所有物理能力，只检查短动作序列中的时空一致。接触、材质行为和控制精度需要额外测试，测试应与声称的能力对应。

608
01:05:39,718 --> 01:05:47,658
VLA 指视觉、语言、动作。模型接收视觉信息和指令，通常还包括机器人的当前位置等信息。

609
01:05:47,658 --> 01:05:54,358
它产生机器人的动作，例如移动手臂或闭合夹爪。2026 年 7 月发布的 Gemini Robotics 2 就是一个例子。

610
01:05:54,358 --> 01:05:55,538
它产生机器人的动作，例如移动手臂或闭合夹爪。2026 年 7 月发布的 Gemini Robotics 2 就是一个例子。

611
01:05:55,538 --> 01:05:59,878
它包括全身控制，所以动作不只限于桌面旁的一条手臂。

612
01:05:59,878 --> 01:06:06,138
在装置作品中，可以设想机器人随着观众互动移动道具。这需要一个完整的工作系统。

613
01:06:06,138 --> 01:06:11,118
模型输出动作只是其中一部分，观察结果和处理错误也很重要。

614
01:06:11,118 --> 01:06:17,478
机器人动作可以表示成关节目标、末端移动，或一段未来控制序列。模型输出必须匹配机器人接口。“拿起杯子”比这些底层动作模糊得多。完整系统需要观察、策略、电机执行和更新后的反馈，VLA 则把视觉语言信息连接到系统使用的动作表示。

615
01:06:17,478 --> 01:06:25,958
机器人动作可以表示成关节目标、末端移动，或一段未来控制序列。模型输出必须匹配机器人接口。“拿起杯子”比这些底层动作模糊得多。完整系统需要观察、策略、电机执行和更新后的反馈，VLA 则把视觉语言信息连接到系统使用的动作表示。

616
01:06:25,958 --> 01:06:37,478
机器人动作可以表示成关节目标、末端移动，或一段未来控制序列。模型输出必须匹配机器人接口。“拿起杯子”比这些底层动作模糊得多。完整系统需要观察、策略、电机执行和更新后的反馈，VLA 则把视觉语言信息连接到系统使用的动作表示。

617
01:06:37,478 --> 01:06:38,607
机器人动作可以表示成关节目标、末端移动，或一段未来控制序列。模型输出必须匹配机器人接口。“拿起杯子”比这些底层动作模糊得多。完整系统需要观察、策略、电机执行和更新后的反馈，VLA 则把视觉语言信息连接到系统使用的动作表示。

618
01:06:38,907 --> 01:06:46,347
图像位置与机器人移动使用不同坐标系。道具在画面中心左边四十像素，并不能直接规定机械手应该移动多少厘米。这个关系取决于相机几何、深度和机器人当前状态。

619
01:06:46,347 --> 01:06:52,707
图像位置与机器人移动使用不同坐标系。道具在画面中心左边四十像素，并不能直接规定机械手应该移动多少厘米。这个关系取决于相机几何、深度和机器人当前状态。

620
01:06:52,707 --> 01:06:58,927
指令还需要参考系。左可以是相机左侧、机器人左侧或工作空间方向。移动可以表示为关节角变化，或末端执行器目标，控制器必须正确解释表示。

621
01:06:58,927 --> 01:07:06,847
指令还需要参考系。左可以是相机左侧、机器人左侧或工作空间方向。移动可以表示为关节角变化，或末端执行器目标，控制器必须正确解释表示。

622
01:07:06,847 --> 01:07:17,047
VLA 学习从观察和语言到动作的映射，通常还使用机器人状态。外围系统仍需决定动作表示及电机执行方式。预测出看似正确运动的模型，本身并不等于经过校准的物理装置。

623
01:07:17,047 --> 01:07:24,107
VLA 学习从观察和语言到动作的映射，通常还使用机器人状态。外围系统仍需决定动作表示及电机执行方式。预测出看似正确运动的模型，本身并不等于经过校准的物理装置。

624
01:07:24,107 --> 01:07:32,807
移动后，新观察完成反馈循环。道具搬运装置的停止条件可以是到达标记位置或稳定抓住物体。明确参考系、距离、反馈和停止条件，就能把模糊移动要求变成可测试任务。

625
01:07:32,807 --> 01:07:38,863
移动后，新观察完成反馈循环。道具搬运装置的停止条件可以是到达标记位置或稳定抓住物体。明确参考系、距离、反馈和停止条件，就能把模糊移动要求变成可测试任务。

626
01:07:39,163 --> 01:07:46,263
这些系统分工不同。助手可以为行李箱互动编写代码；世界模型可以预测行李箱移动后会怎样。

627
01:07:46,263 --> 01:07:51,923
VLA 可以生成移动真实行李箱的指令。一个系统可以把这些工作结合起来，行动后再观察。

628
01:07:51,923 --> 01:07:59,023
但 VLA 不一定包含独立的世界模型。生成一个动作的视频，也不代表机器人真的完成了动作。

629
01:07:59,023 --> 01:08:04,903
规划器可以先请世界模型预测多个候选结果，再选择动作，这是一种安排。另一种策略可以直接从观察输出动作，不生成未来图像。看一次成功演示不能证明采用哪种架构；需要系统说明确认组件，并通过任务测试判断组合是否可靠。

630
01:08:04,903 --> 01:08:13,563
规划器可以先请世界模型预测多个候选结果，再选择动作，这是一种安排。另一种策略可以直接从观察输出动作，不生成未来图像。看一次成功演示不能证明采用哪种架构；需要系统说明确认组件，并通过任务测试判断组合是否可靠。

631
01:08:13,563 --> 01:08:19,392
规划器可以先请世界模型预测多个候选结果，再选择动作，这是一种安排。另一种策略可以直接从观察输出动作，不生成未来图像。看一次成功演示不能证明采用哪种架构；需要系统说明确认组件，并通过任务测试判断组合是否可靠。

632
01:08:19,692 --> 01:08:27,112
把这些变成一个设计选择。假设观众移动了车站场景中的红色行李箱，体验应该怎样响应？

633
01:08:27,112 --> 01:08:32,192
解释一些内容、生成改变后的场景，还是移动真实道具？和同伴选择一种。

634
01:08:32,192 --> 01:08:38,472
说清楚观众做什么，以及应该看到什么响应。也要考虑系统理解错了怎么办。

635
01:08:38,472 --> 01:08:46,492
装置作品需要明确四项：观众输入、可见响应、响应时间和出错后的恢复行为。点击改变灯光、移动镜头生成新视图、移动真实道具，是不同任务。输入和输出决定所需技术，互动设计由此变成具体的系统要求。

636
01:08:46,492 --> 01:08:54,292
装置作品需要明确四项：观众输入、可见响应、响应时间和出错后的恢复行为。点击改变灯光、移动镜头生成新视图、移动真实道具，是不同任务。输入和输出决定所需技术，互动设计由此变成具体的系统要求。

637
01:08:54,292 --> 01:08:58,129
装置作品需要明确四项：观众输入、可见响应、响应时间和出错后的恢复行为。点击改变灯光、移动镜头生成新视图、移动真实道具，是不同任务。输入和输出决定所需技术，互动设计由此变成具体的系统要求。

638
01:08:58,429 --> 01:09:02,389
如果旅人太大，可以试试更远的取景指令或布局参考图。

639
01:09:02,389 --> 01:09:06,249
如果颜色过强，而模型支持引导，就值得测试一下引导设置。

640
01:09:06,249 --> 01:09:12,029
如果只有一个小区域出错，局部编辑可能就够了。这些是测试起点，并不保证一定修好。

641
01:09:12,029 --> 01:09:13,749
先描述看得见的问题。

642
01:09:13,749 --> 01:09:19,489
这样更容易选择可能解决问题的改动，而不是把所有设置都改一遍，寄希望于下一张图片。

643
01:09:19,489 --> 01:09:26,409
错误的位置帮助选择控制方式。整体视角不对可能需要布局参考；场景正确但一只手出错，可能需要局部编辑；大量图片要保持风格，可能值得训练适配器。这些方法范围和成本不同，从最相关的小改动开始，更容易保留已成功的部分。

644
01:09:26,409 --> 01:09:34,569
错误的位置帮助选择控制方式。整体视角不对可能需要布局参考；场景正确但一只手出错，可能需要局部编辑；大量图片要保持风格，可能值得训练适配器。这些方法范围和成本不同，从最相关的小改动开始，更容易保留已成功的部分。

645
01:09:34,569 --> 01:09:39,447
错误的位置帮助选择控制方式。整体视角不对可能需要布局参考；场景正确但一只手出错，可能需要局部编辑；大量图片要保持风格，可能值得训练适配器。这些方法范围和成本不同，从最相关的小改动开始，更容易保留已成功的部分。

646
01:09:39,747 --> 01:09:45,207
这是一个简单的比较：我们想知道引导是否改变主体的清晰程度和结果的多样性。

647
01:09:45,207 --> 01:09:51,607
固定模型、提示词、尺寸、采样器和步数。尝试不同引导值，每个值都使用相同的一组种子。

648
01:09:51,607 --> 01:09:55,907
然后用事先选好的问题评价结果。这最后一步很重要。

649
01:09:55,907 --> 01:10:01,167
如果看完图片才决定什么算成功，就很容易偏向自己碰巧喜欢的结果。

650
01:10:01,167 --> 01:10:03,737
清楚的测试可以帮助我们向别人解释选择。

651
01:10:03,737 --> 01:10:09,067
运行前先画一个小表格，行放种子，列放引导值，每格使用相同提示和模型。成功和失败都要记录，因为删掉失败会改变网格代表的结果。某格生成失败时，应标记缺失并重跑相同条件，不要悄悄换成其他种子。

652
01:10:09,067 --> 01:10:15,787
运行前先画一个小表格，行放种子，列放引导值，每格使用相同提示和模型。成功和失败都要记录，因为删掉失败会改变网格代表的结果。某格生成失败时，应标记缺失并重跑相同条件，不要悄悄换成其他种子。

653
01:10:15,787 --> 01:10:22,045
运行前先画一个小表格，行放种子，列放引导值，每格使用相同提示和模型。成功和失败都要记录，因为删掉失败会改变网格代表的结果。某格生成失败时，应标记缺失并重跑相同条件，不要悄悄换成其他种子。

654
01:10:22,345 --> 01:10:31,785
图像评价可以分成内容、形式、变化和用途。内容包括物体数量、属性和关系，通常可以直接对照要求。手拿着杯子，与手只是出现在杯子附近，是不同关系。

655
01:10:31,785 --> 01:10:35,405
图像评价可以分成内容、形式、变化和用途。内容包括物体数量、属性和关系，通常可以直接对照要求。手拿着杯子，与手只是出现在杯子附近，是不同关系。

656
01:10:35,405 --> 01:10:43,885
形式关注图像怎样组织，包括轮廓、明暗结构、边缘对比和主要焦点。这些属性把技术输出连接到艺术决定。即使偏好不同，也能作出具体描述。

657
01:10:43,885 --> 01:10:47,805
形式关注图像怎样组织，包括轮廓、明暗结构、边缘对比和主要焦点。这些属性把技术输出连接到艺术决定。即使偏好不同，也能作出具体描述。

658
01:10:47,805 --> 01:10:54,425
变化关注整组而不是单张图。一组可能有一张漂亮结果，其他却几乎相同。用途决定哪些属性最重要。清晰教学海报和含混梦境可以合理地选择不同结果，比较仍然有意义。

659
01:10:54,425 --> 01:11:03,025
变化关注整组而不是单张图。一组可能有一张漂亮结果，其他却几乎相同。用途决定哪些属性最重要。清晰教学海报和含混梦境可以合理地选择不同结果，比较仍然有意义。

660
01:11:03,025 --> 01:11:04,045
变化关注整组而不是单张图。一组可能有一张漂亮结果，其他却几乎相同。用途决定哪些属性最重要。清晰教学海报和含混梦境可以合理地选择不同结果，比较仍然有意义。

661
01:11:04,345 --> 01:11:09,465
我们用六分钟看这些网格。它们来自一项用狗的图像研究引导的论文。

662
01:11:09,465 --> 01:11:17,785
这里使用的是类别标签，而不是文字提示。对应位置使用了相同种子，所以请跨组比较同一位置。

663
01:11:17,785 --> 01:11:28,065
先自己观察，再选两组对应图片，写下变化。注意可辨认的特征、不想要的细节，以及每组内部的多样性。

664
01:11:28,065 --> 01:11:35,565
最后，为某种用途选一组。如果用途从清晰的介绍变成奇怪的梦境，你的选择会改变吗？

665
01:11:35,565 --> 01:11:42,405
任务是作出有依据的比较，而不是猜哪个最大数值最好。选对应位置，描述形状和颜色变化，再检查各组内部差异。图片可能更容易辨认，却失去独特而有用的选择。这种取舍很重要：有利于最终成图的设置，不一定最适合探索方案。

666
01:11:42,405 --> 01:11:52,225
任务是作出有依据的比较，而不是猜哪个最大数值最好。选对应位置，描述形状和颜色变化，再检查各组内部差异。图片可能更容易辨认，却失去独特而有用的选择。这种取舍很重要：有利于最终成图的设置，不一定最适合探索方案。

667
01:11:52,225 --> 01:11:59,693
任务是作出有依据的比较，而不是猜哪个最大数值最好。选对应位置，描述形状和颜色变化，再检查各组内部差异。图片可能更容易辨认，却失去独特而有用的选择。这种取舍很重要：有利于最终成图的设置，不一定最适合探索方案。

668
01:11:59,993 --> 01:12:07,953
受控网格有两种读法。跨引导条件，跟踪同一种子并描述变化；在同一引导条件内，比较不同种子及结果范围。前者关注设置，后者关注变化。

669
01:12:07,953 --> 01:12:15,193
受控网格有两种读法。跨引导条件，跟踪同一种子并描述变化；在同一引导条件内，比较不同种子及结果范围。前者关注设置，后者关注变化。

670
01:12:15,193 --> 01:12:23,073
脸部可观察轮廓、眼睛位置、纹理和夸张边缘；完整场景还应看机位距离、人物大小和重复布局。记录实际可见的内容，不要假设更强设置改善了所有属性。

671
01:12:23,073 --> 01:12:28,773
脸部可观察轮廓、眼睛位置、纹理和夸张边缘；完整场景还应看机位距离、人物大小和重复布局。记录实际可见的内容，不要假设更强设置改善了所有属性。

672
01:12:28,773 --> 01:12:36,453
清楚标签能让网格更有说服力。应附模型、提示和采样设置；若经过挑选或裁切，也要说明。否则，展示可能看起来比实际实验更受控，或更有多样性。

673
01:12:36,453 --> 01:12:42,483
清楚标签能让网格更有说服力。应附模型、提示和采样设置；若经过挑选或裁切，也要说明。否则，展示可能看起来比实际实验更受控，或更有多样性。

674
01:12:42,783 --> 01:12:47,043
最后一次讨论，请为车站场景选择一个取景方式和一种绘画风格。

675
01:12:47,043 --> 01:12:52,443
回想远景、近景，以及剪纸、绘画和水墨的例子。用三十秒作出选择。

676
01:12:52,443 --> 01:12:59,003
再用图片中两处看得见的细节，向同伴解释选择。最后说出下一步想尝试的一项改动。

677
01:12:59,003 --> 01:13:02,503
改动要足够具体，让你能看出它是否起效。

678
01:13:02,503 --> 01:13:08,463
请用具体的形式关系解释选择。低机位能放大近处人物的视觉尺度，斜线能连接区域或制造紧张，大块留白能为文字保留空间。“电影感”这样的标签，只有转成机位、灯光、颜色或剪辑决定，才更有用。

679
01:13:08,463 --> 01:13:16,703
请用具体的形式关系解释选择。低机位能放大近处人物的视觉尺度，斜线能连接区域或制造紧张，大块留白能为文字保留空间。“电影感”这样的标签，只有转成机位、灯光、颜色或剪辑决定，才更有用。

680
01:13:16,703 --> 01:13:23,289
请用具体的形式关系解释选择。低机位能放大近处人物的视觉尺度，斜线能连接区域或制造紧张，大块留白能为文字保留空间。“电影感”这样的标签，只有转成机位、灯光、颜色或剪辑决定，才更有用。

681
01:13:23,589 --> 01:13:29,529
结束前，简短回答这些问题：为什么同一个提示词可以生成不同图片？

682
01:13:29,529 --> 01:13:34,789
为什么更强的引导可能让图片更差？想重复结果时应该保存什么？请用自己的话回答。

683
01:13:34,789 --> 01:13:35,689
为什么更强的引导可能让图片更差？想重复结果时应该保存什么？请用自己的话回答。

684
01:13:35,689 --> 01:13:40,669
不需要写公式，也可以用我们的旅人和车站来解释。

685
01:13:40,669 --> 01:13:47,549
完整答案应包括机制和结果：种子对应随机状态变化及输出差异；引导对应预测组合及夸张风险；复现对应需要记录的输入和模型设置。这个简短检查，是为了确认术语确实连接到了系统的实际行为。

686
01:13:47,549 --> 01:13:55,709
完整答案应包括机制和结果：种子对应随机状态变化及输出差异；引导对应预测组合及夸张风险；复现对应需要记录的输入和模型设置。这个简短检查，是为了确认术语确实连接到了系统的实际行为。

687
01:13:55,709 --> 01:13:59,743
完整答案应包括机制和结果：种子对应随机状态变化及输出差异；引导对应预测组合及夸张风险；复现对应需要记录的输入和模型设置。这个简短检查，是为了确认术语确实连接到了系统的实际行为。

688
01:14:00,043 --> 01:14:06,103
主要答案是：即使提示词相同，不同的随机起始状态也可能产生不同图片。

689
01:14:06,103 --> 01:14:12,983
根据采样器的不同，随机性还可能在后续步骤加入。更强的引导沿预测差异的方向推得更远。

690
01:14:12,983 --> 01:14:19,063
这可能使主体更明确，也可能产生不合适的颜色或细节，并减少多样性。

691
01:14:19,063 --> 01:14:25,123
要重复结果，保存完整设置：模型、提示词、参考图、种子和生成设置。使用了适配器也要记录。

692
01:14:25,123 --> 01:14:33,763
是否完全一致还可能取决于软硬件。答案措辞可以不同，关键是解释能否把设置与结果联系起来。

693
01:14:33,763 --> 01:14:40,763
这些答案也说明：一张漂亮图片不足以让我们理解模型。一个样本展示结果，匹配比较展示受控改动的影响，保存设置让比较可以重复。三者结合，才能具体讨论生成过程，而不是依靠对工具“个性”或“创造力”的印象。

694
01:14:40,763 --> 01:14:50,923
这些答案也说明：一张漂亮图片不足以让我们理解模型。一个样本展示结果，匹配比较展示受控改动的影响，保存设置让比较可以重复。三者结合，才能具体讨论生成过程，而不是依靠对工具“个性”或“创造力”的印象。

695
01:14:50,923 --> 01:14:57,077
这些答案也说明：一张漂亮图片不足以让我们理解模型。一个样本展示结果，匹配比较展示受控改动的影响，保存设置让比较可以重复。三者结合，才能具体讨论生成过程，而不是依靠对工具“个性”或“创造力”的印象。

696
01:14:57,377 --> 01:15:03,997
现在，各种控制有了不同含义：提示和参考提供条件，种子确定随机起点，引导组合预测，采样器计算更新，适配与微调改变学到的行为，蒙版与合成限制编辑出现的区域。

697
01:15:03,997 --> 01:15:11,957
现在，各种控制有了不同含义：提示和参考提供条件，种子确定随机起点，引导组合预测，采样器计算更新，适配与微调改变学到的行为，蒙版与合成限制编辑出现的区域。

698
01:15:11,957 --> 01:15:20,397
艺术决定同样具体。机位改变透视，遮挡与汇聚线提供深度线索，色相和明度影响分离，边缘处理控制形状清晰度，角色与运动连续性把单张图连接成序列。

699
01:15:20,397 --> 01:15:25,917
艺术决定同样具体。机位改变透视，遮挡与汇聚线提供深度线索，色相和明度影响分离，边缘处理控制形状清晰度，角色与运动连续性把单张图连接成序列。

700
01:15:25,917 --> 01:15:32,537
有用的实验改变相关变量，保留其他条件并记录结果。这个方法适用于图像编辑、视频比较和互动系统。后面的来源页列出了本课使用的大学课程、论文和官方公告。

701
01:15:32,537 --> 01:15:40,592
有用的实验改变相关变量，保留其他条件并记录结果。这个方法适用于图像编辑、视频比较和互动系统。后面的来源页列出了本课使用的大学课程、论文和官方公告。

702
01:15:40,892 --> 01:15:53,532
技术结构参考了 CMU 生成式人工智能课程中的扩散、文生图、参数高效适配和世界模型。MIT 的流与扩散课程清楚连接了训练目标和数值采样。本课的小数值例子是为课堂编写的。

703
01:15:53,532 --> 01:16:01,052
技术结构参考了 CMU 生成式人工智能课程中的扩散、文生图、参数高效适配和世界模型。MIT 的流与扩散课程清楚连接了训练目标和数值采样。本课的小数值例子是为课堂编写的。

704
01:16:01,052 --> 01:16:11,152
Stanford 的生成模型课程补充技术背景，图形学与摄影材料支持颜色、相机和构图讨论。把这些成熟原则与新工具放在一起，是因为产品名称改变后，它们仍能解释有用的设计决定。

705
01:16:11,152 --> 01:16:19,990
Stanford 的生成模型课程补充技术背景，图形学与摄影材料支持颜色、相机和构图讨论。把这些成熟原则与新工具放在一起，是因为产品名称改变后，它们仍能解释有用的设计决定。

706
01:16:20,290 --> 01:16:32,750
原始论文解释扩散、潜变量、引导、LoRA、图生图编辑和空间条件。IP-Adapter 与 DreamBooth 展示了不同参考信息用法，其发表日期与 2026 年产品更新分开标注。

707
01:16:32,750 --> 01:16:39,550
原始论文解释扩散、潜变量、引导、LoRA、图生图编辑和空间条件。IP-Adapter 与 DreamBooth 展示了不同参考信息用法，其发表日期与 2026 年产品更新分开标注。

708
01:16:39,550 --> 01:16:48,190
近期部分采用官方模型文档和开发者公告，说明发布了什么及开发者如何描述。这不是某个模型适合所有任务的独立证明。实际比较仍需明确任务、匹配输入并检查输出。

709
01:16:48,190 --> 01:16:55,590
近期部分采用官方模型文档和开发者公告，说明发布了什么及开发者如何描述。这不是某个模型适合所有任务的独立证明。实际比较仍需明确任务、匹配输入并检查输出。

710
01:16:55,590 --> 01:16:57,873
近期部分采用官方模型文档和开发者公告，说明发布了什么及开发者如何描述。这不是某个模型适合所有任务的独立证明。实际比较仍需明确任务、匹配输入并检查输出。
