KEN’S CAT LOG

MiniMax H3 加速 LoRA 到底能快多少?用 FL2 和 REF4 对比了 20 条视频

使用 FL2 的 arry v4_step600 和 REF4 的 PDD Ref2VA,对比了 20 条启用与未启用加速 LoRA 的视频,实测生成时间和画面差异。

我在 MiniMax H3 的 FL2 和 REF4 中加入了加速 LoRA,因此想测试一下:在相同条件下,生成时间究竟会变化多少。

使用的配置如下。

  • FL2: arry v4_step600。常规版为 20 step,加速 LoRA 版为 8 step
  • REF4: PDD Ref2VA。常规版为 20 step,加速 LoRA 版为 8 step
  • 所有视频均为 8 秒、768×1344、24fps
  • 每组使用相同的提示词、相同的 seed、相同的参考图
  • 左侧未使用加速 LoRA,右侧使用加速 LoRA

测试内容分为五类:高速动作、激烈场景切换、几乎静止的画面、头发和布料细节、镜头移动与前景遮挡。FL2 制作了 10 条,REF4 制作了 10 条,共计 20 条。

FL2 — arry v4_step600

1. 高速动作

雨中的霓虹街头跑酷视频。设置为包含高速移动、水花,以及大量衣物和头发动态的条件。

未使用加速 LoRA・20 step 使用加速 LoRA・8 step
FL2 高速动作 未使用 LoRA再生 FL2 高速动作 使用 LoRA再生

未使用加速 LoRA 耗时 504 秒(8 分 24 秒),使用后耗时 272 秒(4 分 32 秒)。未使用的一侧还包含首次将 FL2 加载进 VRAM 的时间。使用的一侧在首次切换时曾断开一次容器连接,因此记录的是成功重试所耗的时间。

2. 激烈场景切换

固定一只镀铬蜂鸟,场景依次切换到美术馆、丛林、熔炉、冰洞、纸艺城市和外太空。

未使用加速 LoRA・20 step 使用加速 LoRA・8 step
FL2 激烈场景切换 未使用 LoRA再生 FL2 激烈场景切换 使用 LoRA再生

未使用加速 LoRA 耗时 454 秒(7 分 34 秒),使用后耗时 236 秒(3 分 56 秒)。这一组约快了 1.92 倍。

3. 变化不大的视频

固定机位拍摄钟表匠。只让眨眼、镊子移动几毫米、秒针和灰尘产生变化。

未使用加速 LoRA・20 step 使用加速 LoRA・8 step
FL2 低变化 未使用 LoRA再生 FL2 低变化 使用 LoRA再生

未使用加速 LoRA 耗时 447 秒(7 分 27 秒),使用后耗时 233 秒(3 分 53 秒)。即使动作很少,生成时间也没有太大变化,仍相差约 1.92 倍。

4. 头发与布料细节

身穿缝有银线的半透明雪纺连衣裙高速旋转。用来观察加速后布料和头发会在多大程度上崩坏。

未使用加速 LoRA・20 step 使用加速 LoRA・8 step
FL2 细节 未使用 LoRA再生 FL2 细节 使用 LoRA再生

未使用加速 LoRA 耗时 448 秒(7 分 28 秒),使用后耗时 234 秒(3 分 54 秒)。同样约快了 1.91 倍。

5. 镜头移动与前景遮挡

在森林中骑行的山地车。用蕨类植物完全遮住画面,并在遮挡期间让镜头绕行 180 度。

未使用加速 LoRA・20 step 使用加速 LoRA・8 step
FL2 镜头遮挡 未使用 LoRA再生 FL2 镜头遮挡 使用 LoRA再生

未使用加速 LoRA 耗时 448 秒(7 分 28 秒),使用后耗时 234 秒(3 分 54 秒)。即便镜头移动幅度很大,仍约快了 1.91 倍。

计算 FL2 中 VRAM 已加载的 4 个案例平均值,未使用 LoRA 为 449.25 秒,使用后为 234.25 秒。在本次环境中,速度约为 1.92 倍

REF4 — PDD Ref2VA

REF4 使用了一张由 ChatGPT 图像生成制作的 6 格分镜图,作为参考图输入。

1. 高速动作

将与 FL2 相同的跑酷流程,从 6 格姿势图生成视频。

未使用加速 LoRA・20 step 使用加速 LoRA・8 step
REF4 高速动作 未使用 LoRA再生 REF4 高速动作 使用 LoRA再生

未使用加速 LoRA 耗时 481 秒(8 分 1 秒),使用后耗时 299 秒(4 分 59 秒)。未使用的一侧包含将 REF4 加载进 VRAM 的时间。使用的一侧首次尝试在解码时断开连接,因此记录的是成功重试所耗的时间。

2. 激烈场景切换

通过 6 格分镜图展开相同的蜂鸟与 6 种世界。

未使用加速 LoRA・20 step 使用加速 LoRA・8 step
REF4 激烈场景切换 未使用 LoRA再生 REF4 激烈场景切换 使用 LoRA再生

未使用加速 LoRA 耗时 424 秒(7 分 4 秒),使用后耗时 251 秒(4 分 11 秒)。约快了 1.69 倍。

3. 变化不大的视频

将钟表匠的细微变化制作成 6 格图。在使用加速 LoRA 的一侧,分镜图的格子布局直接残留在了画面中。

未使用加速 LoRA・20 step 使用加速 LoRA・8 step
REF4 低变化 未使用 LoRA再生 REF4 低变化 使用 LoRA再生

未使用加速 LoRA 耗时 418 秒(6 分 58 秒),使用后耗时 247 秒(4 分 7 秒)。时间上约快了 1.69 倍,但这一次画面差异相当明显。

4. 头发与布料细节

以 6 格图参考同一位舞者的旋转动作。这一组无论是否使用 LoRA,都能较为干净地扩展为全画面视频。

未使用加速 LoRA・20 step 使用加速 LoRA・8 step
REF4 细节 未使用 LoRA再生 REF4 细节 使用 LoRA再生

未使用加速 LoRA 耗时 420 秒(7 分 0 秒),使用后耗时 249 秒(4 分 9 秒)。约快了 1.69 倍。

5. 镜头移动与前景遮挡

用 6 格图指定山地车靠近、前景擦拭遮挡以及绕到后方的镜头运动。这一次两边都较明显地保留了分镜格的构图。

未使用加速 LoRA・20 step 使用加速 LoRA・8 step
REF4 镜头遮挡 未使用 LoRA再生 REF4 镜头遮挡 使用 LoRA再生

未使用加速 LoRA 耗时 419 秒(6 分 59 秒),使用后耗时 248 秒(4 分 8 秒)。约快了 1.69 倍。

计算 REF4 中 VRAM 已加载的 4 个案例平均值,未使用 LoRA 为 420.25 秒,使用后为 248.75 秒。在本次环境中,速度约为 1.69 倍

实测后的结论

如果只看生成时间,加速 LoRA 的效果相当显著。FL2 的时间几乎减半,REF4 也缩短了约四成。在打磨提示词和构图阶段,用于快速试作应该很方便。

不过,给 REF4 输入一张带格子的分镜图时,它有时会把这个网格本身也当作构图来学习。尤其是在使用加速 LoRA 时,有些案例中格子布局残留了很久。如果希望 REF4 生成普通的全画面视频,我认为将每一格作为单独图像输入,会比使用一张联系表更稳妥。

另外,FL2 和 REF4 都只在首次从常规版切换到加速 LoRA 版时,发生过一次容器连接断开。在相同条件下重新执行后便成功了,此后也一直稳定。比较适合的操作方式,或许是在首次切换后先跑一条短测试视频。

本次数据是在这台机器、这一分辨率、8 秒视频条件下的实测值。与其将其视为绝对基准,不如将它看作同一环境下启用与未启用 LoRA 的对比结果。