上傳整首歌 → 自動分離人聲並切出演唱段 → 用演唱者照片生成各種場景人像 → 逐段對嘴渲染 → 合併成一支掛回原曲的 MV。
併隙門檻是關鍵:人聲樂句之間的呼吸空隙若大於這個值就會被切開。 歌手斷句細的歌用預設 0.5 秒會切出一堆 1~2 秒的碎片,每個碎片都要花一次完整的 InfiniteTalk,調大到 1.5 秒通常就乾淨了。 段長決定剪接節奏,而且會影響總時間:成本主要是「每段的固定開銷」, 不是每秒——實測 3.9 秒的段花 13.5 分、5.7 秒的段花 13.0 分,更短的反而更久。 長度只在跨過 InfiniteTalk 的 81 幀(3.24 秒)窗邊界時階梯式跳一級 (4~5.7 秒約 13 分、6.2~7.8 秒約 19 分)。所以切得越碎、總時間越長, 23 段比 15 段多付 8 次固定開銷,實測多花約 2 小時。
每個 Lip Sync 片段都是一次完整的 InfiniteTalk 取樣,3 分鐘的歌通常要跑數小時。 中斷後再按一次「繼續渲染」會跳過已完成的片段。