MOTION STUDIO V18-Colab:舊照片修復、AI 製圖與影片生成工作台
從一張老照片開始,到修復、製圖、生成影片、剪接、配音、放大到 4K 為止,全部在同一套 Windows 軟體裡完成。V18-Colab 版新增雲端 Colab 生圖:算力點沒開機,也能用 FLUX、Z-Image Turbo、SDXL 四顆模型製圖。
重點摘要
- 這是什麼
- MOTION STUDIO 是太盛昌資訊服務有限公司(KentWare)開發的 Windows 桌面軟體,把舊照片修復、AI 製圖、AI 影片生成、剪接、配音、放大整合在同一個工作台,共 17 個分頁。
- 在哪裡運算
- 預設在自己的電腦與區域網路內的其他電腦(算力點)運算,照片不必上傳;也可以選用 Google 的雲端模型,或把製圖送到自己的 Google Colab。
- V18-Colab 新增
- 四個製圖分頁可以改用 Google Colab 的 T4 顯示卡算圖,內建 FLUX.1 schnell、Z-Image Turbo、SDXL、FLUX.1 dev 四顆模型,並在軟體裡即時顯示雲端進度。
- 速度(實測)
- Colab T4 高 RAM、1344×768:SDXL 約 1.5 分鐘一張、FLUX.1 schnell 約 4 分鐘、Z-Image Turbo 約 6 分鐘、FLUX.1 dev 約 18 分鐘(2026 年 10 月實測)。本機 16GB 顯示卡生成 5 秒影片:480p 草稿約 3~4 分鐘、720p 定稿約 13~15 分鐘。
- 適合誰
- 照片修復與紀念影片工作室、婚禮與活動影像業者、需要在自己設備上處理客戶照片的中小企業。
最後更新:|版本 V18-Colab|文中時間皆為特定設備上的實測參考值,不是保證值。
章節照製作順序排列;點章節名稱會直接跳過去並展開。
安裝之前:設備等級、效能與授權說明
▼
安裝之前:設備等級、效能與授權說明
安裝與正式拿來做生意之前,請先讀完這一章。
設備等級
| 等級 | 硬體 | 做得到的事 |
|---|---|---|
| 入門體驗 | 一般四核心以上處理器、記憶體 16GB、顯示卡記憶體 4GB | 快速草稿、基礎修復、影片剪接、系統內建語音配音 |
| 推薦生產力 | 記憶體 32GB、NVIDIA 顯示卡記憶體 8GB 以上 | 寫實分鏡圖、鎖臉、動作與場景參考、人物模型訓練 |
| 本機生成影片 | 記憶體 64GB、NVIDIA 顯示卡記憶體 16GB | 以文生影、以圖生影(480p 草稿與 720p 定稿)、聲音克隆 |
| 多台分工 | 兩台以上,各自負責不同工作 | 大量批次、4K 放大、每秒 60 格補格,與製圖同時進行 |
| 雲端 Colab(選用) | 自己的 Google 帳號與 Colab 運算單元、雲端硬碟約 48GB | 不靠自己的顯示卡,用 FLUX、Z-Image Turbo、SDXL 製圖 |
安裝方式
這套系統要裝的元件很多,而且跟顯示卡驅動程式的版本綁得很緊。我們建議由太盛昌的工程師到府或遠端一對一安裝, 安裝前先執行環境探測程式,確認每一台電腦的顯示卡、記憶體與網路。
效能說明
授權與計費提醒
| 項目 | 請注意 |
|---|---|
| 各個 AI 模型 | 製圖、影片、語音用到的模型各有自己的授權條款,有些僅限非商業用途。要拿成品做生意之前,我們會依您實際安裝的模型逐項跟您確認。 |
| 路線C 台灣國語 | 使用的是微軟線上語音的非官方免費介面,文字會送到微軟的伺服器,而且對方隨時可能調整或停止服務。 |
| Google 與其他雲端服務 | 用您自己申請的金鑰,依用量計費,費用由服務商直接向您收取。 |
| 肖像與聲音 | 請只使用您有權使用的照片與錄音。克隆他人聲音、使用他人肖像前,請先取得本人或家屬同意。 |
本版重點功能總覽
▼
本版重點功能總覽
本工作台的主要能力一覽。如果您只想快速知道這套軟體能做什麼,看這一章就夠。
| 功能 | 在哪裡 | 解決了什麼 |
|---|---|---|
| 雲端 Colab 生圖(V18-Colab 新增) | 以文生圖、以圖生圖、一步一步做、批次產線 | 算力點沒開或想用更大的模型時,送到自己的 Google Colab 算圖;FLUX.1 schnell、Z-Image Turbo、SDXL、FLUX.1 dev 四顆可選 |
| 提示詞自動轉換(V18-Colab) | 以文生圖、以圖生圖 | 介面標示每顆模型懂不懂中文;只懂英文的模型送出前自動翻譯,並把實際送出的英文顯示給您看 |
| 雲端進度即時顯示(V18-Colab) | 狀態列 | 搬模型、準備、算到第幾步、還要多久,都顯示在軟體裡,不用切到 Colab 看 |
| 成品檔名帶種子(V18-Colab) | 圖片與本機影片 | 檔名尾巴的 _s 數字就是種子,挑到滿意的那張可以原樣重現或出更高畫質 |
| 以文生圖・以圖生圖(V18 新分頁) | 獨立分頁 | 不必走完整流程,寫一段描述就能畫;畫好可以直接帶去下一步 |
| 以文生影・以圖生影(V18 新分頁) | 獨立分頁 | 文字或一張圖直接變成影片 |
| 本機生成影片(V18) | 以文生影/以圖生影 | 用自己的顯示卡做,不上傳、不計費;480p 草稿試好再出 720p 定稿 |
| 鎖臉(V18) | 以文生圖/以圖生圖 | 臉照指定照片鎖住,衣著、身材、場景自由重畫 |
| Google 圖片與影片模型(選用) | 四個生成分頁、付費 API | 填自己的金鑰就能用,需要同步聲音的鏡頭交給雲端 |
| 每頁右上角的 ? 說明鈕 | 全部 17 個分頁 | 點一下開獨立說明視窗,不用再問「這頁怎麼用」 |
| 配音工作室(本機 Voicebox) | 獨立分頁 | 聲音克隆、內建音色、語音轉文字,全部在本機 |
| 路線C 台灣國語 | 配音工作室 | 本機 AI 模型只有大陸腔,這條給道地台灣腔 |
| 路線D Windows 內建語音 | 配音工作室 | 作業系統內建的台灣中文,離線、一句約 0.1 秒 |
| 新手模式 | 配音工作室右上角 | 收起進階選項,畫面只剩必要按鈕 |
| 剪輯台(新分頁) | 獨立分頁 | 看著畫面拉時間軸剪片:剪下各段,或拼貼成一支 |
| 分段剪輯 | 影片剪接① | 用填秒數的方式切段(剪輯台的簡易版) |
| 內建字幕偵測與移除 | 影片剪接⑤ | 判斷影片自帶字幕軌並另存無字幕版,畫質不變 |
| 長文自動分段合成 | 配音工作室 | 長旁白切成短句逐句做,避免顯示卡爆掉做不完 |
| 即時碼表與看門狗 | 配音工作室 | 看得到已經跑幾秒;畫面假忙碌會自動解除 |
| 片尾字幕 10 種效果 | 影片收尾⑤ | 捲動、滑入、彈出、淡入、逐行、跑馬燈,可先本機預覽 |
| 只配音、畫面不顯示字幕/另存 .srt | 影片剪接⑤ | 現場播放只要旁白;要上傳平台時另掛字幕檔 |
| 每個接縫各自的轉場(57 種) | 影片剪接② | 每兩支影片相接處各選效果與秒數,可單獨預覽 |
| N 卡專屬防呆 | 全部 | N 卡才能做的事,製圖主機沒開會停下來提醒,絕不改派 AMD |
| 分工建議 | 分工 | 每一項附建議放哪台與原因,並自動檢查互相卡住的分工 |
| 指定哪台就跑哪台 | 分工/⑥/批次 | 每項功能各自指定機器,台數不限,不再只認兩台 |
| 影片生成(分段接續) | 獨立分頁 | 管理六段 5 秒的接續:提示詞、首圖、挑尾幀、送去拼接 |
| 一鍵釋放顯示卡 | 右上角 | 配音與繪圖共用一張卡時,依現在要做的事把用不到的模型請出去 |
| 完整記錄檔 | logs 資料夾 | 每一步與每個錯誤都有時間戳記,出事可追 |
開始之前:啟動與介面總覽
▼
開始之前:啟動與介面總覽
- 在程式安裝資料夾裡按兩下
run_windows.bat。 - 會同時開一個黑色終端機視窗,那裡會即時顯示所有動作與錯誤,請不要關掉它。
- 出問題時,記錄檔在
安裝資料夾 logs app_年月日.log,每一行都有時間。
- 左邊:17 個分頁的導覽列,照製作順序由上往下排。
- 上方:算力點膠囊(本機、製圖主機、影像主機、臉部主機(Mac)),綠燈在線、紅燈離線,點一下展開詳細狀態。
- 中間左欄:一張張編號卡片,由上往下做完就對了。滑鼠滾輪可以捲動。
- 中間右欄:預覽、成品、時間軸。
- 最下方:主要按鈕與狀態列,狀態列會講目前在做什麼。
- 點一下會開一個獨立的說明視窗,講這一頁怎麼操作。
- 說明視窗可以一直開著,一邊看一邊操作主畫面。
- 說明內容是網頁檔,放在
安裝資料夾裡的「說明」,改了按「↻ 重新載入」就生效,不用重開程式。
一步一步做(照片 → 分鏡圖)
▼
一步一步做(照片 → 分鏡圖)
整個軟體的起點。左邊六張卡片由上往下做完,按最下面的「🖌️ 產生分鏡圖」。
- 支援 JPG/PNG/HEIC/JFIF/WEBP,會自動轉檔並把拍歪的方向轉正。
- 🩹 先修復照片:老照片建議先按,去刮痕、補破損、提高清晰度。
- 🎨 黑白上色:黑白變彩色,可在修復之後再按。
- 👤 臉部特寫修復/👓 去眼鏡:臉糊掉時用,做出來的臉會當成臉部參考,畫圖時人比較像。
- ↩ 換回原始照片:修壞了就按,原檔不會被覆蓋。
- 風格(單選)決定畫師:寫實、動畫、油畫等。
- 濾鏡(可複選)疊在風格上的色調,可同時勾好幾個。
- 快速按鈕分成場景、動作、光線、長相等組,點一下自動接進描述框,再自己改字。
- 場景對照圖:構圖照這張走,可調渲染程度。
- 動作骨架:姿勢照這張擺。只有製圖主機能做。
- 「🔍 檢查並翻譯」把中文翻成英文,並標出雲端工具可能拒絕的字(只提醒、不阻擋)。
- 四個複製按鈕可把提示詞貼到別的網頁工具用。
- 顯示這次派給哪一台、為什麼;每 30 秒自動重新探測。
- ⚡ 遠端啟動製圖主機的算圖程式:製圖主機開著但算圖程式沒開時,按這個遠端幫它開。
- 畫完再用臉模型貼臉:勾了會把「人物模型」做好的臉貼上去。
四個基本生成模式(以文生圖・以圖生圖・以文生影・以圖生影)
▼
四個基本生成模式(以文生圖・以圖生圖・以文生影・以圖生影)
V18 把最基本的四種生成各自做成一個分頁,排在「一步一步做」下面。四頁的成品可以互相接力: 畫好的圖可以直接帶去改圖、帶去生成影片,或當成「影片生成」的首圖。
| 分頁 | 給它什麼 | 得到什麼 | 在哪裡算 |
|---|---|---|---|
| 以文生圖 | 一段中文描述 | 一張圖 | 算力點(不計費)、Google 圖片模型,或雲端 Colab |
| 以圖生圖 | 一張底圖+怎麼改 | 改好的圖 | 算力點(不計費)、Google 圖片模型,或雲端 Colab |
| 以文生影 | 一段中文描述 | 一支 5 秒左右的影片 | 本地模型(不計費)或 Google Veo |
| 以圖生影 | 一張圖當第一格+怎麼動 | 一支影片 | 本地模型(不計費)、Google Veo 或其他付費管道 |
以文生圖
- ① 選「算力點」(按鈕上會顯示分工指派的那台電腦名稱)、「Google」或「☁️ Colab」。
- ② 用中文寫要畫什麼,按「🔤 翻譯成英文」。
- ③ 算力點要選風格與尺寸;Google 選比例與大小;Colab 選模型(見下一章)。
- 按「🖌️ 產生圖片」,成品出現在右邊。算力點的快速草稿約 1.5 分鐘、寫實定稿約 5 分鐘。成品檔名會帶種子。
- ➡ 帶到一步一步做(當底圖):接著做修復、貼臉、換風格。
- ➡ 用這張做以圖生圖/以圖生影:直接接下一個模式。
- ➡ 當「影片生成」的首圖:作為分段接續第一段的第一格。
以圖生圖
| 像原圖的程度 | 意思 | 適合 |
|---|---|---|
| 微調 | 只改光線、色調、細節 | 修飾、換氛圍 |
| 一半 | 構圖保留,內容可以換 | 換背景、換服裝 |
| 大改 | 只留大致構圖 | 換風格、重畫 |
「↻ 再拿成品當底圖繼續改」可以一層一層改下去。
🔒 鎖臉(以文生圖、以圖生圖都有)
- 勾「鎖臉」,選一張正面、清楚的臉部照片;不是特寫的話程式會自動裁成特寫。
- 衣著、身材、姿勢、場景全部照描述自由畫,只有臉鎖住。
- 換衣服、換造型:以圖生圖選「大改」+勾鎖臉,描述寫「穿紅色洋裝站在花園」。不勾鎖臉的話,「大改」會連臉一起變。
- 也可以按「↩ 拿一步一步做的臉」,直接用那邊做好的臉部特寫。
以文生影・以圖生影
- 先用 480p 草稿試:同一段描述可以一次做 1~4 支(每支的隨機種子不同),挑動作與鏡位最好的那一支。
- 挑好之後把品質切成 720p 定稿,種子維持那一支的數字,再生成一次。
- 種子留空就是隨機;成品完成後種子會自動填回欄位。
- 做完可以送「影片收尾」放大到 1080p 或 4K。
| 品質 | 畫面大小 | 16GB 顯示卡實測(一支 5 秒) |
|---|---|---|
| 480p 草稿 | 832 × 480 | 約 3~4 分鐘 |
| 720p 定稿 | 1280 × 704 | 約 13~15 分鐘 |
- 秒數只有 4、6、8 三種;1080p 與 4K 一定要 8 秒。
- 第一次先用最快的檔次+720p+4 秒試,便宜又快。
- 勾「同時生成聲音」會配上環境音;要自己配旁白就不要勾,改用配音工作室。
- 一段影片只寫一個動作,鏡位寫清楚(鏡頭固定不動/緩慢推近)。
- 以圖生影不要重新描述長相(不要寫「美麗、長髮」這類字),模型會照字面重新捏一個人。只寫動作與鏡位。
- 只想讓臉動(眨眼、微笑、說話)而且長相完全不能變,改用「LivePortrait」分頁。
- ➡ 放進「影片生成」目前這一段:當成分段接續的其中一段。
- ➡ 送到剪輯台:直接去剪。
Google 金鑰(選用)
到 Google AI Studio 申請金鑰,貼進金鑰欄,按「💾 儲存金鑰」再按「✔ 測試金鑰」。 金鑰只存在您自己的電腦裡,四個分頁與「付費 API」共用同一把。影片模型需要在 Google 那邊開啟付費才能用。
雲端 Colab 生圖(FLUX・Z-Image・SDXL 四顆模型)
▼
雲端 Colab 生圖(FLUX・Z-Image・SDXL 四顆模型)
V18-Colab 版新增。把製圖工作送到您自己的 Google Colab 筆記本去算,算完自動傳回軟體。 適合兩種情況:區網的算力點沒開機,或想用算力點顯示卡放不下的較大模型(例如 FLUX)。 以文生圖、以圖生圖、一步一步做、批次產線四個分頁都可以選 Colab;影片仍然在本機生成。
四顆模型怎麼選
| 模型 | 看得懂的語言 | 步數 | 按下到出圖 | 重開後第一次另加 | 適合 |
|---|---|---|---|---|---|
| FLUX.1 schnell(預設) | 只懂英文 | 4 | 約 4 分 | 約 8 分 | 照描述畫出情緒與動作;可商用 |
| SDXL | 只懂英文 | 30 | 約 1.5 分 | 約 3 分 | 大量抽卡、求快;最穩 |
| Z-Image Turbo | 懂中文 | 9 | 約 6 分 | 約 7 分 | 最像真實照片;可直接寫中文 |
| FLUX.1 dev | 只懂英文 | 24 | 約 18 分 | 約 8 分 | 只給確定要的那一張;非商用授權 |
同一句描述,四顆模型各畫一張
描述是「兩隻貓咪憤怒互望」。只懂英文的三顆收到的是 two angry cats staring at each other,Z-Image Turbo 收到的是中文原文。
哪幾顆不能直接用中文
| 情況 | 軟體會做的事 |
|---|---|
| 選只懂英文的模型,英文欄空白 | 先自動翻譯,把英文填進英文欄,再送出 |
| 英文欄有翻譯,但後來又改了中文 | 重新翻譯、更新英文欄,再送出 |
| 英文欄是您自己手改過的 | 照您改的送,不會覆蓋 |
| 翻譯失敗,或沒有指定負責翻譯的算力點 | 不送出,並說明原因 |
| 選 Z-Image Turbo | 直接送中文原文,不經過翻譯 |
只懂英文的模型畫錯時,先看英文欄翻得對不對:翻錯是翻譯的問題,翻對了還畫錯才是模型的問題。
等待時看得到進度
| 階段 | 狀態列顯示 |
|---|---|
| 接單 | Colab 已接單(模型名稱) |
| 搬模型(重開後第一次) | 已搬幾 GB/總共幾 GB,預估還要多久 |
| 準備算圖 | 處理提示詞、把模型搬進顯示卡 |
| 算圖 | 第幾步/共幾步、每步幾秒、預估還要多久 |
| 排隊 | 前面還有任務在算,輪到會自動開始 |
超過 45 秒沒有收到 Colab 的回報,軟體會提醒您檢查 Colab 分頁。按取消會把任務撤回,Colab 不會再去算一張沒人要的圖。
一步一步做、批次產線也能選 Colab
| 項目 | Colab 能不能做 |
|---|---|
| 以文生圖、用原照片當底圖(描圖) | 可以 |
| 貼臉 | 可以:Colab 畫完後,自動交給區網有貼臉功能的算力點貼 |
| 鎖臉、人物模型、動作骨架、場景參考 | 不行;會直接擋下並說明原因,不會自動改派別台 |
| 影片 | 不做;影片一律在本機生成 |
使用前的準備
- Colab 的執行階段選 T4 GPU,並打開高 RAM。沒開高 RAM 只有 SDXL 能跑,其他模型會被擋下並提示。
- 依序執行筆記本的格子:安裝套件 → 掛載雲端硬碟 → 確認資料夾 → 守衛。守衛那一格要保持「執行中」。
- 守衛啟動時會先把預設模型準備好,之後第一張就不用再等搬模型。
- Colab 的瀏覽器分頁要開著、電腦不能進入睡眠。
- 模型權重存放在您自己的 Google 雲端硬碟(四顆合計約 48GB),只需下載一次。
- 在軟體的以文生圖頁選「☁️ Colab」,按「🔑 連接 Colab」用 Google 帳號登入一次。
批次產線(一次畫很多張)
▼
批次產線(一次畫很多張)
內容取自「一步一步做」目前的設定,所以要先去那邊調好,再回來按「↻ 重讀設定」。
- ① 按「↻ 重讀設定」抓取目前的照片、風格、描述。
- ② 張數:勾多個風格或濾鏡時,每個組合各畫指定張數(3 風格 × 5 張 = 15 張)。
- ② 勾「每張用不同的隨機種子」畫面比較有變化。
- ③ 派工:選哪一台,整個佇列就跑那一台。
- 「+ 加入佇列」可重複加不同設定的好幾批。
- 「🏭 開始產線」開始跑,右邊作品牆一張張長出來;「⏹ 停止」中斷。
- 佇列會存檔,關掉程式再開還在。
| 按鈕 | 作用 |
|---|---|
| 📂 開啟資料夾 | 打開這批圖存放的位置,會優先開今天日期那一個 |
| 🖼 開啟這張圖 | 用系統看圖程式打開目前最新這張 |
| 🗑 清空佇列 | 把還沒跑的工作全部取消 |
影片生成(分段接續)
▼
影片生成(分段接續)
AI 影片模型一次只能穩定做 4~8 秒,30 秒的影片是六段接起來的。這一頁管的就是這條鏈。
三個最重要的觀念
| 觀念 | 說明 |
|---|---|
| 長影片是「拼」出來的 | 不要想一次生出 30 秒;所有模型一次都只能穩定做 4~8 秒 |
| 一段 5 秒 = 一個動作 | 提示詞不要寫「0-1 秒抬頭、1-2 秒微笑」,模型不照秒數執行,會把動作混在一起平均。要控制第幾秒發生什麼,靠的是切段 |
| 尾幀要挑「動作停住」那一格 | 影片最後一格常是動作做到一半、眼睛閉著或畫面糊掉,拿來當下一段首圖會整段壞掉 |
- 填片名、每段幾秒(預設 5)、打算幾段(預設 6),按「↻ 套用」。專案自動存檔,關掉再開還在。
- 每一列是一段,記著首圖、動作、影片與狀態;點一列就切換到那一段。
- 共同描述:場景、光線、質感、鏡位,六段共用,只換「這一段的動作」那一句。這是讓六段看起來像同一支影片最有效的方法。
- 負面提示詞:變形的手、多餘的手指、扭曲的臉、文字、浮水印、畫面閃爍、快速運鏡。
- 按「📋 複製這段完整提示詞」,貼到「以圖生影」分頁或外部的影片生成工具。
- 「🖼 指定首圖」第一段用;「📹 放入影片」把生成好下載回來的檔案指給這一段(會自動複製進專案資料夾)。
- 時間軸上點一下跳到那一秒,再用「◀ 退一格」「▶ 進一格」「±0.5 秒」逐格微調。
- 挑動作剛完成、眼睛睜開、畫面清晰那一格,按「⭐ 定為下一段首圖」。
- 程式會把那一格存成圖片、填進下一段的首圖,並自動跳到下一段。
- 六段都有影片後按「➡ 送到剪輯台」,六段照順序帶過去。
- 拼接時每個接縫加 0.2~0.3 秒淡入淡出,色差與小跳動就看不出來。
- 接著到影片剪接上字幕、配旁白,再到影片收尾放大、補幀、加片尾字幕。
防止越接越走樣
| 狀況 | 對策 |
|---|---|
| 人越接越不像 | 每段生成後到「一步一步做」貼臉,把臉修回同一個人 |
| 接縫明顯跳一下 | 尾幀改挑動作停住那一格;接縫加 0.2 秒淡出 |
| 六段不像同一支片 | 六段貼同一段共同描述 |
| 超過六段品質掉很多 | 分成兩三個「場景」各自生成,用明確轉場隔開,不要硬接成一長條 |
剪輯台(看著畫面剪片)
▼
剪輯台(看著畫面剪片)
這一頁做的是真正的「剪」:在時間軸上拉出要留的段落。 可以同時放好幾支影片,每一支各自剪各自的段落。
- 可以一次選好幾支。加入時會自動替每一支抽一排縮圖給時間軸用,所以會等幾秒。
- 點清單裡的某一支,右邊就載入那一支的預覽與時間軸;清單上會顯示每支「選了幾段、共幾秒」。
- 按住滑鼠左右拖曳:拉出來的範圍變成半透明藍色,兩端顯示秒數。
- 單點一下:影片跳到那個時間,方便確認畫面。
- + 把這段加入清單:拉好之後要按這個才會留下來,時間軸上變成綠色色塊。可以重複拉、重複加。
- 用播放頭精準抓點:一邊播一邊看,到了想要的位置按「⟦ 選取起點=現在」或「⟧ 選取終點=現在」;還可以用「◀ 退 1 秒」「▶ 進 1 秒」微調。
- 清單裡的秒數可以直接改;點某一列會跳到那一段的開頭。
兩種輸出方式,差別在這裡
| 按鈕 | 結果 | 適合 |
|---|---|---|
| ✂️ 剪下 | 每一個選段各自存成獨立的影片檔(三段就三個檔),檔名帶第幾段與秒數。所有影片的選段會一起剪。 | 素材整理、把好的片段挑出來備用 |
| 🧩 拼貼這支的選段 | 只把目前這一支的選段接成一支。 | 剪掉中間不要的畫面 |
| 🧩 全部影片一起拼貼 | 所有影片的選段,照清單順序接成一支。 | 多支素材合成一部片 |
同樣這三段改按「✂️ 剪下」,得到的就是三個各自獨立的檔案,不會接在一起。
- ➡ 送到影片剪接:把成品丟進「影片剪接」,接著上字幕、配音、加音樂。
- 成品存在 作品資料夾 > video > cut。
影片剪接(含字幕、配音、移除內建字幕)
▼
影片剪接(含字幕、配音、移除內建字幕)
如果您只有一支影片、不需要剪,可以跳過第一道,直接按「🎬 套用字幕/配音」,它會問您要哪一支影片。
- 「📂 加入影片」可一次選多支;由上而下就是播放順序,用▲▼調整。
- 「起」「迄」填秒數決定這支只要哪一段;兩個都留空代表整支都要。
- ✂️ 分段剪輯:這是真正的「剪」。把一支切成好幾段,刪掉不要的,剩下的自動接起來。
- ⧉ 複製這一列:同一支影片想另外再取一段時用。
- 兩支影片相接的地方叫「接縫」。接縫清單裡每一列都可以選自己的效果與秒數。
- 上面的「預設效果+秒」是新接縫的預設值;「⇩ 套用到全部接縫」一次改全部。
- 共 57 種效果,分成淡化、擦除、推移、覆蓋、揭開、柔和、形狀、對角、百葉窗、風吹、其他 11 類。
- 「▶ 預覽選到的接縫」只做那個接縫前後各 1.5 秒,一兩秒就能看效果。
- 尺寸不一樣時會自動置中補黑邊,不會把畫面拉變形。
- 音樂比影片長會自動切掉尾巴;可勾「保留影片原本的聲音」。
- 去除原本的音效/音樂/旁白:要重新配旁白時通常要勾。
- 🔍 檢查影片內建字幕:列出影片自帶的字幕軌(第幾軌、什麼格式、什麼語言)。
- 🧹 移除內建字幕並另存新檔:另存「原檔名_無字幕.mp4」,用直接複製處理,畫質完全不變、只要幾秒、原檔不動。
- + 加一條字幕:每條填字幕文字、起、迄、淡出(通常 0.5)。
- 幫字幕配上人聲旁白:勾了會出現引擎與聲音選單。
- ☑ 畫面上顯示字幕:取消勾選=字幕只拿來配音,成品畫面沒有字、只有旁白(畫面直接複製,畫質不變)。
- ☑ 另存 .srt 字幕檔:多存一個同名字幕檔,上傳平台時可另外掛上去(軟字幕)。
| 需求 | 畫面上顯示字幕 | 另存 .srt |
|---|---|---|
| 婚喪喜慶、家族聚會、同學會、謝師宴現場播放,只要旁白 | ☐ 不勾 | ☐ 不勾 |
| 現場播放不要字,但之後可能上傳平台 | ☐ 不勾 | ☑ 勾 |
| 畫面要有字幕(例如給長輩看) | ☑ 勾 | 看需要 |
兩種字幕一定要分清楚
| 種類 | 是什麼 | 能不能移除 |
|---|---|---|
| 軟字幕(字幕軌) | 獨立軌道,播放器可以開關 | ✅ 可以乾淨移除(就是上面那顆按鈕) |
| 硬字幕(燒進畫面) | 字已經是畫面上的像素 | ❌ 刪不掉,只能裁切或遮蓋,都會動到畫面 |
語速欄位的意思
| 您填 | 實際意思 |
|---|---|
| 0 | 原速 |
| -15 | 慢 15% |
| +20 | 快 20% |
影片收尾(放大、補幀、浮水印、片尾)
▼
影片收尾(放大、補幀、浮水印、片尾)
- 「📂 選擇影片」或「↩ 拿剪接結果」直接帶入剛做好的成品。
- 由影像主機的第二張顯示卡 做,每幀約 0.15 秒;三分鐘的影片大約要十幾分鐘,正常。
- 補幀讓動作更滑順(例如 25 格補成 50 格),老照片動畫特別有感。
- 文字或圖片浮水印,可選四角位置與大小。
- 片尾字幕浮在畫面上、沒有底色,有 10 種效果可選(見下表)。
- 按「▶ 本機預覽片尾」幾秒鐘就能看到效果,滿意再送去收尾;正式成品效果相同。
| 類型 | 效果 | 起~迄的意思 |
|---|---|---|
| 捲動 | 由下往上捲動(停在上方)/由下往上捲過去(電影片尾)/由上往下捲動(停在下方) | 捲動的期間 |
| 進場 | 由右往左滑入/由左往右滑入/由小放大彈出/從大縮小落定/正中淡入/逐行依序浮現 | 從「起」開始進場,之後停在正中到片尾 |
| 跑馬燈 | 所有行接成一行,從畫面下方由右往左橫走過去 | 橫走的期間 |
- 按「🎞️ 送到影像主機收尾」後在背景執行,可以關掉這頁去做別的。
- 按「↻ 重讀成品清單」看做好了沒,清單裡按「▶ 播放」檢查。
- 整段影片最後接一張照片,停留秒數自己填(例如 5 或 8.5)。
- 轉場可選:選「直接相接」就是影片結束後直接切到照片;選其他效果(淡入淡出、擦除、推移…)會在影片最後一格與照片之間做轉場,轉場長度也能自訂。
- 照片等比縮放置中(不裁切、不變形),空的地方補黑;直式照片會左右留黑。
- 照片是在本機接上(收尾主機做完、成品下載回來之後),原影片不重新編碼、幾秒鐘就好,也不占用收尾主機。成品另存一支檔名結尾 _tail 的影片;沒選照片就不會多做這一步。
- 因為是收尾完成後才接,字幕、浮水印、片尾字幕不會出現在照片那一段。
人物模型(讓畫出來的人是同一個人)
▼
人物模型(讓畫出來的人是同一個人)
- 同一個人、不同角度與光線,至少 30 張,角度越多越像。
- 每張自動找最大的臉,連頭髮下巴裁成 512 正方形。
- 裁完會告訴您「送了幾張、實際存了幾張、幾張重複」。
- 由 臉部主機合成再送製圖主機與影像主機,約 30 秒;用的是裁好的頭部不是原圖。
- 做好後回「一步一步做」⑥勾「畫完再用臉模型貼臉」並選這個人。
- 在製圖主機上訓練,期間 製圖主機的製圖會排隊;可按「查目前進度」。
- 存在製圖主機的舊版語音。想在本機錄音、要更像本人,請改用「配音工作室」。
配音工作室(本機 Voicebox·五條路線)
▼
配音工作室(本機 Voicebox·五條路線)
本機獨立執行的語音引擎,模型與資料都在您自己的電腦裡,不上雲端。主線只有一條: 開伺服器 → 做出一個「聲音」 → 打字試聽 → 拿去影片配音。
- ①按「▶ 啟動伺服器」,等狀態列變綠字。
- 確認「合成前先把別的模型請出顯示卡」已勾選(4GB 顯卡必要,預設就是勾好的)。
- 右上角的新手模式打勾會收起進階選項,畫面只剩必要按鈕;想看全部就取消。
五條路線,依用途選
| 路線 | 腔調 | 一句話要多久 | 在哪裡算 | 適合 |
|---|---|---|---|---|
| A 現成音色 | 大陸普通話 | 約 60~70 秒 | 這台電腦的顯示卡 | 快速試做 |
| B 克隆自己的聲音 | 本人的台灣腔 | 約 205 秒 | 這台電腦的顯示卡 | 家人旁白、重點段落 |
| C 台灣國語 | 道地台灣腔 | 約 1.2 秒 | 微軟伺服器(要連網) | 音質要求高的旁白 |
| D Windows 內建語音 | 台灣中文三種聲音 | 約 0.1 秒 | 作業系統(完全離線) | 平常用這條、抓節奏、沒網路時 |
| E Mac 內建語音 | 台灣中文十餘種 | 約 1 秒 | Mac 主機(要開著) | 長輩聲線(Grandma/Grandpa) |
- 「音色來源」選 Qwen 內建音色或 Kokoro → 按「↻ 讀音色」→ 從下拉挑一個。
- 名字可留空 → 按「➕ 用這個音色建立聲音」,實測 0.1 秒就好。
- 選麥克風 → 按「⏺ 開始錄音」,念 10 到 15 秒就好。
- 伺服器上限 30 秒,錄到 25 秒程式會自動幫您停;超過會自動取前 15 秒(原始錄音完整保留)。
- 把剛才念的那句話自己打在第 2 格,可以省下 3 到 5 分鐘。
- 填名稱(不能與現有重複)→ 按「➕ 用這段錄音建立聲音」,引擎自動用 Chatterbox。
- 三個聲音:曉臻(女,親切)、曉雨(女,清亮)、雲哲(男,沉穩)。
- 按「🎧 試聽台灣國語」念③那格文字;按「🎬 拿這個台灣聲音去影片剪接配音」帶去剪接。
- 選聲音(雅婷女聲、漢函女聲、志威男聲)→ 按「🎧 試聽這個聲音」念③那格文字。
- 按「🎬 拿這個聲音去影片剪接配音」帶去剪接;語速 0 原速、-15 慢 15%、+20 快 20%。
- 不連網、不佔顯示卡,沒有網路也能用。
- 按「↻ 重讀」抓 Mac 的語音清單(台灣中文有十幾種)。
- 「Grandma」「Grandpa」是長輩口吻的聲線,做阿公阿嬤的旁白很自然。
- 這條要 Mac 主機開著;沒開就改用路線D。
- 在②「目前用哪一個聲音」選剛建立的那個(程式會自動幫您選起來),引擎會自動配對。
- 在③打字 → 按「🎧 試聽這段文字」。
- 按「🎬 拿這個聲音去影片剪接配音」自動跳頁並設定好。
- 取消新手模式才看得到。選模型 turbo →「📂 選檔案並轉文字」。
- 再按「📝 轉文字填進影片剪接字幕」,會一句一行填進字幕表(先每句 4 秒,再自己調)。
看到這些訊息代表什麼
| 狀況 | 怎麼辦 |
|---|---|
| 聲音名字前有「⚠空的不能用」 | 那是以前建立到一半失敗留下的空殼,選起來按「✖ 刪除這個聲音」再重建 |
| 說「名稱重複」 | 換個名字,或先把舊的刪掉 |
| 說「這段錄音太長」 | 伺服器上限 30 秒,按「是」讓程式取前 15 秒即可 |
| 很慢、按了沒反應 | 狀態列有跳秒數就是還在跑;真的要處理就按「🧹 立刻釋放顯示卡記憶體」 |
| 長文字 | 超過 40 字會自動切成一句一句做完再接起來,畫面會顯示「第 2/5 段」 |
A 免費導演 · LivePortrait · 健檢 · 付費 API
▼
A 免費導演 · LivePortrait · 健檢 · 付費 API
🛡️ A 免費導演(不花錢)
產生「鎖定長相」的提示詞,貼到免費網頁工具去生成影片。免費工具最常見的毛病是「生著生著人就變成另一個人」,這頁就是解決它。
好:緩緩轉頭看向鏡頭,微笑,風吹動頭髮。
不好:一位六十歲的白髮老先生微笑。← 一寫長相,AI 就會自己想像重畫一個人。
貼到網頁工具時記得同時上傳您那張照片當首幀,只有提示詞是鎖不住臉的。
🌟 LivePortrait(照片跟著影片動)
給一張照片、再給一支「示範怎麼動」的驅動影片,讓照片裡的人照著做表情與轉頭。切片與運算都在影像主機,不花錢。
臉越清楚效果越好,老照片強烈建議先到「一步一步做」按臉部特寫修復再回來拿。想要大幅度動作(走路、鏡頭移動)LivePortrait 做不到,那要用付費 API 或 A 免費導演。
🩺 健檢
請 AI 看一下這張老照片,給修復與動態化的建議:破損程度、要不要先上色、臉清不清楚、適不適合做 LivePortrait。用的是分配表裡負責翻譯那台的 Ollama(目前是 影像主機)。
☁️ 付費 API(會花錢)
用雲端服務把照片生成影片,需要先到服務商儲值。金鑰只存在本機的 cloud_config.json(在安裝資料夾內)。
分工(多台電腦怎麼配)
▼
分工(多台電腦怎麼配)
| 機器 | 配備 | 擅長 |
|---|---|---|
| 操作電腦 | 一般顯示卡即可(4GB 以上更好) | 介面操作、配音工作室、輕量工作 |
| 製圖主機 | NVIDIA 顯示卡(8GB 以上) | 製圖、鎖臉、人物模型、LoRA 訓練、動作骨架 |
| 影像主機 | AMD 顯示卡(可兩張) | 影片收尾、放大補幀、LivePortrait、翻譯 |
| 臉部主機 | Mac(Apple 晶片) | 臉部合成 |
- 功能分成四大類:圖片產生、人物模型、配音、影片編輯・剪輯。每一列選一台。
- 每一項下面都有「💡 建議」與原因;選的不是建議的那台時會變黃字,您手動指定的會註明。
- 最上面的「分工建議」卡會自動檢查互相卡住的地方,例如即時產圖和 LoRA 訓練在同一台。
- 「👍 沒有手動指定的項目全部照建議」一鍵套用;改完一定要按「💾 套用並儲存」。
- 改亂了按「↩ 還原內建預設」。
| 類別 | 建議放在 |
|---|---|
| 圖片產生 | 即時產圖放最快的 N 卡;鎖臉、貼臉、骨架、場景、上色、去眼鏡跟即時產圖同一台;批次產線放另一台 |
| 人物模型 | LoRA 訓練放不是即時產圖的 N 卡(訓練期間那台不能產圖);臉部處理有 Mac 就交給 Mac |
| 配音 | 配音工作室放操作電腦(要錄音、馬上試聽) |
| 影片編輯・剪輯 | 剪接放操作電腦;放大、補幀、LivePortrait 放背景主機 |
- 配音和繪圖共用同一張顯示卡,一定要有所取捨。配音模型全部載入約佔 10 GB,同時畫圖兩邊都會慢好幾倍。
- 切換工作前按右上角「🧹 釋放顯示卡」:要畫圖就「只釋放配音模型」(實測可釋放約 8 GB);要配音就「只釋放繪圖模型」。
- 釋放後不用手動載回,下次用到會自動重新載入(第一次多等幾秒到半分鐘)。
- 多台電腦時,選單裡也能釋放其他台的繪圖模型。
就算在這裡指給別台,執行時仍會停下來提醒——因為卡關的是 ControlNet、kohya 這些套件本身,AMD 卡真的做不出來。
四個最常用的完整流程(照著做就對了)
▼
四個最常用的完整流程(照著做就對了)
流程一 老照片 → 會動的影片
- 一步一步做①:選照片 → 🩹 先修復照片 → 🎨 黑白上色 → 👤 臉部特寫修復
- LivePortrait:↩ 拿流程那張 → 選驅動動作範本 → 🌟 開始讓照片動起來
- 影片收尾:↩ 拿剪接結果 → 放大+補幀 →🎞️ 送到 影像主機
流程二 屏蔽原音效 + 上字幕 + 用自己的聲音配旁白
- 配音工作室①「▶ 啟動伺服器」。
- ②選好您的音色(路線B克隆的,或路線C台灣國語)。
- 按「🎬 拿這個聲音去影片剪接配音」——會自動跳頁並把引擎與聲音設好。
- 影片剪接①「📂 加入影片」,起迄留空。
- ⑤勾「去除原本的音效/音樂/旁白」← 這就是屏蔽音效。
- ⑤「+ 加一條字幕」,逐句填文字、起、迄、淡出;位置選下方。
- 一句話一條,不要整段塞同一條。
- 中文大約一個字 0.3 秒:12 個字就留 3.6 到 4 秒,程式才不用自動幫您調。
- 只要旁白、畫面不要出現字:取消勾選「畫面上顯示字幕」。
- 按「🎬 套用字幕/配音」;沒按過剪接的話會問您要哪一支影片。
- 完成後按「▶ 播放成品」檢查,檔案在
作品資料夾的 video/edit/sub_日期_時間.mp4。
8 句字幕:內建語音約 1 秒、台灣國語約 10 秒、克隆音色約 27 分鐘。先用D試錯,萬一秒數沒抓好,損失的是一秒鐘而不是半小時。
流程三 畫出「同一個人」的分鏡圖
- 人物模型:①選 30 張以上(不可重複)→ ②一鍵裁頭部 → ③建立臉模型
- 一步一步做⑥:勾「畫完再用臉模型貼臉」並選這個人 → 產生分鏡圖
- 批次產線:↻ 重讀設定 → +加入佇列 → 🏭 開始產線(派工必須選 製圖主機)
流程四 一張照片 → 30 秒的影片(全部在本機做)
- 一步一步做或以圖生圖:把照片修好、畫成想要的場景 → ➡ 當「影片生成」的首圖
- 影片生成:填片名,六段各寫一個動作,共同描述六段共用。
- 以圖生影:放第一格的圖、寫這一段的動作 → 先用 480p 草稿挑一支 → 同一個種子出 720p 定稿 → ➡ 放進「影片生成」目前這一段。
- 回影片生成:在時間軸上逐格挑「動作剛停住」那一格 → ⭐ 定為下一段首圖,再做下一段。
- 影片生成:➡ 送到剪輯台 → 🧩 全部影片一起拼貼(接縫加 0.2~0.3 秒淡入淡出)。
- 影片剪接:上字幕、配旁白。影片收尾:放大、補格、加片尾。
疑難排解與效能參考
▼
疑難排解與效能參考
先看這裡
| 症狀 | 原因與處理 |
|---|---|
| 畫面說在忙,碼表一直跳 | 超過 20 秒沒有背景工作時會自動解除並提示;再試一次即可 |
| 建立聲音超過 5 分鐘 | 不正常。正常:有填逐字稿數秒~1 分鐘;沒填要聽寫 41 秒~4 分鐘 |
| 合成很慢或逾時 | 按「🧹 立刻釋放顯示卡記憶體」,再按「📊 看目前佔用」確認低於 3800 MB |
| ⑥說 製圖主機離線但機器是開的 | 機器有開、但算圖程式沒啟動;按「⚡ 遠端啟動製圖主機的算圖程式」 |
| 字幕互相疊在一起 | 程式會自動把「迄」與「淡出」收斂到不碰下一句;若仍發生請把該句字數減少或秒數拉長 |
| 成品比原片短 | 已修正(配音軌會補靜音到片長);若仍發生請提供 log |
| 選照片就出錯 | 看 安裝資料夾裡的 logs 最後幾行,整段貼給工程師 |
速度參考(實測,模型已載入)
| 工作 | 16GB 顯示卡(有 Tensor Core) | 4GB 入門顯示卡 |
|---|---|---|
| 路線D Windows 內建語音一句 | 0.1 秒 | 0.1 秒 |
| 路線C 台灣國語一句 | 1.2 秒 | 1.2 秒 |
| 路線A 內建音色一句 | 5 秒 | 60~70 秒 |
| 路線B 克隆自己的聲音一句 | 4 秒 | 205 秒 |
| 語音轉文字(12 秒錄音) | 0.8 秒 | 41 秒 |
| 建立聲音(有填逐字稿) | 數秒 | 數秒~1 分鐘 |
檔案放在哪
| 東西 | 位置 |
|---|---|
| 程式 | 程式安裝資料夾 |
| 記錄檔 | 安裝資料夾 logs app_年月日.log |
| 說明網頁 | 安裝資料夾裡的「說明」(右上角 ? 讀的就是這裡) |
| 作品、人物、設定 | 資料資料夾(安裝時指定) |
| 剪接成品 | 資料資料夾裡的 outputs/video/edit |
| 配音音檔 | 資料資料夾裡的 outputs/voice |
| Voicebox 與模型 | 語音引擎資料夾(安裝時指定,約 29 GB,可放資料碟) |
常見問答
MOTION STUDIO 是什麼軟體?
MOTION STUDIO 是太盛昌資訊服務有限公司(KentWare)開發的 Windows 桌面軟體。它把舊照片修復、AI 製圖、AI 影片生成、影片剪接、配音與放大到 4K 整合在 17 個分頁裡,主要在使用者自己的電腦與區域網路內的電腦上運算。
V18-Colab 版跟 V18 差在哪裡?
V18-Colab 版多了雲端 Colab 生圖:以文生圖、以圖生圖、一步一步做、批次產線四個分頁可以把製圖送到使用者自己的 Google Colab,使用 FLUX.1 schnell、Z-Image Turbo、SDXL、FLUX.1 dev 四顆模型。另外新增提示詞自動轉換、雲端進度即時顯示,以及成品檔名帶種子。
用 Colab 生一張圖要多久?
2026 年 10 月在 Colab 的 T4 顯示卡(高 RAM)實測,1344×768 一張:SDXL 約 1.5 分鐘、FLUX.1 schnell 約 4 分鐘、Z-Image Turbo 約 6 分鐘、FLUX.1 dev 約 18 分鐘。Colab 重新啟動後第一次使用某顆模型,還要另外加 3 到 8 分鐘搬模型。
可以直接用中文寫提示詞嗎?
可以。Z-Image Turbo 看得懂中文,會直接送出中文原文。SDXL、FLUX.1 schnell、FLUX.1 dev 只看得懂英文,軟體會在送出前自動把中文翻成英文,並把實際送出的英文顯示在英文欄讓使用者確認。
Colab 可以做鎖臉或生成影片嗎?
不行。Colab 只做以文生圖與以圖生圖;貼臉可以在 Colab 畫完後交給區域網路內有貼臉功能的電腦處理。鎖臉、人物模型、動作骨架、場景參考需要 NVIDIA 顯示卡的算力點,影片則在本機生成。
使用 Colab 需要另外付費嗎?
Colab 用的是使用者自己 Google 帳號的運算單元,軟體不代收費用。T4 高 RAM 實測每小時約消耗 1.27 個運算單元,而且連線期間就會計算,不使用時應中斷連線。
需要什麼等級的電腦?
入門體驗需要記憶體 16GB、顯示卡記憶體 4GB;寫實製圖、鎖臉與人物模型訓練建議記憶體 32GB、NVIDIA 顯示卡記憶體 8GB 以上;本機生成影片建議記憶體 64GB、NVIDIA 顯示卡記憶體 16GB。使用 Colab 製圖則不需要高階顯示卡。
用它做出來的作品可以商用嗎?
要看使用的模型。各個 AI 模型有各自的授權條款,例如 FLUX.1 dev 是非商用授權、FLUX.1 schnell 可商用。正式用於商業用途前,應依實際安裝的模型逐項確認授權。
需要安裝或升級設備?
我們提供地端 AI 部署、硬體健檢、顯示卡環境調校與客製流程開發。安裝前先執行環境探測程式,我們會依您現有的設備告訴您做得到哪些功能、大概多快。


