太盛昌資訊 · 官方技術手冊 v14.0 人物模型旗艦版 異質多卡 AI 算力集群

MOTION STUDIO 舊照片數位修復與動畫旗艦工作台

專為個人化親友老照片修復、神經網絡 LoRA 微調、電影分鏡繪製與 4K 超解析度補幀打造之專業操作全手冊。

💡 提示:點擊下方各章節標題,即可彈拉展開或收合詳細內容
⚠️ 特別聲明與落地部署規範(必讀)
重要聲明:所有使用者在進行落地部署與商用生產前,請務必詳閱本條款。本系統功能牽涉深度學習大模型之物理運算邊界,特此說明設備差異與效能原則。

一、使用者落地設備等級差異、硬體建議與「太盛昌遠端安裝服務」

每位使用者或企業客戶現場之硬體設備規格不一(從文書筆電、單卡個人主機,到多主機異質 GPU 算力集群)。本系統雖具備強大的自動容錯調度架構,但高階功能(如 FaceID 即時鎖臉、專屬 LoRA 微調、4K 超解析度補幀)對硬體等級具備明確之物理門檻:

落地設備等級 硬體規格需求建議 支援功能範疇與預期效能
【入門體驗級】
(基本運作)
• CPU:Intel i5 / i7 (8代以上)
• 記憶體:16GB RAM
• GPU:NVIDIA GTX 1650/1660 或 AMD Vega 系列
• 支援分鏡圖快速草稿預覽
• 基礎臉部修復與 2.5D 電影推軌運鏡
• 雲端 API 直連模式(SEEDDance 2.5)
【推薦生產力級】
(進階商業實戰)
• CPU:Intel Core i7 / AMD Ryzen 7
• 記憶體:32GB RAM
• GPU:NVIDIA RTX 3060 / 4060 / 5060 (8GB~12GB VRAM 以上獨立顯卡)
• SDXL 高畫質分鏡圖即時繪製
• ControlNet FaceID 多單元即時鎖臉
• AI 去眼鏡局部重繪、ReActor 臉模型建立
專屬人物 LoRA 神經網絡深度訓練
【旗艦算力池級】
(工業批量與 4K 影音)
• 雙主機協同算力池
• 主節點:RTX 5060 (專職訓練與出圖)
• 次節點:雙卡 AMD Vega 56 (專職批次與超解析)
• 記憶體:64GB RAM 以上
• 深度 LoRA 權重煉製 (1800 步以上極致保真)
深夜無人值守批次產線 (雙卡輪詢自動出圖)
• Real-ESRGAN 4K 超解析度放大
• RIFE 60fps 視訊補幀與音畫混音

🛠️ 專業安裝方式:開通遠端 SSH 由「太盛昌」工程團隊專案部署

本系統深度整合微軟 DirectML、輝達 CUDA、Vulkan 運算庫、多執行緒排程、Ollama 大語言模型以及 kohya 深度訓練框架,涉及極其繁複之底層相依套件、環境變數與通訊連接埠配置。

強烈建議客戶開通現場主機之遠端安全通道(即開通遠端 SSH 存取權限,或提供專用遠端連線協議)。由「太盛昌」專業工程技術團隊進行一對一遠端連線安裝,協助客戶進行環境診斷、顯示卡驅動最佳化調校、通訊連接埠配置與開機常駐守護行程部署,確保系統在客戶現有硬體上發揮最高相容性與最佳穩定度。

二、算力效能與生成吞吐量免責聲明(不保證生成 Token 數)

  • 不保證生成 Token 數與處理時效: 本系統與太盛昌技術團隊,不對任何特定之「生成 Token 數」、「出圖秒數」或「視訊幀率(FPS)」作絕對數值之保證
  • 硬體物理性能決定運算時效: 所有人工智慧神經網路模型(包含語言模型推論、影像擴散生成、模型權重微調與視訊補幀)之產出時效,完全由客戶端現場落地設備之硬體算力(GPU 算力、顯存頻寬、CUDA 核心數、散熱性能)所決定。
  • 中央處理器(CPU)純軟體運算之極限說明: 縱使本系統具備高相容之容錯機制,在缺乏獨立顯示卡或顯存耗盡時可自動退回中央處理器(CPU)進行純軟體模擬計算,但是 CPU 運算速度極其緩慢(通常每一幀需要數秒至十數秒,單一任務耗時可能長達數十分鐘甚至數小時)。純 CPU 運算僅適合作為系統除錯驗證或極端備援之用,無法滿足常態商用之生產力需求。
  • 客戶自主升級責任: 客戶應充分理解自身硬體效能之物理限制,並依據業務實際對產出效率與即時性之要求,自主評估並升級相應之顯示卡與硬體環境
🖥️ 第一章:系統架構與算力節點配置

MOTION STUDIO v14.0 採用世界領先的「雙主機、三顯示卡」異質協同排程體系

1 第一算力節點:RTX 5060 主機(前台即時互動)
  • 7860 連接埠:SD-WebUI 引擎 —— 專職 SDXL 與 SD1.5 分鏡圖繪製、ControlNet FaceID 多單元鎖臉、AI 去眼鏡局部重繪、黑白照片自動上色。
  • 9890 連接埠:TrainServer —— 專職調用 kohya sd-scripts 進行個人專屬 LoRA 模型訓練。
2 第二算力節點:3070ti 雙 Vega 主機(背景批次與影片收尾)
  • 11434 連接埠:Ollama 服務 —— 專職提示詞擴展導演 (qwen2.5:7b) 與 AI 視覺照片健檢 (qwen2.5vl)。
  • 9870 連接埠:FasterLivePortrait —— 專職 AMD DirectML 面部微表情動畫驅動。
  • 9880 連接埠:VideoFinish 服務 —— 由第二張 Vega 顯示卡(Vulkan)專職 Real-ESRGAN 4K 超解析度放大與 RIFE 60fps 視訊補幀。

啟動方式:進入目錄 F:\雜記\PhotoProject 14\ 雙擊 run_windows.bat,觀察工作台頂部狀態膠囊顯示綠燈即代表雙主機在線就緒。

👤 第二章:核心王牌 ——「人物模型」個人資產庫 (LoRA & ReActor)

單張老照片往往臉部模糊、角度單一甚至被眼鏡遮擋。v14.0 將一個人建立為專屬數位資產,透過「特徵平均臉模型」+「專屬 LoRA 訓練」,讓生成相似度飆破九成!

人物模型個人資產庫操作介面
介面截圖 📸 圖 2-1:「人物模型」個人數位資產庫、一鍵裁切 512 正方形與 LoRA 訓練介面
填寫人物代號與匯入照片

切換至「👤 人物模型」分頁,輸入純英文代號(如 DADEVA),點擊匯入 15 ~ 30 張 多角度、不同表情的清晰照片。

①-B 一鍵裁切頭部特寫 (512×512)

點擊「✂️ 一鍵裁頭部」,本機調用 OpenCV YuNet 於 5 秒內自動鎖定人臉五官、髮型與下巴,裁切出標準正方形圖片。點擊開啟資料夾,手動剔除不清晰或閉眼的廢片後按「重讀資料夾」。

一鍵建立 ReActor 臉模型(約 20 秒)

點擊「👤 上傳到 5060 建立臉模型」,主機將逐張抽取特徵向量進行幾何數學平均,自動存為臉模型,消除單張照片的陰影瑕疵。

一鍵訓練專屬 LoRA 模型(約 7~15 分鐘)

選擇性別與步數(推薦 1800 步),點擊「🚀 開始訓練專屬 LoRA」。5060 主機將調用 kohya 深度學習框架針對底模進行權重微調,訓完自動載入模型庫!

🧭 第三章:主力工作台 ——「一步一步做」七步驟指南

這是日常製作老照片分鏡圖、新場景重生最推薦的標準操作流程:

一步一步做主工作台介面
介面截圖 📸 圖 3-1:MOTION STUDIO v14.0「一步一步做」主力工作台操作全景
  1. ① 放照片與前處理修復: 載入照片後,模糊照片可點擊「🩹 先修復照片」(Vega 5 秒完成修復並放大 2 倍);黑白照片點擊「🎨 黑白上色」;全身照片可點擊「👤 臉部特寫修復」;戴粗框眼鏡者點擊「👓 AI 去眼鏡」乾淨摘除鏡框。
  2. ② 選風格與電影濾鏡: 搭配專屬 LoRA 請選「亞洲臉 (majicMIX)」;一般創作可選「寫實定稿 (Juggernaut XL)」。可勾選「黃昏暖金」、「柔焦夢幻」、「日系奶油色」等 12 款電影調色濾鏡。
  3. ③ 中文構想描述與尺寸: 直接點選預設的鏡頭與光線按鈕(如:半身、特寫、午後斜陽、室內柔光);尺寸提供 3:4 直式、16:9 橫式、1:1 方形切換。
  4. ④ 對照圖(進階控制): 可上傳風景照控制構圖(場景對照),或上傳姿勢照控制肢體動作(動作對照)。
  5. ⑤ 檢查並翻譯(防換臉地雷): 點擊檢查,系統自動過濾外貌詞彙(嚴防 AI 把甲畫成乙),並由 Ollama 翻譯為好萊塢光影提示詞,支援一鍵複製給 Google Flow、Veo 或 Gemini。
  6. ⑥ 算力調度與臉部處理(關鍵!): 臉部處理切換至「👤 人物模型」,選取建立好的專屬代號!微調「LoRA 強度滑桿」(預設 1.0),可同時勾選「畫完再用臉模型貼臉」達到雙重保真!
  7. ⑦ 立即生成與 2K 放大: 生成後縮圖自動出現在右側列表。點擊「🔍 放大成 2K」交由第二張 Vega 進行極速無損放大;或點擊「🎬 送到 Google Flow 當首幀」直接轉做動畫!
🏭 第四章:工廠化作業 ——「批次產線」夜班自動出圖

當你需要為同一個人一口氣產生 20 張不同場景、不同角度或不同濾鏡的照片時,請切換至「🏭 批次產線」:

批次產線作業介面
介面截圖 📸 圖 4-1:「批次產線」多矩陣任務配置、夜班雙卡輪詢與自動出圖隊列
  • A. 讀取流程頁設定:點擊「📥 讀取目前流程設定」,自動將第三章寫好的場景、光線與提示詞帶入批次產線。
  • B. 展開矩陣變化:可同時勾選多個風格(寫實、自然、亞洲臉)與多款濾鏡,系統自動計算出總任務張數(如:10 張 × 多種組合)。勾選「每張不同種子」確保張張神采各異!
  • C. 算力夜班排程:算力派發可選「Vega 夜班(慢但不佔 5060)」或「自動(照規則)」。深夜由背景顯卡默默輪流繪製,完全不影響白天前台作業!
  • D. 佇列防護機制:支援「+加入佇列」與隨時暫停,佇列資料存檔於本機,即便電腦斷電重開也能自動接續運算。
🎞️ 第五章:好萊塢收尾 —— 4K 超解析度與 60fps 補幀

不論是用本地生成、或是從 Google Flow、即夢下載回來的動態短片,往往只有 720p 且畫面微卡。請切換至「🎞️ 影片收尾」:

影片收尾與超解析度補幀介面
介面截圖 📸 圖 5-1:「影片收尾」Real-ESRGAN 4K 超解析度放大與 RIFE 60fps 視訊補幀工作台
  • ① 放上影片:可匯入 Flow、Veo、即夢或 LivePortrait 產出的 mp4 視訊。若無影片,亦可點擊「照片變簡易動態」由純光學運鏡自動產出 4 秒運鏡短片。
  • ② AI 超解析度放大:調用 3070ti 第二張 Vega 顯示卡的 Vulkan 引擎,可勾選放大至 1080p 或 4K 劇院級畫質
  • ③ AI 影格插幀補順 (RIFE):可選擇「補到 30fps」或「補到 60fps」,讓原本生硬的畫面變得極致流暢自然!
  • ④ 字幕、浮水印與背景音樂:可自訂影片片尾字樣(如:阿嬤的三合院,1965)、版權浮水印(如:太盛昌資訊),並掛載 mp3 音樂自動對齊混音。
  • ⑤ 送去收尾:點擊「送到 3070ti 收尾」,背景全自動運作,可隨時離開做其他工作!
🎬 第六章:動畫驅動與雲端大模型方案 (A 免費導演 / B+ 微表情 / C 付費 API)

1.「A 免費導演」:首幀鎖定與防換臉 Prompt 擴展

解決「給了甲照片卻產出乙影片」之痛點!本分頁嚴格啟用首幀鎖定與外貌防換臉機制:

A 免費導演操作介面
介面截圖 📸 圖 6-1:「A 免費導演」首幀鎖定、外貌防換臉過濾與雙語提示詞導演介面
  • 鎖定原圖主體容貌:自動在提示詞中植入首幀固定約束,禁止大模型重新憑空繪製人臉。
  • 動作預設範本:內建溫柔眨眼微笑、眼神流轉注視、微側頭輕笑、紀錄片呼吸感等純動作描述。
  • 一鍵導流:支援一鍵複製中英文提示詞,或直通「即夢 AI 網頁版」、「Dreamina 海外版」與「Google Flow」。

2.「B+ LivePortrait」:遠端微表情動畫驅動

針對老照片進行細膩五官牽引,讓逝去親人重現溫柔凝視與微笑:

B+ LivePortrait 介面
介面截圖 📸 圖 6-2:「B+ LivePortrait」動態分鏡切片、表情微調與遠端 GPU 動畫生成
  • 動作範本選擇:內建自然眨眼與微轉頭、溫柔微笑與眼神流轉,亦可上傳自選驅動影片 (.mp4)。
  • 動態分鏡切片管線:獨家支援 2.0 秒黃金長度切片,解決單張顯卡顯存瓶頸與超長任務逾時問題。
  • 背景平滑縫合:自動保留完整原圖背景,邊緣平滑無縫接合,杜絕恐怖谷面具感。

3.「C 付費 API」:字節即夢 SEEDDance 2.5 雲端直連

為追求好萊塢級高動態視訊打造之企業級直連管道:

C 付費 API 介面
介面截圖 📸 圖 6-3:「C 付費API」字節跳動即夢 SEEDDance 2.5 電影級視訊雲端直連介面
  • 管道多元支援:整合 fal.ai 與火山引擎方舟 API,免去複雜外網架設。
  • Base64 直傳免圖床:照片由地端加密直傳 API 伺服器,嚴格保護客戶私隱。
  • 首幀強力鎖定:自動帶入防換臉指令,產出最高 30 秒 4K 電影級連貫動態!
🩺 第七章:系統維護 ——「AI 視覺健檢診斷」

當老照片受損嚴重、或修復效果不理想時,可調用私有大語言模型進行深度體檢:

系統健檢分析介面
介面截圖 📸 圖 7-1:「系統健檢」調用 3070 Ti 本地大語言模型(Ollama qwen2.5)診斷介面
  • 本機私有大腦分析:調用 3070ti 上運行的 Ollama qwen2.5 進行智能照片結構分析。
  • 修復參數最佳化:自動評估老照片之噪點、褪色比例、五官殘缺度,並反饋最佳的降噪與修復步數建議。
💡 第八章:老照片復原「黃金成功心法」
  1. 先特寫,再去鏡,後建模: 年代久遠的照片切忌直接整張大合照拿去鎖臉!正確順序為:先裁出五官特寫 ➔ 有粗框眼鏡按「AI 去眼鏡」摘除 ➔ 匯入「人物模型」建立專屬資產。
  2. 外貌閉嘴,動作放開: 描述提示詞時,千萬不要寫長髮、圓臉、大眼等外貌特徵(寫了 AI 就會重新畫一個陌生人乙!)。外貌交給 LoRA 和臉模型管理,文字只專注寫「動作、微表情、光影流動與鏡頭推拉」。
  3. 雙主機分流,效率翻倍: 讓 5060 專心出圖與訓練 LoRA;修復放大、4K 補幀與批次產線交給雙卡 Vega 跑,雙機協同運作達到最大產能!

太盛昌資訊 · 企業與個人 AI 落地諮詢支援

太盛昌資訊提供完整的 AI 地端私有化部署、硬體架構健檢、顯示卡驅動調校與客製化流程開發服務。若您需要開通遠端連線安裝或升級算力設備,歡迎隨時聯繫我們的工程團隊!

專業工程團隊遠端 SSH 一對一配置 · 讓頂尖 AI 穩定落地於您的專屬硬體