同人社團如何使用AI簡化DLsite上架流程
經常在 DLsite 上販售商品的同學都知道,上架商品是一件相當繁瑣的工作。
具體的工作如下:
* 打包商品本體
* 準備複數枚 2MB 以內的商品介紹圖,以及解析度 1000x1000 以內的 chobit 作品縮圖* 商品登記
* 準備樣品、體驗版
這些工作雖然每項都不複雜,但做起來卻特別繁瑣,特別是對於沒有日常整理資料習慣的人而言更是如此。本人就是一個很好的例子,我某個作品的工作目錄:

有時就連我自己都會忘記資料放在哪裡。
此外,DLsite 必須要對作品中的香腸進行打碼:

各位平常購買的作品,其實我們社團都有無碼版本的,我們其實比任何人都懶得打碼,無奈日本法規就是這麼規定的。
那麼,是否有辦法透過 AI 大幅使流程自動化呢?有的,有的。
【準備影像素材】
DLsite 由於對雲端容量錙銖必較,商品有著嚴格的尺寸與大小限制,同時針對 DLsite與 Chobit 兩個雖然聯動但不同的服務,也有不同的標準。
這個步驟實際上是最適合透過程式自動處理的流程,因為它的邏輯很簡單:「將用戶指定的圖檔縮小到指定尺寸。」但為了保留彈性,例如有時我們可能需要在其他平台宣傳,或者我們希望先釋出模糊的圖片增加神秘感,又或者隱藏特典時,我們就需要不同的參數。
我們只要告訴 AI:「請你幫我寫一個 Python 腳本,能夠接收輸入圖檔、輸出路徑以及config 檔案作為參數,並會依照 config 參數輸出指定尺寸的 JPG 影像。」這類工作AI 往往能一步到位,因為是常見的場景。
除了影像尺寸,DLsite 還有對香腸的嚴格限制。顯然我們不能夠透過 AI 生成打碼圖,AI 生成像素的機制反而可能觸發 AI 偵測,引來客戶的質疑。打碼這件事,其實也是能夠透過演算法固定流程的。
我們需要將流程區分為兩個步驟:
1. 哪些範圍的像素屬於需要打碼的
2. 針對指定範圍的像素進行打碼
困難點明顯是步驟 1,所幸現在已經有許多優秀的模型,能夠自動對影像進行分割。由於一般商品的影像大小都是高解析度,高解析度會浪費記憶體與處理時間,並不會對分割產生多大助益。我們可以提示 AI,在將影像餵入模型前先將影像縮小,再將範圍透過線性轉換對應回原圖。如此一來,我們就能夠找到圖中的鮑魚跟香腸進行打碼。
【打包商品本體】
首先,我們必須要先準備一個商品目錄作為樣品,告訴 AI:「請你參考這個目錄的結構,以後作品就按照這樣的目錄結構安排。」
這個在提示詞工程中我們稱為 one-shot,也就是單一樣本。但我們的目標不是每次都指定一個樣本請 AI 照做,而是「讓 AI 從這個樣本自己通靈規則,並讓它自己撰寫Agent 與 Skill」。
同時,我們必須告訴 AI 我們的需求與可能的狀況,例如:
* 必須採用複製而非移動的方式準備目錄(保留母帶)
* 部分作品可能有其他格式的檔案,需一併考慮
* 盡可能探索工作目錄,並區別成品與編輯中的過渡品
* 正式打包商品前,必須列出路徑對照清單供用戶確認後才執行
當商品成功打包後,我們上個步驟中準備的影像處理器就派上用場。我們只要告訴 AI 將商品目錄中的影像作為輸入,就能取得登錄商品用的影像。
【準備樣品、體驗版】
同人音聲必須提供剪輯後的版本作為樣品,提供客戶參考。這也是工作量較大的一塊。從創作者的角度,會怎麼挑選樣品片段呢?
1. 能夠讓聽眾迅速掌握故事大綱
2. 聽起來讓人特別硬的片段
3. 避免暴雷,將最高潮作為懸念排除
為此,我們需要做的事是讓 AI 知道有哪些台詞,以及這些台詞分別位於音檔中的哪個時間區段。
這件事情其實中國的盜版者特別擅長。中國的盜版者能夠透過 AI 自動產生有字幕翻譯的 MP4,靠的其實就是 AI 自動上字幕的能力。但 AI 往往會聽錯,尤其是 R18 作品(雖然有特別為了 ACG 訓練出的模型,但仍不能十全十美)。
我們作為社團的優勢是有原始台本,因此,我們可以先讓 AI 用 Whisper 進行逐句的字幕與時間段標註。這時就算 Whisper 得出的句子是錯的,也無所謂。
第二步是讓 AI 以台本為 golden standard,對 Whisper 抄寫出的句子進行糾正,同時AI 也能夠根據用戶的準則與要求,挑選出特別有吸引力的片段。
我們的 Skill 指定 AI 以 structured output(結構化輸出)為產物。當 AI 整理出需要裁切的片段,我們就能夠透過 Python 腳本產生出 WAV 檔與 MP4。
當 Skill 與 Agent 模板完成後,我們只要告訴 AI:「我需要你從該目錄中的各個track 各自挑選五個片段,組成五分鐘的 sample。」AI 就能夠自動完成所有的工作。
【商品登記】
大家平常在網路最懶得做的事情,估計就是填表格了。DLsite 要登錄商品時,也有許多表格需要填,這些資料都服務於後台,以確保作品正確的分流與上架時間。
那麼,有什麼方法可以最大限度地自動完成這個步驟呢?
我們同樣要先區分登記商品的步驟:
1. 準備各欄位的資料
2. 進行資料填寫
我們不可能每次都讓 AI 透過 CDP 去操作 Chrome 進行資料填寫,又一邊查閱作品的資訊。這當中,最能夠程式自動化的是步驟 2,也就是資料填寫。
我們只需要開發一個 Chrome Extension,只要接收到用戶上傳的表格資料,Extension就能夠為我們操作網頁,自動將資料填入。我們選擇 JSON 作為格式。
首先,我們先讓 AI 以 CDP 操作 Chrome,實際地去操作 DLsite 的作品登錄頁面,讓它檢查哪些欄位是必要的、哪些欄位提供哪些選項。選擇 JSON 的其中一個優點是,我們可以定義 JSON Schema,確保 Extension 能夠對 JSON 進行驗證,AI 也知道該如何填寫JSON。genres 就是一個很好的例子。

當我們開發完 Extension 以及定義完 Schema 後,步驟 1 的難題也攻克了。我們只要告訴 AI 去閱讀 JSON Schema 以及調查商品目錄,AI 就能夠根據商品內容挑選出合適的genres,以及填寫作品各 track 的時長與統計。我們最後只要將 AI 生成的 JSON 丟到Extension 上,就能夠自動填寫 87% 的欄位。
總結
多模態大模型與相應的 AI 軟體能夠理解、操作電腦中的文件,只要透過制定流程與標準,就能夠大幅度簡化手動操作。我們唯一的風險其實是模型廠商的倫理限制,例如:JK、酪梨等內容。
AI 落地,不光是工程師寫寫程式碼,也能應用到日常的文書,甚至是多媒體工作。當然,擁有工程師背景,能夠知道 AI 的長短處以及具體的技術細節,都能夠大幅提升自動化流程的表現。
從上述的例子,我們可以將 AI 工作流的制定總結為一句話:「判斷哪些程序適合 LLM 裁決、哪些程序適合標準化的程式 IO。」
換言之,AI 工作流並非將所有的工作都丟給大模型。我們可以利用 AI 為那些固定、標準化的流程撰寫腳本;而那些難以標準化、過去需要人為判斷且具有模糊空間的任務,則可以交給 AI。
在此拋磚引玉,希望能給各位日常生活、工作流程帶來一點啟發。
--
FAtelier 09/02 11:29
FAtelier 09/02 11:31