我最近剛處理過類似的情況,涉及近 100 章,分散在獨立的 doc/rtf 檔案中。我的基本程序如下:
1. 我首先使用 LibreOffice 命令列將檔案轉換為 txt。
2. 我寫了一個 Python 腳本來解析 txt 檔案,識別章節標題、交叉引用和節。它還清理了一些雜訊,並轉換了一些代碼點以更新編碼。有些檔案仍有 \v 標記(最初從 Paratext 匯出),而有些則沒有,所以我只能根據文本中的數字來判斷。Python 腳本輸出 SFM
3. 我反覆在更新/優化代碼與手動編輯 txt 檔案之間切換,以清理內容,直到狀態變得相當良好。
4. 最後一步是將各章合併為一個 SFM 檔案,然後我逐書複製並貼上到 Paratext 的標準檢視(Standard view)中。(多年前有人建議我這是貼上數據最安全的方式,因為這樣做時 PT 會進行一些檢查並整理格式。)
5. 如果有重大問題(例如 \s 標記後缺少 \p,導致半章被格式化為章節標題),我就會回到第 3 步。否則,我會在 PT 內部手動修復任何小問題。
我受到鼓勵將我的代碼/程序發布到線上,希望很快就能做到。如果這對您有用,我可以儘早處理……