我最近刚刚处理过类似的情况,涉及近 100 章内容,分别存储在单独的 doc/rtf 文件中。我的基本步骤如下:
1. 我首先使用 LibreOffice 命令行将文件转换为 txt。
2. 我编写了一个 Python 脚本来解析 txt 文件,识别章节标题、交叉引用和经文。它还清理了一些无用内容,并转换了一些码点以更新编码。有些文件仍然包含 \v 标记(最初是从 Paratext 导出的),而其他文件则没有,因此我只能依靠文本中的数字。Python 脚本输出 SFM。
3. 我在更新/完善代码和对 txt 文件进行一些手动编辑以清理内容之间反复迭代,直到格式变得相当整洁。
4. 最后一步是将各章合并为一个 SFM 文件,然后我逐书将其复制并粘贴到 Paratext 的标准视图(Standard view)中。(多年前有人建议这是粘贴数据最安全的方式,因为当您这样做时,PT 会对格式进行一些检查和整理。)
5. 如果存在重大问题(例如 \s 标记后缺少 \p,导致章节的一半被格式化为章节标题),我会回到第 3 步。否则,我会在 PT 内部手动修复任何小问题。
我受到鼓励将我的代码/流程发布到网上,希望很快能做到。如果这对您有用,我可以尽早着手处理……