Saya baru saja melakukan ini baru-baru ini dengan hampir 100 bab dalam file doc/rtf terpisah. Ini adalah prosedur dasar saya:
1. Pertama, saya mengonversi file-file tersebut ke txt menggunakan command-line LibreOffice.
2. Saya menulis skrip Python untuk mem-parsing file txt, mengidentifikasi judul bagian, silang-referensi, dan ayat. Skrip ini juga membersihkan beberapa sampah dan mengonversi beberapa titik kode untuk memperbarui encoding. Beberapa file masih memiliki penanda \v (yang awalnya diekspor dari Paratext) dan yang lain tidak, jadi saya hanya harus mengikuti angka dalam teks. Skrip Python tersebut menghasilkan SFM
3. Saya berulang kali memperbarui/menyempurnakan kode dan melakukan beberapa edit manual pada file txt untuk merapikan semuanya sampai saya mendapatkannya dalam kondisi yang cukup baik.
4. Langkah terakhir adalah menggabungkan bab-bab tersebut menjadi satu file SFM, lalu saya menyalin dan menempelkan buku per buku ke tampilan Standard di Paratext. (Saya pernah disarankan beberapa tahun lalu bahwa ini adalah cara paling aman untuk menempelkan data, karena PT akan melakukan beberapa pemeriksaan dan merapikan format saat Anda melakukan ini.)
5. Jika ada masalah besar (misalnya penanda \s tidak memiliki \p setelahnya sehingga setengah bab diformat sebagai judul bagian), maka saya akan kembali ke langkah 3. Jika tidak, saya akan memperbaiki masalah kecil secara manual di dalam PT itu sendiri.
Saya didorong untuk mengunggah kode/prosedur saya secara online dan berharap dapat melakukannya segera. Jika ini mungkin berguna bagi Anda, saya bisa melakukannya lebih cepat daripada lambat...