मैंने हाल ही में लगभग 100 अध्यायों के साथ यह काम किया, जो अलग-अलग doc/rtf फ़ाइलों में थे। यह मेरी बुनियादी प्रक्रिया थी:
1. मैंने पहले LibreOffice कमांड-लाइन का उपयोग करके फ़ाइलों को txt में परिवर्तित किया।
2. मैंने txt फ़ाइलों को पार्स करने के लिए एक Python स्क्रिप्ट लिखी, जिसने सेक्शन हेडिंग, क्रॉस-रेफरेंस और श्लोकों की पहचान की। इसने कुछ कचरा साफ़ किया और एन्कोडिंग को अपडेट करने के लिए कुछ कोड-पॉइंट्स को परिवर्तित किया। कुछ फ़ाइलों में अभी भी \v मार्कर थे (जो मूल रूप से Paratext से निर्यात किए गए थे) और कुछ में नहीं थे, इसलिए मुझे बस पाठ में नंबरों के आधार पर जाना पड़ा। Python स्क्रिप्ट ने SFM आउटपुट किया
3. मैंने कोड को अपडेट/सुधारने और txt फ़ाइलों में कुछ मैनुअल संपादन करने के बीच बार-बार काम किया ताकि चीज़ों को साफ़ किया जा सके, जब तक कि मैं इसे काफी अच्छी स्थिति में न पा लूँ।
4. आखिरी चरण था अध्यायों को एक SFM फ़ाइल में जोड़ना, और फिर मैंने Paratext में Standard view में किताब-दर-किताब कॉपी और पेस्ट किया। (मुझे कई साल पहले यह सबसे सुरक्षित तरीका बताया गया था, क्योंकि जब आप ऐसा करते हैं तो PT फॉर्मेटिंग की कुछ जाँच और सफाई करता है।)
5. यदि कोई बड़ी समस्या थी (जैसे कि \s मार्कर के बाद \p की कमी थी, जिससे अध्याय का आधा हिस्सा सेक्शन हेडिंग के रूप में फॉर्मेट हो गया) तो मैं वापस चरण 3 पर लौट आता। अन्यथा, मैं छोटी-मोटी समस्याओं को PT के भीतर ही मैनुअल रूप से ठीक कर देता।
मुझे प्रोत्साहित किया गया है कि मैं अपना कोड/प्रक्रिया ऑनलाइन डालूँ और उम्मीद है कि मैं जल्द ही ऐसा करूँगा। यदि यह आपके लिए उपयोगी हो सकता है, तो मैं इसे जल्दी से कर सकता हूँ...