0 वोट
647 व्यूज़

मेरे पास हमारे गैर-रोमन लिपि (तिब्बती) से लैटिन लिपि में रूपांतरण के लिए एक Teckit स्क्रिप्ट है (MSEA गैर-रोमन-लिपि पहल के सॉफ्टवेयर विभाग की मदद से)। इसमें पूर्ण विराम (full stop) के बाद वर्ण-महत्व (capitalisation) की सुविधा है और हमने इसे Paratext 8 में स्वतः अनुप्रेक्षित (automatic transliteration) के लिए डाल दिया है।

यदि पूर्ण विराम पद (verse) के बीच में या बैकस्लैश क्षेत्र (backslash region) में होता है, तो यह ठीक से काम करता है; हालाँकि, जब पूर्ण विराम और अगले वर्ण के बीच बैकस्लैश कमांड होता है, जिसे वर्ण-महत्व (capitalised) होना चाहिए, तो हमारी स्क्रिप्ट टूट जाती है/विफल हो जाती है।

क्या Paratext 8 में कोई ऐसी सुविधा है जिसे हम स्वतः उपकरण के रूप में उपयोग कर सकें ताकि वाक्य सीमा (sentence boundary) पर पूर्ण विराम के बाद के छोटे अक्षर (lower case letter) को वर्ण-महत्व (capitalised) रूप में बदला जा सके?

या क्या SIL कन्वर्टर में कोई ऐसी सुविधा है जो ऐसा कर सके?

English से मशीन-अनुवादित
Paratext में द्वारा (115 अंक)
फिर से दिखाया गया | 647 व्यूज़

4 उत्तर

0 वोट

आपकी टिप्पणियों से मैं यह अनुमान लगाता हूँ कि कोई भी वर्ण शैली (character styling), या कविता की नई पंक्ति (\q1 , \q2) नियम के अनुप्रयोग को अवरुद्ध कर देगी। इसी तरह, पद संख्या (verse number) (\v # ) भी एक समस्या हो सकती है।

मेरे पास कोई उत्तर नहीं है, लेकिन मेरे पास एक समान समस्या है जिसका संबंधित समाधान हो सकता है, इसलिए मैं आपके पोस्ट का लाभ उठा रहा हूँ।

मैं US अंग्रेज़ी शीर्षकों के वर्ण-महत्व (capitalization) को UK शीर्षक वर्ण-महत्व (UK title capitalization) में बदलने की कोशिश कर रहा हूँ। US शीर्षक शैली पहला शब्द और सभी शब्दों को वर्ण-महत्व (capitalizes) करती है, सिवाय कुछ सीमित छोटे शब्दों के, जबकि UK शैली पहला शब्द और केवल विशेष संज्ञाओं (proper nouns) को वर्ण-महत्व (capitalizes) करती है। मेरे पास इसे करने की तर्कशक्ति (logic) है, लेकिन मुझे इसे केवल शीर्षकों में पाठ (\s1 , \s2 , आदि) पर लागू करने का तरीका चाहिए।

जो मैंने पाया है वह यह है कि अनुप्रेक्षित (transliteration) परियोजनाएँ केवल स्थानीय भाषा के पाठ (vernacular text) पर एन्कोडिंग कन्वर्टर परिवर्तनों को लागू करती हैं, और वे मार्कअप संदर्भ (markup contexts) के बारे में अनजान होती हैं। मेरे पास एक cc टेबल है जो Paratext के बाहर वर्ण-महत्व (capitalization) परिवर्तनों को सही ढंग से लागू करती है, लेकिन जब मैं इसे अनुप्रेक्षित (transliteration) परियोजना में लोड करता हूँ तो यह सही ढंग से काम नहीं करता है। मेरी टेबल सभी स्थानीय भाषा के पाठ फ़ील्ड्स (vernacular text fields) में परिवर्तन करती है। गैर-स्थानीय भाषा के फ़ील्ड्स (Non-vernacular fields) (\id , \rem ) प्रभावित नहीं हुए।

अनुप्रेक्षित (transliteration) कार्यक्षमता को वास्तव में उपयोगी बनाने के लिए, हमें मार्कअप संदर्भ के प्रति जागरूक परिवर्तन करने का तरीका चाहिए। क्या यह संभव है?

English से मशीन-अनुवादित
द्वारा (1.8k अंक)
फिर से दिखाया गया

Before Paratext allowed transliteration projects within Paratext itself, we
used the TECkit Bulk SFM Converter tool which is part of SIL Converters (
http://scripts.sil.org/cms/scripts/page.php?site_id=nrsi&id=enccnvtrs).
This tool uses the same *.tec file used in the transliteration project in
Paratext but has the ability to apply the conversion to specific SFM’s
only. The only problem in using this tool is that it must be applied to the
text manually and outside Paratext whenever the text or converter is
changed and each Scripture file (book) must be saved manually, a pain when
there are 66+ books to deal with.

Blessings,

Shegnada J.

Language Technology & Publishing Coordinator, SIL Nigeria

Complex Script Layout Specialist, GPS Dallas

Skype: Shegnada.james.

([Phone Removed]

पुराना पोस्ट - इसकी मूल भाषा में दिखाया जा रहा है
0 वोट

चूंकि यह संवाद मेरे प्रश्न से निकटता से संबंधित प्रतीत होता है, इसलिए मैं नया संवाद शुरू करने के बजाय इस संवाद का उत्तर दे रहा हूँ:

हमारे पास अरबी लिपि में प्रकाशित न्यू टेस्टामेंट (NT) है; उसी पाठ को लैटिन लिपि में प्रकाशित करने की मांग है।

यह एक बार का अनुप्रेक्षण (one-time transliteration) होगा, इसलिए Paratext के भीतर गतिशील रूप से अपडेट करने की आवश्यकता नहीं है। लेकिन मैं सोच रहा हूँ कि क्या किसी ने वाक्य के प्रारंभिक वर्णों को बड़े अक्षरों (uppercase) में बदलने के लिए RegEx स्ट्रिंग विकसित की है? मेरे पास वही चुनौती है जो anon024386 ने प्रारंभिक पोस्ट में उठाई थी, यानी स्ट्रिंग को सभी संभावित SFM के चारों ओर देखने और अंतिम विराम चिह्न के बाद के अगले शब्द को देखने के लिए...

English से मशीन-अनुवादित
द्वारा (175 अंक)

यह आपके ईमेल का एक पार्श्व उत्तर है, आपके प्रश्न का उत्तर नहीं, बल्कि आपके प्रक्रिया पर एक टिप्पणी है।

मेरे अनुभव में, अनुप्रेक्षण (transliteration) कभी भी वह सरल एक-बार का घटनाक्रम नहीं होता जिसे हम सभी चाहते हैं, और Paratext में अनुप्रेक्षण टूल का उपयोग करने का महत्व है। आपको अनुप्रेक्षित (transliterated) परियोजना पर सभी Paratext जाँचें (checks) फिर से चलाना होगा और आपको ऐसे मुद्दे मिलेंगे जो आपको अपने कन्वर्टर और स्रोत पाठ को कई बार संपादित करने के लिए मजबूर करेंगे। इसके अलावा, TecIt मैपिंग RegEx से बहुत मजबूत और लचीली है और इसमें आपकी वर्ण-महत्व (capitalization) की आवश्यकता को स्वयं में शामिल किया जा सकता है। Paratext के बाहर (जब यह संभव नहीं था) और Paratext के भीतर प्रक्रिया करने के बाद, मैं आपको Paratext के भीतर इसे करने की जोर-जोर से सलाह देता हूँ।

English से मशीन-अनुवादित

धन्यवाद Shegnada! हाँ, मैं पूरी तरह से सहमत हूँ कि कोई भी अनुप्रेक्षण प्रोटोकॉल परिपूर्ण परिणाम नहीं देगा, और हमें Paratext में जाँचें (checks) चलाने की आवश्यकता होगी।

हम अनुप्रेक्षण (transliteration) के लिए TecKit का उपयोग कर रहे हैं, लेकिन यह अपर्याप्त है क्योंकि अरबी से लैटिन लिपि में जाने के दौरान कुछ अस्पष्टताएँ (ambiguties) हैं जिन्हें (अभी तक) एल्गोरिदम द्वारा हल नहीं किया जा सकता है। इसलिए हमें प्रारंभिक अनुप्रेक्षण (initial transliteration) के लिए किसी प्रकार के शब्दकोश/शब्द सूची आधारित दृष्टिकोण का उपयोग करना होगा।

यह विशेष नामों (proper names) के वर्ण-महत्व (capitalization) को हल करता है। लेकिन हम वाक्यों, उद्धरणों, आदि के प्रारंभ के लिए वर्ण-महत्व (capitalization) अनुबंधों को जोड़ने के लिए एक स्वतः (automated) तरीके की तलाश में हैं।

मेरा उम्मीद है कि यह स्पष्ट करता है!

English से मशीन-अनुवादित
0 वोट

आप RegexPal में अक्षरों को वर्ण-महत्व (capitalize) करने के लिए निम्नलिखित कोड का उपयोग कर सकते हैं:
^^^
यहाँ एक regex है जो [.?!] के बाद वाक्य के पहले अक्षर को वर्ण-महत्व (capitalize) करेगा। यह मध्यवर्ती बंद उद्धरण चिह्नों, अनुच्छेद, कविता या सूची मार्कअप, खाली पंक्तियों, पद संख्याओं, और वाक्य प्रारंभिक उद्धरण चिह्नों की अनुमति देता है। यह \s और \p के बाद भी वर्ण-महत्व (capitalizes) करता है, जो अध्याय प्रारंभ में या अंतिम विराम चिह्न के बिना शीर्षक के बाद हो सकता है। आपको ?" या !" के बाद के शब्दों को मैनुअल रूप से जाँचने की आवश्यकता होगी, कभी-कभी इन्हें वर्ण-महत्व (capitalized) किया जाता है और कभी-कभी नहीं।
खोजें (Find):
(?<=([.?!][”’]*(\s+\\(b|p|q|li))*|\\(p|s)?)(\s+\\v\s\S+)?\s+[“‘]*)(\p{Ll})
बदलें (Replace):
^^^\6
यह कोड \li से चिह्नित सूचियों और \q से चिह्नित कविताओं में शब्दों को वर्ण-महत्व (capitalize) करेगा। यदि आप अधिक जटिल मार्कअप का उपयोग करते हैं: फुटनोट, क्रॉस-रेफरेंस, \q1\q2 \li1 \li2 \pm \pc \qc \qr आदि, तो आपको समायोजन करने की आवश्यकता होगी।
नोट कर्ली उद्धरण चिह्न (Curly quotes) दर्पण नहीं करते हैं, इसलिए उन्हें RTL से LTR में एन्कोडिंग कन्वर्टर अनुप्रेक्षण (transliteration) में उल्टा करना होगा।

English से मशीन-अनुवादित
द्वारा (1.8k अंक)
फिर से दिखाया गया
0 वोट

CrazyRocky, वर्ण-महत्व (capitalization) के लिए इस RegEx के लिए बहुत देर से धन्यवाद। (लंबे विराम के बाद अंततः इस कार्य पर लौट रहा हूँ।) मैंने स्ट्रिंग को आपके सुझाव के अनुसार संशोधित करने में सक्षम था ताकि हमारे उद्धरण चिह्नों « » के साथ-साथ \q1 और \q2 मार्करों को समायोजित किया जा सके, और यह बहुत अच्छा काम करता है।

आज मैंने देखा कि लूक 2:49-50 में बंद विराम चिह्न और बंद उद्धरण चिह्न के बीच एक फुटनोट है, जिससे v. 50 के पहले शब्द के वर्ण-महत्व (capitalization) को रोकने का प्रतीत होता है:

image

फुटनोट में उद्धरण के अंतिम वाक्यांश का एक वैकल्पिक अनुवाद शामिल है। क्या आप खोज स्ट्रिंग को संशोधित करने या फुटनोट को हटाने का सुझाव देंगे?

English से मशीन-अनुवादित
द्वारा (175 अंक)

CrazyRocky, मैं इस सप्ताह अपने डेस्क से दूर हूँ, लेकिन आपको बताना चाहता हूँ कि आप एक बैच फ़ाइल (हर 66+ पुस्तकों में से प्रत्येक के लिए एक लूप के साथ) का उपयोग करके एक बाहरी प्रक्रिया चला सकते हैं जो केवल विशिष्ट मार्करों को रूपांतरित करती है, या तो CC या TECkit मैपिंग का उपयोग करके। एकमात्र चेतावनी यह है कि आपको Paratext में अध्याय बदलने की आवश्यकता होगी (जो चलाते समय खुला भी रह सकता है) ताकि प्रदर्शित पाठ को ताज़ा/अपडेट किया जा सके।
मेरा अनुभव है कि यह तेज़ और विश्वसनीय है।
मैं सप्ताह के अंत में आपको एक नमूना भेज सकता हूँ, लेकिन मैं अनुमान लगा रहा हूँ कि आपके पास पहले से ही ज्ञान है। :slight_smile:
आशीर्वाद,
Mark

English से मशीन-अनुवादित

संबंधित प्रश्न

0 वोट
1 उत्तर 205 व्यूज़
We have a user who is doing a transliteration from one script in a language to another script in the same language. ... has the reference number of PTXS-17276 Thank you, MSEAIT/LT
MSEAIT_LT 478 पूछा गया अगस्त 3, 2018
0 वोट
3 उत्तर 459 व्यूज़
I am trying to navigate my first transliteration project. Background information The team is starting typesetting, and has ... are supposed to work and what behavior is expected.
[Moderator]
dhigby
1.3k
पूछा गया अगस्त 3, 2018
0 वोट
3 उत्तर 816 व्यूज़
मैं एक .tec एन्कोडिंग कन्वर्टर को परिष्कृत करने की कोशिश कर रहा हूँ ताकि यह दाएं-से-बाएं (Right-to-Left) भाषा ... RegexPal से परिचित नहीं हैं। इसे कैसे करने के लिए कोई सुझाव?
DVM 175 पूछा गया मार्च 17, 2021
0 वोट
1 उत्तर 176 व्यूज़
I have the main vernacular project in a special script and also a Romanized version using transliteration. When trying to do ... you want to do spell checking on the primary text?
anon650332 163 पूछा गया दिसंबर 31, 2018
0 वोट
4 उत्तर 344 व्यूज़
As I am gradually getting more involved in language and dialect adaptations, I keep thinking about what might be the best ... a discussion on this topic with pros and cons, etc.
anon233143 252 पूछा गया अक्टूबर 31, 2018
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
Very truly I tell you, whoever accepts anyone I send accepts me; and whoever accepts me accepts the one who sent me.
John 13:20
3,045 प्रश्न
6,005 उत्तर
5,671 टिप्पणियाँ
2,026 उपयोगकर्ता