0 वोट
539 व्यूज़

नमस्ते,

मैं बड़े अक्षरों (capitalization) के गलत उपयोग की जाँच कर रहा था। विशेष रूप से, मुझे पता है कि अनुवादकों ने कभी-कभी गलती से “LORD” की जगह \nd Lord\nd* लिखा है। लेकिन मुझे आश्चर्य हुआ कि Run Basic Checks…>Capitalization ने सभी अक्षरों को बड़े (all caps) में लिखे हुए उदाहरणों को पकड़ा नहीं।

यह नियमित अभिव्यक्ति (regex) किसी भी दो आस-पास के बड़े अक्षरों को खोजेगी, लेकिन यह बहुत सारा अनावश्यक डेटा (noise) भी लौटाती है। उदाहरण के लिए, पुस्तक के नाम की संक्षिप्त रूप, भाषा कोड, और इमेज फ़ाइल के नाम।
regex:\w*[A-ZĆÄÏÜ]\w*[A-ZĆÄÏÜ]\w
(जिन लोगों को regex के बारे में जानकारी नहीं है, [A-ZĆÄÏÜ] का अर्थ है A से Z तक का कोई भी अक्षर, या Ć, Ä, Ï, और Ü जैसे विशेष अक्षरों में से कोई भी - केवल बड़े अक्षरों में)

मैंने बड़े अक्षरों के नियमों को बदलने की जगह खोजी, लेकिन मैंने केवल मिश्रित बड़े अक्षरों वाले शब्दों को स्वीकार करने या अस्वीकार करने की जगह पाई (जिसमें ALL CAPS वाले शब्द शामिल नहीं होते)।

मैंने Paratext की सहायता फ़ाइलों और इस फ़ोरम में भी खोज की, लेकिन मुझे कोई जानकारी नहीं मिली।

क्या वर्तमान में ALL CAPS में लिखे शब्दों को खोजने का कोई आसान तरीका है? यदि नहीं, तो क्या इस सुविधा को जोड़ा जा सकता है? शायद यह मिश्रित बड़े अक्षरों (mixed caps) के खोज परिणामों में दिखाई दे सकता है, भले ही तकनीकी रूप से वे सभी बड़े अक्षरों में हों। या, शायद यह बेहतर होगा कि उनके लिए एक अलग श्रेणी हो।

बहुत-बहुत धन्यवाद!

English से मशीन-अनुवादित
Paratext में द्वारा (379 अंक)
फिर से दिखाया गया | 539 व्यूज़

6 उत्तर

0 वोट
सर्वोत्तम उत्तर

मैं regex का उपयोग करना पसंद करता हूँ, लेकिन यह हमेशा मेरा सिर घुमा देता है। यहाँ वह तरीका है जिससे मैंने इसे तोड़ने (break down) का प्रबंधन किया है, किसी भी व्यक्ति के लिए जो रुचि रखता है। मैंने सब कुछ संरेखित (aligned) रखने के लिए खाली स्थान के रूप में अंडरस्कोर (underscores) का उपयोग किया है।

उस regex का विभाजन जो उन शब्दों को खोजता है जो ALL CAPS में हैं और जिनसे पहले कुछ विशिष्ट मार्कर नहीं हैं।
(?<!\\(id|h|toc|mt|fig).*)\b\p{Lu}+\b

  1. शब्द सीमा (word boundary) की खोज करें
    __________________________\b_________
  2. शब्द की शुरुआत में किसी भी बड़े अक्षर की खोज करें
    __________________________\b\p{Lu}___
  3. शब्द की शुरुआत से शुरू होकर एक या अधिक बड़े अक्षरों की खोज करें
    __________________________\b\p{Lu}+__
  4. किसी भी लंबाई के ऐसे शब्द की खोज करें जो सभी बड़े अक्षरों में हों
    __________________________\b\p{Lu}+\b
  5. एक all-caps शब्द को खोजने के बाद, जाँचें कि क्या उसके ठीक पहले कोई वैकल्पिक समूह (optional grouping) था
    (?_______________________)\b\p{Lu}+\b
  6. एक all-caps शब्द को खोजने के बाद, सुनिश्चित करें कि उसके ठीक पहले कोई बैकस्लैश (backslash) नहीं था
    (?<!\\___________________)\b\p{Lu}+\b
  7. एक all-caps शब्द को खोजने के बाद, सुनिश्चित करें कि उसके ठीक पहले \id या \h या \toc या \mt या \fig नहीं था
    (?<!\\(id|h|toc|mt|fig)__)\b\p{Lu}+\b
  8. एक all-caps शब्द को खोजने के बाद, सुनिश्चित करें कि पंक्ति के पहले कहीं भी \id या \h या \toc या \mt या \fig नहीं था
    (?<!\\(id|h|toc|mt|fig).*)\b\p{Lu}+\b

मेरे व्यक्तिगत विचार से, मैं |mt को हटा दूँगा क्योंकि मैं पुस्तक के शीर्षकों में भी all caps की जाँच करना चाहता हूँ।

मेरे मन में यह सवाल आता है, यदि कोई आकृति (figure) श्लोक की शुरुआत में या बीच में सम्मिलित की जाए तो क्या होगा? इस regex द्वारा ALL CAPS में लिखे बाद के शब्द पकड़े नहीं जाएंगे।

(\\fig(.*?)\\fig\*) पूरा fig टैग पकड़ता है, लेकिन उसने मदद नहीं की। यह वह है जिससे मैं आगे बढ़ा:
(?<!\\(id|h|toc).*)\b\p{Lu}+\b.*?(?!\\fig\*)

यहाँ विभाजन है:

  1. एक all-caps शब्द को खोजने के बाद, सुनिश्चित करें कि पंक्ति के पहले कहीं भी \id या \h या \toc नहीं था।
    (?<!\\(id|h|toc).*)\b\p{Lu}+\b______________
  2. एक all-caps शब्द को खोजने के बाद, सुनिश्चित करें कि पंक्ति के पहले कहीं भी \id या \h या \toc नहीं था। फिर किसी भी संख्या के अक्षरों को आगे देखें।
    (?<!\\(id|h|toc).*)\b\p{Lu}+\b.*?___________
  3. एक all-caps शब्द को खोजने के बाद, सुनिश्चित करें कि पंक्ति के पहले कहीं भी \id या \h या \toc नहीं था। फिर किसी भी संख्या के अक्षरों को आगे देखें ताकि यह सुनिश्चित हो कि \fig* पंक्ति के बाद कहीं भी नहीं मिला।
    (?<!\\(id|h|toc).*)\b\p{Lu}+\b.*?(?!\\fig\*)

किसी कारण से, इस regex ने “\mt1 GÉNESIS” को पकड़ा नहीं। इसका कारण क्या हो सकता है, कोई विचार?

English से मशीन-अनुवादित
द्वारा (379 अंक)
फिर से दिखाया गया

एक \fig कभी भी श्लोक या अनुच्छेद के अंदर नहीं होना चाहिए क्योंकि यह आपके आउटपुट सॉफ्टवेयर के आधार पर टेक्स्ट और फ़ॉर्मेटिंग को सभी तरह से खराब तरीकों से तोड़ देगा। इसे अनुच्छेद के अंत में रखा जाना चाहिए। बेशक, हम अक्सर regex चलाते हैं जब टेक्स्ट विशेष रूप से साफ़ नहीं होता है, लेकिन मैं उस प्रतिबंध का उल्लेख करना चाहता था।

English से मशीन-अनुवादित
0 वोट

नमस्ते anon094061.
आप Paratext सर्च इंजन में निम्नलिखित नियमित अभिव्यक्ति (regular expression) डाल सकते हैं ताकि वे शब्द देख सकें जो सभी बड़े अक्षरों में हैं: regex:\b\p{Lu}+\b

जहाँ:
“regex:” वह कमांड है जो Paratext को बताता है कि यह एक नियमित अभिव्यक्ति है।
“\b” शब्द सीमा (Word boundary) है
“\p{Lu}” बड़े अक्षरों (uppercase letters) को संकेत करता है
“+” संकेत करता है कि ऊपर दी गई सूत्र एक या अधिक बार है।
अर्थात्, यह उन लगातार बड़े अक्षरों को खोजेगा जिनके सिरों पर शब्द विभाजक (word delimiter) हैं, जैसे कि खाली स्थान (spaces) या विराम चिह्न (commas)।


वास्तव में, Mixed capitalization inventory… असामान्य संयोजनों को विचार करता है, इसलिए यह सभी बड़े अक्षरों में लिखे शब्दों की सूची यहाँ नहीं देता।

English से मशीन-अनुवादित
द्वारा (973 अंक)
फिर से दिखाया गया
0 वोट

यह थोड़ा अधिक जटिल है, लेकिन आप इसका उपयोग भी कर सकते हैं:
regex:(?<!\\(id|h|toc|mt|fig).*)\b\p{Lu}+\b

यह उन विशिष्ट मार्करों (markers) के सामग्री को नजरअंदाज करने के लिए है जिन्हें हम पहले से ही बड़े अक्षरों में होने के रूप में जानते हैं, जैसे कि “id” या “mt”।
आप बड़े कोष्ठक के अंदर “|” और मार्कर का नाम जोड़कर अन्य मार्करों को बाहर रखने के लिए जोड़ सकते हैं।

English से मशीन-अनुवादित
द्वारा (973 अंक)
फिर से दिखाया गया

वाह, यह वास्तव में बहुत अच्छा है! anon689242 को बहुत-बहुत धन्यवाद - यह बिल्कुल वही है जिसकी मुझे ज़रूरत है।

मुझे लगता है कि यह जाँच “Assignments and Progress” के लिए एक शानदार जोड़ होगी।

English से मशीन-अनुवादित
0 वोट

अह, मुझे अभी-अभी एहसास हुआ कि मेरा \fig \fig* समाधान उस श्लोक में होने वाले ALL CAPS परिणामों को फ़िल्टर कर देता है जो आकृति (figure) से पहले होता है। इसलिए, कुछ अधिक उन्नत की ज़रूरत है। मैं यह शोध करूँगा कि regex को एक समूह को नजरअंदाज करने के लिए कैसे बताया जाए।

English से मशीन-अनुवादित
द्वारा (379 अंक)
फिर से दिखाया गया
+1 मत

मैंने पाया है कि नियमित अभिव्यक्तियों (regular expressions) के विश्लेषण में https://regex101.com/ उपयोगी है, हालाँकि मैं समझता हूँ कि इंटरनेट कनेक्शन कुछ लोगों के लिए एक समस्या हो सकती है। मुझे पक्का नहीं है कि regex का कौन सा “flavor” Paratext द्वारा उपयोग किए जाने वाले से मेल खाता है।

English से मशीन-अनुवादित
द्वारा (296 अंक)

मेरी नोट्स के अनुसार, Paratext 9, RegEx Pal, PrintDraft Changes.txt और DBLchanges.txt सभी उपयोग करते हैं
C# (NET 2.0-4.8.1 & .NET Core 1.0-3.0)

मुझे इसकी पुष्टि होने में खुशी होगी।

English से मशीन-अनुवादित
0 वोट

वास्तव में अच्छे अवलोकन। @Shegnada और @anon806807 को धन्यवाद।

मैं बस यह सोच रहा था कि हमें शायद इस regex से आकृतियों (figures) के alt टेक्स्ट की जाँच भी करनी चाहिए। मुझे लगता है कि केवल इमेज फ़ाइल का नाम ही समस्या पैदा कर रहा है, तो हम क्यों नहीं बस उसे फ़िल्टर कर दें? कुछ ऐसा
\b.*\.(TIF|GIF|JPG|JPEG)\b?

शायद एक नेगेटिव लुकएहैड (negative lookahead) के साथ? कुछ ऐसा?

(?:\b.*\.(TIF(F)|GIF|JP(E)G|PNG|EPS|BMP|WEBP)\b)

इसे CN01628B.tif जैसे कुछ को भी नजरअंदाज करना चाहिए।

मैं इसे लिखते समय अपने कंप्यूटर पर नहीं बैठा हूँ, लेकिन मैं उम्मीद करता हूँ कि मैं जल्द ही इसकी परीक्षण करूँगा।

English से मशीन-अनुवादित
द्वारा (379 अंक)
फिर से दिखाया गया

संबंधित प्रश्न

0 वोट
3 उत्तर 228 व्यूज़
(Paul Unger writes) I found a topic in the PT Supporters e-mail list that held promise for how to do this. It ... track. Does anyone know what I need to put for small caps?
गुमनाम पूछा गया अप्रैल 10, 2015
Paratext में
0 वोट
2 उत्तर 309 व्यूज़
जिस टीम की मैं सहायता कर रहा हूँ, वे चाहते हैं कि परमेश्वर का नाम सभी अक्षरों में बड़े अक्षरों (all caps) ... अक्षरों में प्रदर्शित करने के लिए Changes.txt में क्या डालना चाहिए?
Ruth Mathys 153 पूछा गया अक्टूबर 25, 2023
PTXprint में
0 वोट
6 उत्तर 810 व्यूज़
नमस्ते, मेरे पास शब्दसूची (wordlist) में शब्दों को दलाल रूप से (bulk) गलत चिह्नित करने के बारे में एक प्रश्न है। हम न्यू ... , तो यह अब इसे संभव बनाने का अनुरोध है! धन्यवाद, Lizzie
anon859055 130 पूछा गया जुलाई 14, 2021
0 वोट
6 उत्तर 450 व्यूज़
मैं चाहता हूँ कि \nd स्टाइल small caps में हो। जब मैं PT से RTF में निर्यात (export) करता हूँ, तो \nd अंडरलाइन ... नहीं दिखता। small caps प्राप्त करने के लिए मैं क्या कर सकता हूँ?
anon054969 123 पूछा गया फ़रवरी 20, 2021
PTXprint में
0 वोट
0 उत्तर 162 व्यूज़
The KJVA uses \sc markup for signs and inscriptions like \sc King of the Jews\sc*. \sc stands ... Scripture Typesetting trainer & Regular Expression Specialist Dallas TX aDllas TX
anon467281 571 पूछा गया मार्च 15, 2019
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
Very truly I tell you, whoever accepts anyone I send accepts me; and whoever accepts me accepts the one who sent me.
John 13:20
3,048 प्रश्न
6,007 उत्तर
5,672 टिप्पणियाँ
2,027 उपयोगकर्ता