0 वोट
725 व्यूज़

मैं अनुवाद भाषाओं के लिए आकृतिविज्ञान (morphological) विभाजन डेटा की खोज में हूँ, चाहे वे व्यापक संचार की भाषाएं हों या अनुवाद भाषाएं।

उदाहरण के लिए, अंग्रेज़ी में, मैं “unthinkable” जैसे शब्द को [un [[think] able]] या कम से कम un-think-able में तोड़ना चाहूंगा।

मुझे FLEx में पाई जाने वाली जानकारी के प्रकारों के बारे में पता है, लेकिन मैं यह जानना चाहता हूँ कि क्या Paratext में उपलब्ध किसी जांच टूल में यह जानकारी ऐसे तरीके से उपलब्ध है जो उन भाषाओं के लिए उपयोगी हो जिनके लिए FLEx मॉडल उपलब्ध नहीं हैं।

क्या यह जानकारी वहाँ उपलब्ध है?

धन्यवाद!

Jonathan+Robie

English से मशीन-अनुवादित
Paratext में द्वारा (448 अंक)
फिर से दिखाया गया | 725 व्यूज़

5 उत्तर

0 वोट
सर्वोत्तम उत्तर

फ़ाइल में XML इस तरह दिखता है (पढ़ने में थोड़ा आसान हो सकता है):

  <Entry Word="heals">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:s</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healing">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heal">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healed">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="headed">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heading">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>

ध्यान दें कि प्रोजेक्ट में इस जानकारी का होना इस बात पर निर्भर करता है कि किसी ने Wordlist या Interlinear में आकृतिविज्ञान (morphology) का विभाजन किया हो।

English से मशीन-अनुवादित
द्वारा [Expert]
(16.7k अंक)

फिर से दिखाया गया

क्या यह सब हाथ से किया जाता है, या क्या NLP का उपयोग करके एक “पहली अनुमान” (first guess) बनाने का कोई तरीका है?

English से मशीन-अनुवादित
0 वोट

यदि Paratext प्रोजेक्ट में शब्दों को Wordlist में मॉर्फ़ीम्स (morphemes) में तोड़ दिया गया है, तो वह विभाजन WordAnalyses.xml फ़ाइल में सहेजा जाता है। क्या यह कुछ ऐसा है जिसका आप उपयोग कर सकते हैं? मैंने एक स्क्रीनशॉट संलग्न करने की कोशिश की है, लेकिन मुझे पक्का नहीं है कि वह सही ढंग से आ रहा है। उदाहरण के लिए, शब्द ācāmciintōōsii में एक प्रत्यय (prefix) और 3 उपसर्ग (suffixes) हैं: ā-cām-ciin-tōōs-ii।

Iver+Larsen

English से मशीन-अनुवादित
द्वारा (869 अंक)
फिर से दिखाया गया
0 वोट

बिल्कुल सही। यह ठीक वही है जिसकी मुझे आवश्यकता है।

धन्यवाद!

Jonathan+Robie

English से मशीन-अनुवादित
द्वारा (448 अंक)
0 वोट

यह हाथ से किया जाता है, लेकिन Paratext आकृतिविज्ञान (morphology) कैसे किया जाता है, यह सीखने की कोशिश करता है, इसलिए कुछ समय बाद “हाथ से” किया गया काम बस Paratext के अनुमान को स्वीकार करना हो सकता है। आप Wordlist या Interlinear में इस व्यवहार को देख सकते हैं।

संपादन: तो मेरे ऊपर दिए गए XML उदाहरण में, मैं “healed” को “heal +ed” के रूप में दर्ज कर सकता हूँ और फिर “healing”
को “heal +ing” के रूप में, जिससे Paratext यह अनुमान लगा सकता है कि “heals” “heal +s” है और “headed” “head +ed” है, आदि…

English से मशीन-अनुवादित
द्वारा [Expert]
(16.7k अंक)

फिर से दिखाया गया

Hyphenation Tool में, हाथ से काम अनुमानों को सही मानकर स्वीकार करने और गलत अनुमानों को सही करने से शुरू होता है। हालाँकि, एक बार जब आप देखते हैं कि Paratext सही अनुमान लगा रहा है, तो आपको सही अनुमानों को स्वीकारते रहने की आवश्यकता नहीं है। यह ठीक चल रहा है। मेरा अनुमान है कि Morphology Tool भी इसी तरह है, अपने सबसे सामान्य उपसर्गों वाले शब्दों के लिए फ़िल्टर करके इसे प्रशिक्षित करना शुरू करें और एक बार जब वह उन्हें सही ढंग से अनुमान लगा ले, तो दूसरे के लिए फ़िल्टर करें जब तक कि आप अपने ज्ञात उपसर्गों के साथ निपट न जाएं और गलत अनुमान न देखें। Paratext के “अहा मोमेंट” को देखना बहुत रिवॉर्डिंग है जब वह सही होने लगता है।

एक बार में कई को स्वीकार करने से आपके विकल्पों को पुष्टि करने में कुछ लाभ हो सकता है और दोनों टूल्स आपको Shift Select का उपयोग करके कई इंस्टेंस चुनने और फिर मेनू के माध्यम से उन्हें सभी स्वीकार करने की अनुमति देते हैं। यह क्लिक-क्लिक करते हुए नींद आने से बेहतर है।

आशीर्वाद,

English से मशीन-अनुवादित
0 वोट

क्या किसी को इस बारे में अच्छा अनुमान है कि एक अनुवाद को अच्छी तरह से कवर करने वाली आकृतिविज्ञान (morphology) बनाने में कितना काम लगता है? किस स्तर की कौशल आवश्यकता होती है?

English से मशीन-अनुवादित
द्वारा (448 अंक)

Johnathan,

प्रोजेक्ट के सभी शब्दों को विभाजित करने में काफी समय लगता है। उन लोगों के लिए जो यह करना चाहते हैं, मैं Wordlist टूल से शुरू करने की सलाह देता हूँ, Interlinear से नहीं। इससे समान मूल या तना (stem) वाले शब्द एक साथ आ सकते हैं। मैं सूची को सबसे सामान्य क्रियाओं के लिए क्रमबद्ध करूंगा और कुछ बहुत ही सामान्य क्रिया मूल/तनों के लिए सभी सतह रूपों (surface forms) का विश्लेषण करूंगा। इससे आप Paratext के पार्सर को आकृतिविज्ञान सिखाएंगे और यह अन्य क्रियाओं के लिए बहुत तेजी से सही अनुमान लगाना शुरू कर देगा। सही अनुमानित विश्लेषण को स्वीकार करना हाथ से विश्लेषण करने की तुलना में बहुत तेज़ है, इसलिए Paratext को सही ढंग से पार्स करने के लिए सिखाना वह जगह है जहां सबसे तेज़ लाभ प्राप्त किए जा सकते हैं। एक बार जब यह अच्छी तरह से अनुमान लगाने लगे, तो आप प्रोजेक्ट इंटरलिनियराइज़र का उपयोग करने और श्लोक-दर-श्लोक काम करने के लिए स्विच कर सकते हैं। यदि आप यह करना चाहते हैं, तो मैं यह भी सलाह दूंगा कि आप Paratext को Flex से लिंक न करें। ऐसा करने से यह प्रक्रिया जटिल हो जाती है, जब तक कि आप Flex में Ample पार्सर को सही ढंग से सेटअप करने के लिए तैयार न हों, जो कि अधिकांश भाषाओं के लिए बहुत समय लेने वाला होता है।

English से मशीन-अनुवादित

क्या “प्रोजेक्ट के सभी शब्दों को विभाजित करने में काफी समय” सप्ताहों की बात है? महीनों की? और भी अधिक?

English से मशीन-अनुवादित

यदि प्रोजेक्ट में 20,000 अद्वितीय शब्द हैं और यदि कोई व्यक्ति जो भाषा की संरचना को अच्छी तरह से जानता है, उस पर काम कर रहा है, तो वे आसानी से 2 शब्द / मिनट का विभाजन कर सकते हैं। पहले दिन के अंत तक उन्होंने लगभग 1,000 शब्दों का विभाजन कर लिया होगा। उस बिंदु पर Paratext के पास बुद्धिमान अनुमान लगाने शुरू करने के लिए पर्याप्त डेटा होना चाहिए, इसलिए दूसरे दिन वे आसानी से 4 शब्द / मिनट कर सकते हैं, जिससे वे 3,000 शब्दों तक पहुंच जाएंगे। वहां से आगे उन्हें 8 शब्द / मिनट करने में सक्षम होना चाहिए, जिससे प्रतिदिन 4,000 शब्द और होंगे।

सात कार्य दिवस।

English से मशीन-अनुवादित

यह आकृतिविज्ञान (morphology) पर निर्भर करता है और यदि कोई व्यक्ति यह समझता है कि मॉर्फ़ीम्स क्या हैं। अच्छी बात (इस स्थिति में) यह है कि Paratext को यह जानने की आवश्यकता नहीं है कि एक मॉर्फ़ीम का क्या अर्थ है, या यह कि यह किसी अन्य मॉर्फ़ीम का एल्लोमॉर्फ़ है। Paratext को बस यह जानने की आवश्यकता है कि क्या एक वर्ण श्रृंखला (character string) एक मॉर्फ़ीम है या नहीं।
तो यदि आप किसी ऐसे व्यक्ति को खोज सकते हैं जो मॉर्फ़ीम की पहचान करने का तरीका जानता है, तो मुझे लगता है कि वे एक सप्ताह में NT (नया नियम) में विभाजन का अनुमान लगाने में अधिकांश समय सही हो सकते हैं। उन्हें उस विधि का उपयोग करना होगा जो मैंने पहले वर्णित की है। संभवतः पूरे NT को एक महीने में पूरा किया जा सकता है, लेकिन चूंकि दिन-प्रतिदिन इस प्रकार का काम करना चुनौतीपूर्ण है, मैं समय को दोगुना कर दूंगा और मानसिक गलतियों को कम करने के लिए बहुत सारे ब्रेक शेड्यूल कर दूंगा। यदि व्यक्ति को आकृतिविज्ञान के बारे में बहुत सारे सवाल हों जैसे वे कार्य में उतार हों, तो यह भी अधिक समय लेगा ताकि वे आकृतिविज्ञान के उन हिस्सों को हल कर सकें जो वे नहीं जानते। Paratext पैटर्न प्रस्तुत करना शुरू कर देगा जो वास्तव में वहां हो सकते हैं या नहीं, और व्यक्ति को कभी-कभी Paratext को “नहीं” कहने में सक्षम होना होगा।

English से मशीन-अनुवादित

मैं एक ऐसे भाषा में काम कर रहा हूँ जिसमें जटिल आकृतिविज्ञान (morphology) है, इसलिए मैंने दिनों तक तने (stem) और कई उपसर्गों में शब्दों को विभाजित करने में बिताया है। हमने एक संबंधित भाषा में AMPLE सेटअप किया और CARLA का उपयोग करके एक अन्य संबंधित भाषा के लिए अनुकूलन किया, लेकिन वह Flex और Paratext के आगमन से पहले था। इसका केवल ऐतिहासिक महत्व है।

यह बात चीतों को जटिल करती है कि कई उपसर्ग तने की वर्तनी बदल देते हैं। मैं इस आकृतिविज्ञान विश्लेषण करने के कम से कम दो लाभ देखता हूँ। यह मुझे उन शब्दों को पहचानने में मदद करता है जिन्हें अनुवादक ने सही रूप से लिखा हुआ चिह्नित किया है जबकि वास्तव में यह सही नहीं है। जब मैं उन शब्दों के लिए फ़िल्टर करता हूँ जिनका कोई स्वीकृत आकृतिविज्ञान नहीं है, तो मैं अक्सर गलत वर्तनी वाले शब्द पा सकता हूँ। एक अन्य लाभ यह है कि मैं बाइबलिकल टर्म्स टूल में तने (stem) विकल्प का उपयोग कर सकता हूँ। हमारे साथ काम करने वाले कोई भी अनुवादक इस कार्य के लिए पर्याप्त आकृतिविज्ञान ज्ञान नहीं रखता।

Iver+Larsen

English से मशीन-अनुवादित

यह आकृतिविज्ञान (morphology) की जटिलता पर निर्भर करता है। जिस पर मैं काम कर रहा हूँ, उसमें बाइबल में लगभग 50,000 अद्वितीय शब्द होंगे। मैं एक-एक किताब लेता हूँ, और बाइबल के दो-तिहाई हिस्से को पूरा करने के बाद भी, मैं ऐसे शब्द पाता हूँ जिन्हें प्रोग्राम सही ढंग से पार्स नहीं कर पाता।

Iver+Larsen

English से मशीन-अनुवादित

संबंधित प्रश्न

+1 मत
3 उत्तर 324 व्यूज़
सभी को नमस्ते, कुछ समय पहले मैंने पूछा था कि क्या आप, या आपका कोई परिचित, Paratext में बैक ट्रांसलेशन (Back ... [Email Removed] बहुत-बहुत धन्यवाद, dcb . [Email Removed]
dcb 194 पूछा गया अक्टूबर 7, 2020
Paratext में
0 वोट
1 उत्तर 195 व्यूज़
Partnership for Applied Biblical NLP में, हम शब्द विभाजन (word segmentation) के लिए एक सामान्य कार्य (shared task) परिभाषित ... लिए डेटा है, तो कृपया मुझे बताएं! [Email Removed]
Jonathan Robie 448 पूछा गया जुलाई 27, 2022
Paratext में
0 वोट
1 उत्तर 318 व्यूज़
I'm helping a user with a consultant notes problem where when she moves through many of her notes she gets this box that ... report with a code of PTXS-17507 Thank you, MSEAIT/LT
MSEAIT_LT 478 पूछा गया सितंबर 4, 2018
Paratext में
0 वोट
0 उत्तर 159 व्यूज़
As resources have been moved to the DBL for Paratext 8, many now have different language identifiers than they did in ... do this using Greek as the test case. [Link Removed]
[Expert]
Jeff_Shrum
2.9k
पूछा गया नवंबर 29, 2017
0 वोट
1 उत्तर 313 व्यूज़
A project I'm working with has extensive footnotes including Greek, Hebrew, Arabic and English words inside of them ... it possible to exclude footnotes from these sorts of checks?
mnjames 1.9k पूछा गया जुलाई 20, 2018
Paratext में
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
Very truly I tell you, whoever accepts anyone I send accepts me; and whoever accepts me accepts the one who sent me.
John 13:20
3,047 प्रश्न
6,007 उत्तर
5,672 टिप्पणियाँ
2,027 उपयोगकर्ता