0
725 次瀏覽

我正在尋找翻譯語言的形態分節(morphological segmentation)數據,包括通用語言(languages of wider communication)和翻譯語言。

舉例來說,在英語中,我希望將像 “unthinkable” 這樣的詞拆解為 [un [[think] able]],或者至少拆為 un-think-able。

我知道 FLEx 中包含這類資訊,但我想知道 Paratext 中的任何檢查工具是否以對沒有 FLEx 模型的語言有用的方式包含這些資訊。

這些資訊存在嗎?

謝謝!

Jonathan+Robie

機器翻譯自 English
Paratext (448 點) 提出
已重新顯示 | 725 次瀏覽

5 個回答

0
最佳回答

以下是該檔案中 XML 的外觀(可能稍微容易閱讀一些):

  <Entry Word="heals">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:s</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healing">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heal">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healed">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="headed">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heading">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>

請注意,專案中是否擁有這些資訊,取決於是否有人在 Wordlist(詞彙表)或 Interlinear(逐字對照)中進行了形態拆解。

機器翻譯自 English
[Expert]
(16.7k 點) 提出

已重新顯示

這全是手動完成的嗎?還是有辦法使用 NLP(自然語言處理)來建立「初步猜測」?

機器翻譯自 English
0

如果 Paratext 專案中的詞語已在 Wordlist(詞彙表)中被拆解為詞素(morphemes),那麼拆解結果會儲存在 WordAnalyses.xml 檔案中。這是否是您能使用的?我嘗試附加一張螢幕截圖,但不確定它是否能正常顯示。例如,詞語 ācāmciintōōsii 有一個前綴和三個後綴:ā-cām-ciin-tōōs-ii。

Iver+Larsen

機器翻譯自 English
(869 點) 提出
已重新顯示
0

完美。這正是我需要的。

謝謝!

Jonathan+Robie

機器翻譯自 English
(448 點) 提出
0

這是手動完成的,但 Paratext 會嘗試學習形態是如何運作的,因此一段時間後,「手動」工作可能只是接受 Paratext 的猜測。您可以在 Wordlist(詞彙表)或 Interlinear(逐字對照)中看到這種行為。

編輯:所以在我上面的 XML 範例中,我可能會將 “healed” 輸入為 “heal +ed”,然後將 “healing”
輸入為 “heal +ing”,這可能使 Paratext 猜測 “heals” 是 “heal +s”,而 “headed” 是 “head +ed”,等等……

機器翻譯自 English
[Expert]
(16.7k 點) 提出

已重新顯示

在 Hyphenation Tool(連字符工具)中,手動工作從接受猜測為正確並糾正錯誤猜測開始。然而,一旦您看到 Paratext 猜測正確,您就不必繼續接受正確的猜測了。這樣做是沒問題的。我預計 Morphology Tool(形態工具)也是同樣的,通過篩選具有您最常見詞綴的詞語來開始訓練它,一旦它正確猜測它們,就篩選另一個,直到您處理完已知的詞綴並且看不到錯誤的猜測。當 Paratext 開始做對時,看到它的「頓悟時刻」是非常有回報感的。

一次批准許多詞語以確認您的選擇可能有一些好處,兩個工具都允許您使用 Shift 選擇多個實例,然後通過菜單批准它們全部。這比點擊點擊直到睡著要好得多。

祝福,

機器翻譯自 English
0

有人對建立能充分涵蓋翻譯的形態分析需要多少工作量有感覺嗎?需要什麼程度的技能?

機器翻譯自 English
(448 點) 提出

Johnathan,

將專案中的所有詞語拆解需要相當多的時間。對於想要這樣做的人,我建議從 Wordlist(詞彙表)工具開始,而不是從 interlinear(逐字對照)開始。這樣,具有相同詞根或詞幹的詞語就可以被放在一起。我會將列表按最常見的動詞排序,並解析幾個非常常見的動詞詞根/詞幹的所有表面形式。這樣做可以教會 Paratext 的解析器形態結構,它很快就會開始正確地猜測其他動詞。批准正確的猜測解析比手動解析快得多,因此教會 Paratext 正確解析是獲得最快進步的地方。一旦它猜測得很好,您就可以切換到使用專案的 interlinearizer(逐字對照工具)並逐節工作。如果您想這樣做,我也建議您不要將 Paratext 連結到 Flex。這樣做會使過程複雜化,除非您準備好在 Flex 中正確設置 Ample 解析器,這對於大多數語言來說需要大量時間。

機器翻譯自 English

「將專案中的所有詞語拆解需要相當多的時間」是指幾週?幾個月?還是更長?

機器翻譯自 English

如果一個專案有 20,000 個唯一詞語,並且一個熟悉語言結構的人正在處理它,他們可以輕鬆地以每分鐘 2 個詞的速度進行分節。在第一天結束時,他們將分節近 1,000 個詞。到那時,Paratext 應該有足夠的數據開始進行智能猜測,因此在第二天他們可以輕鬆地以每分鐘 4 個詞的速度進行,達到 3,000 個詞。從那以後,他們應該能夠以每分鐘 8 個詞的速度進行,每天再處理 4,000 個詞。

七個工作日。

機器翻譯自 English

這取決於形態結構以及某人是否理解詞素是什麼。好的方面(在這種情況下)是 Paratext 不需要知道詞素代表什麼,甚至不需要知道它是另一個詞素的異形詞素(allomorph)。Paratext 只需要知道一個字元串是否是詞素。
所以如果您能找到一個知道如何識別詞素的人,我認為他們可以在一週內讓 Paratext 正確猜測新約(NT)中的斷點大多數時候。他們必須使用我已經描述的方法。一個人可能可以在一個月內完成整個新約,但由於這種工作每天進行具有挑戰性,我會將時間加倍並安排大量休息以減少心理錯誤。如果執行此任務的人對形態結構有很多疑問,隨著任務的深入,也需要更長的時間來解決他們不知道的形態結構部分。Paratext 開始提出可能存在也可能不存在的模式,而此人必須能夠有時告訴 Paratext「不」。

機器翻譯自 English

我正在處理一種具有複雜形態結構的語言,所以我花了好幾天將詞語拆解為詞幹和許多詞綴。我們確實在一種相關語言中設置了 AMPLE,並使用 CARLA 適配到另一種相關語言,但那是在 Flex 和 Paratext 出現之前。這只有歷史意義。

許多詞綴會改變詞幹的拼寫,這使事情變得複雜。我看到進行這種形態分析至少有兩個優點。它幫助我發現翻譯者標記為正確書寫的詞語,但實際上是不正確的。當我篩選沒有批准形態的詞語時,我經常能找到拼寫錯誤的詞語。另一個優點是我可以使用 biblical terms tool(聖經術語工具)中的詞幹選項。我們合作的翻譯者中沒有人具備足夠的形態結構知識來完成這項任務。

Iver+Larsen

機器翻譯自 English

這取決於形態結構的複雜程度。我正在處理的那個在聖經中大約有 50,000 個唯一詞語。我一次處理一本書,即使已經完成了三分之二的聖經,我仍然發現程序無法正確解析的詞語。

Iver+Larsen

機器翻譯自 English

相關問題

+1
3 個回答 324 次瀏覽
大家好, 之前我曾詢問,您或您認識的人是否有一個 Paratext 專案,其中也包含在 Paratext 中進行的回譯(Back Translation) 感謝每一位回覆的人 (如果您知道其他範例,我們仍然歡迎提供更多 ) ... 道這樣的資料,歡迎透過電子郵件聯繫我:[Email Removed] 非常感謝, dcb . [Email Removed]
dcb 194 提出 已提問 10月 7, 2020
0
1 個回答 195 次瀏覽
在「應用聖經自然語言處理合作計畫」(Partnership for Applied Biblical NLP)中,我們正在定義一項關於詞彙切分(word segmentation)的「共享任務」(shared task)--基本上是一場比賽,看看哪款軟體能 ... 不同類型語言的語言都感興趣 如果您有願意分享的數據,請告訴我! [Email Removed]
Jonathan Robie 448 提出 已提問 7月 27, 2022
0
1 個回答 318 次瀏覽
I'm helping a user with a consultant notes problem where when she moves through many of her notes she gets this box that ... report with a code of PTXS-17507 Thank you, MSEAIT/LT
MSEAIT_LT 478 提出 已提問 9月 4, 2018
0
0 個回答 159 次瀏覽
As resources have been moved to the DBL for Paratext 8, many now have different language identifiers than they did in ... do this using Greek as the test case. [Link Removed]
[Expert]
Jeff_Shrum
2.9k 提出
已提問 11月 29, 2017
0
1 個回答 313 次瀏覽
A project I'm working with has extensive footnotes including Greek, Hebrew, Arabic and English words inside of them ... it possible to exclude footnotes from these sorts of checks?
mnjames 1.9k 提出 已提問 7月 20, 2018
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
There is neither Jew nor Gentile, neither slave nor free, nor is there male and female, for you are all one in Christ Jesus.
Galatians 3:28
3,047 個問題
6,007 個回答
5,672 則評論
2,027 位使用者