0
725 次浏览

我正在寻找翻译语言的形态切分数据,包括通用语言(languages of wider communication)和翻译语言。

例如,在英语中,我希望将像“unthinkable”这样的词分解为 [un [[think] able]],或者至少分解为 un-think-able。

我知道 FLEx 中包含哪些类型的信息,但我在想,对于没有 FLEx 模型的语言,Paratext 中的任何检查工具是否以有用的方式包含这些信息。

这些信息存在吗?

谢谢!

Jonathan+Robie

机器翻译自 English
Paratext (448 分) 发布
已重新显示 | 725 次浏览

5 个回答

0
最佳答案

以下是该文件中 XML 的样子(可能更容易阅读):

  <Entry Word="heals">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:s</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healing">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heal">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healed">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="headed">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heading">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>

请注意,项目中是否包含此信息取决于是否有人在 Wordlist(词汇表)或 Interlinear(逐词对照)中进行了形态分解。

机器翻译自 English
[Expert]
(16.7k 分) 发布

已重新显示

这完全是手工完成的,还是有办法使用 NLP(自然语言处理)来创建“初步猜测”?

机器翻译自 English
0

如果 Paratext 项目中的单词已在词表(Wordlist)中被拆分为词素,那么拆分结果会保存在 WordAnalyses.xml 文件中。这是您可以使用的吗?我尝试附加了一张屏幕截图,但不确定它是否成功发送。例如,单词 ācāmciintōōsii 有一个前缀和 3 个后缀 ā-cām-ciin-tōōs-ii。

Iver+Larsen

机器翻译自 English
(869 分) 发布
已重新显示
0

完美。这正是我需要的。

谢谢!

Jonathan+Robie

机器翻译自 English
(448 分) 发布
0

这是手工完成的,但 Paratext 会尝试学习形态是如何处理的,因此过一段时间后,“手工”工作可能只是接受 Paratext 的猜测。您可以在 Wordlist(词汇表)或 Interlinear(逐词对照)中看到这种行为。

编辑:因此,在我上面的 XML 示例中,我可能会将“healed”输入为“heal +ed”,然后将“healing”
输入为“heal +ing”,这可能会让 Paratext 猜测“heals”是“heal +s”,“headed”是“head +ed”,等等……

机器翻译自 English
[Expert]
(16.7k 分) 发布

已重新显示

在 Hyphenation Tool(连字符工具)中,手工工作从接受猜测为正确并纠正错误猜测开始。然而,一旦您看到 Paratext 猜测正确,您就不必继续接受正确的猜测了。它已经很好了。我预计 Morphology Tool(形态工具)也是同样的方式,通过筛选具有最常见词缀的单词来开始训练它,一旦它正确猜测它们,就筛选另一个,直到您处理完已知的词缀并且不再看到错误猜测为止。看到 Paratext 开始做对的“顿悟时刻”是非常有回报的。

一次批准许多单词以确认您的选择可能有一些好处,并且两个工具都允许您使用 Shift 选择许多实例,然后通过菜单批准它们全部。这比点击-点击直到睡着要好得多。

祝福,

机器翻译自 English
0

大家对于创建能够很好地覆盖翻译的形态分析需要多少工作量有什么感觉吗?需要什么样的技能水平?

机器翻译自 English
(448 分) 发布

Johnathan,

将项目中的所有单词分解需要相当多的时间。对于想要这样做的人,我建议从 Wordlist(词汇表)工具开始,而不是从 interlinear(逐词对照)开始。这样,具有相同词根或词干的单词可以集中在一起。我会对列表进行排序,找出最常见的动词,并解析几个非常常见的动词词根/词干的所有表面形式。这样,您将教会 Paratext 的解析器形态规则,它很快就会开始正确地猜测其他动词。批准正确的猜测解析比手动解析要快得多,因此教会 Paratext 正确解析是获得最快进步的地方。一旦它猜测得很好,您就可以切换到使用项目 interlinearizer(逐词对照器)并逐节工作。如果您想这样做,我还建议您不要将 Paratext 链接到 Flex。这样做会使过程复杂化,除非您准备好在 Flex 中正确设置 Ample 解析器,这对大多数语言来说需要大量时间。

机器翻译自 English

“将项目中的所有单词分解需要相当多的时间”是指几周?几个月?还是更长时间?

机器翻译自 English

如果一个项目有 20,000 个唯一单词,并且一个非常了解语言结构的人正在处理它,他们可以轻松地将 2 个单词/分钟进行切分。在第一天结束时,他们将切分近 1,000 个单词。此时,Paratext 应该有足够的数据开始进行智能猜测,因此在第二天他们可以轻松地做到 4 个单词/分钟,达到 3,000 个单词。从那时起,他们应该能够以 8 个单词/分钟的速度进行,每天再处理 4,000 个单词。

七个工作日。

机器翻译自 English

这取决于形态以及某人是否理解语素是什么。好的方面(在这种情况下)是 Paratext 不需要知道语素意味着什么,甚至不需要知道它是另一个语素的异形体。Paratext 只需要知道一个字符串是否是语素。
所以,如果您能找到一个人知道如何识别语素,我认为他们可以在一周内让 Paratext 正确猜测新约(NT)中的切分点,大多数时候都是正确的。他们将不得不使用我已经描述的方法。一个人可能可以在一个月内完成整个新约,但由于每天做这种工作具有挑战性,我会将时间加倍并安排大量休息以减少心理错误。如果执行此任务的人随着任务的深入对形态有很多疑问,这也需要更长的时间,以便他们解决他们不知道的形态部分。Paratext 开始提出可能存在也可能不存在的模式,而这个人必须能够有时告诉 Paratext“不”。

机器翻译自 English

我正在一种具有复杂形态的语言中工作,所以我花了好几天将单词分解为词干和许多词缀。我们确实在一种相关语言中设置了 AMPLE,并使用 CARLA 适应另一种相关语言,但那是在 Flex 和 Paratext 出现之前。这只有历史兴趣。

许多词缀改变词干的拼写,这使得事情复杂化。我看到进行这种形态分析至少有两个优点。它帮助我发现翻译者标记为正确书写的单词,但实际上是不正确的。当我筛选没有批准形态的单词时,我经常可以发现拼写错误的单词。另一个优点是,我可以使用 biblical terms tool(圣经术语工具)中的词干选项。我们合作的翻译者都没有足够的形态知识来完成这项任务。

Iver+Larsen

机器翻译自 English

这取决于形态的复杂性。我正在处理的那个在圣经中大约有 50,000 个唯一单词。我一次处理一本书,即使已经完成了圣经的三分之二,我仍然发现程序无法正确解析的单词。

Iver+Larsen

机器翻译自 English

相关问题

+1
3 个回答 324 次浏览
大家好, 之前我曾询问过,您或您认识的人是否有在 Paratext 中同时包含回译(Back Translation)的 Paratext 项目 感谢所有回复的人 (如果您知道其他示例,我们仍然欢迎提供 ) 你们中是否有人知 ... 道此类数据,请随时通过电子邮件联系我:[Email Removed] 非常感谢, dcb . [Email Removed]
dcb 194 发布 提问于 十月 7, 2020
0
1 个回答 195 次浏览
在 应用圣经自然语言处理伙伴关系 (Partnership for Applied Biblical NLP)中,我们正在定义一项关于词法切分(word segmentation)的 共享任务 --基本上,这是一场竞赛,旨在测试哪款软件能最好地完成这 ... 且代表不同语言类型的语言都感兴趣 如果您有愿意分享的数据,请告诉我! [Email Removed]
Jonathan Robie 448 发布 提问于 七月 27, 2022
0
1 个回答 318 次浏览
I'm helping a user with a consultant notes problem where when she moves through many of her notes she gets this box that ... report with a code of PTXS-17507 Thank you, MSEAIT/LT
MSEAIT_LT 478 发布 提问于 九月 4, 2018
0
0 个回答 159 次浏览
As resources have been moved to the DBL for Paratext 8, many now have different language identifiers than they did in ... do this using Greek as the test case. [Link Removed]
[Expert]
Jeff_Shrum
2.9k 发布
提问于 十一月 29, 2017
0
1 个回答 313 次浏览
A project I'm working with has extensive footnotes including Greek, Hebrew, Arabic and English words inside of them ... it possible to exclude footnotes from these sorts of checks?
mnjames 1.9k 发布 提问于 七月 20, 2018
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
Accept the one whose faith is weak, without quarreling over disputable matters.
Romans 14:1
3,047 个问题
6,007 个回答
5,672 条评论
2,027 位用户