0 голосов
725 просмотров

Я ищу данные о морфологической сегментации для языков перевода, как для широко используемых языков, так и для языков перевода.

Например, в английском языке я хотел бы разбить слово «unthinkable» на [un [[think] able]] или хотя бы на un-think-able.

Я знаю, какая информация содержится в FLEx, но я想知道, содержит ли какой-либо из инструментов проверки в Paratext эту информацию в полезном виде для языков, для которых нет моделей FLEx.

Есть ли такая информация?

Спасибо!

Jonathan+Robie

Переведено машиной с языка English
Paratext от (448 очков)
снова показан | 725 просмотров

5 Ответов

0 голосов
Лучший ответ

Вот как выглядит XML в файле (может быть, так немного легче читать):

  <Entry Word="heals">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:s</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healing">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heal">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healed">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="headed">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heading">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>

Обратите внимание, что наличие этой информации в проекте зависит от того, выполнял ли кто-либо морфологическую разбивку в Списке слов (Wordlist) или в Интерлинеаре (Interlinear).

Переведено машиной с языка English
от [Expert]
(16,7тыс. очков)

снова показан

Это все делается вручную, или есть способ создать «первый вариант» с помощью NLP?

Переведено машиной с языка English
0 голосов

Если слова в проекте Paratext были разбиты на морфемы в Списке слов (Wordlist), то эта разбивка сохраняется в файле WordAnalyses.xml. Можно ли использовать это? Я пытался прикрепить скриншот, но не уверен, что он дойдет. Например, слово ācāmciintōōsii имеет один префикс и три суффикса: ā-cām-ciin-tōōs-ii.

Iver+Larsen

Переведено машиной с языка English
от (869 очков)
снова показан
0 голосов

Идеально. Это именно то, что мне нужно.

Спасибо!

Jonathan+Robie

Переведено машиной с языка English
от (448 очков)
0 голосов

Это делается вручную, но Paratext пытается научиться тому, как выполняется морфологический анализ, поэтому со временем ручная работа может свестись просто к принятию тех предположений, которые сделал Paratext. Вы можете наблюдать это поведение в Списке слов (Wordlist) или в Интерлинеаре (Interlinear).

ПРАВКА: Таким образом, в моем примере XML выше я мог бы ввести «healed» как «heal +ed», а затем «healing»
как «heal +ing», что могло бы заставить Paratext предположить, что «heals» — это «heal +s», а «headed» — это «head +ed» и т. д.

Переведено машиной с языка English
от [Expert]
(16,7тыс. очков)

снова показан

В инструменте Гиффирования (Hyphenation Tool) ручная работа начинается с принятия предположений как правильных и исправления неверных. Однако, как только вы увидите, что Paratext делает правильные предположения, вам НЕ нужно продолжать принимать правильные предположения. Все в порядке. Я ожидаю, что с инструментом Морфологии (Morphology Tool) будет так же: начните обучать его, фильтруя слова с вашими наиболее частыми аффиксами, и когда он начнет правильно их предсказывать, фильтруйте по другому, пока не обработаете все известные вам аффиксы и не перестанете видеть неверные предположения. Очень приятно наблюдать «момент озарения» Paratext, когда он начинает делать все правильно.

Может быть полезно утверждать много вариантов сразу, чтобы подтвердить ваши выбор, и оба инструмента позволяют выбрать несколько экземпляров с помощью Shift и затем, через меню, утвердить их все. Это НАМНОГО лучше, чем засыпать, кликая-кликая.

Благословений,

Переведено машиной с языка English
0 голосов

Есть ли у кого-то представление о том, сколько работы требуется для создания морфологии, которая хорошо покрывает перевод? Какой уровень навыков необходим?

Переведено машиной с языка English
от (448 очков)

Джонатан,

На разделение всех слов в проекте уходит довольно много времени. Тем, кто хочет этим заниматься, я рекомендую начинать с инструмента Списка слов (Wordlist), а не с интерлинеара. Таким образом, слова с одинаковым корнем или основой могут быть сгруппированы вместе. Я бы отсортировал список по наиболее частым глаголам и разобрал все поверхностные формы для нескольких очень частых корней/основ глаголов. Таким образом, вы научите парсер Paratext морфологии, и он начнет быстро и правильно делать предположения для других глаголов. Утверждение правильного предположения парсера происходит гораздо быстрее, чем ручной разбор, поэтому обучение Paratext правильному разбору дает самые быстрые результаты. Когда он начнет хорошо гадать, вы можете перейти к использованию интерлинеаризатора проекта и работать стих за стихом. Если вы хотите сделать это, я также рекомендую не связывать Paratext с Flex. Это усложняет процесс, если только вы не готовы правильно настроить парсер Ample в Flex, что требует много времени для большинства языков.

Переведено машиной с языка English

«Довольно много времени на разделение всех слов в проекте» — это вопрос недель? Месяцев? Или дольше?

Переведено машиной с языка English

Если в проекте 20 000 уникальных слов и над ним работает человек, хорошо знающий структуру языка, он может легко сегментировать 2 слова в минуту. К концу первого дня он сегментирует почти 1000 слов. На этом этапе у Paratext должно быть достаточно данных, чтобы начать делать разумные предположения, поэтому на второй день он может легко делать 4 слова в минуту, что доведет его до 3000 слов. После этого он должен быть способен делать 8 слов в минуту, что составит еще 4000 слов в день.

Семь рабочих дней.

Переведено машиной с языка English

Это зависит от морфологии и от того, понимает ли человек, что такое морфемы. Хорошая сторона (в этой ситуации) заключается в том, что Paratext не нужно знать, что означает морфема, или даже то, является ли она алломорфом другого морфема. Paratext просто нужно знать, является ли строка символов морфемой или нет.
Так что, если вы сможете найти человека, который знает, как идентифицировать морфемы, я думаю, что он сможет заставить Paratext правильно предсказывать разбивку в Новом Завете большую часть времени за одну неделю. Ему пришлось бы использовать метод, который я уже описал. Вероятно, можно было бы пройти весь Новый Завет за месяц, но поскольку делать такую работу изо дня в день сложно, я бы удвоил время и запланировал много перерывов, чтобы уменьшить количество ошибок. Если у человека, выполняющего эту работу, возникает много вопросов о морфологии по мере того, как он углубляется в задачу, это также займет больше времени, чтобы позволить ему разобраться в тех частях морфологии, которые он не знает. Paratext начнет предполагать паттерны, которые могут и не существовать на самом деле, и человек должен будет иногда говорить Paratext «нет».

Переведено машиной с языка English

Я работаю с языком со сложной морфологией, поэтому я потратил дни на разделение слов на основу и множество аффиксов. Мы настроили AMPLE в родственном языке и использовали CARLA для адаптации к другому родственному языку, но это было до появления Flex и Paratext. Это имеет только исторический интерес.

Ситуацию усложняет то, что многие аффиксы изменяют написание основы. Я вижу хотя бы два преимущества в выполнении этого морфологического разбора. Это помогает мне находить слова, которые переводчик пометил как правильно написанные, хотя на самом деле они неверны. Когда я фильтрую слова без утвержденного морфологического анализа, я часто могу найти слова с ошибками в написании. Другое преимущество состоит в том, что я могу использовать опцию основы в инструменте Библийских терминов (Biblical Terms). Ни один из переводчиков, с которыми мы работаем, не обладает достаточными знаниями в области морфологии, чтобы выполнить эту задачу.

Iver+Larsen

Переведено машиной с языка English

Это зависит от сложности морфологии. В том, над которым я работаю, в Библии будет около 50 000 уникальных слов. Я беру по одной книге за раз, и даже после того, как я сделал две трети Библии, я все еще нахожу слова, которые программа не может разобрать правильно.

Iver+Larsen

Переведено машиной с языка English

Похожие вопросы

+1 голос
3 ответов 324 просмотров
Здравствуйте, все! Некоторое время назад я спрашивал, есть ли у вас или у кого-то из ваших знакомых проект Paratext, в ... [Email Removed]. Огромное спасибо, dcb . [Email Removed]
dcb 194 задал вопрос окт 7, 2020
0 голосов
1 ответ 195 просмотров
В рамках Партнёрства по прикладной библейской NLP мы определяем общую задачу для сегментации слов - по сути, это ... поделиться, пожалуйста, дайте мне знать! [Email Removed]
Jonathan Robie 448 задал вопрос июл 27, 2022
0 голосов
1 ответ 318 просмотров
I'm helping a user with a consultant notes problem where when she moves through many of her notes she gets this box that ... report with a code of PTXS-17507 Thank you, MSEAIT/LT
MSEAIT_LT 478 задал вопрос сен 4, 2018
0 голосов
0 ответов 159 просмотров
As resources have been moved to the DBL for Paratext 8, many now have different language identifiers than they did in ... do this using Greek as the test case. [Link Removed]
[Expert]
Jeff_Shrum
2,9тыс.
задал вопрос ноя 29, 2017
0 голосов
1 ответ 313 просмотров
A project I'm working with has extensive footnotes including Greek, Hebrew, Arabic and English words inside of them ... it possible to exclude footnotes from these sorts of checks?
mnjames 1,9тыс. задал вопрос июл 20, 2018
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
But if we walk in the light, as he is in the light, we have fellowship with one another, and the blood of Jesus, his Son, purifies us from all sin.
1 John 1:7
3,047 вопросов
6,007 ответов
5,672 комментариев
2,027 пользователей