0 голосов
560 просмотров

После того как я углубился в трудоёмкие и загромождающие текст требования по разметке Слов Иисуса с помощью \wj … \wj*, чтобы создать пользовательский инструмент Paratext для их применения к проекту Paratext (в соответствии с назначением персонажей в связанном проекте Glyssen), я начал мечтать о системе разметки, которая была бы более интуитивно понятной для переводчика.

Вот в чём моя претензия к системе разметки \wj … \wj*: она спроектирована для удобства программного обеспечения рендеринга, а не для удобства переводчика. Чтобы успешно применить эти метки, вы должны закрывать и открывать их заново при каждом номере стиха. И при каждом переносе абзаца. А затем вам нужно добавлять символ плюса (+) к каждой метке слова/символа внутри них, например +w …+w* и +nd …+nd*.

Больше всего меня удивляет то, что если вы хотите пройти проверку меток, вам даже нужно закрывать и открывать метки заново при каждой сноске!! Действительно ли это необходимо, или проверка меток генерирует все эти предупреждения зря?

Это заставило меня задуматься о том, что переводчику на самом деле нужен способ просто отметить, где говорящий начинает и прекращает говорить, не обращая внимания на парабиблейский контент или проблемы с форматированием. Это также важно для отслеживания говорящих при записи аудио с несколькими голосами, поскольку правки текста могут всё перепутать, и Glyssen придётся заново синхронизировать.

Поэтому я был рад познакомиться с функцией milestones (контрольных точек) в USFM3, которая предназначена именно для этой цели. Но теперь у меня возникло ещё больше вопросов…

Во-первых, заменит ли это разметку \wj? Если проект, использующий метки \qt-s …\qt-e, хочет издать «красные буквы», нужно ли будет дополнительно добавить разметку \wj? Это кажется таким избыточным и запутанным.

Во-вторых, можем ли мы предположить, что парабиблейские поля, такие как \s, \r и \f, подобно \x, являются внутренними исключениями для активной метки \qt-s? То есть вы могли бы поставить \qt-s |who=Jesus* в начале Нагорной проповеди и \qt-e* в конце, и всё было бы готово. Одна пара меток вместо 120 или более, в зависимости от абзацев и сносок, не говоря уже о том, что нет необходимости возиться с вложенностью терминов, размеченных по словарю. Кажется, что то, что компьютер может определить автоматически (чтобы вывести красные буквы), не должно загромождать текст избыточными метками.

В-третьих, каковы лучшие практики для атрибута «who»? Будут ли инструменты ожидать, что это будут английские имена/описания, такие как «Jesus» (Иисус) и «spies from Pharisees and Herodians» (шпионы от фарисеев и иродеев)? Должны ли это быть те же имена персонажей, которые используются в Glyssen?

В-четвёртых, в какой степени следует размечать эти места в контекстах, где нет необходимости в уточнении? В некоторых стихах Иисус — единственный персонаж, который мог бы говорить, тогда как в других говорит более одного человека, и уточнение действительно необходимо. Лучше ли не загромождать текст чрезмерной разметкой говорящих в таких случаях?

Хорошо, это все мои вопросы на данный момент.

Я также был бы заинтересован в тестировании моего инструмента разметки WordsOfJesus на более широком разнообразии проектов, которые выполнили назначение персонажей в проекте Glyssen. Если у вас есть такой проект, пожалуйста, дайте мне знать, если вы готовы поделиться со мной копией. -Спасибо!

Переведено машиной с языка English
Paratext от (286 очков)
снова показан | 560 просмотров

3 Ответов

0 голосов
Лучший ответ

Это действительно полезная обратная связь, спасибо.

Приношу извинения за то, что мой ответ не предлагает вам решений ваших вопросов, а скорее содержит вопросы к вам, связанные с вашими проблемами и опасениями.

Я предполагаю, что вы администратор проекта, и похоже, что вам комфортно работать с разметкой и изучать связанные с ней правила. Я хотел бы задать несколько вопросов о вас и вашей команде (если она есть) и о том, как вы используете Paratext:

  1. Есть ли другие члены вашей команды, для которых разметка USFM является непреодолимым препятствием (или они предпочитают не изучать её)?
  2. Используете ли вы в основном неформатированный вид или стандартный вид при работе со сложной вложенной разметкой?
  3. Было бы вам полезно не редактировать разметку, а вместо этого выделять часть текста, чтобы присвоить ей определённый атрибут или набор атрибутов?
  4. Если бы мы сделали что-то подобное, было бы полезно, если бы Paratext самостоятельно определял, как наиболее просто представить ваши выбор атрибутов «за кулисами»?
  5. Показалось бы ли вам пункт выше потерей контроля над текстом?
  6. Хотели бы вы иметь возможность редактировать разметку, созданную Paratext в пункте выше (и видеть обычные предупреждения, если правки вызвали ошибки)? Или было бы достаточно просто просматривать её?

Мне интересно знать, заботятся ли команды о разметке за их текстом. Или они больше заботятся о том, чтобы правильные атрибуты были привязаны к словам или частям текста, и предпочитают не беспокоиться о разметке (и препятствии в изучении USFM, которое в основном задокументировано на английском языке).

Переведено машиной с языка English
от [Moderator]
(1,2тыс. очков)

снова показан

Здравствуйте, IanH. Есть люди в других проектах, которые совершенно запутаны в правилах нотации со знаком «+» и, вероятно, никогда не смогут сделать это правильно без кого-то вроде меня, чтобы навести порядок. Как разработчик программного обеспечения, я понимаю причины использования нотации со знаком «+», но всё равно считаю её ненужным костылём, как и требование останавливать и начинать \wj …\wj* при каждой сноске и т. д. Это становится СУПЕР запутанным, когда \w используется для разметки номеров Стронга. И да, есть реальные люди, которые делают это с языками меньшинств. Поэтому выделение и применение атрибутов, а также просьба к Paratext обрабатывать разметку в фоне могут стать улучшением. Это могло бы предлагаться как опция, как текущие стандартный и неформатированный виды, которые могли бы остаться. Я часто переключаюсь на неформатированный вид, когда пытаюсь понять, что вызывает ошибку схемы. Поэтому я не думаю, что полный переход на выделенные диапазоны без возможности видеть и редактировать разметку был бы хорош на начальном этапе, но если это будет сделано хорошо, это станет улучшением. Это будет больше похоже на Microsoft Word и меньше на старый WordPerfect и его коды, и мы знаем, как сложилась история между этими двумя. Конечно, совместимость с существующими текстами была ключом к успеху Microsoft, но также и хороший дизайн пользовательского интерфейса.
– Пользователь Paratext и разработчик Haiola

Переведено машиной с языка English

Привет, IanH,

Чтобы ответить на ваши вопросы:

Я провожу обучение и поддержку Paratext для широкого круга команд из нескольких партнёрских организаций по всей Южной Азии. Я также обучаю вёрстальщиков и разработчиков приложений, а также провожу некоторые другие обучения в области языковых технологий. Не так часто я создаю пользовательские инструменты для интеграции с Paratext, как сейчас. Я склонен работать больше с промежуточными и продвинутыми командами, которые комфортно чувствуют себя с USFM, чем с командами MTT, которые, вероятно, испытывают больше трудностей с кривой обучения USFM.

Лично я постоянно переключаюсь между ними.

Я могу представить, что для некоторых пользователей это было бы чудесно.

Абсолютно, для многих команд, с которыми я работаю. Вы не можете широко применять изменения, если не можете «пощупать» метки. Они снова будут бесконечно кликать, чтобы вручную вносить изменения.

Команды определённо заботятся о разметке за их текстом. Просто в некоторых случаях, таких как \wj, правила форматирования довольно утомительны. Было бы хорошо, если бы Paratext брал на себя заботу о некоторых из этих деталей и скрывал загромождение.

Переведено машиной с языка English
0 голосов

Это зависит от программного обеспечения, используемого для публикации. Я не думаю, что Publishing Assistant обрабатывает контрольные точки (milestones) так, как вы хотите (вам нужно будет уточнить это у их команды).

Контрольные точки USFM 3.0 были созданы в основном для содействия в создании аудиопроизведений (например, взаимодействие с Glyssen), чтобы помочь определить, кто должен говорить в определённый момент, и не предназначены для обработки форматирования печатного издания.

Да, это необходимо. Это ограничение формата USFM.

Переведено машиной с языка English
от [Expert]
(16,7тыс. очков)

снова показан

Спасибо за это. Помогите мне понять: есть ли у формата USFM это ограничение, когда перекрёстная ссылка находится внутри слов Иисуса? Они структурированы одинаково. И PA и SAB корректно отображают слова Иисуса независимо от того, есть ли внутри меток \wj перекрёстная ссылка или сноска. Но проверка меток генерирует предупреждение для сноски, но не для перекрёстной ссылки. В чём разница?

Переведено машиной с языка English
0 голосов

Возможно, я смогу помочь с некоторыми регулярными выражениями для вставки всех этих промежуточных маркеров \wj и \wj*.
Регулярное выражение закрывает, а затем снова открывает \wj перед и после маркеров абзацев, номеров стихов, сносок и заголовков разделов.
Как использовать:

  1. Поставьте \wj в начале и \wj* в конце любого текста, который вы хотите пометить.
  • Если слова Иисуса охватывают несколько абзацев, вам не нужно закрывать \wj,
  • однако для монологов, охватывающих несколько глав, вам нужно будет поставить закрывающий \wj* в конце главы и открывающий \wj в начале следующей главы.
    Вы можете сделать это для любого количества разделов текста.
  1. После того как вы разметите текст, выполните следующее в RegexPal
    Найти:
    (?<=\\wj\s)([^\\]|\\(?!wj\*))*?(?=\\wj\*):::((\s*(\\(b|p\w*|mi?|q\w*)\s|(\\(m?r|m?s\w*)\s.*)+|\s+\\v\s\S+\s|\\(x|ef|f|add)\s.*?\\(x|ef|f|add)\*))+)(\s*)
    Заменить:
    \wj*\1\9\\wj (убедитесь, что в конце замены есть пробел)

  2. Если в вашем тексте красных букв есть разметка персонажей, например \w Pharisees|Pharisee\w* или \tl Talitha cum \tl*, вам нужно будет добавить вложенную разметку персонажей в теги, то есть добавить + после \:
    Выполните это регулярное выражение:
    Найти:
    (?<=\\wj\s)([^\\]|\\(?!wj\*))*?(?=\\wj\*):::\\(\w+)([^\\].*?)(\s*)\\\1\*\
    Заменить:
    \\+\1\2\\+\1*\3
    Это даст: \+w Pharisees|Pharisee\+w* и \+tl Talitha cum\+tl*
    Обратите внимание, что пробел после cum перемещается на правую сторону \tl*

Вот код, который нужно вставить в userMenu.txt, чтобы вы могли запускать его из пользовательского меню RegexPal:
———\wj Cleanup—————————#f#
\wj*...\wj#r#(?<=\\wj\s)([^\\]|\\(?!wj\*))*?(?=\\wj\*):::((\s*(\\(b|p\w*|mi?|q\w*)\s|(\\(m?r|m?s\w*)\s.*)+|\s+\\v\s\S+\s|\\(x|ef|f|add)\s.*?\\(x|ef|f|add)\*))+)(\s*)#\\wj*\1\9\\wj
fix embedded markers#r#(?<=\\wj\s)([^\\]|\\(?!wj\*))*?(?=\\wj\*):::\\(\w+)(?s)(.*?)(\s*)\\\1\*#\\+\1\2\\+\1*\3

Переведено машиной с языка English
от (1,8тыс. очков)
снова показан

Thanks, CrazyRocky! Great to hear from you again! And what cool regexes!

Hey, a couple things that caught my eye:

I see that you exclude the \add text from \wj marking. Is that because it’s not really an explicit word of Jesus? I’ve been treating it like other character-level formatting, like \nd and \w. But I don’t know whether it’s customary to take the red ink away when a translator adds an implicit word to Jesus’ quote.

Also, I’ve never thought of nesting \wj inside \w like this before. Interesting! I’m curious why you prefer it this way. I’ve always encouraged users to nest it the other way around:
\wj Woe to you \+w Pharisees|Pharisee\+w* and teachers of the Law!\wj*
Are there particular advantages to doing it with \wj on the inside?

Actually, I’ve just put together have a much faster and more reliable way to insert all the \wj tags in the project and nest the \w markers and such. It’s a custom tool for Paratext’s Custom Tools menu. Basically, Glyssen already knows which verses Jesus should be speaking in, and there are just a handful of ambiguous cases to manually disambiguate, so there’s no need to manually go through the text inserting any \wj markers. We use Glyssen’s work to apply the \wj tags wherever they are needed.

But where are they really needed? That was my question, and I saw no instructions in the USFM docs telling users what these markers must close and reopen around. Cross-references work fine without such clutter, as do footnotes, but the markers check complains in the case of footnotes. Now as I’m looking into this further, I realize that even though the marker check does not complain about cross-references, the schema check does. I still think it would be best if the marker check treated footnotes and cross-references consistently. Anyway, I guess I’ll have to make closing and reopening \wj around cross-references and footnotes both standard in my tool. Let me know if you’d be interested in testing it out. -Thanks!

Думаю, это зависит от ситуации. У меня есть версия, где содержимое \add было комментарием, поэтому я не хотел помечать их красным. Так что просто удалите \add из регулярного выражения, и оно будет включено в красные буквы.

Я посмотрел свой проект, где это проблема, и обнаружил, что я тоже делаю именно так. Должно быть, это старый код. Я удалю его из моего файла userMenu.txt и отредактирую его выше.
Я заменю его кодом для добавления + ко всем вложенным тегам персонажей.

Переведено машиной с языка English

Я вмешаюсь и скажу, что эта система, при которой нужно постоянно открывать/закрывать маркеры \wj, всегда меня раздражала по тем самым причинам. Чтобы пройти проверки, я прошел и исправил маркеры, но никто другой в команде не может понять логику того, почему и когда необходимо закрывать и открывать заново маркер \wj. Или почему необходимо вложение (или точно когда оно нужно, а когда нет).

Я думаю, что конечная цель PT должна состоять в том, чтобы обычные пользователи могли использовать его без постоянной настройки со стороны высококвалифицированных сотрудников поддержки. Пометка слов Иисуса определенно кажется тем, что обычный пользователь должен уметь делать.

Тот факт, что CrazyRocky смог создать более или менее успешные регулярные выражения для автоматизации этого, должен подсказать нам, что возможно скрыть всю эту разметку за кулисами: что файлы USFM могли бы быть размечены минимальным образом, а PT или программы публикации могли бы быть запрограммированы на заполнение дополнительной информации по мере необходимости и на лету.

Переведено машиной с языка English

Похожие вопросы

0 голосов
2 ответов 360 просмотров
Учитывая, что команды начинают использовать Glyssen для предварительной обработки своих текстов Нового Завета, чтобы определить каждого ... и работать с кем-то еще над этим
Mark P 3,2тыс. задал вопрос авг 5, 2019
0 голосов
1 ответ 28 просмотров
Я вижу, что в v7 (как минимум) была ошибка, которая мешала форматировать цитаты (курсив) как слова Иисуса (красным цветом). ... не так? Это функция или баг? Есть ли обходной путь?
ASmith 169 задал вопрос июл 10, 2025
0 голосов
1 ответ 26 просмотров
Я заметил, что в более ранних версиях PT (по крайней мере, в v7) была ошибка, из-за которой цитаты внутри маркеров ... то и другое одновременно. Может ли кто-нибудь помочь с этим?
ASmith 169 задал вопрос июл 10, 2025
0 голосов
2 ответов 339 просмотров
Я получаю ошибку при использовании \qt, если цитата содержит другой маркер, например \pg pg*. Это значит, что с \qt ... ли какой-нибудь способ обойти это? Какова цель этой ошибки?
Clear7419 251 задал вопрос сен 14, 2022
0 голосов
1 ответ 278 просмотров
I need to mark up a passage with glossary terms using \wj \wj* Words of Jesus (red letter) markup. I am ... am wondering if anyone knows what is best practice in this situation.
Kent Spielmann 1,8тыс. задал вопрос фев 7, 2018
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
I appeal to you, brothers and sisters, in the name of our Lord Jesus Christ, that all of you agree with one another in what you say and that there be no divisions among you, but that you be perfectly united in mind and thought.
1 Corinthians 1:10
3,048 вопросов
6,007 ответов
5,672 комментариев
2,028 пользователей