0 голосов
646 просмотров

У меня есть скрипт Teckit (с помощью программного обеспечения раздела «Не латинские письменности» инициативы MSEA) для конвертации между нашей не латинской письменностью (тибетской) и латиницей. В нем есть функция для использования заглавной буквы после точки, и мы разместили его в Paratext 8 для автоматической транслитерации.

Он работает нормально, если точка находится в середине стиха или области обратного слэша; однако наш скрипт ломается/не работает, если между точкой и следующим символом, который должен быть заглавным, находится команда обратного слэша.

Есть ли в Paratext 8 что-то, что можно использовать как автоматический инструмент для преобразования строчной буквы после точки в заглавную форму на границе предложения?

Или есть ли такая возможность в конвертерах SIL?

Переведено машиной с языка English
Paratext от (115 очков)
снова показан | 646 просмотров

4 Ответов

0 голосов

Из ваших комментариев я предполагаю, что любое стилирование символов или новая строка поэзии (\q1 , \q2) будет блокировать применение правила. Аналогично, номер стиха (\v # ) также может быть проблемой.

У меня нет ответа, но у меня есть похожая проблема, решение которой может быть связано, поэтому я присоединяюсь к вашему сообщению.

Я пытаюсь изменить капитализацию заголовков с американского английского на британский заглавный стиль. Американский заглавный стиль капитализирует первое слово и все слова, кроме ограниченного набора коротких слов, тогда как британский стиль капитализирует первое слово и только имена собственные. У меня есть логика для этого, но мне нужен способ применить ее только к тексту в заголовках (\s1 , \s2 , и т. д.).

Я обнаружил, что проекты транслитерации применяют изменения конвертера кодировки только к тексту на родном языке, и они не учитывают контекст разметки. У меня есть таблица cc, которая правильно применяет изменения капитализации вне Paratext, но когда я загружаю ее в проект транслитерации, она не работает правильно. Моя таблица вносит изменения во все поля текста на родном языке. Поля, не являющиеся текстом на родном языке (\id , \rem ), не были затронуты.

Чтобы функциональность транслитерации действительно была полезной, нам нужен способ вносить изменения, учитывающие контекст разметки. Возможно ли это?

Переведено машиной с языка English
от (1,8тыс. очков)
снова показан

До того как Paratext позволил создавать проекты транслитерации непосредственно в Paratext, мы
использовали инструмент TECkit Bulk SFM Converter, входящий в состав SIL Converters (
http://scripts.sil.org/cms/scripts/page.php?site_id=nrsi&id=enccnvtrs).
Этот инструмент использует тот же файл *.tec, что и проект транслитерации в
Paratext, но позволяет применять преобразование только к определенным файлам SFM.
Единственная проблема при использовании этого инструмента заключается в том, что его
необходимо применять к тексту вручную и вне Paratext каждый раз, когда изменяется текст
или конвертер, а каждый файл Писания (книгу) нужно сохранять вручную, что очень неудобно,
когда приходится иметь дело с 66 и более книгами.

Благословений,

Shegnada J.

Координатор по технологиям языка и издательскому делу, SIL Nigeria

Специалист по компоновке сложных письменностей, GPS Dallas

Skype: Shegnada.james.

([Phone Removed]

Переведено машиной с языка English
0 голосов

Отвечаю на этот разговор, а не начинаю новый, поскольку этот разговор, кажется, тесно связан с моим вопросом:

У нас есть Новый Завет, опубликованный арабской письменностью; есть потребность в публикации того же текста латиницей.

Это будет одноразовая транслитерация, поэтому не требуется динамическое обновление внутри Paratext. Но я wondering, разработал ли кто-нибудь строку RegEx, чтобы сделать первые буквы предложений заглавными? У меня та же проблема, что и у anon024386, упомянутая в исходном сообщении: заставить строку просматривать все возможные SFM и видеть следующее слово после конечной пунктуации…

Переведено машиной с языка English
от (175 очков)

Это побочный ответ на ваше электронное письмо, не ответ на ваш вопрос, а комментарий к вашему процессу.

По моему опыту, транслитерация никогда не бывает простым одноразовым событием, каким бы мы все ни хотели, и стоит использовать инструмент транслитерации в Paratext. Вам захочется снова запустить все проверки Paratext на транслитерированном проекте, и вы обнаружите проблемы, которые заставят вас редактировать ваш конвертер и исходный текст несколько раз. Кроме того, отображение TecIt намного сильнее и гибче, чем RegEx, и может включать в себя вашу потребность в капитализации. Пройдя этот процесс как вне Paratext (когда это было невозможно), так и внутри Paratext, я настоятельно рекомендую вам делать это внутри Paratext.

Переведено машиной с языка English

Спасибо, Shegnada! Да, я полностью согласен с тем, что ни один протокол транслитерации не даст идеального результата, и нам нужно будет запустить проверки в Paratext.

Мы используем TecKit для транслитерации, но он недостаточен из-за некоторых неоднозначностей при переходе с арабской на латинскую письменность, которые (пока) не могут быть решены алгоритмом. Поэтому нам придется использовать какой-то подход на основе словаря/списка слов для начальной транслитерации.

Это решает проблему капитализации собственных имен. Но мы ищем автоматический способ добавить соглашения о капитализации в начале предложений, цитат и т. д.

Надеюсь, это проясняет ситуацию!

Переведено машиной с языка English
0 голосов

Вы можете использовать следующий код для капитализации букв в RegexPal:
^^^
Вот регулярное выражение, которое капитализирует первую букву предложения после [.?!] . Оно допускает промежуточные закрывающие кавычки, разметку абзаца, поэзии или списка, пустые строки, номера стихов и открывающие кавычки в начале предложения. Оно также капитализирует после \s и \p , которые могут встречаться в начале главы или после заголовка, не имеющего конечной пунктуации. Вам нужно будет вручную проверить слова после ?" или !" — они иногда капитализируются, а иногда нет.
Найти:
(?<=([.?!][”’]*(\s+\\(b|p|q|li))*|\\(p|s)?)(\s+\\v\s\S+)?\s+[“‘]*)(\p{Ll})
Заменить:
^^^\6
Этот код капитализирует слова в списках, отмеченных \li, и в поэзии, отмеченной \q. Если вы используете более сложную разметку: сноски, перекрестные ссылки, \q1\q2 \li1 \li2 \pm \pc \qc \qr и т. д., вам нужно будет внести корректировки.
Примечание Кавычки-«лапки» не зеркалятся, поэтому их нужно инвертировать в конвертере кодировки при транслитерации с RTL на LTR.

Переведено машиной с языка English
от (1,8тыс. очков)
снова показан
0 голосов

CrazyRocky, очень запоздалое спасибо за этот RegEx для капитализации. (Наконец-то возвращаюсь к этой задаче после долгого перерыва.) Мне удалось изменить строку, как вы предложили, чтобы учесть наши кавычки « » , а также маркеры \q1 и \q2, и это отлично работает.

Сегодня я заметил, что в Луки 2:49-50 у нас есть сноска между закрывающей пунктуацией и закрывающей кавычкой, что, кажется, препятствует капитализации первого слова стиха 50:

image

Сноска содержит альтернативный перевод последней фразы цитаты. Вы бы предложили изменить поисковую строку или переместить сноску?

Переведено машиной с языка English
от (175 очков)

CrazyRocky, на этой неделе я в отъезде от рабочего стола, но хотел сообщить вам, что вы можете запустить внешний процесс с помощью пакетного файла (с циклом для каждой из 66 и более книг), который конвертирует только определенные маркеры, используя либо отображения CC, либо TECkit. Единственное условие состоит в том, что вам нужно переключать главы в Paratext (который может оставаться открытым во время выполнения), чтобы обновить/обновить отображаемый текст.
По моему опыту, это быстро И надежно.
Я мог бы отправить вам образец в конце недели, но я предполагаю, что у вас уже есть необходимые знания. :slight_smile:
Благословений,
Mark

Переведено машиной с языка English

Похожие вопросы

0 голосов
1 ответ 205 просмотров
We have a user who is doing a transliteration from one script in a language to another script in the same language. ... has the reference number of PTXS-17276 Thank you, MSEAIT/LT
MSEAIT_LT 478 задал вопрос авг 3, 2018
0 голосов
3 ответов 459 просмотров
I am trying to navigate my first transliteration project. Background information The team is starting typesetting, and has ... are supposed to work and what behavior is expected.
[Moderator]
dhigby
1,3тыс.
задал вопрос авг 3, 2018
0 голосов
3 ответов 816 просмотров
Я пытаюсь доработать конвертер кодировок .tec, чтобы он был безопасен для многократного применения (round trip) при ... Есть ли какие-либо предложения, как это сделать?
DVM 175 задал вопрос мар 17, 2021
0 голосов
1 ответ 176 просмотров
I have the main vernacular project in a special script and also a Romanized version using transliteration. When trying to do ... you want to do spell checking on the primary text?
anon650332 163 задал вопрос дек 31, 2018
0 голосов
4 ответов 344 просмотров
As I am gradually getting more involved in language and dialect adaptations, I keep thinking about what might be the best ... a discussion on this topic with pros and cons, etc.
anon233143 252 задал вопрос окт 31, 2018
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
Just as a body, though one, has many parts, but all its many parts form one body, so it is with Christ.
1 Corinthians 12:12
3,045 вопросов
6,005 ответов
5,671 комментариев
2,026 пользователей