Много лет назад я помню, как видел рассылку Paratext с объявлением о новой функции, которая помогает пользователям визуализировать кодовые точки Unicode в тексте. Там было что-то вроде: «Мы знаем, что для представления конкретного символа часто можно использовать более одной комбинации кодовых точек Unicode. Часто способ, которым формируется символ или слово, сильно зависит от клавиатуры, которую использует переводчик, и от конкретных нажатий клавиш. Если у вас возникают проблемы с поиском слов в результатах поиска или при попытке выполнить операции с регулярными выражениями, вы можете использовать этот инструмент, который мы создали для вас, чтобы визуализировать, как именно каждое слово и каждый символ представлены на низком уровне».
Я знаком с сочетанием Alt+X для просмотра кодовых точек символа, а также с пунктом меню Tools>Checking Inventories>Characters Inventory, но ни одно из этих средств не показывает целые слова с их кодовыми точками — именно это, как я помню, было видно на скриншоте в объявлении.
Кто-нибудь знает, где можно найти это объявление или описанную в нем функцию? Я уже покрутился и не могу найти.
Моя конечная цель — лучше понять, как различные способы кодирования символов и представления слов влияют на языковые проекты. Будь то через изучение сопутствующей документации или общение с экспертами в этой области.
Спасибо!
Years ago I remember seeing a Paratext newsletter with an announcement about a new feature that helps users visualize the Unicode codepoints in the text. It said something like “We know that there is often more than one combination of Unicode codepoints that can be used to represent a given character. Often, the way the character or word is composed depends a lot on the keyboard the translator is using and the particular keystrokes he used. If you’re having trouble finding words in search results or when trying to perform regex operations, you can use this tool we made for you to visualize how each word and character is represented underlyingly.”
I’m familiar with Alt+X to see the codepoints for a character, and also with Tools>Checking Inventories>Characters Inventory, but neither of these show entire words with their codepoints- that’s what I remember seeing in the printscreen in the announcement.
Does anyone know where to find this announcement or the feature it describes? I’ve searched around and can’t find it.
My ultimate goal is to better understand how different ways of encoding characters and representing words affect language projects. Be it through looking through accompanying documentation or talking with experts on the topic.
Thank you!