0 votos
520 vistas

Estoy notando lo que parece ser una diferencia binaria entre algunos IDs de términos que aparecen en Major Biblical Terms y los utilizados en los archivos de renderizado del proyecto. Los IDs de términos coincidentes se ven visualmente iguales si se abre el xml en un editor. Pero estoy prototipando un complemento (plug-in) y mi código notó la diferencia. Quizás sea algo como compuesto vs no compuesto, pero no sé nada de hebreo. Estoy publicando enlaces a dos versiones del ID del término Shem. Una es de Major Biblical Terms. La otra es de TermRenderings.xml en uno de mis proyectos. Ambos IDs se ven iguales, pero un visor de archivos binarios muestra que son diferentes.
Gracias por cualquier sugerencia.
stevepence

Shem de un archivo de Renderings
Shem de Major Terms

Traducción automática desde English
Paratext por (127 puntos) | 520 vistas

4 Respuestas

0 votos
Mejor respuesta

Esto probablemente sea más detalle del que desea tener, pero aquí está mi opinión sobre los problemas de normalización del hebreo. Unicode ideó un orden canónico de diacríticos que no era ideal lingüísticamente. Dado que el orden de los diacríticos entre diacríticos no interactuantes puede ser arbitrario, decidieron no cambiar el orden cuando se les solicitó. Pero hay algunas situaciones donde el orden es importante para los diacríticos interactuantes en hebreo y ese orden se pierde por la normalización. Para evitar esto, la gente usa el CGJ (U+034F) para permitir un orden diferente de diacríticos. Esto debería considerarse parte de la ortografía de la palabra.

Mientras todo esto se debatía, las fuentes a menudo no estaban diseñadas para manejar el orden canónico de Unicode. Pero eso se ha corregido hace mucho tiempo y las fuentes pueden manejar el texto ordenado canónicamente en Unicode sin problemas.

Todo esto para decir que no veo ninguna razón por la que los datos no deberían almacenarse en ninguna forma normal de Unicode (NFC, NFD, que creo que son idénticas en hebreo), pero que si tiene algunos datos heredados (datos Unicode antiguos), se debe tener cuidado con la normalización. En particular, revise la palabra para Jerusalén (si mal no recuerdo de mi memoria borrosa sobre palabras que contienen problemas de orden de diacríticos), que debería contener un CGJ (o mirarse cuidadosamente con una representación visual frente a usted).

En cuanto al ejemplo de Lorna, no debería haber dificultad con esos dos diacríticos ya que son no interactuantes (uno arriba, uno abajo).

Traducción automática desde English
por (656 puntos)
0 votos

Para descubrir qué caracteres hay en una cadena, podría usar UniView 14 . Pegue su texto en el cuadro donde dice “text area”, luego haga clic en la flecha que apunta hacia abajo justo debajo del cuadro de texto y verá una lista de los caracteres (forma del carácter, valor Unicode y descripción).

Si su sospecha es correcta y la diferencia se debe a la forma de normalización, quizás desee incluir un paso de normalización en su complemento.

Traducción automática desde English
por (296 puntos)
0 votos

Cadena de codificación de ShemFrompmcdblRendering.txt: U+05E9 U+05B5 U+05C1 U+05DD
Cadena de codificación de ShemFromMajorTerms.txt: U+05E9 U+05C1 U+05B5 U+05DD

Si miramos las propiedades Unicode, creo que la codificación de ShemFromMajorTerms.txt está incorrecta y es posible que el documento Major Terms necesite normalización.
Advertencia: Sé que el hebreo tiene algunos problemas de normalización Unicode y no estoy al tanto de dónde no se debe seguir la normalización.

Traducción automática desde English
por (329 puntos)

stevepence,
Sospecho que a medida que más organizaciones escriban sus propios complementos, otros podrían encontrarse con su problema. Simplemente no afectaba a un usuario de Paratext, pero aparentemente sí le afecta a usted si está escribiendo complementos. Si la lista de Major Biblical Terms no está utilizando las mejores prácticas para la codificación del hebreo, quizás podría discutir sus necesidades con anon291708.

Traducción automática desde English
0 votos

Gracias a todos los que respondieron. La respuesta de todos fue extremadamente útil para entender este problema. ¡Estoy muy agradecido!

No me atrevería a comentar qué archivo tiene las codificaciones “correctas” - ciertamente un tema complejo. Mi preocupación muy limitada es poder usar los ids de manera inequívoca como claves para conjuntos de datos. Obviamente, la herramienta Biblical Terms es capaz de vincular correctamente los ids en diferentes archivos a pesar de las diferencias en sus representaciones binarias, presumiblemente mediante una normalización en tiempo real.

Dado que actualmente solo estoy prototipando, este es el nivel de profundidad al que necesito llegar ahora. Una vez que llegue a codificar el propio complemento, necesitaré profundizar en los detalles de cómo PT hace lo que hace en esta área.

Ahora entiendo el problema mucho mejor. ¡Gracias a todos!

stevepence

Traducción automática desde English
por (127 puntos)

En Paratext, todos los IDs de términos y IDs de renderizado se normalizan al formato NFC al cargarlos para evitar este problema. De hecho, casi todos los datos se normalizan internamente al comparar dos cadenas debido a este problema. Lo considero un problema de diseño de Unicode, pero ese es otro tema. :stuck_out_tongue_winking_eye:

EDICIÓN: Además, si está creando un complemento de Paratext, debería usar IProject.GetBiblicalTermRenderings y IPluginHost.GetBiblicalTermList / IProject.BiblicalTermList para manejar los Biblical Terms - lo cual debería evitar este problema.

Traducción automática desde English

Gracias. Actualmente todavía estoy trabajando en VBA finalizando un prototipo y obteniendo comentarios de los usuarios. No he comenzado a hacer trabajo real con la api. Ciertamente espero que la api oculte todos estos detalles, pero aprecio la ayuda de todos para entender los problemas - incluso si nunca tengo que llegar a eso.

stevepence

Traducción automática desde English

Preguntas relacionadas

0 votos
2 respuestas 199 vistas
When downloading Paratext 8, I'm told: The Online file is smaller and may be used if you are installing while connected to the ... to download that extra 85Mb, if I don't have to.
jeffh 1,4k preguntada mar 23, 2017
0 votos
3 respuestas 409 vistas
We have a problem with language IDs not matching which prevents the Interlinearizer from working. The KPZ project was registered ... or how I can look at those changes. Iver+Larsen
Iver Larsen 869 preguntada ene 24, 2020
0 votos
2 respuestas 360 vistas
In PT8 when I compare two project (of the same language) there were two arrows to go backwards or forwards to ... they do not work for difference between two different projects.
anon784407 105 preguntada ene 13, 2020
0 votos
0 respuestas 154 vistas
Biblical Term rendering discussion not | Biblical Term rendering description e | The entire history leading to a deci ... Terms tool. See also: Introduction to Biblical Term notes
[Expert]
anon421222
735
preguntada feb 23, 2017
0 votos
2 respuestas 639 vistas
Tenemos un usuario que tiene un número de traducciones asociadas con la lista NT Key Biblical Terms. Le ... términos en orden alfabético para este proceso. Gracias, james_post
[Moderator]
james_post
2,1k
preguntada nov 10, 2021
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
So Peter was kept in prison, but the church was earnestly praying to God for him.
Acts 12:5
3,048 preguntas
6,007 respuestas
5,672 comentarios
2,028 usuarios