0 votos
724 vistas

Estoy buscando datos de segmentación morfológica para lenguas de traducción, tanto para lenguas de comunicación amplia como para lenguas de traducción.

Por ejemplo, en inglés, me gustaría descomponer una palabra como “unthinkable” en [un [[think] able]] o al menos en un-think-able.

Conozco los tipos de información que se encuentran en FLEx, pero me pregunto si alguna de las herramientas de verificación de Paratext contiene esta información de una manera útil para los idiomas que no tienen modelos de FLEx.

¿Está disponible esta información?

¡Gracias!

Jonathan+Robie

Traducción automática desde English
Paratext por (448 puntos)
mostrada de nuevo | 724 vistas

5 Respuestas

0 votos
Mejor respuesta

Así es como se ve el XML en el archivo (quizás sea un poco más fácil de leer):

  <Entry Word="heals">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:s</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healing">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heal">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healed">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="headed">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heading">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>

Tenga en cuenta que tener esta información en un proyecto depende de que alguien haya realizado el desglose morfológico en la Lista de palabras (Wordlist) o en la Interlineal.

Traducción automática desde English
por [Expert]
(16,7k puntos)

mostrada de nuevo

¿Todo esto se hace a mano, o hay una forma de crear una “primera estimación” utilizando PLN (Procesamiento del Lenguaje Natural)?

Traducción automática desde English
0 votos

Si las palabras en un proyecto de Paratext se han descompuesto en morfemas en la Lista de palabras (Wordlist), el desglose se guarda en el archivo WordAnalyses.xml. ¿Es algo que puedas usar? He intentado adjuntar una captura de pantalla, pero no estoy seguro de si se enviará correctamente. Por ejemplo, la palabra ācāmciintōōsii tiene un prefijo y 3 sufijos: ā-cām-ciin-tōōs-ii.

Iver+Larsen

Traducción automática desde English
por (869 puntos)
mostrada de nuevo
0 votos

Perfecto. Esto es exactamente lo que necesito.

¡Gracias!

Jonathan+Robie

Traducción automática desde English
por (448 puntos)
0 votos

Se hace a mano, pero Paratext intenta aprender cómo se realiza la morfología, por lo que, después de un tiempo, el trabajo “a mano” podría limitarse simplemente a aceptar lo que Paratext ha adivinado. Puede ver este comportamiento en la Lista de palabras (Wordlist) o en la Interlineal.

EDICIÓN: Entonces, en mi ejemplo XML anterior, podría ingresar “healed” como “heal +ed” y luego “healing”
como “heal +ing”, lo que podría hacer que Paratext adivine que “heals” es “heal +s” y “headed” es “head +ed”, etc…

Traducción automática desde English
por [Expert]
(16,7k puntos)

mostrada de nuevo

En la Herramienta de Silabificación (Hyphenation Tool), el trabajo manual comienza aceptando las estimaciones como correctas y corrigiendo las incorrectas. Sin embargo, una vez que vea que Paratext está adivinando correctamente, NO tiene que seguir aceptando las estimaciones correctas. Está bien. Espero que la Herramienta de Morfología funcione de la misma manera: comience entrenándola filtrando palabras con sus afijos más comunes y, una vez que las adivine correctamente, filtre por otro hasta que haya tratado sus afijos conocidos y no vea estimaciones incorrectas. Es bastante gratificante ver el “momento eureka” de Paratext cuando comienza a acertar.

Puede haber algún beneficio en aprobar muchas a la vez para afirmar sus elecciones, y ambas herramientas le permiten seleccionar varias instancias con Shift y luego, a través del menú, aprobarlas todas. MUCHO mejor que quedarse dormido haciendo clic-clic.

Bendiciones,

Traducción automática desde English
0 votos

¿Alguien tiene una buena idea de cuánto trabajo implica crear una morfología que cubra bien una traducción? ¿Qué nivel de habilidad se requiere?

Traducción automática desde English
por (448 puntos)

Johnathan,

Toma bastante tiempo dividir todas las palabras de un proyecto. Para quienes deseen hacer esto, recomiendo comenzar con la herramienta Lista de palabras (Wordlist) y no con la interlineal. De esta manera, las palabras con la misma raíz o tema pueden aparecer juntas. Ordenaría la lista para los verbos más comunes y analizaría todas las formas superficiales de algunas raíces/temas verbales muy comunes. De esta manera, enseñará la morfología al analizador de Paratext y comenzará a adivinar correctamente muy rápidamente para otros verbos. Aprobar un análisis correctamente adivinado es mucho más rápido que analizar manualmente, por lo que enseñar a Paratext a analizar correctamente es donde se pueden obtener los mayores avances más rápido. Una vez que esté adivinando bien, podría cambiar a usar el interlineador del proyecto y trabajar versículo por versículo. Si desea hacer esto, también recomiendo que no vincule Paratext con Flex. Hacerlo complica este proceso, a menos que esté listo para configurar correctamente el analizador Ample en Flex, lo cual toma mucho tiempo para la mayoría de los idiomas.

Traducción automática desde English

¿“Toma bastante tiempo dividir todas las palabras de un proyecto” es cuestión de semanas? ¿Meses? ¿Más tiempo?

Traducción automática desde English

Si un proyecto tiene 20,000 palabras únicas y alguien que conoce bien la estructura del idioma está trabajando en él, puede segmentar fácilmente 2 palabras por minuto. Al final del primer día, habrá segmentado casi 1,000 palabras. En ese punto, Paratext debería tener suficientes datos para comenzar a hacer estimaciones inteligentes, por lo que el segundo día pueden hacer fácilmente 4 palabras por minuto, llegando a 3,000 palabras. A partir de ahí, deberían poder hacer 8 palabras por minuto, lo que equivale a otras 4,000 palabras por día.

Siete días laborables.

Traducción automática desde English

Depende de la morfología y de si alguien entiende cuáles son los morfemas. Lo bueno (en esta situación) es que Paratext no necesita saber qué significa un morfema, ni siquiera que es un alomorf de otro morfema. Paratext solo necesita saber si una cadena de caracteres es un morfema o no.
Así que, si pudiera encontrar a alguien que sepa cómo identificar el morfema, creo que podrían lograr que Paratext adivine correctamente las divisiones en un NT la mayor parte del tiempo en una semana. Tendrían que usar el método que ya he descrito. Probablemente se podría pasar por todo el NT en un mes, pero, dado que es desafiante hacer este tipo de trabajo día tras día, duplicaría el tiempo y programaría muchas pausas para reducir los errores mentales. Si la persona que lo hace tiene muchas preguntas sobre la morfología a medida que avanza en la tarea, también tomará más tiempo para que resuelva las partes de la morfología que no conoce. Paratext comenzará a postular patrones que pueden o no estar realmente ahí, y la persona tendrá que poder decirle a Paratext “no” a veces.

Traducción automática desde English

Estoy trabajando en un idioma con morfología compleja, por lo que he pasado días dividiendo palabras en un tema y muchos afijos. Configuramos AMPLE en un idioma relacionado y usamos CARLA para adaptarlo a otro idioma relacionado, pero eso fue antes de la aparición de Flex y Paratext. Esto solo tiene interés histórico.

Complica las cosas el hecho de que muchos afijos cambian la ortografía del tema. Veo al menos dos ventajas en hacer este análisis morfológico. Me ayuda a detectar palabras que un traductor ha marcado como escritas correctamente cuando en realidad no lo son. Cuando filtro las palabras sin morfología aprobada, a menudo puedo encontrar palabras mal escritas. Otra ventaja es que puedo usar la opción de tema en la herramienta de términos bíblicos. Ninguno de los traductores con quienes trabajamos tiene un conocimiento adecuado de la morfología para realizar esta tarea.

Iver+Larsen

Traducción automática desde English

Depende de la complejidad de la morfología. El en el que estoy trabajando tendría aproximadamente 50,000 palabras únicas en la Biblia. Tomo un libro a la vez y, incluso después de haber hecho dos tercios de la Biblia, aún encuentro palabras que el programa no puede analizar correctamente.

Iver+Larsen

Traducción automática desde English

Preguntas relacionadas

+1 voto
3 respuestas 324 vistas
Hola a todos, Hace algún tiempo pregunté si ustedes, o alguien que conozcan, tienen un proyecto de Paratext con una ... de este tipo. Muchas gracias, dcb . [Email Removed]
dcb 194 preguntada oct 7, 2020
0 votos
1 respuesta 195 vistas
En la Partnership for Applied Biblical NLP, estamos definiendo una tarea compartida para la segmentación de palabras: ... a compartir, por favor, avíseme! [Email Removed]
Jonathan Robie 448 preguntada jul 27, 2022
0 votos
1 respuesta 318 vistas
I'm helping a user with a consultant notes problem where when she moves through many of her notes she gets this box that ... report with a code of PTXS-17507 Thank you, MSEAIT/LT
MSEAIT_LT 478 preguntada sep 4, 2018
0 votos
0 respuestas 159 vistas
As resources have been moved to the DBL for Paratext 8, many now have different language identifiers than they did in ... do this using Greek as the test case. [Link Removed]
[Expert]
Jeff_Shrum
2,9k
preguntada nov 29, 2017
0 votos
1 respuesta 313 vistas
A project I'm working with has extensive footnotes including Greek, Hebrew, Arabic and English words inside of them ... it possible to exclude footnotes from these sorts of checks?
mnjames 1,9k preguntada jul 20, 2018
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
Dear friends, since God so loved us, we also ought to love one another.
1 John 4:11
3,047 preguntas
6,007 respuestas
5,672 comentarios
2,027 usuarios