0 votes
760 vues

Je cherche des données de segmentation morphologique pour les langues de traduction, tant pour les langues à large communication que pour les langues de traduction.

Par exemple, en anglais, j'aimerais décomposer un mot comme « unthinkable » en [un [[think] able]] ou au moins en un-think-able.

Je connais les types d'informations trouvées dans FLEx, mais je me demande si l'un des outils de vérification de Paratext contient ces informations d'une manière utile pour les langues qui n'ont pas de modèles FLEx.

Ces informations sont-elles disponibles ?

Merci !

Jonathan+Robie

Traduit automatiquement depuis English
Paratext par (448 points)
réaffiché | 760 vues

5 Réponses

0 votes
Meilleure réponse

Voici à quoi ressemble le XML dans le fichier (peut-être un peu plus facile à lire) :

  <Entry Word="heals">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:s</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healing">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heal">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healed">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="headed">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heading">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>

Notez que la présence de ces informations dans un projet dépend du fait que quelqu'un ait effectué la décomposition morphologique dans la Liste des mots (Wordlist) ou dans l'Interlinéaire.

Traduit automatiquement depuis English
par [Expert]
(16,7k points)

réaffiché

Est-ce que tout cela est fait à la main, ou y a-t-il un moyen de créer une « première estimation » en utilisant le TALN (traitement automatique des langues) ?

Traduit automatiquement depuis English
0 votes

Si les mots d'un projet Paratext ont été décomposés en morphèmes dans la Liste des mots (Wordlist), la décomposition est conservée dans le fichier WordAnalyses.xml. Est-ce quelque chose que vous pouvez utiliser ? J'ai essayé de joindre une capture d'écran, mais je ne suis pas sûr qu'elle passe. Par exemple, le mot ācāmciintōōsii a un préfixe et 3 suffixes ā-cām-ciin-tōōs-ii.

Iver+Larsen

Traduit automatiquement depuis English
par (869 points)
réaffiché
0 votes

Parfait. C'est exactement ce dont j'ai besoin.

Merci !

Jonathan+Robie

Traduit automatiquement depuis English
par (448 points)
0 votes

C'est fait à la main, mais Paratext essaie d'apprendre comment la morphologie est gérée, de sorte qu'après un certain temps, le travail « à la main » pourrait se limiter à accepter ce que Paratext a deviné. Vous pouvez observer ce comportement dans la Liste des mots (Wordlist) ou dans l'Interlinéaire.

EDIT : Donc, dans mon exemple XML ci-dessus, je pourrais saisir « healed » comme « heal +ed » et ensuite « healing »
comme « heal +ing », ce qui pourrait amener Paratext à deviner que « heals » est « heal +s » et que « headed » est « head +ed », etc…

Traduit automatiquement depuis English
par [Expert]
(16,7k points)

réaffiché

Dans l'outil de césure (Hyphenation Tool), le travail manuel commence par accepter les devinées comme correctes et corriger les devinées erronées. Cependant, une fois que vous voyez que Paratext devine correctement, vous n'avez PAS besoin de continuer à accepter les devinées correctes. C'est bon à prendre. J'imagine que l'outil de morphologie fonctionne de la même manière : commencez par l'entraîner en filtrant les mots avec vos affixes les plus courants et, une fois qu'il les devine correctement, filtrez-en un autre jusqu'à ce que vous ayez traité vos affixes connus et que vous ne voyiez plus de devinées erronées. C'est très gratifiant de voir le « moment d'éveil » de Paratext lorsqu'il commence à avoir raison.

Il peut y avoir un avantage à approuver beaucoup d'éléments à la fois pour confirmer vos choix, et les deux outils vous permettent de sélectionner de nombreuses instances avec Maj (Shift) et de les approuver toutes via le menu. BEAUCOUP mieux que de s'endormir en cliquant-cliquant.

Bénédiction,

Traduit automatiquement depuis English
0 votes

Est-ce que quelqu'un a une bonne idée de la quantité de travail nécessaire pour créer une morphologie qui couvre bien une traduction ? Quel niveau de compétence est requis ?

Traduit automatiquement depuis English
par (448 points)

Johnathan,

Il faut un temps considérable pour diviser tous les mots d'un projet. Pour ceux qui souhaitent le faire, je recommande de commencer avec l'outil Liste des mots (Wordlist) et non avec l'interlinéaire. De cette façon, les mots ayant la même racine ou la même base peuvent être regroupés. Je trierais la liste pour les verbes les plus courants et analyserais toutes les formes de surface pour quelques racines/bases de verbes très courantes. De cette façon, vous enseignerez la morphologie à l'analyseur de Paratext et il commencera à deviner correctement très rapidement pour les autres verbes. Approuver une analyse correctement devinée est beaucoup plus rapide que l'analyse manuelle, donc enseigner à Paratext à analyser correctement est là où les gains les plus rapides peuvent être réalisés. Une fois qu'il devine bien, vous pourriez passer à l'utilisation de l'interlinéariseur du projet et travailler verset par verset. Si vous souhaitez le faire, je recommande également de ne pas lier Paratext à Flex. Cela complique ce processus, à moins que vous ne soyez prêt à configurer correctement l'analyseur Ample dans Flex, ce qui prend beaucoup de temps pour la plupart des langues.

Traduit automatiquement depuis English

« Un temps considérable pour diviser tous les mots d'un projet », est-ce une question de semaines ? De mois ? Plus longtemps ?

Traduit automatiquement depuis English

Si un projet a 20 000 mots uniques et si quelqu'un qui connaît bien la structure de la langue y travaille, il peut facilement segmenter 2 mots / minute. À la fin du premier jour, il aura segmenté près de 1 000 mots. À ce stade, Paratext devrait avoir suffisamment de données pour commencer à faire des devinées intelligentes, de sorte qu'au deuxième jour, il peut facilement faire 4 mots / minute, ce qui le porte à 3 000 mots. À partir de là, il devrait pouvoir faire 8 mots / minute pour 4 000 mots de plus par jour.

Sept jours ouvrables.

Traduit automatiquement depuis English

Cela dépend de la morphologie et de savoir si quelqu'un comprend ce que sont les morphèmes. La bonne chose (dans cette situation) est que Paratext n'a pas besoin de savoir ce qu'un morphème signifie, ou même s'il est un allomorphe d'un autre morphème. Paratext a juste besoin de savoir si une chaîne de caractères est un morphème ou non.
Donc, si vous pouviez trouver quelqu'un qui sait identifier le morphème, je pense qu'ils pourraient amener Paratext à deviner correctement les coupures dans un NT la plupart du temps en une semaine. Ils devraient utiliser la méthode que j'ai déjà décrite. On pourrait probablement parcourir tout le NT en un mois, mais comme il est difficile de faire ce type de travail jour après jour, je doublerais le temps et planifierais beaucoup de pauses pour réduire les erreurs mentales. Si la personne qui le fait a beaucoup de questions sur la morphologie au fur et à mesure qu'elle s'engage dans la tâche, cela prendra aussi plus de temps pour lui permettre de résoudre les parties de la morphologie qu'elle ne connaît pas. Paratext commencera à postuler des motifs qui peuvent ou non être réellement présents, et la personne devra pouvoir dire à Paratext « non » parfois.

Traduit automatiquement depuis English

Je travaille dans une langue à morphologie complexe, donc j'ai passé des jours à diviser les mots en base et de nombreux affixes. Nous avons configuré AMPLE dans une langue apparentée et utilisé CARLA pour s'adapter à une autre langue apparentée, mais c'était avant l'avènement de Flex et de Paratext. Cela n'a qu'un intérêt historique.

Cela complique les choses que de nombreux affixes changent l'orthographe de la base. Je vois au moins deux avantages à faire cette analyse morphologique. Cela m'aide à repérer les mots qu'un traducteur a marqués comme correctement écrits alors qu'en fait ce n'est pas le cas. Lorsque je filtre les mots sans morphologie approuvée, je peux souvent trouver des mots mal orthographiés. Un autre avantage est que je peux utiliser l'option de base dans l'outil des termes bibliques. Aucun des traducteurs avec qui nous travaillons n'a une connaissance adéquate de la morphologie pour effectuer cette tâche.

Iver+Larsen

Traduit automatiquement depuis English

Cela dépend de la complexité de la morphologie. Celui sur lequel je travaille aurait environ 50 000 mots uniques dans la Bible. Je prends un livre à la fois, et même après avoir fait les deux tiers de la Bible, je trouve encore des mots que le programme ne peut pas analyser correctement.

Iver+Larsen

Traduit automatiquement depuis English

Questions connexes

+1 vote
3 réponses 329 vues
Bonjour à toutes et à tous, Il y a quelque temps, j'ai demandé si vous, ou quelqu'un que vous connaissez, ... connaissez de telles données. Merci beaucoup, dcb . [Email Removed]
dcb 194 posée oct. 7, 2020
0 votes
1 réponse 197 vues
Dans le cadre du Partnership for Applied Biblical NLP, nous définissons une tâche partagée pour la segmentation des mots ... à partager, faites-le-moi savoir ! [Email Removed]
Jonathan Robie 448 posée juil. 27, 2022
0 votes
1 réponse 325 vues
I'm helping a user with a consultant notes problem where when she moves through many of her notes she gets this box that ... report with a code of PTXS-17507 Thank you, MSEAIT/LT
MSEAIT_LT 478 posée sept. 4, 2018
0 votes
0 réponses 162 vues
As resources have been moved to the DBL for Paratext 8, many now have different language identifiers than they did in ... do this using Greek as the test case. [Link Removed]
[Expert]
Jeff_Shrum
2,9k
posée nov. 29, 2017
0 votes
1 réponse 320 vues
A project I'm working with has extensive footnotes including Greek, Hebrew, Arabic and English words inside of them ... it possible to exclude footnotes from these sorts of checks?
mnjames 1,9k posée juil. 20, 2018
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
For where two or three gather in my name, there am I with them.
Matthew 18:20
3,048 questions
6,007 réponses
5,672 commentaires
2,028 utilisateurs