Dans notre équipe, nous avons entrepris de réviser une traduction publiée du Nouveau Testament. Au début, nous étions optimistes, espérant que cela ne prendrait pas trop de temps et que peu de modifications seraient nécessaires. Maintenant, nous avons constaté que plus de 90 % des versets ont été modifiés.
Nous avons effectué tout notre travail de révision en dehors de Paratext. Cela, pour de nombreuses raisons que je ne détaillerai pas ici. Cependant, maintenant que nous approchons de la ligne d'arrivée, nous devons travailler à l'importation du travail dans Paratext.
Le texte dont nous disposons est structuré très simplement, vous pouvez le considérer comme un tableau, où la première colonne est la référence du verset (par ex : Marc 1:1) et la deuxième colonne contient le contenu du verset en texte brut. Il n'y a pas de titres, pas de marqueurs de paragraphe, pas de notes de bas de page, rien de ce genre. Je voulais prendre le USFM existant et le mettre à jour avec le nouveau texte. J'ai développé du code pour faire cela, en utilisant principalement usfm-grammar. J'ai pris le USFM existant, l'ai converti en JSON, modifié le JSON pour mettre à jour la traduction, puis j'ai converti la traduction de nouveau en USFM en utilisant le même outil.
Cependant, je remarque que conserver les en-têtes, les paragraphes et les références croisées est délicat. J'ai passé un ou deux jours à travailler sur cela (y compris le processus de décision de cette approche), et je ne veux vraiment pas passer beaucoup de temps à programmer quelque chose si ce n'est pas une bonne utilisation de mon temps. Lorsque j'ai importé le résultat dans Paratext, il se plaignait d'un USFM invalide. Il semble donc que usfm-grammar puisse produire un USFM invalide.
J'ai cherché des bibliothèques pour écrire du USFM. J'ai trouvé pas mal d'options pour analyser le USFM et pour convertir le USFM vers d'autres formats, mais usfm-grammar était la seule bibliothèque que j'ai trouvée qui pouvait écrire du USFM, en convertissant le JSON en USFM.
Je regarde maintenant deux options :
- Continuer à développer un outil capable de fusionner les révisions en texte brut avec le USFM existant.
- ou… essentiellement démarrer un nouveau projet dans Paratext, en important le texte brut en USFM, sans tenter de le fusionner avec les en-têtes existants et les autres informations de la traduction existante.
J'ai déjà essayé l'option 2. Comme vous pouvez l'imaginer, il était assez facile de générer une sortie comme celle-ci :
\id MRK
\c 1
\p
\v 1 the first verse
\v 2 the second verse
\v 3 the third verse
\v 4 etc
Quel conseil me donneriez-vous ? Je penche actuellement pour l'option 2, et je fais simplement le travail d'ajouter manuellement les en-têtes et les références croisées. Les en-têtes ont de toute façon besoin d'une révision manuelle.