Dans le cadre du Partnership for Applied Biblical NLP, nous définissons une « tâche partagée » pour la segmentation des mots — en gros, un concours pour voir quel logiciel le fait le mieux. L'objectif est de créer des logiciels de TALN (traitement automatique des langues) capables de le faire mieux. Nous envisageons d'utiliser le format que Paratext utilise dans Wordanalyses.xml, et nous avons besoin de données de haute qualité pour une variété de langues.
J'ai ces fichiers pour certaines langues pour lesquelles je suis au moins observateur sur le projet, mais j'en ai besoin de plus, en particulier pour les langues pour lesquelles beaucoup de travail a été fait sur la morphologie, soit dans l'Interlinearizer, soit dans la Wordlist.
Nous sommes intéressés à la fois par les langues de communication large et par les langues morphologiquement complexes qui représentent différents types de langues. Si vous avez des données que vous êtes disposé à partager, faites-le-moi savoir !
[Email Removed]
In the Partnership for Applied Biblical NLP, we are defining a “shared task” for word segmentation - basically, a contest to see which software can do it best. The goal is to create NLP software that can do it better. We are considering using the format Paratext uses in Wordanalyses.xml, and we need high quality data for a variety of languages.
I have these files for some languages where I am at least an observer on the project, but I need more, particularly for languages where a lot of work has been done on the morphology in either the Interlinearizer or the Wordlist.
We are interested in both languages of wider communication and languages that are morphologically complex and represent different kinds of languages. If you have data you are willing to share, please let me know!
[Email Removed]
Traduit automatiquement depuis English