En la Partnership for Applied Biblical NLP, estamos definiendo una «tarea compartida» para la segmentación de palabras: básicamente, un concurso para ver qué software lo hace mejor. El objetivo es crear software de PLN que lo haga mejor. Estamos considerando usar el formato que Paratext utiliza en Wordanalyses.xml, y necesitamos datos de alta calidad para una variedad de idiomas.
Tengo estos archivos para algunos idiomas en los que soy al menos observador en el proyecto, pero necesito más, especialmente para idiomas en los que se haya realizado mucho trabajo en la morfología, ya sea en el Interlinearizer o en la Wordlist.
<
Nos interesan tanto los idiomas de comunicación amplia como los idiomas morfológicamente complejos que representan diferentes tipos de idiomas. Si tiene datos que esté dispuesto a compartir, ¡por favor, avíseme!
[Email Removed]
In the Partnership for Applied Biblical NLP, we are defining a “shared task” for word segmentation - basically, a contest to see which software can do it best. The goal is to create NLP software that can do it better. We are considering using the format Paratext uses in Wordanalyses.xml, and we need high quality data for a variety of languages.
I have these files for some languages where I am at least an observer on the project, but I need more, particularly for languages where a lot of work has been done on the morphology in either the Interlinearizer or the Wordlist.
We are interested in both languages of wider communication and languages that are morphologically complex and represent different kinds of languages. If you have data you are willing to share, please let me know!
[Email Removed]
Traducción automática desde English