В рамках Партнёрства по прикладной библейской NLP мы определяем «общую задачу» для сегментации слов — по сути, это соревнование, чтобы выяснить, какая программа выполняет эту задачу лучше всего. Цель состоит в создании NLP-программ, которые смогут делать это лучше. Мы рассматриваем возможность использования формата, который Paratext применяет в Wordanalyses.xml, и нам нужны данные высокого качества для различных языков.
У меня есть эти файлы для некоторых языков, по которым я хотя бы являюсь наблюдателем в проекте, но мне нужно больше, особенно для языков, по которым было проделана значительная работа над морфологией в Interlinearizer или Wordlist.
Нас интересуют как языки широкого общения, так и морфологически сложные языки, представляющие разные типы языков. Если у вас есть данные, которыми вы готовы поделиться, пожалуйста, дайте мне знать!
[Email Removed]
In the Partnership for Applied Biblical NLP, we are defining a “shared task” for word segmentation - basically, a contest to see which software can do it best. The goal is to create NLP software that can do it better. We are considering using the format Paratext uses in Wordanalyses.xml, and we need high quality data for a variety of languages.
I have these files for some languages where I am at least an observer on the project, but I need more, particularly for languages where a lot of work has been done on the morphology in either the Interlinearizer or the Wordlist.
We are interested in both languages of wider communication and languages that are morphologically complex and represent different kinds of languages. If you have data you are willing to share, please let me know!
[Email Removed]