Na Partnership for Applied Biblical NLP, estamos definindo uma “tarefa compartilhada” para segmentação de palavras — basicamente, um concurso para ver qual software faz isso melhor. O objetivo é criar software de PLN que consiga fazer isso com mais eficiência. Estamos considerando usar o formato que o Paratext utiliza no Wordanalyses.xml e precisamos de dados de alta qualidade para uma variedade de idiomas.
Eu tenho esses arquivos para alguns idiomas nos quais sou pelo menos observador no projeto, mas preciso de mais, especialmente para idiomas em que muito trabalho foi feito na morfologia, seja no Interlinearizer ou na Wordlist.
Temos interesse tanto em idiomas de comunicação ampla quanto em idiomas morfologicamente complexos que representem diferentes tipos de idiomas. Se você tiver dados dispostos a compartilhar, por favor, me avise!
[E-mail removido]
In the Partnership for Applied Biblical NLP, we are defining a “shared task” for word segmentation - basically, a contest to see which software can do it best. The goal is to create NLP software that can do it better. We are considering using the format Paratext uses in Wordanalyses.xml, and we need high quality data for a variety of languages.
I have these files for some languages where I am at least an observer on the project, but I need more, particularly for languages where a lot of work has been done on the morphology in either the Interlinearizer or the Wordlist.
We are interested in both languages of wider communication and languages that are morphologically complex and represent different kinds of languages. If you have data you are willing to share, please let me know!
[Email Removed]
Tradução automática de English