Dalam Partnership for Applied Biblical NLP, kami sedang mendefinisikan "shared task" untuk segmentasi kata - pada dasarnya, sebuah kontes untuk melihat perangkat lunak mana yang dapat melakukannya dengan terbaik. Tujuannya adalah untuk membuat perangkat lunak NLP yang dapat melakukannya dengan lebih baik. Kami mempertimbangkan penggunaan format yang digunakan Paratext di Wordanalyses.xml, dan kami membutuhkan data berkualitas tinggi untuk berbagai bahasa.
Saya memiliki file-file ini untuk beberapa bahasa di mana saya setidaknya menjadi pengamat dalam proyek, tetapi saya membutuhkan lebih banyak, terutama untuk bahasa-bahasa di mana banyak pekerjaan telah dilakukan pada morfologi di Interlinearizer atau Wordlist.
Kami tertarik pada bahasa-bahasa komunikasi yang lebih luas dan bahasa-bahasa yang kompleks secara morfologis serta mewakili berbagai jenis bahasa. Jika Anda memiliki data yang bersedia dibagikan, silakan beri tahu saya!
[Email Removed]
In the Partnership for Applied Biblical NLP, we are defining a “shared task” for word segmentation - basically, a contest to see which software can do it best. The goal is to create NLP software that can do it better. We are considering using the format Paratext uses in Wordanalyses.xml, and we need high quality data for a variety of languages.
I have these files for some languages where I am at least an observer on the project, but I need more, particularly for languages where a lot of work has been done on the morphology in either the Interlinearizer or the Wordlist.
We are interested in both languages of wider communication and languages that are morphologically complex and represent different kinds of languages. If you have data you are willing to share, please let me know!
[Email Removed]
Diterjemahkan secara otomatis dari English