0 suara
724 tampilan

Saya mencari data segmentasi morfologis untuk bahasa terjemahan, baik bahasa komunikasi luas maupun bahasa terjemahan.

Sebagai contoh, dalam bahasa Inggris, saya ingin memecah kata seperti “unthinkable” menjadi [un [[think] able]] atau setidaknya un-think-able.

Saya tahu jenis informasi yang ditemukan di FLEx, tetapi saya bertanya-tanya apakah alat pemeriksaan di Paratext berisi informasi ini dengan cara yang berguna untuk bahasa yang tidak memiliki model FLEx.

Apakah informasi ini tersedia?

Terima kasih!

Jonathan+Robie

Diterjemahkan secara otomatis dari English
Paratext oleh (448 poin)
ditampilkan kembali | 724 tampilan

5 Jawaban

0 suara
Jawaban terbaik

Berikut adalah tampilan XML dalam file (mungkin sedikit lebih mudah dibaca):

  <Entry Word="heals">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:s</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healing">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heal">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healed">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="headed">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heading">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>

Perhatikan bahwa memiliki informasi ini dalam proyek bergantung pada seseorang yang telah melakukan pemecahan morfologi di Wordlist atau di Interlinear.

Diterjemahkan secara otomatis dari English
oleh [Expert]
(16,7k poin)

ditampilkan kembali

Apakah semua ini dilakukan secara manual, atau ada cara untuk membuat “tebakan pertama” menggunakan NLP?

Diterjemahkan secara otomatis dari English
0 suara

Jika kata-kata dalam proyek Paratext telah dipecah menjadi morfem di Wordlist, pemecahan tersebut disimpan dalam file WordAnalyses.xml. Apakah ini sesuatu yang bisa Anda gunakan? Saya telah mencoba melampirkan tangkapan layar, tetapi saya tidak yakin apakah itu muncul. Sebagai contoh, kata ācāmciintōōsii memiliki satu prefiks dan 3 sufiks ā-cām-ciin-tōōs-ii.

Iver+Larsen

Diterjemahkan secara otomatis dari English
oleh (869 poin)
ditampilkan kembali
0 suara

Sempurna. Ini persis apa yang saya butuhkan.

Terima kasih!

Jonathan+Robie

Diterjemahkan secara otomatis dari English
oleh (448 poin)
0 suara

Ini dilakukan secara manual, tetapi Paratext mencoba mempelajari bagaimana morfologi dilakukan sehingga setelah beberapa waktu, pekerjaan “manual” mungkin hanya berupa menerima apa yang telah ditebak oleh Paratext. Anda dapat melihat perilaku ini di Wordlist atau di Interliinear.

EDIT: Jadi dalam contoh XML saya di atas, saya mungkin memasukkan “healed” sebagai “heal +ed” dan kemudian “healing”
sebagai “heal +ing” yang mungkin membuat Paratext menebak bahwa “heals” adalah “heal +s” dan “headed” adalah “head +ed”, dll…

Diterjemahkan secara otomatis dari English
oleh [Expert]
(16,7k poin)

ditampilkan kembali

Di Hyphenation Tool, pekerjaan manual dimulai dengan menerima tebakan sebagai benar dan memperbaiki tebakan yang salah. Namun, setelah Anda melihat bahwa Paratext menebak dengan benar, Anda TIDAK perlu terus menerima tebakan yang benar. Itu sudah bagus. Saya memperkirakan bahwa Morphology Tool juga sama, mulai melatihnya dengan memfilter kata-kata dengan afiks Anda yang paling umum dan setelah ia menebaknya dengan benar, filter untuk yang lain sampai Anda telah menangani afiks yang Anda kenal dan tidak melihat tebakan yang salah. Sangat memuaskan untuk melihat “momen aha” Paratext ketika ia mulai mendapatkannya dengan benar.

Dapat ada beberapa manfaat dalam menyetujui banyak sekaligus untuk menegaskan pilihan Anda dan kedua alat memungkinkan Anda untuk Shift Select banyak instance dan kemudian, melalui menu, menyetujui semuanya. JAUH lebih baik daripada tertidur karena mengklik-klik.

Berkat,

Diterjemahkan secara otomatis dari English
0 suara

Apakah ada yang memiliki gambaran yang baik tentang berapa banyak pekerjaan yang diperlukan untuk membuat morfologi yang mencakup terjemahan dengan baik? Tingkat keterampilan apa yang diperlukan?

Diterjemahkan secara otomatis dari English
oleh (448 poin)

Johnathan,

Membutuhkan waktu yang cukup banyak untuk membagi semua kata dalam proyek. Bagi mereka yang ingin melakukan ini, saya merekomendasikan untuk memulai di alat Wordlist dan bukan interlinear. Dengan cara ini, kata-kata dengan akar atau batang yang sama dapat dibuat muncul bersama. Saya akan mengurutkan daftar untuk kata kerja paling umum dan menganalisis semua bentuk permukaan untuk beberapa akar/batang kata kerja yang sangat umum. Dengan cara ini, Anda akan mengajarkan morfologi ke parser Paratext dan ia akan mulai menebak dengan benar dengan sangat cepat untuk kata kerja lainnya. Menyetujui parse yang ditebak dengan benar jauh lebih cepat daripada parse manual, sehingga mengajarkan Paratext untuk parse dengan benar adalah tempat di mana keuntungan tercepat dapat dibuat. Setelah ia menebak dengan baik, maka Anda bisa beralih ke penggunaan interlinearizer proyek dan bekerja ayat demi ayat. Jika Anda ingin melakukan ini, saya juga merekomendasikan agar Anda tidak menghubungkan Paratext ke Flex. Melakukan hal itu mempersulit proses ini, kecuali Anda siap untuk mengatur parser Ample dengan benar di Flex yang membutuhkan banyak waktu untuk sebagian besar bahasa.

Diterjemahkan secara otomatis dari English

Apakah “waktu yang cukup banyak untuk membagi semua kata dalam proyek” adalah masalah minggu? Bulan? Lebih lama?

Diterjemahkan secara otomatis dari English

Jika proyek memiliki 20.000 kata unik dan jika seseorang yang memahami struktur bahasa dengan baik sedang mengerjakannya, mereka dapat dengan mudah memsegmentasi 2 kata / menit. Pada akhir hari pertama, mereka akan telah memsegmentasi hampir 1.000 kata. Pada titik itu, Paratext harus memiliki cukup data untuk mulai membuat tebakan cerdas sehingga pada hari kedua mereka dapat dengan mudah melakukan 4 kata / menit, membawa mereka ke 3.000 kata. Dari sana ke depan, mereka harus mampu melakukan 8 kata / menit untuk 4.000 kata lagi per hari.

Tujuh hari kerja.

Diterjemahkan secara otomatis dari English

Ini bergantung pada morfologi dan apakah seseorang memahami apa itu morfem. Hal yang baik (dalam situasi ini) adalah bahwa Paratext tidak perlu tahu apa yang ditandakan oleh morfem, atau bahkan bahwa itu adalah alomorf dari morfem lain. Paratext hanya perlu tahu jika sebuah string karakter adalah morfem atau tidak.
Jadi jika Anda bisa menemukan seseorang yang tahu cara mengidentifikasi morfem, saya pikir mereka bisa membuat Paratext menebak pemecahan dalam PB dengan benar sebagian besar waktu dalam satu minggu. Mereka harus menggunakan metode yang telah saya jelaskan. Seseorang mungkin bisa melalui seluruh PB dalam sebulan, tetapi karena menantang untuk melakukan jenis pekerjaan ini hari demi hari, saya akan menggandakan waktu dan menjadwalkan banyak istirahat untuk mengurangi kesalahan mental. Jika orang yang melakukannya memiliki banyak pertanyaan tentang morfologi saat mereka masuk ke tugas, itu juga akan memakan waktu lebih lama untuk memungkinkan mereka untuk bekerja bagian morfologi yang tidak mereka ketahui. Paratext akan mulai memposisikan pola yang mungkin ada atau tidak, dan orang tersebut harus mampu memberi tahu Paratext “tidak” kadang-kadang.

Diterjemahkan secara otomatis dari English

Saya bekerja dalam bahasa dengan morfologi kompleks, jadi saya telah menghabiskan hari-hari membagi kata-kata dalam batang dan banyak afiks. Kami memang mengatur AMPLE dalam bahasa terkait dan menggunakan CARLA untuk beradaptasi ke bahasa terkait lainnya, tetapi itu adalah sebelum munculnya Flex dan Paratext. Ini hanya memiliki kepentingan historis.

Hal ini mempersulit hal-hal bahwa banyak afiks mengubah ejaan batang. Saya melihat setidaknya dua keuntungan untuk melakukan parse morfologis ini. Ini membantu saya untuk menemukan kata-kata yang telah ditandai oleh penerjemah sebagai ditulis dengan benar ketika sebenarnya tidak benar. Ketika saya memfilter kata-kata dengan morfologi yang tidak disetujui, saya sering dapat menemukan kata-kata yang salah eja. Keuntungan lainnya adalah bahwa saya dapat menggunakan opsi batang di alat istilah alkitabiah. Tidak ada penerjemah yang kami kerjakan yang memiliki pengetahuan morfologi yang memadai untuk melakukan tugas ini.

Iver+Larsen

Diterjemahkan secara otomatis dari English

Ini bergantung pada kompleksitas morfologi. Yang sedang saya kerjakan akan memiliki sekitar 50.000 kata unik dalam Alkitab. Saya mengambil satu buku pada satu waktu, dan bahkan setelah melakukan dua pertiga Alkitab, saya masih menemukan kata-kata yang tidak dapat di-parse dengan benar oleh program.

Iver+Larsen

Diterjemahkan secara otomatis dari English

Pertanyaan terkait

+1 suara
3 jawaban 324 tampilan
Halo semua, Beberapa waktu lalu saya bertanya apakah Anda, atau seseorang yang Anda kenal, memiliki proyek Paratext dengan ... itu. Banyak terima kasih, dcb . [Email Removed]
dcb 194 bertanya Okt 7, 2020
0 suara
1 jawaban 195 tampilan
Dalam Partnership for Applied Biblical NLP, kami sedang mendefinisikan "shared task" untuk segmentasi kata - pada dasarnya, ... dibagikan, silakan beri tahu saya! [Email Removed]
Jonathan Robie 448 bertanya Jul 27, 2022
0 suara
1 jawaban 318 tampilan
I'm helping a user with a consultant notes problem where when she moves through many of her notes she gets this box that ... report with a code of PTXS-17507 Thank you, MSEAIT/LT
MSEAIT_LT 478 bertanya Sep 4, 2018
0 suara
0 jawaban 159 tampilan
As resources have been moved to the DBL for Paratext 8, many now have different language identifiers than they did in ... do this using Greek as the test case. [Link Removed]
[Expert]
Jeff_Shrum
2,9k
bertanya Nov 29, 2017
0 suara
1 jawaban 313 tampilan
A project I'm working with has extensive footnotes including Greek, Hebrew, Arabic and English words inside of them ... it possible to exclude footnotes from these sorts of checks?
mnjames 1,9k bertanya Jul 20, 2018
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
Just as a body, though one, has many parts, but all its many parts form one body, so it is with Christ.
1 Corinthians 12:12
3,047 pertanyaan
6,007 jawaban
5,672 komentar
2,027 pengguna