0 votos
725 visualizações

Estou procurando dados de segmentação morfológica para idiomas de tradução, tanto para idiomas de comunicação ampla quanto para idiomas de tradução.

Por exemplo, em inglês, eu gostaria de decompor uma palavra como “unthinkable” em [un [[think] able]] ou, pelo menos, em un-think-able.

Conheço os tipos de informações encontradas no FLEx, mas estou me perguntando se alguma das ferramentas de verificação no Paratext contém essas informações de uma forma útil para idiomas que não possuem modelos FLEx.

Essas informações estão disponíveis?

Obrigado!

Jonathan+Robie

Tradução automática de English
Paratext por (448 pontos)
reexibida | 725 visualizações

5 Respostas

0 votos
Melhor resposta

Este é o aspecto do XML no arquivo (pode ser um pouco mais fácil de ler):

  <Entry Word="heals">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:s</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healing">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heal">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="healed">
    <Analysis>
      <Lexeme>Stem:heal</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="headed">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ed</Lexeme>
    </Analysis>
  </Entry>
  <Entry Word="heading">
    <Analysis>
      <Lexeme>Stem:head</Lexeme>
      <Lexeme>Suffix:ing</Lexeme>
    </Analysis>

Observe que ter essas informações em um projeto depende de alguém ter realizado a decomposição morfológica na Lista de Palavras (Wordlist) ou no Interlinear.

Tradução automática de English
por [Expert]
(16,7k pontos)

reexibida

Isso é tudo feito manualmente, ou há uma maneira de criar um “primeiro palpite” usando PLN (Processamento de Linguagem Natural)?

Tradução automática de English
0 votos

Se as palavras em um projeto do Paratext tiverem sido decompostas em morfemas na Lista de Palavras (Wordlist), a decomposição é mantida no arquivo WordAnalyses.xml. Isso é algo que você pode usar? Tentei anexar uma captura de tela, mas não tenho certeza se ela será exibida. Por exemplo, a palavra ācāmciintōōsii tem um prefixo e 3 sufixos: ā-cām-ciin-tōōs-ii.

Iver+Larsen

Tradução automática de English
por (869 pontos)
reexibida
0 votos

Perfeito. É exatamente o que eu preciso.

Obrigado!

Jonathan+Robie

Tradução automática de English
por (448 pontos)
0 votos

É feito manualmente, mas o Paratext tenta aprender como a morfologia é feita, então, após um tempo, o trabalho “manual” pode ser apenas aceitar o que o Paratext adivinhou. Você pode ver esse comportamento na Lista de Palavras (Wordlist) ou no Interlinear.

EDIÇÃO: Então, no meu exemplo XML acima, eu poderia inserir “healed” como “heal +ed” e depois “healing”
como “heal +ing”, o que poderia fazer o Paratext adivinhar que “heals” é “heal +s” e “headed” é “head +ed”, etc…

Tradução automática de English
por [Expert]
(16,7k pontos)

reexibida

Na Ferramenta de Hifenização, o trabalho manual começa com a aceitação dos palpites como corretos e a correção dos palpites errados. No entanto, uma vez que você perceber que o Paratext está adivinhando corretamente, você NÃO precisa continuar aceitando os palpites corretos. Está bom. Espero que a Ferramenta de Morfologia funcione da mesma forma: comece treinando-a filtrando palavras com seus afixos mais comuns e, uma vez que ela adivinhe corretamente, filtre por outro até que você tenha lidado com seus afixos conhecidos e não veja mais palpites errados. É muito gratificante assistir ao “momento eureka” do Paratext quando ele começa a acertar.

Pode haver algum benefício em aprovar muitos de uma vez para afirmar suas escolhas, e ambas as ferramentas permitem que você selecione muitas instâncias com Shift e, em seguida, via menu, aprove todas. MUITO melhor do que adormecer clicando sem parar.

Bênçãos,

Tradução automática de English
0 votos

Alguém tem uma boa noção de quanto trabalho é necessário para criar uma morfologia que cubra bem uma tradução? Qual nível de habilidade é exigido?

Tradução automática de English
por (448 pontos)

Johnathan,

Leva um tempo considerável dividir todas as palavras de um projeto. Para aqueles que desejam fazer isso, recomendo começar na ferramenta Lista de Palavras (Wordlist) e não no interlinear. Dessa forma, palavras com a mesma raiz ou radical podem ser agrupadas. Eu ordenaria a lista pelos verbos mais comuns e analisaria todas as formas superficiais de algumas raizes/radical de verbos muito comuns. Dessa forma, você ensinará ao analisador do Paratext a morfologia e ele começará a adivinhar corretamente muito rapidamente para outros verbos. Aprovar uma análise corretamente adivinhada é muito mais rápido do que analisar manualmente, então ensinar o Paratext a analisar corretamente é onde os ganhos mais rápidos podem ser obtidos. Uma vez que ele estiver adivinhando bem, você pode mudar para usar o interlinearizador do projeto e trabalhar versículo por versículo. Se você quiser fazer isso, também recomendo que você não vincule o Paratext ao Flex. Fazer isso complica o processo, a menos que você esteja pronto para configurar corretamente o analisador Ample no Flex, o que leva muito tempo para a maioria dos idiomas.

Tradução automática de English

“Um tempo considerável para dividir todas as palavras de um projeto” é uma questão de semanas? Meses? Mais tempo?

Tradução automática de English

Se um projeto tem 20.000 palavras únicas e se alguém que conhece bem a estrutura da língua estiver trabalhando nele, eles podem facilmente segmentar 2 palavras/minuto. No final do primeiro dia, eles terão segmentado quase 1.000 palavras. Nesse ponto, o Paratext deve ter dados suficientes para começar a fazer palpites inteligentes, então, no segundo dia, eles podem facilmente fazer 4 palavras/minuto, chegando a 3.000 palavras. A partir daí, eles devem ser capazes de fazer 8 palavras/minuto, ou seja, mais 4.000 palavras por dia.

Sete dias úteis.

Tradução automática de English

Depende da morfologia e se alguém entende o que são os morfemas. A boa notícia (nesta situação) é que o Paratext não precisa saber o que um morfema significa, ou mesmo que ele é um alomorfema de outro morfema. O Paratext só precisa saber se uma sequência de caracteres é um morfema ou não.
Então, se você pudesse encontrar alguém que saiba identificar o morfema, eu acho que eles poderiam fazer o Paratext adivinhar as divisões em um NT (Novo Testamento) corretamente na maioria das vezes em uma semana. Eles teriam que usar o método que já descrevi. Provavelmente seria possível percorrer todo o NT em um mês, mas, como é desafiador fazer esse tipo de trabalho dia após dia, eu dobraria o tempo e agendaria muitas pausas para reduzir erros mentais. Se a pessoa que estiver fazendo isso tiver muitas perguntas sobre a morfologia à medida que avança na tarefa, também levará mais tempo para permitir que ela resolva partes da morfologia que não conhece. O Paratext começará a propor padrões que podem ou não estar realmente lá, e a pessoa terá que ser capaz de dizer “não” ao Paratext às vezes.

Tradução automática de English

Estou trabalhando em um idioma com morfologia complexa, então passei dias dividindo palavras em um radical e muitos afixos. Configuramos o AMPLE em um idioma relacionado e usamos o CARLA para adaptar a outro idioma relacionado, mas isso foi antes do surgimento do Flex e do Paratext. Isso só tem interesse histórico.

Complica as coisas o fato de muitos afixos alterarem a grafia do radical. Vejo pelo menos duas vantagens em fazer essa análise morfológica. Ajuda-me a identificar palavras que um tradutor marcou como corretamente escritas, quando, na verdade, não estão corretas. Quando filtro as palavras sem morfologia aprovada, muitas vezes encontro palavras com erros de grafia. Outra vantagem é que posso usar a opção de radical na ferramenta de termos bíblicos. Nenhum dos tradutores com quem trabalhamos tem conhecimento adequado da morfologia para realizar essa tarefa.

Iver+Larsen

Tradução automática de English

Depende da complexidade da morfologia. A que estou trabalhando teria cerca de 50.000 palavras únicas na Bíblia. Eu trabalho um livro de cada vez e, mesmo depois de ter feito dois terços da Bíblia, ainda encontro palavras que o programa não consegue analisar corretamente.

Iver+Larsen

Tradução automática de English

Perguntas relacionadas

+1 voto
3 respostas 324 visualizações
Olá a todos, Há algum tempo, perguntei se vocês, ou alguém que vocês conheçam, possuem um projeto no Paratext com uma ... de dados assim. Muitas obrigado, dcb . [Email Removed]
dcb 194 perguntada Out 7, 2020
0 votos
1 resposta 195 visualizações
Na Partnership for Applied Biblical NLP, estamos definindo uma tarefa compartilhada para segmentação de palavras - basicamente, um ... , por favor, me avise! [E-mail removido]
Jonathan Robie 448 perguntada Jul 27, 2022
0 votos
1 resposta 318 visualizações
I'm helping a user with a consultant notes problem where when she moves through many of her notes she gets this box that ... report with a code of PTXS-17507 Thank you, MSEAIT/LT
MSEAIT_LT 478 perguntada Set 4, 2018
0 votos
0 respostas 159 visualizações
As resources have been moved to the DBL for Paratext 8, many now have different language identifiers than they did in ... do this using Greek as the test case. [Link Removed]
[Expert]
Jeff_Shrum
2,9k
perguntada Nov 29, 2017
0 votos
1 resposta 313 visualizações
A project I'm working with has extensive footnotes including Greek, Hebrew, Arabic and English words inside of them ... it possible to exclude footnotes from these sorts of checks?
mnjames 1,9k perguntada Jul 20, 2018
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
May the God who gives endurance and encouragement give you the same attitude of mind toward each other that Christ Jesus had.
Romans 15:5
3,047 perguntas
6,007 respostas
5,672 comentários
2,027 usuários