Na nossa equipe, começamos a revisar uma tradução publicada do Novo Testamento. No início, éramos otimistas, esperando que não levaria muito tempo e que não seriam necessárias muitas alterações. Agora, descobrimos que mais de 90% dos versículos foram modificados.
Fizemos todo o nosso trabalho de revisão externamente ao Paratext. Isso é por muitos motivos, que não entrarei em detalhes aqui. No entanto, agora que estamos chegando à linha de chegada, precisamos trabalhar na importação do trabalho de volta para o Paratext.
O texto que temos é estruturado de forma muito simples; você pode pensar nele como uma tabela, onde a primeira coluna é a referência do versículo (ex.: Marcos 1:1) e a segunda coluna é o conteúdo do versículo em texto simples. Não há títulos, nem marcadores de parágrafo, nem notas de rodapé, nada disso. Eu queria pegar o USFM existente e atualizá-lo com o novo texto. Desenvolvi algum código que fazia isso, usando principalmente usfm-grammar. Peguei o USFM existente, converti para JSON, modifiquei o JSON para atualizar a tradução e, em seguida, converti a tradução de volta para USFM usando a mesma ferramenta.
No entanto, estou notando que manter os cabeçalhos, parágrafos e referências cruzadas preservados é complicado. Passei um ou dois dias trabalhando nisso (incluindo o processo de decidir por essa abordagem) e realmente não quero gastar muito tempo programando algo se não for um bom uso do meu tempo. Quando importei o resultado de volta para o Paratext, ele reclamou sobre USFM inválido. Então, parece que usfm-grammar pode produzir USFM inválido.
Procurei por bibliotecas para escrever USFM. Encontrei várias opções para analisar USFM e para converter USFM para outros formatos, mas usfm-grammar foi a única biblioteca que encontrei que poderia escrever USFM, convertendo JSON para USFM.
Agora estou considerando duas opções:
- Continuar a desenvolver uma ferramenta que possa mesclar revisões em texto simples com o USFM existente.
- ou… efetivamente começar um novo projeto no Paratext, importando o texto simples como USFM, sem tentar mesclá-lo com os cabeçalhos existentes e outras informações na tradução existente.
Já tentei a opção 2. Como você pode imaginar, foi bastante fácil gerar uma saída como esta:
\id MRK
\c 1
\p
\v 1 the first verse
\v 2 the second verse
\v 3 the third verse
\v 4 etc
Que conselho você me daria? Atualmente, estou inclinado para a opção 2 e apenas fazendo o trabalho de adicionar de volta os cabeçalhos e referências cruzadas manualmente. Os cabeçalhos precisam de uma revisão manual de qualquer forma.