+4 votes
335 vues

Je suis un passionné d'expressions régulières. Alors que j'écrivais une expression régulière pour rechercher des versets sans ponctuation finale :
[^\\][^\p{P}\d]\r\n\\v
ou
[^\\l][^\p{P}\d]\r\n\\v \d+ \p{Lu}
, j'ai réalisé que la variante C# des expressions régulières dans RegexPal (et le filtrage/Process de FLEx) prend en charge les catégories de caractères Unicode abrégées (et non longues).

Voici certaines des plus utiles :

  • \p{L} Lettre (presque toute orthographe)
  • \p{Lu} Lettre majuscule
  • \p{Ll} Lettre minuscule
  • \p{P} Ponctuation
  • \p{M} Tout diacritique

Si le P après la barre oblique est en majuscule, cela signifie NON cette classe de caractères.

  • \P{L} Tout caractère non lettre

La liste complète :

  • \p{L} : tout type de lettre de n'importe quelle langue.
    • \p{Ll} : une lettre minuscule qui a une variante majuscule.
    • \p{Lu} : une lettre majuscule qui a une variante minuscule.
    • \p{Lt} : une lettre qui apparaît au début d'un mot lorsque seule la première lettre du mot est en majuscule.
    • \p{L&} : une lettre qui existe en variantes minuscule et majuscule (combinaison de Ll, Lu et Lt).
    • \p{Lm} : un caractère spécial utilisé comme une lettre.
    • \p{Lo} : une lettre ou un idéogramme qui n'a pas de variantes minuscule et majuscule.
  • \p{M} : un caractère destiné à être combiné avec un autre caractère (par exemple, accents, tréma, cadres, etc.).
    • \p{Mn} : un caractère destiné à être combiné avec un autre caractère sans occuper d'espace supplémentaire (par exemple, accents, tréma, etc.).
    • \p{Mc} : un caractère destiné à être combiné avec un autre caractère qui occupe un espace supplémentaire (signes vocaux dans de nombreuses langues orientales).
    • \p{Me} : un caractère qui encadre le caractère avec lequel il est combiné (cercle, carré, touche, etc.).
  • \p{Z} : tout type d'espace ou de séparateur invisible.
    • \p{Zs} : un caractère espace invisible, mais qui occupe de l'espace.
    • \p{Zl} : caractère de séparation de ligne U+2028.
    • \p{Zp} : caractère de séparation de paragraphe U+2029.
  • \p{S} : symboles mathématiques, signes monétaires, dingbats, caractères de dessin de boîtes, etc.
    • \p{Sm} : tout symbole mathématique.
    • \p{Sc} : tout signe monétaire.
    • \p{Sk} : un caractère de combinaison (marque) en tant que caractère complet à part entière.
    • \p{So} : divers symboles qui ne sont ni des symboles mathématiques, ni des signes monétaires, ni des caractères de combinaison.
  • \p{N} : tout type de caractère numérique dans n'importe quel script.
    • \p{Nd} : un chiffre de zéro à neuf dans n'importe quel script, à l'exception des scripts idéographiques.
    • \p{Nl} : un nombre qui ressemble à une lettre, comme un chiffre romain.
    • \p{No} : un chiffre en exposant ou en indice, ou un nombre qui n'est pas un chiffre de 0 à 9 (en excluant les nombres des scripts idéographiques).
  • \p{P} : tout type de caractère de ponctuation.
    • \p{Pd} : tout type de trait d'union ou de tiret.
    • \p{Ps} : tout type de parenthèse ouvrante.
    • \p{Pe} : tout type de parenthèse fermante.
    • \p{Pi} : tout type de guillemet ouvrant.
    • \p{Pf} : tout type de guillemet fermant.
    • \p{Pc} : un caractère de ponctuation tel qu'un tiret bas qui relie les mots.
    • \p{Po} : tout type de caractère de ponctuation qui n'est ni un tiret, ni une parenthèse, ni un guillemet, ni un connecteur.
  • \p{C} : caractères de contrôle invisibles et points de code inutilisés.
    • \p{Cc} : un caractère de contrôle ASCII ou Latin-1 : 0x00–0x1F et 0x7F–0x9F.
    • \p{Cf} : indicateur de mise en forme invisible.
    • \p{Co} : tout point de code réservé à un usage privé.
    • \p{Cs} : la moitié d'une paire de substituts dans l'encodage UTF-16.
    • \p{Cn} : tout point de code auquel aucun caractère n'a été attribué.

Documentation complète :
https://www.regular-expressions.info/unicode.html#category

Traduit automatiquement depuis English
Paratext par (231 points)
réaffiché | 335 vues

1 Réponse

0 votes
***** Ajouté pour supprimer ce commentaire des questions sans réponse *****
Traduit automatiquement depuis English
par (9,9k points)

Questions connexes

0 votes
3 réponses 411 vues
Paratext est livré avec la liste des références croisées du GNT92 (Système de référence biblique abrégé, édité par ... traduction réutilise-t-elle simplement la liste GNT92 ?
LivingField 607 posée oct. 29, 2018
0 votes
0 réponses 135 vues
Are there ways to display genealogy information that helps make sense of what can be a textual maze? I've looked ... just wonder what others have done-if anything. Thanks, Paul
Paul 642 posée août 4, 2015
0 votes
1 réponse 13 vues
<!--[if gte mso 9]> Normal 0 false false false EN-US EN-CA AR-SA MicrosoftInternetExplorer4 <![endif]--><!--[if ... 3 installée, tandis que j'utilise encore la version 9.4.101.25.
Kamesa49 102 posée sept. 6, 2025
0 votes
2 réponses 578 vues
Cher lecteur. Je souhaite trouver \fq suivi de n'importe quelle chaîne de caractères, y compris ɛ ɔ ɲ ŋ, jusqu'au ... recherche à la première non-occurrence ? Merci d'avance, Bart
goodgoan 347 posée août 3, 2023
+1 vote
5 réponses 890 vues
Je souhaite changer les minuscules en majuscules dans certaines situations - par exemple, je veux changer toutes les minuscules ... simple et de l'ajouter au fur et à mesure.
Phil_Leckrone 9,9k posée mars 2, 2022
Welcome to Support Bible, where you can ask questions and receive answers from other members of the community.
And let us consider how we may spur one another on toward love and good deeds, not giving up meeting together, as some are in the habit of doing, but encouraging one another—and all the more as you see the Day approaching.
Hebrews 10:24-25
3,045 questions
6,005 réponses
5,671 commentaires
2,026 utilisateurs