Aller au contenu

Inspecteur de Caractères Unicode

Collez un texte ou un emoji et voyez précisément de quels points de code, octets et écritures il est fait.

Traité localement dans votre navigateur

Options
0 caractères · 0 lignes
Le résultat apparaîtra ici.

Qu'est-ce que Inspecteur de Caractères Unicode ?

Unicode donne à chaque caractère un numéro, son point de code, et les encodages le stockent différemment : l’UTF-8 utilise de 1 à 4 octets, l’UTF-16 une ou deux unités de 16 bits. Connaître les points de code exacts explique des bogues mystérieux : espaces de largeur nulle invisibles, lettres cyrilliques trompeuses, accents formés de marques combinantes, ou emoji famille composé en réalité de cinq points de code.

Cet inspecteur fait office d’inspecteur de caractères, de visionneuse de points de code d’emoji et de visionneuse d’octets UTF-8. Pour chaque point de code (ou, si vous préférez, chaque grapheme visible, grâce à Intl.Segmenter quand votre navigateur le fournit), il liste le caractère, le point de code U+, la valeur décimale, les octets UTF-8, les unités UTF-16, l’entité HTML, la catégorie générale (Lu, Ll, So, Cf…) et l’écriture (Latin, Han, Cyrillique, Commun…). Un résumé compte caractères, points de code, unités UTF-16 et octets UTF-8, et indique si le texte est purement ASCII ou en forme NFC.

Comment ça marche ?

  1. Collez ou saisissez un texte, un emoji ou une chaîne suspecte.
  2. Choisissez une ligne par point de code (par défaut) ou par graphème (caractère visible).
  3. Lisez le tableau (500 premiers éléments) et le résumé ; les caractères de contrôle et invisibles sont représentés par des symboles visibles.

Cas d'usage courants

  • Repérer des caractères invisibles comme l’espace de largeur nulle (U+200B) ou une marque d’ordre des octets dans un texte copié.
  • Comprendre pourquoi deux chaînes d’apparence identique ne correspondent pas (lettres trompeuses ou normalisation différente).
  • Apprendre comment les séquences d’emoji se construisent avec plusieurs points de code et jointures.
  • Calculer la longueur en octets UTF-8 d’un texte pour une colonne de base de données ou une limite d’API.

Exemples

Essayez cette saisie dans l'outil ci-dessus :

Entrée
Héllo 👨‍👩‍👧 世界
Sortie
U+0048 U+00E9 U+006C U+006C U+006F U+0020 U+1F468 U+200D U+1F469 U+200D U+1F467 U+0020 U+4E16 U+754C

Confidentialité

Inspecteur de Caractères Unicode s'exécute entièrement dans votre navigateur. Le texte ou les fichiers que vous fournissez sont traités sur votre appareil et ne sont ni envoyés, ni journalisés, ni stockés sur nos serveurs.

Limites

Les noms de caractères ne sont pas fournis et les écritures ne couvrent que les systèmes les plus courants (les autres apparaissent sous « Other »). L’analyse s’arrête après 200 000 caractères et le tableau affiche 500 lignes.

Questions fréquentes

Quelle différence entre point de code et graphème ?

Un point de code est un nombre Unicode. Un graphème est ce que vous voyez comme un caractère ; il peut compter plusieurs points de code, comme « e » plus un accent combinant, ou un drapeau formé de deux indicateurs régionaux.

Pourquoi 😀 a-t-il deux unités UTF-16 ?

Les unités UTF-16 font 16 bits : au-delà de U+FFFF, un point de code est stocké en paire de substitution (D83D DE00). En UTF-8, le même caractère occupe quatre octets : F0 9F 98 80.

Que signifient catégorie et écriture ?

La catégorie est la catégorie générale Unicode (Lu = lettre majuscule, Nd = chiffre décimal, Cf = caractère de format invisible…). L’écriture indique le système d’écriture du caractère ; ponctuation et emoji sont en général « Common ».

Plus d'outils dans Encodage & décodage →