Convertisseur Unicode

Convertissez le texte en séquences d'échappement Unicode ou vice versa.

Qu’est-ce qu’Unicode ?

Unicode est une norme internationale pour l'encodage, la représentation et la gestion du texte. Il attribue un numéro unique (point de code) à chaque caractère de chaque système d'écriture, ainsi qu'aux symboles, émojis et caractères de contrôle. Unicode vise à devenir le jeu de caractères universel, contenant actuellement plus de 149 000 caractères couvrant 161 scripts.

Encodages Unicode

Les points de code Unicode peuvent être codés dans différents formats : UTF-8 (variable de 1 à 4 octets, compatible ASCII), UTF-16 (2 ou 4 octets, utilisé par JavaScript/Windows) et UTF-32 (fixé de 4 octets). UTF-8 est devenu l'encodage dominant sur le Web, gérant toutes les langues tout en restant efficace pour le texte ASCII.

Cas d'utilisation courants
  • Débogage des problèmes d'encodage dans le texte
  • Trouver des points de code de caractères spéciaux
  • Conversion de séquences Unicode échappées
  • Analyser la composition des personnages
  • Travailler avec l'internationalisation (i18n)
Formats de notation
U+XXXX Notation Unicode standard (par exemple, U+0041 pour « A »)
\uXXXX Séquence d'échappement JavaScript/JSON
&#DDDD; Entité décimale HTML
&#xHHHH; Entité HTML hexadécimale
Foire aux questions

Quelle est la différence entre UTF-8 et Unicode ?

Unicode est le jeu de caractères (mappage des caractères sur des nombres). UTF-8 est un moyen de coder ces nombres sous forme d'octets. Les autres codages incluent UTF-16 et UTF-32.

Pourquoi certains caractères ressemblent-ils à des cases ou à des points d’interrogation ?

Cela se produit lorsque votre système ne dispose pas d'une police incluant ce caractère ou lorsque l'encodage est mal détecté. Le personnage existe mais ne peut pas être affiché.