L’encodage en pour cent travaille sur les octets. L’ASCII occupe souvent un octet par caractère, mais lettres accentuées, cyrillique et emoji utilisent plusieurs octets UTF-8. Chaque octet non conservé littéralement devient un signe pour cent suivi de deux chiffres hexadécimaux.
Le scalaire é produit deux échappements
En UTF-8, é correspond aux octets C3 A9 : le composant RFC donne %C3%A9. C’est un scalaire Unicode et un caractère visible, mais deux octets et six caractères ASCII en sortie. URLCodec montre les quatre vues pour expliquer la longueur.
La casse hex ne change pas le décodage, mais la forme canonique est majuscule
Les formes %c3%a9 et %C3%A9 décrivent les mêmes octets. URLCodec accepte les deux au décodage, réencode le texte puis compare à la forme canonique majuscule. L’interopérabilité est conservée et la sortie reste déterministe pour tests et documentation.
Contrôlez le composant destinataire
L’encodage en pour cent dépend du contexte. URLCodec transforme volontairement une valeur et n’analyse pas une URL entière, ne sépare pas les paires de requête, ne normalise pas un chemin, ne valide pas une destination et ne décide pas si un système attend les règles de formulaire. Collez le résultat uniquement dans le composant dont vous avez vérifié le contrat. Encoder change la représentation ; cela ne chiffre, n’authentifie, ne nettoie ni ne sécurise une destination.