Раскрыть текст в его байтовую последовательность UTF-8; увидеть десятичное / hex / двоичное представление каждого символа
UTF-8 — это переменной длины кодировка Unicode: символы ASCII (0-127) занимают 1 байт; обычные не-ASCII символы — 3 байта; некоторые редкие символы и эмодзи — 4 байта. Это самая популярная символьная кодировка в интернете и базовая кодировка, которую этот сайт использует для всего текста.
С помощью этого инструмента можно напрямую увидеть, что «€» кодируется тремя байтами E2 82 AC (десятичные 226, 130, 172), что объясняет, почему один и тот же не-ASCII символ занимает разный размер в разных кодировках.
Входные данные: € → Байты: E2 82 AC (3 байта)
Входные данные: A → Байты: 41 (1 байт, т.е. ASCII 65)