Просмотр UTF-8

Раскрыть текст в его байтовую последовательность UTF-8; увидеть десятичное / hex / двоичное представление каждого символа

Символов: {{ charCount }} Байт: {{ byteCount }}
#СимволДесятичноеHexДвоичное
{{ r.index }} {{ r.display }} {{ r.dec }} {{ r.hex }} {{ r.bin }}
Показаны первые {{ maxRows }} байт, всего {{ rows.length }} байт
Введите текст, чтобы увидеть здесь последовательность байтов UTF-8
Инструмент Hex →

О кодировке UTF-8

UTF-8 — это переменной длины кодировка Unicode: символы ASCII (0-127) занимают 1 байт; обычные не-ASCII символы — 3 байта; некоторые редкие символы и эмодзи — 4 байта. Это самая популярная символьная кодировка в интернете и базовая кодировка, которую этот сайт использует для всего текста.

С помощью этого инструмента можно напрямую увидеть, что «€» кодируется тремя байтами E2 82 AC (десятичные 226, 130, 172), что объясняет, почему один и тот же не-ASCII символ занимает разный размер в разных кодировках.

Примеры

Входные данные: → Байты: E2 82 AC (3 байта)

Входные данные: A → Байты: 41 (1 байт, т.е. ASCII 65)

Часто задаваемые вопросы

В: Почему один не-ASCII символ занимает 3 байта?
О: В UTF-8 символы в диапазоне U+0800–U+FFFF (охватывающем большинство не-ASCII символов) используют фиксированное 3-байтовое кодирование. Это правило переменной длины UTF-8, а не ошибка.
В: Как соотносятся hex, десятичное и двоичное?
О: Все три описывают одно и то же значение байта в разных системах счисления. Например, значение байта 228 — это E4 в hex и 11100100 в двоичном. Этот инструмент выводит их рядом для удобного сравнения.