UTF-8 ビューア

テキストを UTF-8 バイト列に展開。各文字の 10 進 / 16 進 / 2 進を確認

文字数: {{ charCount }} バイト数: {{ byteCount }}
#文字10 進16 進2 進
{{ r.index }} {{ r.display }} {{ r.dec }} {{ r.hex }} {{ r.bin }}
最初の {{ maxRows }} バイトを表示、合計 {{ rows.length }} バイト
テキストを入力すると、ここに UTF-8 バイト列が表示されます
Hex ツール →

UTF-8 エンコードについて

UTF-8 は可変長の Unicode エンコードです。ASCII 文字(0-127)は 1 バイト、一般的な日本語の文字は 3 バイト、一部の希少な文字や絵文字は 4 バイトになります。インターネット上で最も普及した文字エンコードであり、本サイトがすべての日本語テキストに使用している基盤のエンコードです。

本ツールを使うと、「あ」が 3 バイト E3 81 82(10 進で 227, 129, 130)にエンコードされることを直接確認でき、同じ日本語の文字がエンコードによってサイズが異なる理由がわかります。

入力: → バイト: E3 81 82(3 バイト)

入力: A → バイト: 41(1 バイト、つまり ASCII 65)

よくある質問

Q: なぜ日本語の 1 文字が 3 バイトになるのか?
A: UTF-8 では、U+0800 から U+FFFF の範囲(ほとんどの日本語の文字をカバー)の文字は固定の 3 バイトでエンコードされます。これは UTF-8 の可変長規則によるもので、エラーではありません。
Q: 16 進・10 進・2 進はどう対応するのか?
A: いずれも同じバイト値を異なる基数で表したものです。例えばバイト値 227 は 16 進で E3、2 進で 11100100 です。本ツールはそれらを並べて比較しやすく表示します。