Unicode & Tabela de Emojis
Um número para cada caractere de cada idioma do mundo
O ASCII padronizou a codificação para o alfabeto em inglês (0 a 127). O Unicode nasceu para estender essa ideia universalmente: atribuir um identificador numérico único — chamado Code Point (no formato U+XXXX) — para cada letra, símbolo, escrita antiga, alfabeto e emoji existente.
'A' = U+0041 (65 decimal) — 1 byte em UTF-8
'ç' = U+00E7 (231 decimal) — 2 bytes em UTF-8 (0xC3 0xA7)
'😀' = U+1F600 (128512 decimal) — 4 bytes em UTF-8 (0xF0 0x9F 0x98 0x80)
Compatibilidade com ASCII
Os primeiros 128 code points do Unicode (de U+0000 a U+007F) são exatamente idênticos aos caracteres da tabela ASCII original. Portanto, qualquer texto ASCII de 7 bits já é um texto Unicode válido!
📋 Tabelas de Referência Unicode
1. Letras Acentuadas do Português (Suplemento Latin-1)
| Caractere | Code Point | Decimal | UTF-8 (Bytes Hex) | Nome Oficial Unicode |
|---|---|---|---|---|
| ç | U+00E7 | 231 | C3 A7 | Latin Small Letter C with Cedilla |
| Ç | U+00C7 | 199 | C3 87 | Latin Capital Letter C with Cedilla |
| ã | U+00E3 | 227 | C3 A3 | Latin Small Letter A with Tilde |
| Ã | U+00C3 | 195 | C3 83 | Latin Capital Letter A with Tilde |
| á | U+00E1 | 225 | C3 A1 | Latin Small Letter A with Acute |
| é | U+00E9 | 233 | C3 A9 | Latin Small Letter E with Acute |
| í | U+00ED | 237 | C3 AD | Latin Small Letter I with Acute |
| ó | U+00F3 | 243 | C3 B3 | Latin Small Letter O with Acute |
| ú | U+00FA | 250 | C3 BA | Latin Small Letter U with Acute |
| ñ | U+00F1 | 241 | C3 B1 | Latin Small Letter N with Tilde |
2. Símbolos de Moedas e Comerciais
| Símbolo | Code Point | Decimal | UTF-8 Hex | Nome Oficial |
|---|---|---|---|---|
| $ | U+0024 | 36 | 24 | Dollar Sign |
| € | U+20AC | 8364 | E2 82 AC | Euro Sign |
| £ | U+00A3 | 163 | C2 A3 | Pound Sign |
| ¥ | U+00A5 | 165 | C2 A5 | Yen Sign |
| ₿ | U+20BF | 8383 | E2 82 BF | Bitcoin Sign |
| © | U+00A9 | 169 | C2 A9 | Copyright Sign |
| ® | U+00AE | 174 | C2 AE | Registered Sign |
| ™ | U+2122 | 8482 | E2 84 A2 | Trade Mark Sign |
3. Símbolos Matemáticos e Científicos
| Símbolo | Code Point | Decimal | Nome Oficial |
|---|---|---|---|
| ∑ | U+2211 | 8721 | N-Ary Summation (Somatório) |
| √ | U+221A | 8730 | Square Root (Raiz Quadrada) |
| ∞ | U+221E | 8734 | Infinity (Infinito) |
| ≈ | U+2248 | 8776 | Almost Equal To (Aproximadamente Igual) |
| ≠ | U+2260 | 8800 | Not Equal To (Diferente) |
| ≤ | U+2264 | 8804 | Less-Than or Equal To (Menor ou Igual) |
| ≥ | U+2265 | 8805 | Greater-Than or Equal To (Maior ou Igual) |
| π | U+03C0 | 960 | Greek Small Letter Pi |
| Δ | U+0394 | 980 | Greek Capital Letter Delta |
| Ω | U+03A9 | 937 | Greek Capital Letter Omega (Ohm) |
4. Principais Emojis de Computação e Tecnologia
Os emojis ocupam o plano astrológico e suplementar do Unicode (U+1F000 em diante), exigindo 4 bytes na codificação UTF-8:
| Emoji | Code Point | Decimal | UTF-8 (4 Bytes Hex) | Nome Oficial Unicode |
|---|---|---|---|---|
| 💻 | U+1F4BB | 128187 | F0 9F 92 BB | Personal Computer |
| 🧠 | U+1F9E0 | 129504 | F0 9F a7 A0 | Brain (Cérebro / IA) |
| 🚀 | U+1F680 | 128640 | F0 9F 9a 80 | Rocket (Foguete) |
| ⚡ | U+26A1 | 9889 | E2 9A A1 | High Voltage (Voltagem / Raio) |
| ⚙️ | U+2699 | 9881 | E2 9A 99 | Gear (Engrenagem / Config) |
| 🔒 | U+1F512 | 128274 | F0 9F 94 92 | Lock (Cadeado / Segurança) |
| 💡 | U+1F4A1 | 128161 | F0 9F 92 A1 | Light Bulb (Ideia / Lâmpada) |
| 😀 | U+1F600 | 128512 | F0 9F 98 80 | Grinning Face (Rosto Sorridente) |
| 😎 | U+1F60E | 128526 | F0 9F 98 8E | Smiling Face with Sunglasses |
| 🔥 | U+1F525 | 128293 | F0 9F 94 A5 | Fire (Fogo / Desempenho) |
Como o UTF-8 Funciona na Prática?
Unicode atribui o número (Code Point), mas o UTF-8 define como guardar os bits em arquivo:
- 1 Byte (0 a 127):
0xxxxxxx(Compatível 100% com ASCII). - 2 Bytes (128 a 2047):
110xxxxx 10xxxxxx(Usado para letras acentuadas comoç,ã). - 3 Bytes (2048 a 65535):
1110xxxx 10xxxxxx 10xxxxxx(Usado para símbolos matemáticos e línguas asiáticas). - 4 Bytes (65536 a 1114111):
11110xxx 10xxxxxx 10xxxxxx 10xxxxxx(Usado para os emojis e caracteres suplementares).
Essa abordagem inteligente permite economizar armazenamento em arquivos de texto sem perder a capacidade de representar qualquer caractere do planeta!
🔗 Links e Tabelas Oficiais do Unicode Consortium
Para buscar Code Points e tabelas oficiais mantidas pelo Unicode Consortium:
- 🌐 Índice Oficial de Tabelas de Código Unicode: Unicode Consortium Code Charts (PDF index)
- 😀 Tabela Oficial Completa de Emojis: Unicode Full Emoji List (v15.1 / v16.0)
- 🔍 Buscador de Caracteres Unicode Database: Unicode Character Search Tool
- 📜 Especificação Técnica do UTF-8 (RFC 3629): IETF RFC 3629 — UTF-8, a Transformation Format of ISO 10646