O que é o formato de ficheiro UTF8?
A extensão .utf8 marca um arquivo de texto simples que está explicitamente codificado em UTF-8 - a codificação de caracteres Unicode dominante na web moderna e na maioria dos sistemas operacionais. O UTF-8 foi projetado por Ken Thompson e Rob Pike em setembro de 1992 e posteriormente padronizado como RFC 3629 (2003); ele codifica cada ponto de código Unicode usando de um a quatro bytes, permanecendo totalmente compatível com ASCII.
A extensão em si não é um formato de arquivo distinto. É uma convenção informal usada para sinalizar a codificação - mais comumente quando uma ferramenta como iconv -t UTF-8 converte um arquivo de codificação legada, ou quando um projeto armazena cópias irmãs em diferentes codificações e precisa diferenciá-las. Renomeie um arquivo .utf8 para um arquivo .txt e ele se comportará de forma idêntica; qualquer editor ou visualizador que manipule texto simples o abrirá sem modificações.
Um arquivo .utf8 pode opcionalmente começar com a marca de ordem de byte (BOM) do UTF-8, a sequência de três bytes EF BB BF. A maioria das ferramentas de Linux e macOS omite o BOM; as aplicações de Windows historicamente o adicionavam. Leitores que tratam o arquivo como Windows-1252 exibirão o BOM como os caracteres estranhos .
Como o UTF-8 é a codificação padrão de Markdown, CSV, JSON e muitos outros formatos de texto, o sufixo .utf8 aparece com mais frequência em pipelines de conversão de dados, fluxos de trabalho de localização e projetos de migração de sistemas legados onde nomear explicitamente a codificação evita ambiguidades.
Segurança e proteção
RISCO: LOWUm arquivo .utf8 é texto simples e não pode ser executado, portanto, abrir um para leitura é seguro. As únicas ressalvas não são maliciosas: escolha a codificação UTF-8 para evitar caracteres corrompidos e esteja ciente de que o BOM opcional pode confundir alguns scripts/importações de CSV. Como sempre, confie na extensão apenas após uma verificação de sanidade - um arquivo alegando ser «data.utf8» que na verdade é um executável seria o risco real, não o formato de texto UTF-8 em si.
Detalhes do formato
em resumoProgramas que abrem arquivos UTF8
Detalhes técnicos
especificação profunda| Esquema de codificação | Unicode de largura variável; cada ponto de código usa de 1 a 4 bytes |
| Compatibilidade ASCII | Bytes 0x00-0x7F são idênticos ao US-ASCII; um arquivo ASCII puro é um UTF-8 válido |
| Cobertura de caracteres | Todos os 1.114.112 pontos de código Unicode (U+0000 a U+10FFFF) |
| Tipo MIME | text/plain; charset=utf-8 |
| Marca de ordem de byte (BOM) | Prefixo opcional de três bytes EF BB BF (U+FEFF); geralmente omitido no Linux/macOS, às vezes adicionado por ferramentas Windows |
| Ordenação de bytes | Independente de ordem de byte; a extremidade (endianness) não é uma preocupação, ao contrário do UTF-16 ou UTF-32 |
| Estrutura do arquivo | Sequência plana de caracteres codificados; sem cabeçalho obrigatório, esquema ou metadados |
| Papel da extensão | Apenas convenção de nomenclatura - sinaliza a codificação UTF-8 para ferramentas e humanos; estruturalmente idêntico a um arquivo .txt |
| Sincronização automática | Bytes de continuação sempre começam com 10xxxxxx; um leitor pode ressincronizar após corrupção de dados sem reanalisar desde o início |
| Bytes por ponto de código | 1 byte (U+0000-U+007F), 2 bytes (U+0080-U+07FF), 3 bytes (U+0800-U+FFFF), 4 bytes (U+10000-U+10FFFF) |
| Finais de linha | Não obrigatório; arquivos podem usar LF (Unix/macOS), CR+LF (Windows) ou apenas CR (Mac legado) |
| Compressão | Nenhuma integrada; a redundância de texto faz com que arquivos .utf8 comprimam eficientemente com gzip, zstd ou bzip2 |
| Tamanho de arquivo típico | De bytes a muitos megabytes; texto na faixa ASCII tem o mesmo tamanho byte a byte que o ASCII; scripts não latinos requerem 2-4 bytes por caractere |
| Ferramentas comuns de geração | iconv -t UTF-8, Python str.encode('utf-8'), editores como VS Code, Vim (:set fileencoding=utf-8) e Notepad (Windows 10+) |
| Lançado | UTF-8 designed 1992; standardized in Unicode/ISO 10646. The .utf8 hint suffix is a later informal convention |
| Versão mais recente | UTF-8 per current Unicode (e.g. Unicode 16.0, 2024) and RFC 3629 |
| Padrão aberto | Sim · livre de royalties |
| Especificação | datatracker.ietf.org |
Conversões de UTF8
Perguntas e Respostas da Comunidade
perguntado por usuáriosAinda não há perguntas - seja o primeiro a perguntar sobre arquivos UTF8.