Qu'est-ce que le format de fichier UTF8 ?
L'extension .utf8 marque un fichier texte brut explicitement encodé en UTF-8 - l'encodage de caractères Unicode dominant sur le web moderne et la plupart des systèmes d'exploitation. L'UTF-8 a été conçu par Ken Thompson et Rob Pike en septembre 1992, puis standardisé sous le nom de RFC 3629 (2003) ; il encode chaque point de code Unicode en utilisant de un à quatre octets tout en restant entièrement rétrocompatible avec l'ASCII.
L'extension elle-même n'est pas un format de fichier distinct. C'est une convention informelle utilisée pour signaler l'encodage - le plus souvent lorsqu'un outil tel que iconv -t UTF-8 convertit un fichier encodé selon une ancienne norme, ou lorsqu'un projet stocke des copies sœurs dans différents encodages et doit les distinguer. Renommez un fichier .utf8 en fichier .txt et il se comportera de manière identique ; n'importe quel éditeur ou visionneuse gérant le texte brut l'ouvrira sans modification.
Un fichier .utf8 peut éventuellement commencer par la marque d'ordre des octets (BOM) UTF-8, la séquence de trois octets EF BB BF. La plupart des outils Linux et macOS omettent le BOM ; les applications Windows l'ont historiquement ajouté. Les lecteurs qui traitent le fichier comme du Windows-1252 afficheront le BOM sous la forme des caractères parasites «  ».
Parce que l'UTF-8 est l'encodage par défaut du Markdown, du CSV, du JSON et de nombreux autres formats texte, le suffixe .utf8 apparaît le plus souvent dans les pipelines de conversion de données, les flux de localisation et les projets de migration de systèmes hérités où nommer explicitement l'encodage évite toute ambiguïté.
Sécurité et sûreté
RISQUE : LOWUn fichier .utf8 est du texte brut et ne peut pas s'exécuter, son ouverture pour lecture est donc sûre. Les seules mises en garde sont non malveillantes : choisissez l'encodage UTF-8 pour éviter les caractères illisibles, et sachez que le BOM optionnel peut perturber certains scripts ou imports CSV. Comme toujours, ne faites confiance à l'extension qu'après vérification - un fichier prétendant être « data.utf8 » qui serait en réalité un exécutable constituerait le véritable risque, et non le format texte UTF-8 lui-même.
Détails du format
en brefProgrammes qui ouvrent les fichiers UTF8
Détails techniques
spécifications approfondies| Schéma d'encodage | Unicode à largeur variable ; chaque point de code utilise de 1 à 4 octets |
| Compatibilité ASCII | Les octets 0x00-0x7F sont identiques à l'US-ASCII ; un fichier ASCII pur est un fichier UTF-8 valide |
| Couverture des caractères | Tous les 1 114 112 points de code Unicode (U+0000 à U+10FFFF) |
| Type MIME | text/plain; charset=utf-8 |
| Marque d'ordre des octets (BOM) | Préfixe optionnel de trois octets EF BB BF (U+FEFF) ; généralement omis sur Linux/macOS, parfois ajouté par les outils Windows |
| Ordre des octets | Indépendant de l'ordre des octets ; l'endianness n'est pas un problème, contrairement à l'UTF-16 ou l'UTF-32 |
| Structure du fichier | Séquence plate de caractères encodés ; pas d'en-tête, de schéma ou de métadonnées obligatoires |
| Rôle de l'extension | Convention de nommage uniquement - signale l'encodage UTF-8 aux outils et aux humains ; structurellement identique à un fichier .txt |
| Auto-synchronisation | Les octets de continuation commencent toujours par 10xxxxxx ; un lecteur peut se resynchroniser après une corruption de données sans rescanner depuis le début |
| Octets par point de code | 1 octet (U+0000-U+007F), 2 octets (U+0080-U+07FF), 3 octets (U+0800-U+FFFF), 4 octets (U+10000-U+10FFFF) |
| Fins de ligne | Non imposées ; les fichiers peuvent utiliser LF (Unix/macOS), CR+LF (Windows) ou CR seul (ancien Mac) |
| Compression | Aucune intégrée ; la redondance du texte permet aux fichiers .utf8 de se compresser efficacement avec gzip, zstd ou bzip2 |
| Taille de fichier typique | De quelques octets à plusieurs mégaoctets ; le texte en plage ASCII a la même taille octet par octet que l'ASCII ; les écritures non latines nécessitent 2 à 4 octets par caractère |
| Outils de génération courants | iconv -t UTF-8, Python str.encode('utf-8'), éditeurs tels que VS Code, Vim (:set fileencoding=utf-8) et Notepad (Windows 10+) |
| Publié | UTF-8 designed 1992; standardized in Unicode/ISO 10646. The .utf8 hint suffix is a later informal convention |
| Dernière version | UTF-8 per current Unicode (e.g. Unicode 16.0, 2024) and RFC 3629 |
| Standard ouvert | Oui · libre de droits |
| Spécification | datatracker.ietf.org |
Conversions UTF8
Q&R de la communauté
posées par les utilisateursPas encore de questions - soyez le premier à poser une question sur les fichiers UTF8.