Qu'est-ce que le format de fichier FASTA ?
Le format .fasta appartient à la catégorie des fichiers de données de bioinformatique. Le contenu des fichiers .fasta comprend des séquences de données génétiques - ils peuvent contenir des informations sur la structure de l'ADN et de l'ARN, mais aussi sur les structures protéiques. Le contenu est organisé selon une mise en page spécifique à cette norme. L'une de ses caractéristiques est une ligne d'en-tête > (appelée defline), dans laquelle un identifiant et des annotations descriptives peuvent également être enregistrés. Une ou plusieurs lignes de lettres de séquence brute suivent chaque en-tête, utilisant les codes de nucléotides ou d'acides aminés de l'IUPAC.
Les fichiers .fasta peuvent stocker un grand nombre de séquences dans un seul fichier, c'est pourquoi les fichiers multi-.fasta sont souvent utilisés comme bases de données de référence. Toutes ces informations sont utilisées par des programmes spécialisés pour les analyses génétiques. Grâce au format .fasta, des tests comparatifs d'ADN peuvent être effectués, ainsi que des études sur l'évolution des structures génétiques.
Comme le format .fasta ne stocke que l'identifiant et la séquence brute - sans scores de qualité ni annotations riches - des formats complémentaires sont souvent utilisés à ses côtés : les fichiers .fastq ajoutent des scores de qualité par base pour les lectures de séquençage, tandis que les fichiers GenBank portent des annotations de caractéristiques complètes. Le format a été développé par William R. Pearson et David J. Lipman pour leur programme de comparaison de séquences FASTA et est devenu depuis la norme de base en texte brut pour le partage de séquences biologiques entre les outils et les bases de données du monde entier.
Les extensions de variantes courantes incluent .fa, .fna (séquences de nucléotides), .faa (séquences d'acides aminés) et .ffn (séquences codantes).
Sécurité et sûreté
RISQUE : LOWUn fichier FASTA est une donnée de séquence en texte brut sans contenu exécutable, il est donc très peu risqué à ouvrir. Les précautions réalistes sont pratiques, pas de sécurité : les fichiers FASTA de génomes complets peuvent peser de plusieurs centaines de Mo à plusieurs Go et peuvent figer un éditeur de texte basique (utilisez un visualiseur en streaming comme AliView ou seqkit/samtools faidx en ligne de commande), et surveillez les en-têtes mal formés ou les fins de ligne mixtes qui cassent les outils en aval. Obtenez des séquences de référence auprès de sources faisant autorité (NCBI, Ensembl, UniProt) pour garantir l'intégrité des données.
Détails du format
en brefProgrammes qui ouvrent les fichiers FASTA
Détails techniques
spécifications approfondies| Type de format | Format de séquence biologique en texte brut ; un ou plusieurs enregistrements par fichier |
| Encodage du fichier | Texte brut ASCII / UTF-8 ; pas de données binaires |
| Marqueur d'en-tête d'enregistrement | « > » (supérieur à, 0x3E) à l'offset d'octet 0 de chaque ligne d'en-tête - le seul identifiant pseudo-magique |
| Structure de l'en-tête (defline) | « >identifiant description » selon la convention defline de NCBI, largement suivie par les bases de données et les outils |
| Alphabet de séquence | Codes de nucléotides IUPAC (A, C, G, T, U, N, codes d'ambiguïté) pour l'ADN/ARN ; codes d'acides aminés à une lettre pour les protéines |
| Prise en charge multi-enregistrements | Enregistrements illimités par fichier (multi-FASTA) ; un seul fichier peut servir de base de données de référence complète |
| Retour à la ligne de la séquence | Généralement 60 à 80 caractères par ligne ; le retour à la ligne est cosmétique - les outils conformes réassemblent la séquence en ignorant les sauts de ligne |
| Scores de qualité | Non pris en charge ; séquence brute uniquement - les données de qualité par base nécessitent le format FASTQ à la place |
| Prise en charge des annotations | Identifiant et description en texte libre dans l'en-tête uniquement ; pas d'annotations de caractéristiques ou de coordonnées (utilisez GenBank/.gb ou GFF3 pour cela) |
| Compression | Aucune native ; couramment distribué compressé avec gzip sous forme de .fasta.gz ou .fa.gz |
| Type MIME | text/x-fasta (également vu : text/plain, application/x-fasta) |
| Taille de fichier typique | Quelques Ko pour un seul gène ou une seule protéine, jusqu'à des dizaines de Go pour un génome complet ou des bases de données de référence |
| Extensions de variantes | .fa (générique), .fna (nucléotide), .faa (acide aminé), .ffn (séquences codantes), .frn (ARN non codant) |
| Vérification d'intégrité intégrée | Aucune ; les versions de référence sont généralement accompagnées de fichiers de somme de contrôle .md5 externes |
| Utilisation de la plateforme | Multiplateforme ; dominant dans les pipelines de bioinformatique Linux/HPC, avec un large support sur les outils Windows et macOS |
| Interopérabilité | Accepté comme entrée/sortie par pratiquement tous les outils d'analyse de séquences : BLAST, BWA, STAR, Bowtie2, EMBOSS, Biopython, et autres |
| Publié | 1985 (FASTP/FASTA sequence-comparison program; format formalized 1988) |
| Dernière version | De facto standard; no formal versioned spec (NCBI defline conventions widely followed) |
| Standard ouvert | Oui · libre de droits |
| Spécification | www.ncbi.nlm.nih.gov |
Conversions FASTA
Q&R de la communauté
posées par les utilisateursPas encore de questions - soyez le premier à poser une question sur les fichiers FASTA.