Wat is het FASTA-bestandsformaat?
Het .fasta-formaat behoort tot de categorie bio-informatica-databestanden. De inhoud van .fasta-bestanden omvat sequenties van genetische gegevens - ze kunnen informatie bevatten over de structuur van DNA en RNA, maar ook over eiwitstructuren. De inhoud is georganiseerd in een lay-out die specifiek is voor deze standaard. Een van de kenmerkende eigenschappen is een > headerregel (een defline genoemd), waarin ook een identificatiecode en beschrijvende annotaties kunnen worden opgenomen. Eén of meer regels met ruwe sequentieletters volgen op elke header, waarbij gebruik wordt gemaakt van IUPAC-nucleotide- of aminozuurcodes.
.fasta-bestanden kunnen een groot aantal sequenties in één bestand opslaan, daarom worden multi-.fasta-bestanden vaak gebruikt als referentiedatabases. Al deze informatie wordt gebruikt door gespecialiseerde programma's voor genetische analyses. Dankzij het .fasta-formaat kunnen vergelijkende DNA-tests worden uitgevoerd, evenals studies naar de evolutie van genetische structuren.
Omdat .fasta alleen de identificatiecode en de ruwe sequentie opslaat - zonder kwaliteitsscores of uitgebreide annotaties - worden er vaak aanvullende formaten naast gebruikt: .fastq-bestanden voegen kwaliteitsscores per base toe voor sequencing-reads, terwijl GenBank-bestanden volledige functie-annotaties bevatten. Het formaat is ontwikkeld door William R. Pearson en David J. Lipman voor hun FASTA-sequentievergelijkingsprogramma en is sindsdien de basisstandaard voor platte tekst geworden voor het delen van biologische sequenties tussen tools en databases wereldwijd.
Veelvoorkomende variant-extensies zijn .fa, .fna (nucleotidesequenties), .faa (aminozuursequenties) en .ffn (coderende sequenties).
Beveiliging & veiligheid
RISICO: LOWEen FASTA-bestand bevat sequentiegegevens in platte tekst zonder uitvoerbare inhoud, dus het is zeer veilig om te openen. De realistische waarschuwingen zijn praktisch, niet beveiligingsgerelateerd: FASTA-bestanden van het volledige genoom kunnen honderden MB tot vele GB groot zijn en kunnen een eenvoudige tekstverwerker doen vastlopen (gebruik een streaming viewer zoals AliView of command-line seqkit/samtools faidx), en let op misvormde headers of gemengde regeleinden die tools verderop in de keten kunnen verstoren. Haal referentiesequenties uit betrouwbare bronnen (NCBI, Ensembl, UniProt) om de gegevensintegriteit te waarborgen.
Formaatdetails
in een notendopProgramma's die FASTA-bestanden openen
Technische details
diepe specificaties| Formaat-type | Biologisch sequentieformaat in platte tekst; één of meer records per bestand |
| Bestandscodering | ASCII / UTF-8 platte tekst; geen binaire gegevens |
| Record header-markering | „>” (groter-dan, 0x3E) op byte-offset 0 van elke headerregel - de enige pseudo-magic identifier |
| Header (defline) structuur | „>identificatie beschrijving” volgens de NCBI defline-conventie, die breed wordt gevolgd door databases en tools |
| Sequentie-alfabet | IUPAC-nucleotidecodes (A, C, G, T, U, N, ambiguïteitscodes) voor DNA/RNA; aminozuurcodes van één letter voor eiwitten |
| Ondersteuning voor meerdere records | Onbeperkt aantal records per bestand (multi-FASTA); een enkel bestand kan dienen als volledige referentiedatabase |
| Regelafbreking sequentie | Meestal 60-80 tekens per regel; afbreking is cosmetisch - conforme tools voegen de sequentie weer samen en negeren regelafbrekingen |
| Kwaliteitsscores | Niet ondersteund; alleen ruwe sequentie - kwaliteitsgegevens per base vereisen in plaats daarvan het FASTQ-formaat |
| Annotatie-ondersteuning | Alleen identificatiecode en vrije tekstbeschrijving in de header; geen functie- of coördinaatannotaties (gebruik daarvoor GenBank/.gb of GFF3) |
| Compressie | Geen systeemeigen compressie; wordt vaak gedistribueerd met gzip-compressie als .fasta.gz of .fa.gz |
| MIME-type | text/x-fasta (ook gezien: text/plain, application/x-fasta) |
| Typische bestandsgrootte | Een paar KB voor een enkel gen of eiwit, tot tientallen GB voor volledige genoom- of referentiedatabases |
| Variant-extensies | .fa (generiek), .fna (nucleotide), .faa (aminozuur), .ffn (coderende sequenties), .frn (niet-coderend RNA) |
| In-file integriteitscontrole | Geen; referentie-releases gaan meestal vergezeld van externe .md5-checksumbestanden |
| Platformgebruik | Platformonafhankelijk; dominant in Linux/HPC bio-informatica-pipelines, met brede ondersteuning in Windows- en macOS-tools |
| Interoperabiliteit | Geaccepteerd als invoer/uitvoer door vrijwel alle sequentie-analysetools: BLAST, BWA, STAR, Bowtie2, EMBOSS, Biopython en andere |
| Uitgebracht | 1985 (FASTP/FASTA sequence-comparison program; format formalized 1988) |
| Laatste versie | De facto standard; no formal versioned spec (NCBI defline conventions widely followed) |
| Open standaard | Ja · royaltyvrij |
| Specificatie | www.ncbi.nlm.nih.gov |
FASTA conversies
Community V&A
gevraagd door gebruikersNog geen vragen - wees de eerste om iets te vragen over FASTA-bestanden.