Hva er FASTA-filformatet?
Formatet .fasta tilhører kategorien bioinformatikk-datafiler. Innholdet i .fasta-filer inkluderer sekvenser av genetiske data - de kan inneholde informasjon om strukturen til DNA og RNA, men også om proteinstrukturer. Innholdet er organisert i et oppsett spesifikt for denne standarden. Et av de karakteristiske trekkene er en >-overskriftslinje (kalt en defline), der en identifikator og beskrivende annoteringer også kan registreres. Én eller flere linjer med rå sekvensbokstaver følger hver overskrift, ved bruk av IUPAC-nukleotid- eller aminosyrekoder.
.fasta-filer kan lagre et stort antall sekvenser i en enkelt fil, og det er grunnen til at multi-.fasta-filer ofte brukes som referansedatabaser. All denne informasjonen brukes av spesialiserte programmer for genetiske analyser. Takket være .fasta-formatet kan DNA-sammenligningstester utføres, samt studier av utviklingen av genetiske strukturer.
Fordi .fasta kun lagrer identifikatoren og den rå sekvensen - uten kvalitetsmål eller rike annoteringer - brukes ofte komplementære formater ved siden av: .fastq-filer legger til kvalitetsmål per base for sekvenseringsavlesninger, mens GenBank-filer bærer fullstendige funksjonsannoteringer. Formatet ble utviklet av William R. Pearson og David J. Lipman for deres FASTA-sekvenssammenligningsprogram og har siden blitt den grunnleggende standarden for ren tekst for deling av biologiske sekvenser på tvers av verktøy og databaser over hele verden.
Vanlige variantutvidelser inkluderer .fa, .fna (nukleotidsekvenser), .faa (aminosyresekvenser) og .ffn (kodende sekvenser).
Sikkerhet og trygghet
RISIKO: LOWEn FASTA-fil er sekvensdata i ren tekst uten eksekverbart innhold, så den er svært trygg å åpne. De realistiske forholdsreglene er praktiske, ikke sikkerhetsmessige: FASTA-filer for hele genomer kan være på hundrevis av MB til mange GB og kan fryse en enkel tekstredigerer (bruk en strømmende visning som AliView eller kommandolinje-verktøy som seqkit/samtools faidx), og vær oppmerksom på feilformaterte overskrifter eller blandede linjeavslutninger som kan ødelegge for verktøy senere i prosessen. Hent referansesekvenser fra autoritative kilder (NCBI, Ensembl, UniProt) for å sikre dataintegritet.
Formatdetaljer
i et nøtteskallProgrammer som åpner FASTA-filer
Tekniske detaljer
dyp spesifikasjon| Format-type | Biologisk sekvensformat i ren tekst; én eller flere oppføringer per fil |
| Filkoding | ASCII / UTF-8 ren tekst; ingen binære data |
| Markør for overskrift | «>» (større enn, 0x3E) ved byte-offset 0 på hver overskriftslinje - den eneste pseudo-magiske identifikatoren |
| Overskriftsstruktur (defline) | «>identifikator beskrivelse» i henhold til NCBI defline-konvensjon, fulgt av de fleste databaser og verktøy |
| Sekvensalfabet | IUPAC-nukleotidkoder (A, C, G, T, U, N, tvetydighetskoder) for DNA/RNA; enkeltbokstavs aminosyrekoder for protein |
| Støtte for flere oppføringer | Ubegrenset antall oppføringer per fil (multi-FASTA); en enkelt fil kan fungere som en fullstendig referansedatabase |
| Linjebryting i sekvens | Vanligvis 60-80 tegn per linje; bryting er kosmetisk - kompatible verktøy setter sammen sekvensen igjen og ignorerer linjeskift |
| Kvalitetsmål | Ikke støttet; kun rå sekvens - kvalitetsdata per base krever FASTQ-formatet i stedet |
| Støtte for annotering | Kun identifikator og fritekstbeskrivelse i overskriften; ingen funksjons- eller koordinatannoteringer (bruk GenBank/.gb eller GFF3 for disse) |
| Komprimering | Ingen innebygd; distribueres ofte gzip-komprimert som .fasta.gz eller .fa.gz |
| MIME-type | text/x-fasta (også sett: text/plain, application/x-fasta) |
| Typisk filstørrelse | Noen få KB for et enkelt gen eller protein, opptil titalls GB for hele genomer eller referansedatabaser |
| Variantutvidelser | .fa (generisk), .fna (nukleotid), .faa (aminosyre), .ffn (kodende sekvenser), .frn (ikke-kodende RNA) |
| Innebygd integritetssjekk | Ingen; referanseutgivelser følges vanligvis av eksterne .md5-kontrollsumfiler |
| Plattformbruk | Plattformuavhengig; dominerende i Linux/HPC-bioinformatikk-pipelines, med bred støtte i verktøy for Windows og macOS |
| Interoperabilitet | Akseptert som inndata/utdata av praktisk talt alle sekvensanalyseverktøy: BLAST, BWA, STAR, Bowtie2, EMBOSS, Biopython og andre |
| Utgitt | 1985 (FASTP/FASTA sequence-comparison program; format formalized 1988) |
| Siste versjon | De facto standard; no formal versioned spec (NCBI defline conventions widely followed) |
| Åpen standard | Ja · royalty-fri |
| Spesifikasjon | www.ncbi.nlm.nih.gov |
FASTA-konverteringer
Spørsmål og svar fra fellesskapet
spurt av brukereIngen spørsmål ennå - vær den første til å spørre om FASTA-filer.