Hvad er FASTA-filformatet?
Formatet .fasta tilhører kategorien af bioinformatik-datafiler. Indholdet af .fasta-filer inkluderer sekvenser af genetiske data - de kan indeholde information om strukturen af DNA og RNA, men også om proteinstrukturer. Indholdet er organiseret i et layout, der er specifikt for denne standard. Et af de karakteristiske træk er en > overskriftslinje (kaldet en defline), hvori en identifikator og beskrivende annoteringer også kan registreres. En eller flere linjer med rå sekvensbogstaver følger efter hver overskrift ved hjælp af IUPAC-nukleotid- eller aminosyrekoder.
.fasta-filer kan gemme et stort antal sekvenser i en enkelt fil, hvilket er grunden til, at multi-.fasta-filer ofte bruges som referencedatabaser. Al denne information bruges af specialiserede programmer til genetiske analyser. Takket være .fasta-formatet kan der udføres DNA-sammenligningstests samt undersøgelser af udviklingen af genetiske strukturer.
Da .fasta kun gemmer identifikatoren og den rå sekvens - uden kvalitetsscorer eller rige annoteringer - bruges komplementære formater ofte sammen med det: .fastq-filer tilføjer kvalitetsscorer pr. base for sekventerings-reads, mens GenBank-filer indeholder fulde funktionsannoteringer. Formatet blev udviklet af William R. Pearson og David J. Lipman til deres FASTA-sekvenssammenligningsprogram og er siden blevet den grundlæggende tekststandard for deling af biologiske sekvenser på tværs af værktøjer og databaser verden over.
Almindelige variant-filendelser inkluderer .fa, .fna (nukleotidsekvenser), .faa (aminosyresekvenser) og .ffn (kodende sekvenser).
Sikkerhed og tryghed
RISIKO: LOWEn FASTA-fil er sekvensdata i almindelig tekst uden eksekverbart indhold, så den er meget sikker at åbne. De realistiske forholdsregler er praktiske, ikke sikkerhedsrelaterede: FASTA-filer med hele genomer kan være på hundreder af MB til mange GB og kan få en simpel teksteditor til at fryse (brug en streaming-fremviser som AliView eller kommandolinje-seqkit/samtools faidx), og vær opmærksom på fejlformaterede overskrifter eller blandede linjeskift, der kan ødelægge downstream-værktøjer. Hent referencesekvenser fra autoritative kilder (NCBI, Ensembl, UniProt) for at sikre dataintegritet.
Formatdetaljer
kort fortaltProgrammer der åbner FASTA-filer
Tekniske detaljer
dyb specifikation| Format-type | Biologisk sekvensformat i almindelig tekst; en eller flere poster pr. fil |
| Filkodning | ASCII / UTF-8 almindelig tekst; ingen binære data |
| Markør for post-overskrift | «>» (større end, 0x3E) ved byte-offset 0 på hver overskriftslinje - den eneste pseudo-magiske identifikator |
| Overskriftsstruktur (defline) | «>identifikator beskrivelse» i henhold til NCBI defline-konventionen, som følges bredt af databaser og værktøjer |
| Sekvens-alfabet | IUPAC-nukleotidkoder (A, C, G, T, U, N, tvetydighedskoder) for DNA/RNA; enkeltbogstavs-aminosyrekoder for protein |
| Understøttelse af flere poster | Ubegrænsede poster pr. fil (multi-FASTA); en enkelt fil kan fungere som en fuld referencedatabase |
| Linjeombrydning i sekvens | Typisk 60-80 tegn pr. linje; ombrydning er kosmetisk - kompatible værktøjer samler sekvensen igen og ignorerer linjeskift |
| Kvalitetsscorer | Ikke understøttet; kun rå sekvens - kvalitetsdata pr. base kræver i stedet FASTQ-formatet |
| Annoteringsstøtte | Kun identifikator og fritekstbeskrivelse i overskriften; ingen funktions- eller koordinatannoteringer (brug GenBank/.gb eller GFF3 til disse) |
| Komprimering | Ingen indbygget; distribueres ofte gzip-komprimeret som .fasta.gz eller .fa.gz |
| MIME-type | text/x-fasta (ses også: text/plain, application/x-fasta) |
| Typisk filstørrelse | Få KB for et enkelt gen eller protein, op til titusinder af GB for hele genomer eller referencedatabaser |
| Variant-filendelser | .fa (generisk), .fna (nukleotid), .faa (aminosyre), .ffn (kodende sekvenser), .frn (ikke-kodende RNA) |
| In-file integritetskontrol | Ingen; referenceudgivelser ledsages typisk af eksterne .md5-kontrolsumfiler |
| Platformsanvendelse | Platformsuafhængig; dominerende i Linux/HPC-bioinformatik-pipelines, med bred understøttelse i Windows- og macOS-værktøjer |
| Interoperabilitet | Accepteres som input/output af stort set alle sekvensanalyseværktøjer: BLAST, BWA, STAR, Bowtie2, EMBOSS, Biopython og andre |
| Udgivet | 1985 (FASTP/FASTA sequence-comparison program; format formalized 1988) |
| Seneste version | De facto standard; no formal versioned spec (NCBI defline conventions widely followed) |
| Åben standard | Ja · royaltyfri |
| Specifikation | www.ncbi.nlm.nih.gov |
FASTA-konverteringer
Fællesskabets Q&A
spurgt af brugereIngen spørgsmål endnu - vær den første til at spørge om FASTA-filer.