Vad är filformatet FASTA?
Formatet .fasta tillhör kategorin bioinformatikdatafiler. Innehållet i .fasta-filer inkluderar sekvenser av genetiska data - de kan innehålla information om strukturen för DNA och RNA, men även om proteinstrukturer. Innehållet är organiserat i en layout som är specifik för denna standard. En av dess karakteristiska egenskaper är en rubrikrad som börjar med > (kallad defline), där en identifierare och beskrivande anteckningar kan registreras. En eller flera rader med råa sekvensbokstäver följer efter varje rubrik, med användning av IUPAC-nukleotid- eller aminosyrakoder.
.fasta-filer kan lagra ett stort antal sekvenser i en enda fil, vilket är anledningen till att multi-.fasta-filer ofta används som referensdatabaser. All denna information används av specialiserade program för genetiska analyser. Tack vare .fasta-formatet kan jämförande DNA-tester utföras, liksom studier av utvecklingen av genetiska strukturer.
Eftersom .fasta endast lagrar identifieraren och den råa sekvensen - utan kvalitetspoäng eller rika anteckningar - används ofta kompletterande format vid sidan av det: .fastq-filer lägger till kvalitetspoäng per bas för sekvenseringsdata, medan GenBank-filer bär på fullständiga funktionsanteckningar. Formatet utvecklades av William R. Pearson och David J. Lipman för deras FASTA-sekvensjämförelseprogram och har sedan dess blivit den grundläggande textstandarden för att dela biologiska sekvenser mellan verktyg och databaser över hela världen.
Vanliga varianttillägg inkluderar .fa, .fna (nukleotidsekvenser), .faa (aminosyrasekvenser) och .ffn (kodande sekvenser).
Säkerhet & trygghet
RISK: LOWEn FASTA-fil är sekvensdata i klartext utan körbart innehåll, så den är mycket säker att öppna. De realistiska varningarna är praktiska, inte säkerhetsrelaterade: FASTA-filer för hela genom kan vara hundratals MB till många GB och kan låsa en enkel textredigerare (använd en strömmande visare som AliView eller kommandoradsverktyg som seqkit/samtools faidx), och se upp för felaktiga rubriker eller blandade radbrytningar som kan störa efterföljande verktyg. Hämta referenssekvenser från auktoritativa källor (NCBI, Ensembl, UniProt) för att säkerställa dataintegritet.
Formatdetaljer
i ett nötskalProgram som öppnar FASTA-filer
Tekniska detaljer
djup specifikation| Formattyp | Biologiskt sekvensformat i klartext; en eller flera poster per fil |
| Filkodning | ASCII / UTF-8 klartext; inga binära data |
| Markör för postrubrik | «>» (större än, 0x3E) vid byte-offset 0 på varje rubrikrad - den enda pseudo-magiska identifieraren |
| Rubrikstruktur (defline) | «>identifierare beskrivning» enligt NCBI defline-konvention, som följs allmänt av databaser och verktyg |
| Sekvensalfabet | IUPAC-nukleotidkoder (A, C, G, T, U, N, ambiguitetskoder) för DNA/RNA; enstaka aminosyrakoder för protein |
| Stöd för flera poster | Obegränsat antal poster per fil (multi-FASTA); en enskild fil kan fungera som en hel referensdatabas |
| Radbrytning i sekvens | Vanligtvis 60-80 tecken per rad; brytningen är kosmetisk - kompatibla verktyg sätter ihop sekvensen igen och ignorerar radbrytningar |
| Kvalitetspoäng | Stöds ej; endast rå sekvens - kvalitetspoäng per bas kräver istället formatet FASTQ |
| Stöd för anteckningar | Endast identifierare och fritextbeskrivning i rubriken; inga funktions- eller koordinatanteckningar (använd GenBank/.gb eller GFF3 för dessa) |
| Komprimering | Ingen inbyggd; distribueras ofta gzip-komprimerad som .fasta.gz eller .fa.gz |
| MIME-typ | text/x-fasta (även sett: text/plain, application/x-fasta) |
| Typisk filstorlek | Några KB för en enskild gen eller protein, upp till tiotals GB för hela genom eller referensdatabaser |
| Varianttillägg | .fa (generisk), .fna (nukleotid), .faa (aminosyra), .ffn (kodande sekvenser), .frn (icke-kodande RNA) |
| Integritetskontroll i filen | Ingen; referensutgåvor åtföljs vanligtvis av externa .md5-kontrollsummafiler |
| Plattformsanvändning | Plattformsoberoende; dominerande i Linux/HPC-bioinformatikpipelines, med brett stöd i verktyg för Windows och macOS |
| Interoperabilitet | Accepteras som indata/utdata av praktiskt taget alla sekvensanalysverktyg: BLAST, BWA, STAR, Bowtie2, EMBOSS, Biopython med flera |
| Släppt | 1985 (FASTP/FASTA sequence-comparison program; format formalized 1988) |
| Senaste version | De facto standard; no formal versioned spec (NCBI defline conventions widely followed) |
| Öppen standard | Ja · royaltyfri |
| Specifikation | www.ncbi.nlm.nih.gov |
FASTA-konverteringar
Frågor & svar
frågat av användareInga frågor än - bli den första att fråga om FASTA-filer.