Che cos'è il formato di file FASTA?
Il formato .fasta appartiene alla categoria dei file di dati di bioinformatica. I contenuti dei file .fasta includono sequenze di dati genetici - possono contenere informazioni sulla struttura del DNA e dell'RNA, ma anche sulle strutture proteiche. Il contenuto è organizzato in un layout specifico per questo standard. Una delle sue caratteristiche distintive è la riga di intestazione > (chiamata defline), in cui possono essere registrati anche un identificatore e annotazioni descrittive. Una o più righe di lettere della sequenza grezza seguono ogni intestazione, utilizzando i codici IUPAC per nucleotidi o amminoacidi.
I file .fasta possono memorizzare un gran numero di sequenze in un unico file, motivo per cui i file multi-.fasta sono spesso utilizzati come database di riferimento. Tutte queste informazioni vengono utilizzate da programmi specializzati per analisi genetiche. Grazie al formato .fasta, è possibile eseguire test comparativi del DNA, nonché studi sull'evoluzione delle strutture genetiche.
Poiché il formato .fasta memorizza solo l'identificatore e la sequenza grezza - senza punteggi di qualità o annotazioni ricche - vengono spesso utilizzati formati complementari insieme ad esso: i file .fastq aggiungono punteggi di qualità per base per le letture di sequenziamento, mentre i file GenBank portano annotazioni complete delle caratteristiche. Il formato è stato sviluppato da William R. Pearson e David J. Lipman per il loro programma di confronto di sequenze FASTA ed è diventato da allora lo standard di base in testo semplice per la condivisione di sequenze biologiche tra strumenti e database in tutto il mondo.
Le estensioni varianti comuni includono .fa, .fna (sequenze nucleotidiche), .faa (sequenze di amminoacidi) e .ffn (sequenze codificanti).
Sicurezza e incolumità
RISCHIO: LOWUn file FASTA contiene dati di sequenza in testo semplice senza contenuti eseguibili, quindi il rischio di apertura è molto basso. Le precauzioni realistiche sono pratiche, non di sicurezza: i file FASTA di interi genomi possono essere da centinaia di MB a molti GB e potrebbero bloccare un editor di testo di base (usa un visualizzatore in streaming come AliView o strumenti da riga di comando come seqkit/samtools faidx), e fai attenzione alle intestazioni malformate o ai finali di riga misti che interrompono gli strumenti a valle. Ottieni le sequenze di riferimento da fonti autorevoli (NCBI, Ensembl, UniProt) per garantire l'integrità dei dati.
Dettagli del formato
in sintesiProgrammi che aprono file FASTA
Dettagli tecnici
specifiche approfondite| Tipo di formato | Formato di sequenza biologica in testo semplice; uno o più record per file |
| Codifica del file | Testo semplice ASCII / UTF-8; nessun dato binario |
| Marcatore di intestazione record | «>» (maggiore di, 0x3E) all'offset di byte 0 di ogni riga di intestazione - l'unico identificatore pseudo-magic |
| Struttura dell'intestazione (defline) | «>identificatore descrizione» secondo la convenzione defline NCBI, ampiamente seguita da database e strumenti |
| Alfabeto della sequenza | Codici nucleotidici IUPAC (A, C, G, T, U, N, codici di ambiguità) per DNA/RNA; codici amminoacidici a lettera singola per le proteine |
| Supporto multi-record | Record illimitati per file (multi-FASTA); un singolo file può fungere da database di riferimento completo |
| A capo della riga di sequenza | In genere 60-80 caratteri per riga; l'andata a capo è estetica - gli strumenti conformi riassemblano la sequenza ignorando le interruzioni di riga |
| Punteggi di qualità | Non supportati; solo sequenza grezza - i dati di qualità per base richiedono invece il formato FASTQ |
| Supporto annotazioni | Identificatore e descrizione in testo libero solo nell'intestazione; nessuna annotazione di caratteristiche o coordinate (usare GenBank/.gb o GFF3 per queste) |
| Compressione | Nessuna nativa; comunemente distribuito compresso con gzip come .fasta.gz o .fa.gz |
| Tipo MIME | text/x-fasta (visto anche: text/plain, application/x-fasta) |
| Dimensione tipica del file | Pochi KB per un singolo gene o proteina, fino a decine di GB per genomi interi o database di riferimento |
| Estensioni varianti | .fa (generico), .fna (nucleotide), .faa (amminoacido), .ffn (sequenze codificanti), .frn (RNA non codificante) |
| Controllo integrità nel file | Nessuno; i rilasci di riferimento sono in genere accompagnati da file di checksum .md5 esterni |
| Utilizzo piattaforma | Multipiattaforma; dominante nelle pipeline di bioinformatica Linux/HPC, con ampio supporto su strumenti Windows e macOS |
| Interoperabilità | Accettato come input/output da virtualmente tutti gli strumenti di analisi delle sequenze: BLAST, BWA, STAR, Bowtie2, EMBOSS, Biopython e altri |
| Rilasciato | 1985 (FASTP/FASTA sequence-comparison program; format formalized 1988) |
| Ultima versione | De facto standard; no formal versioned spec (NCBI defline conventions widely followed) |
| Standard aperto | Sì · royalty-free |
| Specifica | www.ncbi.nlm.nih.gov |
Conversioni FASTA
Domande e risposte della community
chiesto dagli utentiAncora nessuna domanda - sii il primo a chiedere informazioni sui file FASTA.