O que é o formato de ficheiro FASTA?
O formato .fasta pertence à categoria de arquivos de dados de bioinformática. O conteúdo dos arquivos .fasta inclui sequências de dados genéticos - eles podem conter informações sobre a estrutura do DNA e RNA, mas também sobre estruturas de proteínas. O conteúdo é organizado em um layout específico para este padrão. Uma de suas características marcantes é a linha de cabeçalho > (chamada de defline), na qual um identificador e anotações descritivas também podem ser registrados. Uma ou mais linhas de letras de sequência bruta seguem cada cabeçalho, usando códigos de nucleotídeos ou aminoácidos da IUPAC.
Arquivos .fasta podem armazenar um grande número de sequências em um único arquivo, razão pela qual arquivos multi-.fasta são frequentemente usados como bancos de dados de referência. Toda essa informação é utilizada por programas especializados para análises genéticas. Graças ao formato .fasta, testes comparativos de DNA podem ser realizados, bem como estudos sobre a evolução de estruturas genéticas.
Como o .fasta armazena apenas o identificador e a sequência bruta - sem pontuações de qualidade ou anotações ricas - formatos complementares são frequentemente usados ao seu lado: arquivos .fastq adicionam pontuações de qualidade por base para leituras de sequenciamento, enquanto arquivos GenBank carregam anotações completas de recursos. O formato foi desenvolvido por William R. Pearson e David J. Lipman para seu programa de comparação de sequências FASTA e, desde então, tornou-se o padrão de texto simples de base para o compartilhamento de sequências biológicas entre ferramentas e bancos de dados em todo o mundo.
Extensões variantes comuns incluem .fa, .fna (sequências de nucleotídeos), .faa (sequências de aminoácidos) e .ffn (sequências codificadoras).
Segurança e proteção
RISCO: LOWUm arquivo FASTA contém dados de sequência em texto simples sem conteúdo executável, portanto, o risco ao abri-lo é muito baixo. As precauções reais são práticas, não de segurança: arquivos FASTA de genoma completo podem ter centenas de MB a muitos GB e podem travar um editor de texto básico (use um visualizador de streaming como AliView ou linha de comando seqkit/samtools faidx), e atente para cabeçalhos malformados ou finais de linha mistos que quebram ferramentas subsequentes. Obtenha sequências de referência de fontes autorizadas (NCBI, Ensembl, UniProt) para garantir a integridade dos dados.
Detalhes do formato
em resumoProgramas que abrem arquivos FASTA
Detalhes técnicos
especificação profunda| Tipo de formato | Formato de sequência biológica em texto simples; um ou mais registros por arquivo |
| Codificação do arquivo | Texto simples ASCII / UTF-8; sem dados binários |
| Marcador de cabeçalho de registro | ">" (maior que, 0x3E) no deslocamento de byte 0 de cada linha de cabeçalho - o único identificador pseudo-mágico |
| Estrutura do cabeçalho (defline) | ">identificador descrição" conforme a convenção defline do NCBI, amplamente seguida por bancos de dados e ferramentas |
| Alfabeto de sequência | Códigos de nucleotídeos IUPAC (A, C, G, T, U, N, códigos de ambiguidade) para DNA/RNA; códigos de aminoácidos de uma única letra para proteína |
| Suporte a múltiplos registros | Registros ilimitados por arquivo (multi-FASTA); um único arquivo pode servir como um banco de dados de referência completo |
| Quebra de linha de sequência | Tipicamente 60-80 caracteres por linha; a quebra é cosmética - ferramentas conformes remontam a sequência ignorando as quebras de linha |
| Pontuações de qualidade | Não suportado; apenas sequência bruta - dados de qualidade por base exigem o formato FASTQ |
| Suporte a anotações | Identificador e descrição de texto livre apenas no cabeçalho; sem anotações de recursos ou coordenadas (use GenBank/.gb ou GFF3 para isso) |
| Compressão | Nenhuma nativa; comumente distribuído comprimido com gzip como .fasta.gz ou .fa.gz |
| Tipo MIME | text/x-fasta (também visto: text/plain, application/x-fasta) |
| Tamanho típico do arquivo | Alguns KB para um único gene ou proteína, até dezenas de GB para genomas inteiros ou bancos de dados de referência |
| Extensões variantes | .fa (genérico), .fna (nucleotídeo), .faa (aminoácido), .ffn (sequências codificadoras), .frn (RNA não codificador) |
| Verificação de integridade no arquivo | Nenhuma; lançamentos de referência são tipicamente acompanhados por arquivos de checksum .md5 externos |
| Uso em plataformas | Multiplataforma; dominante em pipelines de bioinformática Linux/HPC, com amplo suporte em ferramentas Windows e macOS |
| Interoperabilidade | Aceito como entrada/saída por virtualmente todas as ferramentas de análise de sequência: BLAST, BWA, STAR, Bowtie2, EMBOSS, Biopython e outras |
| Lançado | 1985 (FASTP/FASTA sequence-comparison program; format formalized 1988) |
| Versão mais recente | De facto standard; no formal versioned spec (NCBI defline conventions widely followed) |
| Padrão aberto | Sim · livre de royalties |
| Especificação | www.ncbi.nlm.nih.gov |
Conversões de FASTA
Perguntas e Respostas da Comunidade
perguntado por usuáriosAinda não há perguntas - seja o primeiro a perguntar sobre arquivos FASTA.