¿Qué es el formato de archivo FASTA?
El formato .fasta pertenece a la categoría de archivos de datos de bioinformática. El contenido de los archivos .fasta incluye secuencias de datos genéticos - pueden contener información sobre la estructura del ADN y el ARN, pero también sobre estructuras de proteínas. El contenido se organiza en un diseño específico de este estándar. Una de sus características distintivas es una línea de encabezado > (llamada defline), en la que también se pueden registrar un identificador y anotaciones descriptivas. Una o más líneas de letras de secuencia sin formato siguen a cada encabezado, utilizando códigos de nucleótidos o aminoácidos de la IUPAC.
Los archivos .fasta pueden almacenar una gran cantidad de secuencias en un solo archivo, razón por la cual los archivos multi-.fasta se utilizan a menudo como bases de datos de referencia. Toda esta información es utilizada por programas especializados para análisis genéticos. Gracias al formato .fasta, se pueden realizar pruebas comparativas de ADN, así como estudios sobre la evolución de las estructuras genéticas.
Debido a que .fasta almacena solo el identificador y la secuencia sin procesar - sin puntuaciones de calidad ni anotaciones ricas - a menudo se utilizan formatos complementarios junto a él: los archivos .fastq añaden puntuaciones de calidad por base para las lecturas de secuenciación, mientras que los archivos GenBank llevan anotaciones de características completas. El formato fue desarrollado por William R. Pearson y David J. Lipman para su programa de comparación de secuencias FASTA y desde entonces se ha convertido en el estándar de texto plano de referencia para compartir secuencias biológicas entre herramientas y bases de datos de todo el mundo.
Las extensiones de variantes comunes incluyen .fa, .fna (secuencias de nucleótidos), .faa (secuencias de aminoácidos) y .ffn (secuencias codificantes).
Seguridad y protección
RIESGO: LOWUn archivo FASTA contiene datos de secuencia en texto plano sin contenido ejecutable, por lo que su apertura es de muy bajo riesgo. Las precauciones realistas son prácticas, no de seguridad: los FASTA de genoma completo pueden tener cientos de MB o muchos GB y pueden congelar un editor de texto básico (use un visor de flujo como AliView o seqkit/samtools faidx en línea de comandos), y preste atención a encabezados mal formados o finales de línea mixtos que rompen las herramientas posteriores. Obtenga secuencias de referencia de fuentes autorizadas (NCBI, Ensembl, UniProt) para garantizar la integridad de los datos.
Detalles del formato
en pocas palabrasProgramas que abren archivos FASTA
Detalles técnicos
especificación profunda| Tipo de formato | Formato de secuencia biológica de texto plano; uno o más registros por archivo |
| Codificación de archivo | Texto plano ASCII / UTF-8; sin datos binarios |
| Marcador de encabezado de registro | ">" (mayor que, 0x3E) en el desplazamiento de byte 0 de cada línea de encabezado - el único identificador pseudo-magic |
| Estructura del encabezado (defline) | ">identificador descripción" según la convención defline de NCBI, ampliamente seguida por bases de datos y herramientas |
| Alfabeto de secuencia | Códigos de nucleótidos IUPAC (A, C, G, T, U, N, códigos de ambigüedad) para ADN/ARN; códigos de aminoácidos de una sola letra para proteínas |
| Soporte multi-registro | Registros ilimitados por archivo (multi-FASTA); un solo archivo puede servir como una base de datos de referencia completa |
| Ajuste de línea de secuencia | Típicamente 60-80 caracteres por línea; el ajuste es cosmético - las herramientas conformes reensamblan la secuencia ignorando los saltos de línea |
| Puntuaciones de calidad | No soportado; solo secuencia sin procesar - los datos de calidad por base requieren el formato FASTQ en su lugar |
| Soporte de anotación | Identificador y descripción de texto libre solo en el encabezado; sin anotaciones de características o coordenadas (use GenBank/.gb o GFF3 para eso) |
| Compresión | Ninguna nativa; comúnmente distribuido comprimido con gzip como .fasta.gz o .fa.gz |
| Tipo MIME | text/x-fasta (también visto: text/plain, application/x-fasta) |
| Tamaño de archivo típico | Unos pocos KB para un solo gen o proteína, hasta decenas de GB para genomas completos o bases de datos de referencia |
| Extensiones de variantes | .fa (genérico), .fna (nucleótido), .faa (aminoácido), .ffn (secuencias codificantes), .frn (ARN no codificante) |
| Verificación de integridad en el archivo | Ninguna; los lanzamientos de referencia suelen ir acompañados de archivos de suma de comprobación .md5 externos |
| Uso de plataforma | Multiplataforma; dominante en flujos de trabajo de bioinformática Linux/HPC, con amplio soporte en herramientas de Windows y macOS |
| Interoperabilidad | Aceptado como entrada/salida por prácticamente todas las herramientas de análisis de secuencias: BLAST, BWA, STAR, Bowtie2, EMBOSS, Biopython y otras |
| Lanzado | 1985 (FASTP/FASTA sequence-comparison program; format formalized 1988) |
| Última versión | De facto standard; no formal versioned spec (NCBI defline conventions widely followed) |
| Estándar abierto | Sí · libre de regalías |
| Especificación | www.ncbi.nlm.nih.gov |
Conversiones de FASTA
Preguntas y respuestas de la comunidad
preguntado por usuariosAún no hay preguntas; sea el primero en preguntar sobre los archivos FASTA.