Short read shotgun sequencing
# read count (num_seq), base count (sum_len), ... of each FASTQ file
seqkit stats *.fastq.gz
file format type num_seqs sum_len min_len avg_len max_len
reads_R1.fastq.gz FASTQ DNA 1,000,000 120,000,000 80 120.0 150
reads_R2.fastq.gz FASTQ DNA 1,000,000 120,000,000 80 120.0 150
# summarized counts across multiple files of a FASTQ dataset
cat *.fastq.gz | seqkit stats
file format type num_seqs sum_len min_len avg_len max_len
- FASTQ DNA 2,000,000 240,000,000 80 120.0 150
⇒ total number of (single) reads: 2,000,000 ( /2 = 1,000,000 paired reads )
⇒ total number of base pairs: 240,000,000 ( = 0,24 Gbp ) → Giga base pairs
Filter FASTQ sequences by read lengths (remove too short reads)