Prozkoumání souboru fastq
Soubory fastq obvykle obsahují tisíce nebo miliony čtení a mohou být velmi velké! V tomto cvičení použiješ malý podsample fastq obsahující 500 čtení, který se snadno vejde do paměti a lze ho celý načíst pomocí funkce readFastq().
Původní soubor sekvencí pochází z Arabidopsis thaliana a poskytlo ho UC Davis Genome Center. Přístupové číslo je SRR1971253 a soubor byl stažen z archivu sekvenčních čtení (Sequence Read Archive, SRA). Obsahuje DNA z listových tkání, která byla sloučena a sekvenována na platformě Illumina HiSeq 2000. Jedná se o jednočtecí sekvence délky 50 párů bází (bp).
fqsample je objekt třídy ShortReadQ a obsahuje informace o čteních, skóre kvality a identifikátorech. Teď je řada na tobě – prozkoumej ho!
Toto cvičení je součástí kurzu
Úvod do Bioconductoru v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Load ShortRead
___
# Print fqsample
___