test: transcript sequences fixture - #330
Conversation
✅ Snyk checks have passed. No issues have been found so far.
💻 Catch issues earlier using the plugins for VS Code, JetBrains IDEs, Visual Studio, and Eclipse. |
|
|
||
| ## gencode.v50.BCR_ABL1.transcripts.fa.gz | ||
|
|
||
| Gencode v50 release protein-coding transcript sequences FASTA, subsetted to only contain sequences from the genes BCR and ABL1. Gzipped. |
There was a problem hiding this comment.
I'm not fully familiar with the gencode transcript reference, but does it actually contain the gene labels (e.g. BCR, ABL1). If so did you just grep for those plus protein_coding or something?
Short version, is this enough information to recreate the file easily?
There was a problem hiding this comment.
I created them "by hand": opened the whole file in my editor, searched for the gene labels, copy and pasted into a new file. It could be done with some Bash-Fu, but that is complicated by the released FASTA formatting being linebroken on nucleotide 80 (or something around that) of each line.
$ gunzip -c test/fixtures/reference/gencode.v50.BCR_ABL1.transcripts.fa.gz | head -n 50
>ENST00000928586.2|ENSG00000186716.23|OTTHUMG00000150655.5|-|BCR-216|BCR|6876|UTR5:1-596|CDS:597-4361|UTR3:4362-6876|
GGGGGGAGGGTGGCGGCTCGATGGGGGAGCCGCCTCCAGGGGGCCCCCCCGCCCTGTGCC
CACGGCGCGGCCCCTTTAAGAGGCCCGCCTGGCTCCGTCATCCGCGCCGCGGCCACCTCC
CCCCGGCCCTCCCCTTCCTGCGGCGCAGAGTGCGGGCCGGGCGGGAGTGCGGCGAGAGCC
GGCTGGCTGAGCTTAGCGTCCGAGGAGGCGGCGGCGGCGGCGGCGGCACGGCGGCGGCGG
GGCTGTGGGGCGGTGCGGAAGCGAGAGGCGAGGAGCGCGCGGGCCGTGGCCAGAGTCTGG
CGGCGGCCTGGCGGAGCGGAGAGCAGCGCCCGCGCCTCGCCGTGCGGAGGAGCCCCGCAC
ACAATAGCGGCGCGCGCAGCCCGCGCCCTTCCCCCCGGCGCGCCCCGCCCCGCGCGCCGA
GCGCCCCGCTCCGCCTCACCTGCCACCAGGGAGTGGGCGGGCATTGTTCGCCGCCGCCGC
CGCCGCGCGGGCCATGGGGGCCGCCCGGCGCCCGGGGCCGGGCTGGCGAGGCGCCGCGCC
GCCGCTGAGACGGGCCCCGCGCGCAGCCCGGCGGCGCAGGTAAGGCCGGCCGCGCCATGG
TGGACCCGGTGGGCTTCGCGGAGGCGTGGAAGGCGCAGTTCCCGGACTCAGAGCCCCCGC
GCATGGAGCTGCGCTCAGTGGGCGACATCGAGCAGGAGCTGGAGCGCTGCAAGGCCTCCA
TTCGGCGCCTGGAGCAGGAGGTGAACCAGGAGCGCTTCCGCATGATCTACCTGCAGACGT
TGCTGGCCAAGGAAAAGAAGAGCTATGACCGGCAGCGATGGGGCTTCCGGCGCGCGGCGC
AGGCCCCCGACGGCGCCTCCGAGCCCCGAGCGTCCGCGTCGCGCCCGCAGCCAGCGCCCG
CCGACGGAGCCGACCCGCCGCCCGCCGAGGAGCCCGAGGCCCGGCCCGACGGCGAGGGTT
CTCCGGGTAAGGCCAGGCCCGGGACCGCCCGCAGGCCCGGGGCAGCCGCGTCGGGGGAAC
GGGACGACCGGGGACCCCCCGCCAGCGTGGCGGCGCTCAGGTCCAACTTCGAGCGGATCC
GCAAGGGCCATGGCCAGCCCGGGGCGGACGCCGAGAAGCCCTTCTACGTGAACGTCGAGT
TTCACCACGAGCGCGGCCTGGTGAAGGTCAACGACAAAGAGGTGTCGGACCGCATCAGCT
CCCTGGGCAGCCAGGCCATGCAGATGGAGCGCAAAAAGTCCCAGCACGGCGCGGGCTCGA
GCGTGGGGGATGCATCCAGGCCCCCTTACCGGGGACGCTCCTCGGAGAGCAGCTGCGGCG
TCGACGGCGACTACGAGGACGCCGAGTTGAACCCCCGCTTCCTGAAGGACAACCTGATCG
ACGCCAATGGCGGTAGCAGGCCCCCTTGGCCGCCCCTGGAGTACCAGCCCTACCAGAGCA
TCTACGTCGGGGGCATGATGGAAGGGGAGGGCAAGGGCCCGCTCCTGCGCAGCCAGAGCA
CCTCTGAGCAGGAGAAGCGCCTTACCTGGCCCCGCAGGTCCTACTCCCCCCGGAGTTTTG
AGGATTGCGGAGGCGGCTATACCCCGGACTGCAGCTCCAATGAGAACCTCACCTCCAGCG
AGGAGGACTTCTCCTCTGGCCAGTCCAGCCGCGTGTCCCCAAGCCCCACCACCTACCGCA
TGTTCCGGGACAAAAGCCGCTCTCCCTCGCAGAACTCGCAACAGTCCTTCGACAGCAGCA
GTCCCCCCACGCCGCAGTGCCATAAGCGGCACCGGCACTGCCCGGTTGTCGTGTCCGAGG
CCACCATCGTGGGCGTCCGCAAGACCGGGCAGATCTGGCCCAACGATGGCGAGGGCGCCT
TCCATGGAGACGCAGATGGCTCGTTCGGAACACCACCTGGATACGGCTGCGCTGCAGACC
GGGCAGAGGAGCAGCGCCGGCACCAAGATGGGCTGCCCTACATTGATGACTCGCCCTCCT
CATCGCCCCACCTCAGCAGCAAGGGCAGGGGCAGCCGGGATGCGCTGGTCTCGGGAGCCC
TGGAGTCCACTAAAGCGAGTGAGCTGGACTTGGAAAAGGGCTTGGAGATGAGAAAATGGG
TCCTGTCGGGAATCCTGGCTAGCGAGGAGACTTACCTGAGCCACCTGGAGGCACTGCTGC
TGCCCATGAAGCCTTTGAAAGCCGCTGCCACCACCTCTCAGCCGGTGCTGACGAGTCAGC
AGATCGAGACCATCTTCTTCAAAGTGCCTGAGCTCTACGAGATCCACAAGGAGTTCTATG
ATGGGCTCTTCCCCCGCGTGCAGCAGTGGAGCCACCAGCAGCGGGTGGGCGACCTCTTCC
AGAAGCTGGCCAGCCAGCTGGGTGTGTACCGGGCCTTCGTGGACAACTACGGAGTTGCCA
TGGAAATGGCTGAGAAGTGCTGTCAGGCCAATGCTCAGTTTGCAGAAATCTCCGAGAACC
TGAGAGCCAGAAGCAACAAAGATGCCAAGGATCCAACGACCAAGAACTCTCTGGAAACTC
TGCTCTACAAGCCTGTGGACCGTGTGACGAGGAGCACGCTGGTCCTCCATGACTTGCTGA
AGCACACTCCTGCCAGCCACCCTGACCACCCCTTGCTGCAGGACGCCCTCCGCATCTCAC
AGAACTTCCTGTCCAGCATCAATGAGGAGATCACACCCCGACGGCAGTCCATGACGGTGA
AGAAGGGAGAGCACCGGCAGCTGCTGAAGGACAGCTTCATGGTGGAGCTGGTGGAGGGGG
CCCGCAAGCTGCGCCACGTCTTCCTGTTCACCGACCTGCTTCTCTGCACCAAGCTCAAGA
AGCAGAGCGGAGGCTTCCAGATGGTGGATGAACTGGAGGCAGTGCCCAACATCCCCCTGG
TGCCCGATGAGGAGCTGGACGCTTTGAAGATCAAGATCTCCCAGATCAAGAATGACATCC
There was a problem hiding this comment.
as for the protein coding part, the gencode site hosts a subsetted transcriptome of just protein-coding transcripts, which was the file I started with
Describe the problem or feature in addition to a link to the issues.
This is needed for writing decent tests in #326
BCR and ABL1 were chosen somewhat arbitrarily. We do have other test fixtures referencing these genes specifically (tests are for Arriba), but this doesn't interact with those tests
v50 release chosen as its latest. Other fixtures use v31; I could use that release if we want
Before submitting this PR, please make sure:
scripts/ordocker/directories, please ensure any image versions have been incremented accordingly!