Skip to content

test: transcript sequences fixture - #330

Merged
a-frantz merged 3 commits into
mainfrom
transcripts
Aug 25, 2026
Merged

test: transcript sequences fixture#330
a-frantz merged 3 commits into
mainfrom
transcripts

Conversation

@a-frantz

@a-frantz a-frantz commented Aug 25, 2026

Copy link
Copy Markdown
Member

Describe the problem or feature in addition to a link to the issues.

This is needed for writing decent tests in #326

BCR and ABL1 were chosen somewhat arbitrarily. We do have other test fixtures referencing these genes specifically (tests are for Arriba), but this doesn't interact with those tests

v50 release chosen as its latest. Other fixtures use v31; I could use that release if we want

Before submitting this PR, please make sure:

  • You have added a few sentences describing the PR here.
  • The code passes all CI tests without any errors or warnings.
  • You have added tests (when appropriate).
  • You have added an entry in any relevant CHANGELOGs (when appropriate).
  • If you have made any changes to the scripts/ or docker/ directories, please ensure any image versions have been incremented accordingly!
  • You have updated the README or other documentation to account for these changes (when appropriate).

@a-frantz a-frantz self-assigned this Aug 25, 2026
@stjudecloud-cloudy

stjudecloud-cloudy commented Aug 25, 2026

Copy link
Copy Markdown

Snyk checks have passed. No issues have been found so far.

Status Scan Engine Critical High Medium Low Total (0)
Open Source Security 0 0 0 0 0 issues
Licenses 0 0 0 0 0 issues

💻 Catch issues earlier using the plugins for VS Code, JetBrains IDEs, Visual Studio, and Eclipse.


## gencode.v50.BCR_ABL1.transcripts.fa.gz

Gencode v50 release protein-coding transcript sequences FASTA, subsetted to only contain sequences from the genes BCR and ABL1. Gzipped.

Copy link
Copy Markdown
Member

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

I'm not fully familiar with the gencode transcript reference, but does it actually contain the gene labels (e.g. BCR, ABL1). If so did you just grep for those plus protein_coding or something?

Short version, is this enough information to recreate the file easily?

Copy link
Copy Markdown
Member Author

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

I created them "by hand": opened the whole file in my editor, searched for the gene labels, copy and pasted into a new file. It could be done with some Bash-Fu, but that is complicated by the released FASTA formatting being linebroken on nucleotide 80 (or something around that) of each line.

$  gunzip -c test/fixtures/reference/gencode.v50.BCR_ABL1.transcripts.fa.gz | head -n 50
>ENST00000928586.2|ENSG00000186716.23|OTTHUMG00000150655.5|-|BCR-216|BCR|6876|UTR5:1-596|CDS:597-4361|UTR3:4362-6876|
GGGGGGAGGGTGGCGGCTCGATGGGGGAGCCGCCTCCAGGGGGCCCCCCCGCCCTGTGCC
CACGGCGCGGCCCCTTTAAGAGGCCCGCCTGGCTCCGTCATCCGCGCCGCGGCCACCTCC
CCCCGGCCCTCCCCTTCCTGCGGCGCAGAGTGCGGGCCGGGCGGGAGTGCGGCGAGAGCC
GGCTGGCTGAGCTTAGCGTCCGAGGAGGCGGCGGCGGCGGCGGCGGCACGGCGGCGGCGG
GGCTGTGGGGCGGTGCGGAAGCGAGAGGCGAGGAGCGCGCGGGCCGTGGCCAGAGTCTGG
CGGCGGCCTGGCGGAGCGGAGAGCAGCGCCCGCGCCTCGCCGTGCGGAGGAGCCCCGCAC
ACAATAGCGGCGCGCGCAGCCCGCGCCCTTCCCCCCGGCGCGCCCCGCCCCGCGCGCCGA
GCGCCCCGCTCCGCCTCACCTGCCACCAGGGAGTGGGCGGGCATTGTTCGCCGCCGCCGC
CGCCGCGCGGGCCATGGGGGCCGCCCGGCGCCCGGGGCCGGGCTGGCGAGGCGCCGCGCC
GCCGCTGAGACGGGCCCCGCGCGCAGCCCGGCGGCGCAGGTAAGGCCGGCCGCGCCATGG
TGGACCCGGTGGGCTTCGCGGAGGCGTGGAAGGCGCAGTTCCCGGACTCAGAGCCCCCGC
GCATGGAGCTGCGCTCAGTGGGCGACATCGAGCAGGAGCTGGAGCGCTGCAAGGCCTCCA
TTCGGCGCCTGGAGCAGGAGGTGAACCAGGAGCGCTTCCGCATGATCTACCTGCAGACGT
TGCTGGCCAAGGAAAAGAAGAGCTATGACCGGCAGCGATGGGGCTTCCGGCGCGCGGCGC
AGGCCCCCGACGGCGCCTCCGAGCCCCGAGCGTCCGCGTCGCGCCCGCAGCCAGCGCCCG
CCGACGGAGCCGACCCGCCGCCCGCCGAGGAGCCCGAGGCCCGGCCCGACGGCGAGGGTT
CTCCGGGTAAGGCCAGGCCCGGGACCGCCCGCAGGCCCGGGGCAGCCGCGTCGGGGGAAC
GGGACGACCGGGGACCCCCCGCCAGCGTGGCGGCGCTCAGGTCCAACTTCGAGCGGATCC
GCAAGGGCCATGGCCAGCCCGGGGCGGACGCCGAGAAGCCCTTCTACGTGAACGTCGAGT
TTCACCACGAGCGCGGCCTGGTGAAGGTCAACGACAAAGAGGTGTCGGACCGCATCAGCT
CCCTGGGCAGCCAGGCCATGCAGATGGAGCGCAAAAAGTCCCAGCACGGCGCGGGCTCGA
GCGTGGGGGATGCATCCAGGCCCCCTTACCGGGGACGCTCCTCGGAGAGCAGCTGCGGCG
TCGACGGCGACTACGAGGACGCCGAGTTGAACCCCCGCTTCCTGAAGGACAACCTGATCG
ACGCCAATGGCGGTAGCAGGCCCCCTTGGCCGCCCCTGGAGTACCAGCCCTACCAGAGCA
TCTACGTCGGGGGCATGATGGAAGGGGAGGGCAAGGGCCCGCTCCTGCGCAGCCAGAGCA
CCTCTGAGCAGGAGAAGCGCCTTACCTGGCCCCGCAGGTCCTACTCCCCCCGGAGTTTTG
AGGATTGCGGAGGCGGCTATACCCCGGACTGCAGCTCCAATGAGAACCTCACCTCCAGCG
AGGAGGACTTCTCCTCTGGCCAGTCCAGCCGCGTGTCCCCAAGCCCCACCACCTACCGCA
TGTTCCGGGACAAAAGCCGCTCTCCCTCGCAGAACTCGCAACAGTCCTTCGACAGCAGCA
GTCCCCCCACGCCGCAGTGCCATAAGCGGCACCGGCACTGCCCGGTTGTCGTGTCCGAGG
CCACCATCGTGGGCGTCCGCAAGACCGGGCAGATCTGGCCCAACGATGGCGAGGGCGCCT
TCCATGGAGACGCAGATGGCTCGTTCGGAACACCACCTGGATACGGCTGCGCTGCAGACC
GGGCAGAGGAGCAGCGCCGGCACCAAGATGGGCTGCCCTACATTGATGACTCGCCCTCCT
CATCGCCCCACCTCAGCAGCAAGGGCAGGGGCAGCCGGGATGCGCTGGTCTCGGGAGCCC
TGGAGTCCACTAAAGCGAGTGAGCTGGACTTGGAAAAGGGCTTGGAGATGAGAAAATGGG
TCCTGTCGGGAATCCTGGCTAGCGAGGAGACTTACCTGAGCCACCTGGAGGCACTGCTGC
TGCCCATGAAGCCTTTGAAAGCCGCTGCCACCACCTCTCAGCCGGTGCTGACGAGTCAGC
AGATCGAGACCATCTTCTTCAAAGTGCCTGAGCTCTACGAGATCCACAAGGAGTTCTATG
ATGGGCTCTTCCCCCGCGTGCAGCAGTGGAGCCACCAGCAGCGGGTGGGCGACCTCTTCC
AGAAGCTGGCCAGCCAGCTGGGTGTGTACCGGGCCTTCGTGGACAACTACGGAGTTGCCA
TGGAAATGGCTGAGAAGTGCTGTCAGGCCAATGCTCAGTTTGCAGAAATCTCCGAGAACC
TGAGAGCCAGAAGCAACAAAGATGCCAAGGATCCAACGACCAAGAACTCTCTGGAAACTC
TGCTCTACAAGCCTGTGGACCGTGTGACGAGGAGCACGCTGGTCCTCCATGACTTGCTGA
AGCACACTCCTGCCAGCCACCCTGACCACCCCTTGCTGCAGGACGCCCTCCGCATCTCAC
AGAACTTCCTGTCCAGCATCAATGAGGAGATCACACCCCGACGGCAGTCCATGACGGTGA
AGAAGGGAGAGCACCGGCAGCTGCTGAAGGACAGCTTCATGGTGGAGCTGGTGGAGGGGG
CCCGCAAGCTGCGCCACGTCTTCCTGTTCACCGACCTGCTTCTCTGCACCAAGCTCAAGA
AGCAGAGCGGAGGCTTCCAGATGGTGGATGAACTGGAGGCAGTGCCCAACATCCCCCTGG
TGCCCGATGAGGAGCTGGACGCTTTGAAGATCAAGATCTCCCAGATCAAGAATGACATCC

Copy link
Copy Markdown
Member Author

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

as for the protein coding part, the gencode site hosts a subsetted transcriptome of just protein-coding transcripts, which was the file I started with

@a-frantz
a-frantz merged commit f2ae44a into main Aug 25, 2026
63 checks passed
@a-frantz
a-frantz deleted the transcripts branch August 25, 2026 15:25
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

3 participants