Genbank accession
URC25564.1 [GenBank]
Protein name
central tail fiber J
RBP type
TF
Evidence Phold
Probability 1,00
TSP
Evidence RBPdetect
Probability 0,80
TF
Evidence RBPdetect2
Probability 0,96
Protein sequence
MAENMITGSKGGSSKPYVPKEMEDNLISINKIKILLAVSDGECDPDFTLRDLYLDDVPVIADDGTVNYQGVSAEFRPGTQTQDYIQGFTDTSSEVTLARDITTSNPYVISVTNKTLSAIRIKMLMPTGIKQEDNGDLVGVKVTYAVDVAVDGDSYKEVLRDTIEGKTRSGYDRSRRIDLPAFNDRVLLRVRRVTADSTSSRVTDLIKLQSYAEVIDAKFRYPLTGLVYVEFDSELFPNQIPNISIKKKWKLINVPSNYDPVMREYHGSWDGTFKKAWSNNPAWVLYDIITNQRYGLDQRELGVQVDKWSLYEAAQYCDQKVPDGKGGTEPRYLCDVVIQSQIEAYQLIRDICSIFRGMSFWNGESLSIVIDKPRDPSYIFTNDNVVDGDFQYTTASEKSMYTQCNVTFDDEQNMYQQDVEGVFDTEAALRFGYNPTSITAIGCTRRSEANRRGRWILKTNLRSTTVNFATGLEGMIPSIGDVIAVADNFHSSNLKLNLSGRVMEVSGLQVFVPFKIDARPGDFIIINKPDGKPVKRTISKVSGDGKTIELNIGFGFEVKPDTVFAIDRTDIALQQYVVTSIGKGDDDDDDDEFTTAVEYDPNKYDEIDYGVNIDDRPTSIVQPDTMAAPENVQISSYSRIVQGASVETMVVSWDKVPYASLYEMQWRKGDGNWLYTPQTANKEIEVEGIYSGNYQVRVRSVSASGNTSPWSKIATATLIGKVGEPGAPINLTASDNEVFGIRVKWGMPEGSGDTAYIELHQSPDGTVENSSLLTLIPYPQYEYWHSTLPAGQVVWYRIRSVDRIGNVSGWTDFVRGMASDDVESVLGDILDKIFDTEAGQEIKENAIDSANKIKDQAQSIIQNALANDADVKWTRVQNGKRKAEYGHALELIATETEARVTQIEELRASIDKDIVSSIKTVQEAIANESETRATQVQQLDSKFTKEIDGVKRDTAASIGEVRQTIANESEARAQAVQQLDAKFTKEINDLDGVIKTEVEANISEVKQAIANETEARVQADQALTAKFGDVESALAQKLDSWANVDSVGAKYAMKLGLTYKGQKYSAGMIMQLSQSSQGLISQILFDANRFAIMTSSTGGTFTLPFVVENNQVFINSLLVKNGSITNAMIGNVIQSNNFVQNQQGWRLDKNGIFENYGSTPGEGATKFTNEGLKVKDANGVLRVEVGRITGSW
Physico‐chemical
properties
protein length:1192 AA
molecular weight: 132176,36370 Da
isoelectric point:4,77160
aromaticity:0,08473
hydropathy:-0,38549

Domains

Domains [InterPro]
DC_0014
STR
1–1192
IPR053171
Unmapped
3–872
IPR013783
STR
627–719
IPR003961
STR
628–725
IPR003961
STR
628–717
URC25564.1
1 1192
Architecture
STR
ATT
STR
ATT
STR
STR 1-91 | ATT 92-217 | STR 218-340 | ATT 341-488 | STR 489-1192
Legend: ATT STR RBD CBM LEC ENZ CHP LNK TAS TTP UNK Unmapped

Tail Spike Domain Segmentation

Tail Spike Domain Segmentation

This protein has been segmented into three structural domains: N-terminal, central domain, and C-terminal.

Domain Layout
N-terminal
Central
C-terminal
URC25564.1
1 1192
Domain Start End Length (AA) Confidence
N-terminal 1 510 510 0,9457
Central domain 511 1066 557 0,0409
C-terminal 1067 1192 125 0,3852
Legend: N-terminal Central domain C-terminal
3D Structure with Domain Coloring

The structure is colored according to the domain segmentation: N-terminal (blue), Central (green), C-terminal (pink).

Domain Coloring
N-terminal
1-510
Central
511-1066
C-terminal
1067-1192

Taxonomy

  Name Taxonomy ID Lineage
Phage Escherichia phage EC167
[NCBI]
2936945 Viruses > Duplodnaviria > Heunggongvirae > Uroviricota > Caudoviricetes
Host Escherichia coli
[NCBI]
562 cellular organisms > Bacteria > Pseudomonadati > Pseudomonadota > Gammaproteobacteria > Enterobacterales

Coding sequence (CDS)

Coding sequence (CDS)
Genbank protein accession
URC25564.1 [NCBI]
Genbank nucleotide accession
ON185587.1 [NCBI]
CDS location
range 16609 -> 20187
strand +
CDS
ATGGCTGAAAATATGATAACTGGCAGTAAGGGGGGATCATCAAAACCTTATGTGCCGAAAGAGATGGAAGATAACCTGATCTCAATAAACAAAATCAAAATCCTTCTTGCCGTTTCCGATGGCGAGTGCGATCCAGATTTCACGCTTCGCGATCTGTATCTTGATGATGTTCCTGTAATTGCAGACGACGGAACTGTTAACTACCAGGGTGTGAGCGCAGAGTTTCGCCCAGGTACACAGACTCAAGATTACATCCAGGGATTTACTGACACGTCAAGCGAAGTGACGCTGGCGCGTGACATTACTACGTCAAATCCTTATGTAATTTCTGTAACCAACAAAACATTATCTGCTATCAGAATAAAAATGCTAATGCCAACAGGCATTAAGCAAGAGGATAACGGCGATCTTGTCGGCGTTAAGGTTACTTATGCTGTTGATGTGGCTGTTGACGGAGACTCTTACAAAGAAGTATTGCGAGACACTATCGAAGGTAAAACTCGCTCCGGTTACGACAGAAGCAGAAGGATTGACCTTCCGGCATTTAATGATCGAGTATTACTTAGGGTTAGAAGGGTTACGGCAGACAGCACATCTTCTCGTGTTACTGATCTTATTAAGCTACAAAGTTACGCTGAGGTTATTGATGCAAAATTCCGTTATCCTCTGACTGGTCTTGTATACGTTGAATTTGACAGTGAGTTGTTCCCTAACCAGATCCCTAACATTTCAATCAAGAAGAAATGGAAGTTAATTAATGTTCCGAGCAATTACGATCCGGTAATGCGAGAGTATCACGGTTCATGGGATGGTACTTTCAAGAAAGCGTGGTCGAACAATCCGGCGTGGGTTCTTTATGACATTATCACAAACCAGCGATACGGATTAGATCAGCGAGAACTTGGCGTGCAGGTTGACAAATGGAGTCTTTACGAAGCGGCGCAATACTGCGATCAGAAAGTGCCGGATGGAAAAGGCGGTACAGAGCCGCGTTATCTATGCGACGTTGTGATTCAAAGCCAGATTGAGGCTTATCAGCTTATTCGTGACATTTGCTCTATCTTCCGTGGAATGAGCTTTTGGAATGGAGAGAGCTTGTCAATAGTTATTGATAAACCACGCGATCCATCTTACATCTTCACAAATGATAACGTTGTTGATGGGGATTTTCAGTATACGACAGCAAGCGAAAAGAGCATGTACACACAGTGCAACGTGACGTTCGACGACGAGCAAAACATGTATCAGCAGGACGTCGAAGGCGTGTTTGATACTGAGGCAGCACTACGCTTTGGATACAATCCTACAAGCATAACAGCGATCGGATGTACGCGCAGGAGTGAGGCAAATCGGCGCGGTCGATGGATACTAAAAACCAACTTGCGCAGCACTACTGTAAACTTTGCTACTGGCCTGGAAGGGATGATCCCATCAATAGGTGATGTGATTGCTGTTGCTGACAACTTTCACAGCAGCAACCTGAAGTTAAACCTATCAGGTCGCGTGATGGAGGTTTCCGGTTTGCAGGTGTTCGTTCCGTTTAAGATTGACGCGCGACCAGGTGATTTCATTATCATCAACAAGCCTGACGGAAAGCCAGTTAAGCGCACAATCTCAAAGGTAAGCGGTGACGGAAAAACCATTGAGTTAAACATTGGGTTTGGATTTGAAGTTAAACCGGACACGGTTTTTGCAATCGACCGCACTGATATTGCATTGCAGCAATACGTTGTAACGAGTATCGGCAAAGGTGATGATGATGATGATGATGATGAATTTACAACGGCTGTTGAATATGACCCGAACAAATACGACGAGATTGATTATGGAGTAAACATTGACGACAGGCCAACTTCAATTGTCCAGCCTGACACAATGGCAGCGCCTGAAAATGTGCAAATATCCTCCTACTCGCGAATTGTCCAGGGTGCAAGCGTTGAAACAATGGTTGTGTCGTGGGATAAAGTACCTTACGCATCGCTGTATGAAATGCAGTGGCGAAAAGGTGATGGCAACTGGCTGTATACGCCGCAGACAGCTAACAAAGAGATAGAGGTAGAAGGAATTTATTCAGGGAACTATCAAGTAAGGGTTAGATCTGTTTCTGCAAGCGGTAACACCTCCCCGTGGTCAAAGATTGCAACCGCCACCCTGATAGGTAAAGTTGGCGAGCCAGGAGCGCCGATTAATCTTACAGCTTCTGATAATGAAGTTTTTGGCATTCGTGTCAAATGGGGTATGCCGGAAGGATCAGGCGATACGGCTTACATTGAGCTTCACCAATCTCCAGACGGAACGGTTGAAAACTCAAGCCTGCTTACGCTGATTCCATATCCTCAATATGAGTATTGGCATAGCACGTTACCAGCGGGTCAAGTTGTATGGTATAGAATCCGTAGCGTTGACAGGATCGGCAACGTTTCCGGCTGGACTGACTTTGTTCGCGGCATGGCGTCAGATGATGTTGAATCTGTTTTAGGCGACATTCTGGACAAGATTTTTGATACCGAAGCGGGTCAAGAAATCAAAGAGAACGCCATAGACAGTGCAAACAAAATCAAAGACCAGGCGCAATCAATCATCCAGAACGCATTGGCAAACGATGCTGATGTGAAGTGGACGCGAGTACAAAACGGAAAGCGTAAGGCTGAATATGGTCATGCACTGGAGCTTATTGCTACCGAAACGGAGGCGCGCGTAACTCAAATCGAAGAGTTAAGGGCGTCAATTGATAAAGATATAGTTTCAAGTATCAAAACCGTTCAGGAAGCGATTGCCAACGAATCAGAGACGCGAGCTACTCAAGTTCAGCAGCTTGATTCTAAATTTACAAAGGAAATAGACGGCGTAAAACGAGATACGGCTGCAAGTATTGGCGAGGTAAGGCAAACCATTGCCAATGAATCAGAAGCGCGCGCTCAGGCCGTTCAGCAGCTTGACGCTAAGTTCACGAAAGAGATAAACGACCTTGACGGAGTTATCAAAACAGAAGTCGAGGCTAACATCTCAGAAGTGAAACAGGCGATCGCCAATGAGACAGAGGCAAGGGTTCAGGCTGACCAGGCTTTAACAGCCAAATTTGGAGACGTTGAATCTGCATTAGCTCAAAAACTTGATTCGTGGGCCAACGTTGATTCGGTTGGCGCTAAGTACGCTATGAAATTGGGCCTTACTTACAAGGGGCAGAAGTACAGCGCAGGCATGATCATGCAGTTGTCGCAATCTTCTCAAGGCCTGATCTCGCAAATCTTGTTCGATGCTAACAGGTTCGCGATCATGACTAGCTCTACTGGCGGTACGTTTACATTGCCTTTCGTTGTTGAAAACAACCAAGTTTTCATTAACAGCTTGTTAGTGAAAAACGGGTCCATAACGAATGCCATGATTGGAAATGTTATTCAGTCAAACAATTTTGTTCAAAATCAGCAAGGTTGGAGGCTTGATAAAAACGGAATATTTGAAAACTACGGATCAACTCCAGGAGAGGGAGCTACTAAATTCACCAACGAAGGATTGAAGGTAAAAGATGCAAACGGAGTATTGAGGGTTGAAGTCGGAAGGATTACCGGAAGCTGGTAA

Genome Context

Genome Context

Tertiary structure

PDB ID
cbdfb6a8eb037e9f4f3fe102cd1239b38ca1f06f20c394c40b09efab4c646cd2
ESMFold
Source ESMFold
Method ESMFold
Resolution 0,7778
Oligomeric State monomer
Model Confidence
Very high
pLDDT > 90
High
90 > pLDDT > 70
Low
70 > pLDDT > 50
Very low
pLDDT < 50

Literature

Title Authors Date PMID Source
Complete genome sequences of 17 Escherichia coli bacteriophages isolated from wastewater, pond water, cow manure and bird feces Vitt,A.R., Ahern,S.J., Gambino,M., Holst Sorensen,M.C. and Brondsted,L. 2022-10-20 GenBank