Protein

View in Explore

Genbank accession

YP_009167614.1 [GenBank]

Protein name

tail fiber protein proximal subunit

RBP type

Evidence UniProt/TrEMBL

Probability 1,00

Evidence GenBank

Probability 1,00

TSP

Evidence RBPdetect

Probability 0,51

Evidence RBPdetect2

Probability 0,93

Protein sequence

MAEIKRKFRAEDGLDAGGDKIINVALADRAVGTDGVNVDYLIQENTVQQYDPTRGYLKDFVIIYDNRFWAAINDIPKPAGAFNSVRWRALRTDANWTTVSSGPYQLKSGESISVNTAAGNDITFTLPSSPIDGDTIVLQDIGGKPGVNQVLITAPVQSIVNFRGQQVRSVLMTHPKSQIVLIFSNRLWQMYVADYSREAAVVTPASLYQAQSNDFIVRRFTSASAINIKLPRFANHGDIINFVDLDKLNPLYHTIVTTYDETTSVQEVGTHSIEGRTSIDGFLMFDDNEKLWRLFDGDSKARLRIITTNSNIRPNEEVMVFGANNGTTQTIELQLPTDISIGDTVKISMNYMRKGQTVKIKAAGEDKIASSVQLLQFPKRSEYPPETKWVTVQELVFNGETNYVPVLQLAYIEDSDGKYWVVQQNVPTVERVDSLNNSTRARLGVIALATQAQANADLENSPQKELAITPETLANRTATETRRGIARIATTAQVNQDTTFSFADDLIITPKKLNERTATETRRGVAEIATQQETNTGTDDTTIITPKKLQARQGSESLSGIVTFVSTAGATPASSRELNGTNVYNKNTNNLVVSPKALDQYKATPTQQGAVILAVESEVIAGQSQEGWANAVVTPETLHKKTSTDGRIGLIEIATQSEVNTGTDYTRAVTPKTLNDRRATESLSGIAEIATQVEFDAGVDDTRISTPLKIKTRFNSTDRTSVVALSGLVESGTLWDHYTLNILEANETQRGTLRVATQVEAAAGKLDNVLITPKKLLGTKSTEAQEGVIKVATQTETVAGTSANTAVSPKNLKWIVQSEPTWAATTAVRGFVKTSSGSITFVGNDTAGSTQDLELYEKNSYAVSPYELNRVLANYLPLKAKAADSNLLDGLDSSQFIRRDIAQTVNGSLTLTQQTNLSAPLVSSSTATFGGSVSANSTLTISNTGTATRLIFEKGPQTGTNPAQTMTVRVWGNQFSGELDTTRSTVFEVSDETSSHFYSQRNKAGNITFNINGTVTPINVNASGTLNANGVATFGNSVTATGEIISRSANAFRAINGNYGFIVRNDGSVTNFMLTASGDQTGGFNGLRPLAINNASGQVTIGESLIIAKGATINSGGLTVNSRIRSQGTKTSDLYTRAPTSDTVGFWSIDINDSATYNQFPGYFKMVEKTNEVTGLPYLERGEEVKSPGTLTQFGNTLDSLYQDWITYPTTPEARTTRWTRTWQKTKNSWSSFVQVFDGGNPPQPSDIGALPSDNATMGNLTIRDFLRIGNVRIIPDPVNKTVKFEWVE

Physico‐chemical properties

protein length:	1289 AA
molecular weight:	140057,57800 Da
isoelectric point:	5,54751
aromaticity:	0,07215
hydropathy:	-0,32824

Domains

Domains [InterPro]

DC_1986
ATT
14–133

DC_1986 DC_1209 IPR048391

IPR048390
ATT
980–1092

IPR048390

DC_1209
STR
998–1275

DC_1209

YP_009167614.1

1 1289

Architecture

ATT

STR

ATT

STR

ATT

STR

ATT 14-133 | STR 343-979 | ATT 980-1092 | STR 1093-1138 | ATT 1139-1237 | STR 1238-1275 |

Legend: ATT STR RBD CBM LEC ENZ CHP LNK TAS TTP UNK Unmapped

Domains [InterPro]

Domain ID	Category	Cluster	Start	End	Layer	Name	Pref Zone	Confidence	Evidence	Support
DC_1986	ATT	DC_1986	14	133	Novel HMM	DC_1986	N-terminal	Low	Positional only	693 proteins / 693 hits
DC_1209	STR	DC_1209	343	1061	Novel HMM	DC_1209	Central	Low	Positional only	904 proteins / 904 hits
IPR048390	ATT	DC_0836	980	1092	InterPro cluster	Long-tail fiber proximal subunit, trimerization domain	C-terminal	Medium	Text match	656 proteins / 656 hits
DC_1209	STR	DC_1209	998	1275	Novel HMM	DC_1209	Central	Low	Positional only	904 proteins / 904 hits
IPR048391	ATT	DC_0875	1139	1237	InterPro cluster	Long-tail fiber proximal subunit domain	C-terminal	Medium	Text match	795 proteins / 796 hits

Tail Spike Domain Segmentation

This protein has been segmented into three structural domains: N-terminal, central domain, and C-terminal.

Domain Layout

N-terminal

Central

C-terminal

YP_009167614.1

1 1289

Domain	Start	End	Length (AA)	Confidence
N-terminal	1	981	981	0,8980
Central domain	982	1180	200	0,3202
C-terminal	1181	1289	108	0,2617

Note: Constraints were applied during segmentation.
Fixed 119 C-terminal predictions appearing before Central domain

Legend: N-terminal Central domain C-terminal

3D Structure with Domain Coloring

The structure is colored according to the domain segmentation: N-terminal (blue), Central (green), C-terminal (pink).

Domain Coloring

N-terminal
1-981

Central
982-1180

C-terminal
1181-1289

Taxonomy

	Name	Taxonomy ID	Lineage
Phage	Enterobacteria phage RB68 [NCBI]	36339	Viruses > Duplodnaviria > Heunggongvirae > Uroviricota > Caudoviricetes
Host	Escherichia coli B [NCBI]	37762	Bacteria > Proteobacteria > Gammaproteobacteria > Enterobacteriales > Enterobacteriaceae > Escherichia

Coding sequence (CDS)

Genbank protein accession

YP_009167614.1 [NCBI]

Genbank nucleotide accession

NC_027979 [NCBI]

CDS location

range 149595 -> 153464
strand +

CDS

ATGGCCGAGATTAAAAGAAAGTTCAGAGCAGAAGATGGTCTGGACGCAGGTGGTGATAAAATAATCAACGTAGCTTTAGCTGATCGTGCCGTAGGAACTGACGGTGTAAACGTTGATTACTTAATTCAAGAAAACACAGTTCAACAATATGATCCAACTCGTGGATATTTAAAAGATTTTGTAATCATTTATGATAACCGCTTTTGGGCTGCTATAAATGATATTCCAAAACCAGCAGGAGCTTTTAATAGCGTACGATGGAGAGCGTTACGCACTGATGCAAACTGGACAACTGTTTCGTCAGGACCTTATCAATTAAAATCAGGCGAATCGATTTCAGTTAACACCGCAGCGGGTAATGACATTACATTTACTTTGCCATCTTCTCCAATTGATGGTGATACTATCGTTCTCCAAGATATTGGAGGAAAACCTGGAGTTAACCAGGTTTTAATTACAGCTCCGGTACAAAGCATTGTAAATTTTAGAGGTCAACAAGTACGCTCAGTACTAATGACTCATCCAAAATCACAGATAGTTTTAATTTTTAGTAATCGTCTGTGGCAAATGTATGTTGCTGATTATAGCAGAGAAGCGGCAGTTGTAACACCGGCAAGTCTTTATCAAGCGCAATCAAACGATTTTATCGTGCGTAGATTTACTTCTGCTTCAGCAATTAATATTAAACTTCCTAGATTTGCTAATCATGGGGATATTATTAATTTTGTTGATTTAGATAAATTAAATCCACTTTATCACACAATTGTTACCACATATGATGAAACAACTTCAGTACAAGAAGTTGGAACTCATTCCATTGAAGGCCGTACATCTATTGATGGTTTCTTAATGTTTGATGATAATGAGAAATTGTGGAGATTGTTTGACGGGGATAGTAAAGCACGTTTACGCATTATAACGACTAATTCTAATATTCGTCCAAATGAAGAAGTCATGGTATTTGGCGCGAATAATGGAACAACCCAAACAATTGAACTTCAGCTTCCAACTGATATTTCTATCGGTGATACTGTTAAGATTTCCATGAATTATATGAGAAAAGGACAAACAGTTAAAATCAAAGCTGCCGGTGAAGATAAAATTGCTTCTTCAGTTCAATTGCTGCAATTTCCAAAACGTTCAGAATACCCACCTGAAACTAAATGGGTGACTGTTCAAGAATTAGTTTTTAATGGCGAAACCAATTATGTTCCAGTTTTACAGCTTGCTTATATCGAAGATTCCGATGGAAAATATTGGGTTGTACAGCAAAACGTTCCAACTGTAGAAAGAGTAGACTCTTTAAATAATTCTACTAGAGCAAGATTAGGCGTAATTGCTTTAGCTACACAGGCTCAAGCTAATGCTGATCTAGAAAATTCTCCACAAAAAGAACTGGCAATTACTCCAGAAACGTTAGCTAATCGTACTGCTACAGAAACTCGTAGAGGTATTGCAAGAATAGCAACAACTGCGCAAGTAAACCAGGATACCACATTCTCTTTTGCAGATGACCTTATCATCACTCCTAAAAAGTTGAATGAAAGAACTGCTACAGAAACTCGTAGGGGTGTCGCTGAAATTGCTACGCAACAGGAAACTAATACAGGTACTGATGATACGACAATCATCACTCCTAAAAAGCTTCAAGCTCGCCAAGGTTCTGAATCATTATCTGGTATTGTAACTTTTGTATCTACTGCAGGTGCTACTCCAGCTTCTAGCCGTGAATTAAATGGTACGAATGTTTATAATAAAAACACTAATAATTTAGTTGTTTCGCCAAAAGCTTTGGACCAGTATAAAGCTACGCCTACTCAACAGGGTGCAGTAATTTTAGCAGTTGAAAGTGAAGTAATTGCTGGTCAAAGTCAAGAAGGATGGGCAAATGCTGTTGTGACGCCAGAAACGTTACATAAAAAGACATCAACTGATGGAAGAATTGGTTTAATTGAAATTGCTACGCAAAGTGAAGTTAATACAGGAACTGATTATACTCGTGCAGTCACTCCTAAAACTTTAAATGACCGTAGAGCAACTGAAAGTTTAAGTGGTATAGCTGAAATTGCTACACAAGTTGAATTCGACGCAGGCGTCGACGATACTCGTATCTCTACACCATTAAAAATTAAAACTAGATTTAATAGTACTGATCGTACTTCTGTTGTTGCTCTATCTGGATTAGTTGAATCAGGAACTCTCTGGGACCATTATACCCTTAATATTCTTGAAGCAAATGAGACACAACGTGGTACACTTCGTGTGGCTACACAAGTTGAAGCTGCTGCTGGAAAATTAGATAATGTTTTAATAACTCCTAAAAAGCTTTTAGGTACTAAATCTACTGAAGCACAAGAAGGTGTTATTAAAGTTGCAACACAAACCGAAACTGTTGCTGGAACATCGGCAAATACTGCTGTATCTCCAAAAAATTTAAAATGGATTGTGCAGAGTGAACCTACTTGGGCAGCTACTACTGCAGTAAGAGGCTTTGTTAAAACTTCATCTGGTTCAATTACATTCGTTGGTAATGATACAGCCGGTTCTACTCAGGACTTAGAGCTATACGAGAAAAATAGCTATGCAGTATCACCATACGAATTAAACCGTGTATTAGCAAATTATTTGCCATTAAAAGCAAAAGCTGCAGATAGTAATTTATTGGATGGTCTAGATTCATCTCAGTTCATTCGTAGGGATATTGCGCAGACGGTTAATGGTTCACTAACCTTAACTCAACAAACGAATCTGAGTGCCCCTCTTGTATCATCTAGTACTGCTACGTTCGGTGGATCAGTTTCAGCAAATAGTACATTAACTATTTCTAATACTGGAACAGCAACTCGATTGATTTTTGAGAAAGGACCTCAAACTGGAACAAACCCAGCCCAAACGATGACTGTTAGAGTGTGGGGAAATCAATTTAGTGGGGAATTAGATACAACACGTTCTACCGTATTTGAAGTTAGTGATGAAACATCTAGTCATTTTTATTCTCAGCGCAATAAAGCCGGAAATATAACATTTAATATCAACGGTACAGTAACACCGATAAATGTTAATGCTTCAGGAACATTGAATGCAAATGGCGTAGCAACATTTGGTAATTCAGTCACTGCAACTGGTGAAATTATTTCTCGAAGCGCAAATGCTTTCCGTGCTATTAACGGAAATTATGGTTTCATTGTTCGCAATGATGGATCAGTAACGAATTTTATGCTTACTGCATCGGGTGATCAGACTGGTGGATTTAACGGATTACGCCCATTAGCTATTAATAATGCATCTGGTCAAGTAACGATTGGTGAAAGCTTAATCATCGCCAAAGGTGCTACTATAAATTCTGGTGGTTTAACTGTTAACTCGAGAATTCGTTCTCAAGGTACTAAAACATCTGACTTATATACACGTGCGCCAACATCTGATACTGTAGGATTCTGGTCAATTGATATTAACGATTCAGCTACTTATAACCAGTTCCCAGGTTATTTTAAAATGGTTGAAAAAACTAATGAAGTGACTGGTCTTCCATATTTAGAACGTGGCGAAGAAGTTAAATCTCCTGGTACACTGACTCAGTTTGGTAACACACTTGATTCGCTTTACCAAGATTGGATTACTTATCCAACAACGCCAGAAGCGCGTACCACTCGCTGGACACGTACATGGCAGAAAACCAAAAATTCTTGGTCAAGTTTTGTTCAGGTATTTGATGGAGGTAATCCTCCTCAACCATCTGATATTGGTGCTTTACCATCTGATAATGCTACAATGGGTAATCTTACTATTCGTGATTTCTTACGAATTGGTAATGTTCGCATTATTCCTGACCCAGTGAATAAAACTGTTAAATTTGAATGGGTTGAATAA

Genome Context

Tertiary structure

PDB ID

a627fecbdd76eb562dff75ece1621c99ba7b1b4f2d61b2bbe2b38310e6766a9b

ESMFold

Source ESMFold

Method ESMFold

Resolution 0,5562

Oligomeric State monomer

Download PDB

Model Confidence

Very high
pLDDT > 90

High
90 > pLDDT > 70

Low
70 > pLDDT > 50

Very low
pLDDT < 50

Protein

Domains

Domains [InterPro]

Domains [InterPro]

Tail Spike Domain Segmentation

Tail Spike Domain Segmentation

3D Structure with Domain Coloring

Domain Coloring

Taxonomy

Coding sequence (CDS)

Coding sequence (CDS)

Genome Context

Genome Context

Tertiary structure

Predicted Aligned Error (PAE)

Model Confidence