MolScribe, chembl_test_linux
Failure breakdown
Attempted: 900 | exact: 582 (0.647)
| failure mode |
n |
share of all |
share of failures |
what it points at |
| unparseable output |
59 |
0.066 |
0.186 |
decoder emitted a string RDKit cannot read |
| stereochemistry only |
102 |
0.113 |
0.321 |
skeleton correct; wedge/hash reading wrong |
| right formula, wrong bonds |
1 |
0.001 |
0.003 |
atoms counted correctly, connectivity misread |
| other structural error |
156 |
0.173 |
0.491 |
a genuinely different molecule |
Accuracy by molecule size
| heavy atoms |
n |
exact |
valid |
| <=15 |
15 |
0.800 |
1.000 |
| <=20 |
81 |
0.765 |
0.975 |
| <=25 |
219 |
0.721 |
0.982 |
| <=30 |
189 |
0.672 |
0.937 |
| <=35 |
201 |
0.627 |
0.915 |
| <=40 |
132 |
0.530 |
0.894 |
| >40 |
63 |
0.429 |
0.841 |
Accuracy by rendering style
| style |
n |
exact |
valid |
| clean |
300 |
0.823 |
0.977 |
| degraded |
300 |
0.350 |
0.863 |
| varied |
300 |
0.767 |
0.963 |
Sequence length
- Reference SMILES length, all attempted: median 49 tokens
- Reference SMILES length, correct predictions: median 46 tokens
Longest failures
| reference |
predicted |
CC(=O)OC[C@H]1O[C@@H](O[C@H]2[C@H](OC(C)=O)[C@@H](OC(C)=O)[C@H](S(N)(= |
CC(=O)COC[CH]12CO=C(C(C)=O)CC3OC(OC1C(OC(C)=O)C(OC(C)=O)C(S(N)(=O)=O)O |
CC(=O)OC[C@H]1O[C@@H](O[C@H]2[C@H](OC(C)=O)[C@@H](OC(C)=O)[C@H](S(N)(= |
CC(=O)OC1C2CC(=O)OC3[CH]OC(S(N)(=O)=O)[CH]45(OC(C)=O)[CH]6(OC(C)=O)[CH |
CC(=O)OC[C@H]1O[C@@H](O[C@H]2[C@H](OC(C)=O)[C@@H](OC(C)=O)[C@H](S(N)(= |
[I-].[I-] |
Cc1c(C)c2c(c(C)c1OC(=O)CCC(=O)NC1CC(C)(C)N([O])C1(C)C)CCC(C)(C(=O)NC1C |
Cc1c(C)c2c(c(C)c1OC(=O)CCC(=O)NC1CC(C)(C)N(O)C1(C)C)CCC(C)(C(=O)NC1CC( |
Cc1c(C)c2c(c(C)c1OC(=O)CCC(=O)NC1CC(C)(C)N([O])C1(C)C)CCC(C)(C(=O)NC1C |
*N1C(C)(C)CC(NC(=O)C2(C)CCc3c(C)c(OC(=O)CCC(=O)NC4CC(C)(C)N(O)C4(C)C)c |