MolScribe, chembl_test_macfonts
Failure breakdown
Attempted: 900 | exact: 581 (0.646)
| failure mode |
n |
share of all |
share of failures |
what it points at |
| unparseable output |
78 |
0.087 |
0.245 |
decoder emitted a string RDKit cannot read |
| stereochemistry only |
100 |
0.111 |
0.313 |
skeleton correct; wedge/hash reading wrong |
| right formula, wrong bonds |
3 |
0.003 |
0.009 |
atoms counted correctly, connectivity misread |
| other structural error |
138 |
0.153 |
0.433 |
a genuinely different molecule |
Accuracy by molecule size
| heavy atoms |
n |
exact |
valid |
| <=15 |
15 |
0.867 |
1.000 |
| <=20 |
81 |
0.741 |
0.975 |
| <=25 |
219 |
0.708 |
0.945 |
| <=30 |
189 |
0.646 |
0.905 |
| <=35 |
201 |
0.637 |
0.900 |
| <=40 |
132 |
0.553 |
0.856 |
| >40 |
63 |
0.476 |
0.889 |
Accuracy by rendering style
| style |
n |
exact |
valid |
| clean |
300 |
0.823 |
0.977 |
| degraded |
300 |
0.357 |
0.803 |
| varied |
300 |
0.757 |
0.960 |
Sequence length
- Reference SMILES length, all attempted: median 49 tokens
- Reference SMILES length, correct predictions: median 47 tokens
Longest failures
| reference |
predicted |
CC(=O)OC[C@H]1O[C@@H](O[C@H]2[C@H](OC(C)=O)[C@@H](OC(C)=O)[C@H](S(N)(= |
CC(=O)O[C@H]1[C@@H](OC(C)=O)[C@@H](OC(=O)C(C)=O)O[C@@H](O[C@H]2[C@H](O |
CC(=O)OC[C@H]1O[C@@H](O[C@H]2[C@H](OC(C)=O)[C@@H](OC(C)=O)[C@H](S(N)(= |
CC(=O)OC[C@H]1O[C@@H](O[C@H]2[C@H](OC(C)=O)[C@@H](OC(C)=O)[C@H]([S@SP3 |
CC(=O)OC[C@H]1O[C@@H](O[C@H]2[C@H](OC(C)=O)[C@@H](OC(C)=O)[C@H](S(N)(= |
CC(=O)OCC1OC2C(OC(C)(=O)CS2(=O)=O)C(OC(C)=O)C1OC1CC(OC(C)=O)C2OC(=O)OC |
Cc1c(C)c2c(c(C)c1OC(=O)CCC(=O)NC1CC(C)(C)N([O])C1(C)C)CCC(C)(C(=O)NC1C |
Cc1c(C)c2c(c(C)c1OC(=O)CCC(=O)NC1CC(C)(C)N(O)C1(C)C)CCC(C)(C(=O)NC1CC( |
Cc1c(C)c2c(c(C)c1OC(=O)CCC(=O)NC1CC(C)(C)N([O])C1(C)C)CCC(C)(C(=O)NC1C |
Cc1c(C)c2c(c(C)c1OC(=O)CCC(=O)NC1CC(C)(C)N(O)C1(C)C)CCC(C)(C(=O)NC1CC( |