Введение

Обозначение структуры химических соединений

Упрощенная система ввода молекулярной структуры в виде строки (SMILES) — это спецификация, представляющая собой линейную нотацию для описания структуры химических соединений с использованием коротких строк ASCII. Строки SMILES могут быть импортированы большинством молекулярных редакторов для преобразования обратно в двухмерные изображения или трехмерные модели молекул. Изначальная спецификация SMILES была разработана в 1980-х годах. С тех пор она была модифицирована и расширена. В 2007 году в сообществе разработчиков открытого программного обеспечения для химии был разработан открытый стандарт под названием OpenSMILES.

История

Оригинальная спецификация SMILES была инициирована Дэвидом Вайнингером в лаборатории USEPA Mid Continent Ecology Division в Дулуте в 1980-х годах. За вклад в раннюю разработку были отмечены Гилман Вейт и Роуз Руссо (USEPA), а также Альберт Лео и Корвин Ханш (Помона Колледж) за поддержку работы, и Артур Вайнингер (Помона; Daylight CIS) и Джереми Скофилд (Cedar River Software, Рентон, штат Вашингтон) за помощь в программировании системы. Агентство по охране окружающей среды финансировало первоначальный проект по разработке SMILES. Впоследствии спецификация была изменена и расширена другими разработчиками, в особенности компанией Daylight Chemical Information Systems. В 2007 году сообщество Open Source химии Blue Obelisk разработало открытый стандарт под названием "OpenSMILES". Другие "линейные" нотации включают в себя нотацию Висвессера (WLN), ROSDAL и SLN (Tripos Inc). В июле 2006 года IUPAC представил InChI как стандарт для представления химических формул. SMILES обычно считается более удобным для чтения человеком, чем InChI, а также обладает широкой поддержкой программного обеспечения и прочной теоретической базой, например, теорией графов.

Терминология

Термин SMILES относится к строчной нотации для кодирования молекулярных структур, и конкретные экземпляры должны строго называться строками SMILES. Однако термин SMILES также обычно используется для обозначения как одной строки SMILES, так и нескольких строк SMILES; точное значение обычно становится очевидным из контекста. Термины "канонический" и "изомерный" могут привести к некоторой путанице при применении к SMILES. Эти термины описывают различные атрибуты строк SMILES и не являются взаимоисключающими. Как правило, для молекулы можно записать несколько одинаково допустимых строк SMILES. Например, CCO, OCC и C(O)C все описывают структуру этанола. Разработаны алгоритмы для генерации одной и той же строки SMILES для данной молекулы; из множества возможных строк эти алгоритмы выбирают только одну. Этот SMILES уникален для каждой структуры, хотя и зависит от алгоритма канонизации, используемого для его генерации, и называется каноническим SMILES. Эти алгоритмы сначала преобразуют SMILES во внутреннее представление молекулярной структуры; затем алгоритм анализирует эту структуру и создает уникальную строку SMILES. Разработаны различные алгоритмы для генерации канонических SMILES, в том числе алгоритмы, разработанные компаниями Daylight Chemical Information Systems, OpenEye Scientific Software, MEDIT, Chemical Computing Group, MolSoft LLC и Chemistry Development Kit. Распространенное применение канонических SMILES – индексация и обеспечение уникальности молекул в базе данных. В настоящее время не существует систематического сравнения коммерческого программного обеспечения для проверки наличия подобных недостатков в этих пакетах. Нотация SMILES позволяет указывать конфигурацию в тетраэдрических центрах и геометрию двойных связей. Это структурные особенности, которые нельзя определить только по связности, и поэтому SMILES, кодирующие эту информацию, называются изомерными SMILES. Примечательной особенностью этих правил является то, что они позволяют строго определять частичную хиральность. Термин "изомерные SMILES" также применяется к SMILES, в которых указаны изомеры.

SMILES определение как строки языка без контекста

С точки зрения теории формальных языков, SMILES является словом. SMILES может быть проанализирован с помощью синтаксического анализатора, не требующего контекста. Использование этого представления применялось для прогнозирования биохимических свойств (включая токсичность и биоразлагаемость), основываясь на основном принципе химиоинформатики о том, что похожие молекулы обладают похожими свойствами. Прогностические модели реализовали подход к распознаванию синтаксических шаблонов (который включал определение молекулярного расстояния), а также более надежную схему, основанную на статистическом распознавании шаблонов.

Облигации

Связь представляется одним из символов = # $ : / \. Связи между алифатическими атомами считаются одинарными, если не указано иное, и подразумеваются по соседству в SMILES-строке. Хотя одинарные связи могут быть записаны как , это обычно опускается. Например, SMILES для этанола может быть записан как C C O, CC O или C CO, но обычно записывается как CCO. Двойные, тройные и четверные связи обозначаются символами =, # и $ соответственно, как показано на примерах SMILES O=C=O (углекислый газ), C#N (цианистый водород HCN) и [Ga+]$[As ] (арсенид галлия). Дополнительный тип связи – "разрыв связи", обозначаемый точкой (.), для указания, что две части не связаны между собой. Например, водный хлорид натрия может быть записан как [Na+].[Cl-] для отображения диссоциации. Ароматическая связь "один с половиной" может быть обозначена символом :, см. ниже. Одинарные связи, соседствующие с двойными связями, могут быть представлены символами / или \ для обозначения стереохимической конфигурации; см. ниже.

Кольца

Кольцевые структуры записываются путем разрыва каждого кольца в произвольной точке (хотя некоторые варианты приведут к более читаемым SMILES, чем другие), чтобы получить ациклическую структуру и добавить числовые метки замыкания кольца для обозначения связи между несмежными атомами. Например, циклогексан и диоксан могут быть записаны как C1CCCCC1 и O1CCOCC1 соответственно. Для второго кольца метка будет 2. Например, декалин (декагидронафталин) может быть записан как C1CCCC2C1CCCC2. SMILES не требует использования номеров колец в каком-либо определенном порядке и допускает использование номера кольца ноль, хотя это встречается редко. Также разрешено повторное использование номеров колец после замыкания первого кольца, хотя это обычно затрудняет чтение формул. Например, бициклогексил обычно записывается как C1CCCCC1C2CCCCC2, но его также можно записать как C0CCCCC0C0CCCCC0. Несколько цифр после одного атома указывают на множественные связи замыкания кольца. Например, альтернативное SMILES-обозначение для декалина — C1CCCC2CCCCC12, где конечный атом углерода участвует в обеих связях замыкания кольца 1 и 2. Если требуется двухзначный номер кольца, метка предваряется символом %, поэтому C%12 представляет собой одну связь замыкания кольца 12. Каждой цифре или обеим цифрам может предшествовать тип связи, чтобы указать тип связи замыкания кольца. Например, циклопропен обычно записывается как C1=CC1, но если двойная связь выбрана в качестве связи замыкания кольца, его можно записать как C=1CC1, C1CC=1 или C=1CC=1. (Первая форма предпочтительна.) C=1CC 1 недопустима, так как явно указывает на противоречивые типы для связи замыкания кольца. Связи замыкания кольца нельзя использовать для обозначения кратных связей. Например, C1C1 не является допустимой альтернативой C=C для этилена. Однако их можно использовать с отсутствием связей; C1.C2.C12 — это причудливый, но допустимый альтернативный способ записи пропана, который чаще записывается как CCC. Выбор точки разрыва кольца, прилегающей к присоединенным группам, может привести к более простой SMILES-формуле, избегая ветвлений. Например, циклогексан-1,2-диол наиболее просто записывается как OC1CCCCC1O; выбор другого места разрыва кольца создает разветвленную структуру, для записи которой требуются скобки.

Разветвление

Ветви описываются с помощью скобок, как в CCC(=O)O для пропионовой кислоты и FC(F)F для фторформа. Первый атом внутри скобок и первый атом после заключенной в скобки группы связаны с одним и тем же атомом точки ветвления. Символ связи должен находиться внутри скобок; вне скобок (например: CCC=(O)O) недопустимо. Замещенные кольца могут быть записаны с точкой ветвления в кольце, как показано на примере SMILES COc(c1)cccc1C#N (см. изображение) и COc(cc1)ccc1C#N (см. изображение), которые кодируют 3-й и 4-й изомеры цианоанизола. Запись SMILES для замещенных колец таким образом может сделать их более понятными для человека. Ветви могут быть записаны в любом порядке. Например, бромохлородифторметан может быть записан как FC(Br)(Cl)F, BrC(F)(F)Cl, C(F)(Cl)(F)Br или подобным образом. Как правило, форму SMILES легче всего читать, если более простая ветвь указана первой, а конечная, не заключенная в скобки часть – самая сложная. Единственные ограничения для таких перестановок:
Если номера колец используются повторно, они объединяются в соответствии с порядком их появления в строке SMILES. Для сохранения правильного объединения могут потребоваться корректировки. Если указана стереохимия, необходимо внести изменения; см. ниже. Единственный тип ветвей, не требующий скобок, – это связи, замыкающие кольцо. Правильный выбор связей, замыкающих кольцо, может уменьшить количество необходимых скобок. Например, толуол обычно записывается как Cc1ccccc1 или c1ccccc1C, избегая скобок, которые потребовались бы при записи как c1cc(C)ccc1 или c1cc(ccc1)C.

Стереохимия

SMILES позволяет, но не требует указания стереоизомеров. Конфигурация вокруг двойных связей задается с использованием символов / и \ для обозначения направленных одинарных связей, примыкающих к двойной связи. Например, F/C=C/F (см. изображение) является одним из представлений транс-1,2-дифторэтилена, в котором атомы фтора находятся по разные стороны от двойной связи (как показано на рисунке), в то время как F/C=C\F (см. изображение) является одним из возможных представлений цис-1,2-дифторэтилена, в котором атомы фтора находятся с одной стороны от двойной связи. Символы направления связей всегда встречаются группами как минимум из двух, причем первый из них произвольный. То есть, F\C=C\F эквивалентно F/C=C/F. При наличии чередующихся одинарных и двойных связей группы состоят более чем из двух символов, при этом средние символы направления примыкают к двум двойным связям. Например, распространенная форма (2,4)-гексадиена записывается как C/C=C/C=C/C. В качестве более сложного примера, бета-каротин имеет очень длинную цепь чередующихся одинарных и двойных связей, которую можно записать как CC1CCC/C(C)=C1/C=C/C(C)=C/C=C/C(C)=C/C=C/C=C(C)/C=C/C=C(C)/C=C/C2=C(C)/CCCC2(C)C.

Конфигурация тетраэдрического углерода указывается символами @ или @@. Рассмотрите четыре связи в порядке их появления слева направо в SMILES-представлении. Смотря на центральный атом углерода с точки зрения первой связи, остальные три будут либо по часовой стрелке, либо против часовой стрелки. Эти случаи обозначаются символами @@ и @ соответственно (поскольку сам символ @ представляет собой спираль, направленную против часовой стрелки). Например, рассмотрим аминокислоту аланин. Одна из ее SMILES-форм – NC(C)C(=O)O, более полно записываемая как N[CH](C)C(=O)O. L-аланин, более распространенный энантиомер, записывается как N[C@@H](C)C(=O)O (см. изображение). Если смотреть со стороны азот-углеродной связи, группы водорода (H), метила (C) и карбоксилата (C(=O)O) располагаются по часовой стрелке. D-аланин может быть записан как N[C@H](C)C(=O)O (см. изображение). Хотя порядок указания заместителей в SMILES обычно не имеет значения, в данном случае он важен; перестановка любых двух групп требует изменения индикатора хиральности. Если заместители поменять местами, так что аланин будет записан как NC(C(=O)O)C, то конфигурация также изменится; L-аланин будет записан как N[C@H](C(=O)O)C (см. изображение). Другие способы записи включают C[C@H](N)C(=O)O, OC(=O)[C@@H](N)C и OC(=O)[C@H](C)N.

Обычно первая из четырех связей находится слева от атома углерода, но если SMILES записывается, начиная с хирального углерода, например C(C)(N)C(=O)O, то все четыре связи находятся справа, но первая (связь [CH] в данном случае) используется в качестве ориентира для определения порядка следующих трех: L-аланин также может быть записан как [C@@H](C)(N)C(=O)O. Спецификация SMILES содержит дополнительные сведения о символе @ для обозначения стереохимии вокруг более сложных хиральных центров, таких как тригонально-бипирамидальная молекулярная геометрия.

Изотопы

Изотопы указываются числом, равным целочисленной изотопной массе, предшествующему символу атома. Бензол, в котором один атом является углеродом-14, записывается как [14C]1ccccc1, а дейтерохлороформ – [2H]C(Cl)(Cl)Cl.

Другие примеры SMILES

Нотация SMILES подробно описана в теоретическом руководстве по SMILES, предоставленном Daylight Chemical Information Systems, и приведено множество наглядных примеров. Утилита Daylight "depict" позволяет пользователям проверять собственные примеры SMILES и служит ценным учебным пособием.

Расширения

SMARTS — это линейная нотация для спецификации подструктурных фрагментов в молекулах. Хотя она использует многие из тех же символов, что и SMILES, она также позволяет указывать атомы и связи-подстановочные знаки, которые можно использовать для определения подструктурных запросов при поиске в химических базах данных. Распространенное заблуждение заключается в том, что подструктурный поиск на основе SMARTS включает сопоставление строк SMILES и SMARTS. На самом деле, как строки SMILES, так и строки SMARTS сначала преобразуются во внутренние графовые представления, в которых выполняется поиск изоморфизма подграфов. SMIRKS, являясь надмножеством "REACTION SMILES" и подмножеством "REACTION SMARTS", — это линейная нотация для описания реакционных превращений. Общий синтаксис для расширений реакций — REACTANT>AGENT>PRODUCT (без пробелов), где любое из полей может быть либо пустым, либо содержать несколько молекул, разделенных точкой (.), а также другие описания, зависящие от базового языка. Атомы могут быть дополнительно идентифицированы числом (например, [C:1]) для отображения, например, в реакциях. SMILES соответствует дискретным молекулярным структурам. Однако многие материалы являются макромолекулами, которые слишком велики (и часто стохастичны), чтобы удобно генерировать для них SMILES. BigSMILES — это расширение SMILES, предназначенное для обеспечения эффективной системы представления макромолекул.

Перевод

SMILES можно преобразовать обратно в двумерные изображения с использованием алгоритмов генерации структурных диаграмм (SDG). Это преобразование может быть неоднозначным. Переход к трехмерному представлению осуществляется методами минимизации энергии. Существует множество доступных для скачивания и онлайн-утилит для преобразования.