Искусственный интеллект в дерматологии показывает впечатляющие результаты, но остаётся серьёзное ограничение: алгоритмы неодинаково хорошо распознают рак кожи у пациентов с разным цветом кожи.

Несколько групп исследователей одновременно опубликовали работы, в которых подтверждается высокая точность новых нейросетевых моделей при анализе дерматоскопических изображений. В среднем ИИ-диагносты превосходят начинающих врачей по чувствительности и специфичности. Однако, как выяснилось, этот успех не универсален.

Главная проблема — дисбаланс обучающих данных. Большинство наборов снимков, на которых тренировали модели, содержат преимущественно изображения светлой кожи. В результате алгоритмы значительно хуже справляются с выявлением злокачественных новообразований на тёмной коже. По оценкам специалистов, точность распознавания меланомы у людей с фототипом IV–VI по шкале Фицпатрика может быть на 15–20 процентных пунктов ниже, чем у пациентов с фототипом I–II.

«Мы получили мощный инструмент, который уже сейчас способен сократить число пропущенных диагнозов у белых пациентов. Но если мы не скорректируем обучающие выборки, ИИ может усуглишён жизниь существующее неравенство в здравоохранении», — отметил один из авторов исследования, дерматолог из Университета Джонса Хопкинса (имя не указывается по просьбе учёного).

Разработчики пытаются решить проблему. Некоторые группы применяют методы аугментации данных — искусственно «затемняют» изображения, другие собирают целевые датасеты в Африке, Азии и среди темнокожего населения США и Европы. Однако такие наборы пока малы и не всегда доступны для коммерческих компаний.

Эксперты подчёркивают, что недооценка этого недостатка может привести к ложному чувству безопасности: клиники, внедрившие ИИ-диагностику, могут не догадываться, что для части пациентов система работает хуже. ВОЗ и Американская академия дерматологии уже выпустили рекомендации по обязательному тестированию алгоритмов на мультиэтнических выборках перед клиническим применением.

Пока же врачам советуют не полагаться исключительно на ИИ при осмотре пациентов с тёмной кожей, а использовать его как вспомогательный инструмент наряду с традиционной дерматоскопией и биопсией.

Дополнительное беспокойство вызывает и то, что многие стартапы в области телемедицины, предлагающие онлайн-диагностику родинок по фото, не раскрывают, на каких данных обучены их модели. Пациент, загрузивший снимок своей кожи, может получить ошибочно-отрицательный результат просто из-за того, что его фототип плохо представлен в тренировочном наборе.

Ситуация напоминает ту, что ранее наблюдалась в радиологии: первые коммерческие ИИ для анализа рентгенограмм грудной клетки плохо работали на пациентах с ожирением и на женщинах из-за дисбаланса обучающих выборок. Дерматология сейчас проходит тот же путь, и, по мнению специалистов, исправить ситуацию можно только за счёт осознанного сбора разнообразных клинических данных.

В ближайшее ожидается публикация нового международного консорциума, который представит эталонный мультиэтнический датасет для обучения и валидации дерматологических ИИ. Если инициатива будет поддержана регуляторами, возможно, через два-три года недостаток будет устранён.