В медицинских ИИ-системах слишком много «неопределенных» значений Недавний анализ JAMA Network Open вскрыл опасную проб
Недавний анализ JAMA Network Open вскрыл опасную проблему — в электронных медицинских картах, страховых базах данных и системах приёма пациентов в больницах значительная часть данных, вводимых для обучения ИИ, содержит пустые значения.
Что это значит:
🔹Пустые значения показывают, что данные для этого поля вообще не были собраны, записаны или переданы.
🔹В результатах лабораторных анализов это может означать, что анализ был назначен, но так и не был выполнен.
🔹Модель, которая сталкивается с неопределенными значениями без надлежащей обработки, может заполнить пропущенные значения, пропустить их или неправильно классифицировать.
Как это становится проблемой:
🔹Данные на конец 2025 года показывают, что некоторые одобренные FDA диагностические инструменты на основе ИИ были обучены на наборах данных, где до 34% входных переменных содержали пропущенные или неопределенные значения.
🔹Эксперты подчёркивают, что модель, обученная на трех миллионах неполных записей, может работать хуже, чем модель, обученная на трехстах тысячах чистых записей».
🔹Неопределённые данные распространяются дальше, в развёрнутые модели, которые дают рекомендации непосредственно в месте оказания медицинской помощи.
В итоге получается, что врачи должны доверять результатам моделей, условия обучения которых никогда не были полностью раскрыты. Это нежизнеспособная регуляторная позиция в отношении инструментов, влияющих на решения о лечении.
Медкарта