Деидентификация неструктурированных медицинских данных

Полное руководство по деидентификации неструктурированных данных здравоохранения

Анализ структурированных данных может помочь в улучшении диагностики и ухода за пациентами. Однако анализ неструктурированных данных может подпитывать революционные медицинские прорывы и открытия.

Это суть темы, которую мы будем обсуждать сегодня. Очень интересно наблюдать, что так много радикальных достижений в области медицинских технологий произошло с использованием всего лишь 10-20% полезных медицинских данных.

Статистика показывает, что более 90% данных в этом спектре неструктурированы, что означает, что данные менее пригодны для использования и их сложнее понимать, интерпретировать и применять. От аналоговых данных, таких как рецепты врачей, до цифровых данных в форме медицинских изображений и аудиовизуальных данных, неструктурированные данные бывают разных типов.

Такие огромные массивы неструктурированных данных являются домом для невероятных идей, которые могут ускорить прогресс в здравоохранении на десятилетия. Будь то помощь в открытии лекарств для критических, отнимающих жизнь аутоиммунных заболеваний или данные, которые могут помочь компаниям медицинского страхования в оценке рисков, неструктурированные данные могут проложить путь к неизвестным возможностям.

Когда такие амбиции есть, интерпретируемость и совместимость данных здравоохранения становятся критически важными. С жесткими рекомендациями и обеспечением соответствие нормативным требованиям как GDPR и HIPAA, то неизбежно становится деидентификация данных здравоохранения.

Мы уже рассмотрели обширную статью о демистификации структурированные данные здравоохранения и неструктурированные данные здравоохранения. Есть специальная (подробная) статья о деидентификация данных здравоохранения также. Мы настоятельно рекомендуем вам прочитать их для получения целостной информации, поскольку у нас будет эта статья для специального материала о деидентификация неструктурированных данных

Проблемы деидентификации неструктурированных данных

Как следует из названия, неструктурированные данные не организованы. Они разбросаны по форматам, типам файлов, размерам, контексту и т. д. Тот факт, что неструктурированные данные существуют в виде аудио, текста, медицинских изображений, аналоговых записей и т. д., делает все более сложным понимание идентификаторов персональной информации (PII), что имеет важное значение в деидентификация неструктурированных данных.

Чтобы дать вам представление об основных проблемах, вот краткий список:

Проблемы деидентификации неструктурированных данных

  • Контекстное понимание – когда заинтересованной стороне ИИ сложно понять конкретный контекст, стоящий за определенной частью или аспектом неструктурированных данных. Например, понимание того, является ли имя названием компании, именем человека или названием продукта, может привести к дилемме о том, следует ли его деидентифицировать.  
  • Нетекстовые данные – где выявление слуховых или визуальных подсказок для имен или персональных данных может оказаться сложной задачей, поскольку заинтересованной стороне, возможно, придется просматривать многие часы отснятого материала или записи, пытаясь идентифицировать критические аспекты. 
  • Двусмысленность – это особенно верно в контексте аналоговых данных, таких как рецепт врача или запись в регистре больницы. От почерка до ограничений выражения на естественном языке, это может сделать деидентификацию данных сложной задачей. 

Лучшие практики деидентификации неструктурированных данных

Процесс удаления персональных данных из неструктурированных данных существенно отличается от деидентификация структурированных данных но не невозможно. Благодаря системному и контекстному подходу потенциал неструктурированных данных может быть легко задействован. Давайте рассмотрим различные способы, которыми этого можно достичь. 

Лучшие практики деидентификации неструктурированных данных

Редактирование изображения: Это касается данных медицинской визуализации и подразумевает удаление идентификаторов пациентов и размывание анатомических ссылок и частей изображений. Они заменяются специальными символами, чтобы сохранить диагностическую функциональность и полезность данных визуализации. 

Соответствие шаблону: Некоторые из наиболее распространенных персональных данных, такие как имена, контактные данные и адреса, можно обнаружить и удалить, используя мудрость изучения предопределенных шаблонов. 

Дифференциальная конфиденциальность или возмущение данных: это подразумевает включение контролируемого шума для сокрытия данных или атрибутов, которые можно отследить до отдельного человека. Этот идеальный метод не только обеспечивает деидентификацию данных, но и сохранение статистических свойств набора данных для анализа. 

Деидентификация данных: Это один из самых надежных и эффективных способов удаления PII из неструктурированных данных. Это можно реализовать одним из двух способов:

  • Контролируемое обучение – где модель обучена классифицировать текст или данные как PII или не PII
  • Неконтролируемое обучение – где модель обучается автономно обнаруживать закономерности при идентификации персональных данных

Этот метод обеспечивает сохранность конфиденциальность пациента при этом сохраняя человеческое вмешательство для самых избыточных аспектов задачи. Заинтересованные стороны и поставщики медицинских данных, использующие методы МО для деидентификации неструктурированных данных, могут просто иметь процесс обеспечения качества с участием человека, чтобы гарантировать справедливость, релевантность и точность результатов. 

Маскирование данных: Маскировка данных — это цифровая игра слов, направленная на деидентификацию медицинских данных, при которой определенные идентификаторы делаются общими или неопределенными с помощью таких узкоспециализированных методов, как:

  • Токенизация – включающее замену персональных данных символами или токенами
  • Обобщение – путем замены конкретных значений PII на общие/неопределенные
  • Перетасовка – путем смешивания персональных данных, чтобы сделать их неоднозначными

Однако этот метод имеет ограничение, заключающееся в том, что при использовании сложной модели или подхода данные можно сделать повторно идентифицируемыми.

Аутсорсинг для участников рынка

Единственно правильный подход к обеспечению процесса деидентификация неструктурированных данных герметичен, надежен и соответствует рекомендациям HIPAA, — это передать задачи на аутсорсинг надежному поставщику услуг, такому как Шаип. Благодаря передовым моделям и строгим протоколам контроля качества мы гарантируем человеческий надзор за конфиденциальностью данных смягчается в любое время.

Будучи предприятием, доминировавшим на рынке в течение многих лет, мы понимаем критичность ваших проектов. Поэтому свяжитесь с нами сегодня, чтобы оптимизировать ваши амбиции в сфере здравоохранения с помощью данных здравоохранения, деидентифицированных Shaip.

Понравилась статья? Подпишитесь на Шаипа в LinkedIn, чтобы получать больше новостей.

Социальная Поделиться