Уявіть собі сценарій, коли дослідники розробляють новий препарат. Їм потрібні обширні дані пацієнтів для тестування, але є серйозні занепокоєння щодо конфіденційності та доступності даних.
Тут синтетичні дані пропонують рішення. Він надає реалістичні, але цілком штучні набори даних, які імітують статистичні властивості реальних даних пацієнтів. Такий підхід дозволяє проводити комплексне дослідження без порушення конфіденційності пацієнта.
Дональд Рубін був піонером концепції синтетичних даних на початку 90-х років. Він створив анонімний набір даних відповідей перепису населення США, що відображав статистичні властивості фактичних даних перепису. Це ознаменувало створення одного з перших синтетичних наборів даних , який тісно пов'язаний зі статистикою реального перепису населення.
Застосування синтетичних даних швидко набирає обертів. Accenture визнає це ключовою тенденцією в галузях наук про життя та медичних технологій. Аналогічно, Gartner прогнозує , що до 2024 року синтетичні дані становитимуть 60% використання даних.
У цій статті ми поговоримо про синтетичні дані в охороні здоров’я. Ми вивчимо його визначення, як він генерується та його можливі застосування.
Що таке синтетичні дані в охороні здоров'я?
Вихідні дані:
ID пацієнта: 987654321
вік: 35
Стать: чоловік
раса: білий
Етнічна приналежність: латиноамериканець
Медична історія: Гіпертонія, цукровий діабет
Сучасні ліки: Лізиноприл, метформін
Результати лабораторних досліджень: Артеріальний тиск 140/90 мм рт.ст., цукор крові 200 мг/дл
діагноз: Діабет типу 2
Синтетичні дані:
ID пацієнта: 123456789
вік: 38
Стать: жінка
раса: Black
Етнічна приналежність: Нелатиноамериканець
Медична історія: Астма, депресія
Сучасні ліки: Альбутерол, флуоксетин
Результати лабораторних досліджень: Артеріальний тиск 120/80 мм рт.ст., цукор крові 100 мг/дл
діагноз: Астма
Синтетичні дані в охороні здоров'я стосуються штучно згенерованих даних, які імітують реальні дані про здоров'я пацієнтів. Цей тип даних створюється за допомогою алгоритмів та статистичних моделей. Вони розроблені для відображення складних закономірностей та характеристик фактичних даних про охорону здоров'я. Однак вони не відповідають жодним реальним особам, що захищає конфіденційність пацієнтів.
Створення синтетичних даних передбачає аналіз реальних наборів даних пацієнтів, щоб зрозуміти їхні статистичні властивості. Потім, використовуючи цю статистику, генеруються нові точки даних. Вони імітують статистичну поведінку оригінальних даних, але не відтворюють жодної конкретної інформації.
Синтетичні дані стають все більш важливими в охороні здоров'я. Він поєднує в собі потужність великих даних і дотримання конфіденційності пацієнтів.
[Читайте також: 22 безкоштовних та відкритих наборів даних охорони здоров'я для машинного навчання ]
Поточний стан даних у сфері охорони здоров’я
Охорона здоров’я постійно намагається знайти баланс між перевагами даних та проблемами конфіденційності пацієнтів. Отримання медичних даних для комерційних чи наукових цілей є надзвичайно складним і дорогим.
Наприклад, отримання дозволу на використання даних системи охорони здоров’я може тривати до двох років. Доступ до даних на рівні пацієнта часто спричиняє витрати в сотні тисяч, якщо не більше, залежно від масштабу проекту. Ці перешкоди значною мірою заважають прогресу в цій галузі.
Сектор охорони здоров’я знаходиться на ранніх стадіях удосконалення та застосування даних. Декілька факторів, у тому числі питання конфіденційності, відсутність стандартизованих форматів даних і існування резервів даних, перешкоджали інноваціям і прогресу. Однак цей сценарій швидко змінюється, особливо з появою генеративних технологій ШІ.
Незважаючи на ці перешкоди, використання даних в охороні здоров’я зростає. Такі платформи, як Snowflake і AWS, змагаються, щоб запропонувати інструменти, які використовують потенціал цих даних. Зростання хмарних обчислень полегшує розширену аналітику даних і прискорює розробку продуктів.
У цьому контексті синтетичні дані постають як багатообіцяюче рішення проблем доступності даних у сфері охорони здоров’я.
Як синтетичні дані використовуються в охороні здоров'я?
Синтетичні дані — це сучасна революція в охороні здоров’я, що дозволяє організаціям впроваджувати інновації, поважаючи безпеку та конфіденційність. Оскільки вони нагадують дані реального світу, синтетичні набори даних дозволяють дослідникам, клініцистам і розробникам просувати інновації, не перешкоджаючи конфіденційності пацієнтів.
Ось лише кілька простих реальних прикладів того, як синтетичні дані трансформують охорону здоров’я:
1. Тестування нових методів лікування без ризику для конфіденційності
Уявіть собі групу дослідників, які розробляють лікування діабету. Замість доступу до конфіденційних записів пацієнтів вони використовують синтетичні дані, які імітують риси реальних пацієнтів, наприклад вік, рівень цукру в крові та історію хвороби. Вони можуть розробляти гіпотези та вдосконалювати їх у протоколи щодо того, як адаптувати лікування, зберігаючи при цьому конфіденційність пацієнта.
2. Навчання ШІ для швидшої діагностики
Подумайте про інструмент машинного навчання, призначений для виявлення раку легенів за рентгенівськими променями. Синтетичні медичні зображення можуть включати багато сценаріїв — упорядкування форм, розмірів і розташування пухлин будь-яким кумедним способом може допомогти машині навчитися точно ідентифікувати випадок із ртутним рецидивом раку. Це полегшує діагностику, повністю уникаючи етичних проблем щодо використання реальних сканувань пацієнтів.
3. Практичні операції у віртуальній реальності
Багатьом студентам-медикам потрібна реальна практична практика, перш ніж вони зможуть лікувати справжніх пацієнтів. Синтетичні дані створюють цілу інтерактивну транспозицію, у якій віртуальний пацієнт на основі даних симулюється з різними історіями хвороби та станами, таким чином дозволяючи студентам проходити операції чи діагностичні процедури неодноразово та дуже безпечно.
4. Уможливлення планування охорони здоров'я
Симуляція перебігу таких захворювань, як COVID-19 або грип, за допомогою синтетичних даних є важливою для того, щоб дозволити дослідникам епіцентру моделювати поширення епідемії вірусу в міських районах порівняно з сільськими районами, одночасно оцінюючи та тестуючи стратегії вакцинації, таким чином обходячи незнання конфіденційних даних про населення.
5. Безпечне тестування медичних приладів
Розгляньте компанію, яка розробляє новий переносний пристрій для моніторингу пульсу. Синтетичні набори даних, що імітують різноманітні кардіопатії, дозволяють компаніям тестувати свої пристрої за кількома сценаріями, перш ніж виходити в економіку.
Як слід створювати синтетичні дані для охорони здоров’я
Створення синтетичних даних у сфері охорони здоров’я – справді тривалий процес, який проводить тонку межу між технічною експертизою та глибоким розумінням систем охорони здоров’я. Щоб спростити поняття, загалом так можна тлумачити створення синтетичних даних у закладах охорони здоров’я.
1. Зрозумійте справжні дані
Організації охорони здоров’я вивчають реальні дані пацієнтів, починаючи з лікарняних записів, результатів лабораторних досліджень або деталей клінічних випробувань. Наприклад, лікарня може проаналізувати демографічні дані пацієнтів, історію лікування та результати, щоб отримати певне розуміння основних тенденцій або закономірностей.
2. Припинення розкриття даних пацієнта шляхом видалення ідентифікаційної інформації
Після цього з міркувань конфіденційності набір даних більше не містить персональну інформацію (PII) – імена, адреси чи номери соціального страхування. Ви можете пов’язати це з процесом анонімізації деяких медичних довідок, які, якщо їх надрукувати зараз, не можна буде відстежити до особи.
3. Ідентифікація ключових шаблонів
Спеціаліст аналізує очищений набір даних і виявляє закономірності та взаємозв’язки, що є ще одним основним будівельним блоком для успішного дослідження. Наприклад, вони можуть виявити, що літні люди з діабетом зазвичай використовують певні ліки або що певні вікові групи, як правило, мають певні симптоми.
4. Побудова моделей за шаблонами
Після того як ці шаблони визначено, уявлення дозволяють побудувати математичні моделі, які імітують статистичні асоціації, знайдені в реальних даних. Наприклад, якщо 30% пацієнтів у наборі даних мають високий кров’яний тиск, ми можемо припустити, що синтетичні дані приблизно відображатимуть ці стани в аналогічних пропорціях.
6. Перевірка синтетичних даних
Потім синтетичний набір даних порівнюється з вихідними даними, щоб він зберіг ту саму статистику, що визначає властивості та зв’язки. Наприклад, якщо в початковому наборі даних існує залежна кореляція між ожирінням і серцевими захворюваннями, така ж повинна існувати і для цього синтетичного набору даних.
7. Тестування реального використання
Нарешті, синтетичні дані беруться для тестування в різних сценаріях, щоб стверджувати, що вони можуть бути використані для своїх передбачуваних цілей. Серед них — використання його для того, щоб дозволити дослідникам навчити модель штучного інтелекту для діагностики захворювань або симулювати варіації операційних ресурсів у відділенні невідкладної допомоги, пов’язані з сезоном грипу.
Як перевірити синтетичні дані для охорони здоров’я
Особи, які приймають рішення в організаціях, повинні ретельно перевіряти достовірність синтетичних даних перед їх застосуванням в охороні здоров’я. Ця парадигма застосовується до будь-яких даних, які використовуються згідно з протоколами конфіденційності. Нижче наведено способи оцінити достовірність синтетичних даних:
- Порівняння з реальними даними: Синтетичні дані порівнюються з реальними даними, щоб підтвердити, що основні тенденції, які вони визначають, наприклад, зв’язок між віком і хворобою, належним чином відображаються. Наприклад, якщо 20 відсотків реальних пацієнтів мають цукровий діабет, то така ж частка повинна проявлятися у синтетичних пацієнтів.
- Проведення статистичних тестів: Статистичні тести дозволяють нам перевірити, чи синтетичні дані відповідають оригіналу з точки зору розподілу та кореляції, таким чином підтверджуючи, що вони обґрунтовані та заслуговують на довіру для аналізу.
- Перевірка реальних завдань: Завдання реального світу, такі як навчальна вправа на моделях штучного інтелекту, використовуватимуться для порівняння того, чи результати, отримані від навчання синтетичних даних, також дадуть результати, подібні до навчання на реальних даних.
- Огляд експерта: Синтетичні набори даних перевіряються клініцистами та експертами з охорони здоров’я на наявність автентичних атрибутів, таких як стандартні історії та методи лікування, які відповідають реалістичному науковому дослідженню.
- Контроль конфіденційності на місці: Ця оцінка гарантує, що синтетичні дані не можна відстежити до реальних пацієнтів, і збереже конфіденційність реальних пацієнтів, уникаючи втрати зручності використання набору даних.
[Читайте також: Чому набори даних охорони здоров'я важливі для формування майбутнього медичного штучного інтелекту ]
Потенціал синтетичних даних в охороні здоров’я та фармацевтиці

Інтеграція синтетичних даних в охорону здоров’я та фармацевтику відкриває цілий світ можливостей. Цей інноваційний підхід змінює різні аспекти галузі. Здатність синтетичних даних віддзеркалювати набори даних реального світу, зберігаючи конфіденційність, революціонізує багато секторів.
Покращте доступність даних, дотримуючись конфіденційності
Однією з найбільш значних перешкод у сфері охорони здоров’я та фармацевтики є доступ до великої кількості даних із дотриманням законів про конфіденційність. Синтетичні дані пропонують новаторське рішення. Він надає набори даних, які зберігають статистичні характеристики реальних даних, не розкриваючи приватну інформацію. Цей прогрес дозволяє більш широко досліджувати та тренувати моделі машинного навчання. Це сприяє прогресу в лікуванні та розробці ліків.
Кращий догляд за пацієнтами завдяки прогнозній аналітиці
Синтетичні дані можуть значно покращити лікування пацієнтів. Моделі машинного навчання, навчені на основі синтетичних даних, допомагають медичним працівникам передбачити реакцію пацієнтів на лікування. Цей прогрес веде до більш персоналізованих та ефективних стратегій догляду. Точна медицина стає більш доступною для підвищення ефективності лікування та результатів для пацієнтів.
Оптимізуйте витрати за допомогою вдосконаленого використання даних
Застосування синтетичних даних в охороні здоров’я та фармацевтиці також призводить до значного скорочення витрат. Це мінімізує ризики та витрати, пов’язані з витоком даних. Крім того, покращені можливості прогнозування моделей машинного навчання допомагають оптимізувати ресурси. Ця ефективність перетворюється на зниження витрат на охорону здоров’я та більш оптимізовану роботу.
Тестування та перевірка
Синтетичні дані дають змогу безпечно та практично тестувати нові технології, включаючи системи електронних медичних записів та діагностичні інструменти. Постачальники медичних послуг можуть ретельно оцінювати інновації, використовуючи синтетичні дані, не ризикуючи конфіденційністю пацієнтів або безпекою даних. Це гарантує, що нові рішення є ефективними та надійними, перш ніж вони будуть реалізовані в реальних сценаріях.
Сприяти спільним інноваціям у сфері охорони здоров’я
Синтетичні дані відкривають нові можливості для співпраці в галузі охорони здоров’я та фармацевтичних досліджень. Організації можуть ділитися синтетичними наборами даних з партнерами. Це дозволяє проводити спільні дослідження без шкоди для конфіденційності пацієнта. Такий підхід відкриває шлях для інноваційних партнерств. Ця співпраця прискорює медичні прориви та створює більш динамічне дослідницьке середовище.
Проблеми з синтетичними даними
Хоча синтетичні дані мають величезний потенціал, вони також мають проблеми, які ви повинні вирішити.
Забезпечення точності та репрезентативності даних
Синтетичні набори даних мають точно відображати статистичні властивості даних реального світу. Однак досягнення такого рівня точності є складним і часто потребує складних алгоритмів. Це може призвести до оманливих ідей і хибних висновків, якщо це робити не правильно.
Управління зміщенням і різноманітністю даних
Оскільки синтетичні набори даних створюються на основі існуючих даних, будь-які властиві зміщення вихідних даних можуть бути відтворені. Забезпечення різноманітності та усунення упереджень має вирішальне значення для того, щоб зробити синтетичні дані надійними та універсально застосовними.
Баланс конфіденційності та корисності
Хоча синтетичні дані хвалять за їх здатність захищати конфіденційність, знайти правильний баланс між конфіденційністю даних і корисністю є делікатним завданням. Необхідно переконатися, що синтетичні дані, незважаючи на анонімність, зберігають достатньо деталей і конкретності для змістовного аналізу.
Етичні та правові міркування
Питання щодо згоди та етичного використання синтетичних даних, особливо коли вони отримані з конфіденційної інформації про здоров’я, залишаються сферами активного обговорення та регулювання.
Конфіденційність і безпека синтетичних даних у сфері охорони здоров’я
Хоча відомо, що синтетичні дані захищають конфіденційність пацієнтів через підстанцію реальних даних із штучною, хоча й реалістичною альтернативою, дилем конфіденційності та безпеки все ще багато. Одним із основних пов’язаних ризиків є повторна ідентифікація, за якої синтетичні дані випадково розкривають шаблони, які можуть допомогти розшифрувати справжніх досліджуваних пацієнтів. Дотримання правил і норм створює додаткову перешкоду для пом’якшення таких проблем – міркування під час роботи з синтетичними даними: HIPAA та GDPR.
Щоб усунути ці проблеми, організації охорони здоров’я повинні застосувати більш надійні методи збереження конфіденційності, такі як диференційована конфіденційність і безпечні алгоритми, щоб запобігти такому використанню. Якщо такі розвиваючі та складні менеджери ризиків використовуватимуть профілактичні заходи, синтетичні дані продовжуватимуть інновації, дотримуючись будь-яких принципів конфіденційності щодо пацієнта та здорового глузду етики.
Висновок
Синтетичні дані змінюють охорону здоров’я та фармацевтику, збалансовуючи конфіденційність із практичним використанням. Незважаючи на труднощі, його здатність покращувати дослідження, лікування пацієнтів і співпрацю є значною. Це робить синтетичні дані ключовою інновацією для майбутнього охорони здоров’я.