你在醫院做檢查時,結果會留在病歷裡,不能隨便交給別人。研究人員因此製造由電腦做成的「合成資料」,讓AI練習,也避免搬走整份真人紀錄。
AI也就是人工智慧,是能從許多例子找規律的電腦工具。醫療AI可以學影像或紀錄,再幫醫療人員找線索。
病歷為什麼不能隨便拿來教電腦
台灣用《個人資料保護法》管理病歷等資料。大家常把這部法律叫做「個資法」。
第6條列出病歷、醫療與健檢資料,原則上不得蒐集、處理或使用。只有符合條文列出的情況,才可以使用。
第20條談非公務機關怎麼使用其他個人資料。它要求使用資料時,不能超出原本目的的必要範圍,但也列出例外。
非公務機關包括民營醫院和公司。某份資料能不能拿去教AI,要看資料內容、原本目的與使用方式。
合成資料怎麼做出來
合成資料不是把姓名塗掉的真人病歷。研究人員用電腦規則或AI,做出新的數字、文字或影像。
有些工具先學真實資料裡常一起出現的線索,再做新例子。也有工具模擬人體和醫療影像設備,直接算出影像。
目標是讓整批資料保留真實世界的規律,卻不直接複製某人的紀錄。這就像重新出題,不是把原考卷擦掉名字。
FDA是美國管理食品與醫療產品的政府單位。FDA正研究合成資料能否補充病人資料,以及它有哪些限制。
例如,某種影像太少,AI就沒有足夠例子可學。合成資料可以試著補上,但要確認它符合真實情況。
假資料也要查有沒有洩密
「去識別化」和合成資料不是同一件事。前者從真人資料拿掉姓名等線索,後者由電腦做出新例子。
FDA研究人員整理許多論文後提醒,生成工具可能記住特定資料。這會傷害病人的隱私,所以電腦做的資料不一定安全。
檢查不能只看影像像不像真的。還要查它有沒有抄到真人,也要查少見例子有沒有被漏掉。
有些合成資料會先讀取真人紀錄。製作團隊在這個階段,仍要依法保護原始資料。
看起來像真的,為什麼還不夠
第一,研究人員要查新資料有沒有保留需要的規律。影像看起來正常,重要的小地方仍可能錯。
第二,要把AI完成工作的結果和可信資料比一比。只看影像漂不漂亮,還不能知道它是否有用。
第三,測試資料要像工具未來會遇到的人。如果只測常見例子,少見病人仍可能被漏掉。
AI一直抄AI,可能忘記少見例子
想像你抄同學畫的校園地圖,同學又只抄你的版本。每抄一次,小路或角落都可能少一點。
AI學完許多例子後,會得到一套判斷方法。研究人員把這個成果叫做「模型」。
Shumailov團隊發現,AI反覆學前一代的內容時,少見內容會先消失。研究團隊把這種情況叫做「模型崩潰」。
研究裡有會處理文字的語言模型,也有其他生成模型。它沒有測遍所有醫療影像AI,不能說每一款都會崩潰。
另一組測試每10筆會保留1筆原始資料。結果只出現較小的變差,但這不是醫療AI的固定配方。
目前能確定什麼
合成資料可以增加練習例子,卻不能完全取代真實資料。它的用途與製作方式不同,需要的檢查也不同。
台灣個資法保護病歷與健檢資料。換成合成資料後能否連回真人,不能只看資料名稱決定。
模型崩潰研究提供一個警告:AI只學AI時,少見內容可能先消失。醫療AI會不會出現同樣問題,仍要個別測試。
這些資料是從哪裡來的
- 個人資料保護法第6條(全國法規資料庫)病歷、醫療與健檢資料的蒐集、處理及使用條件
- 個人資料保護法第20條(全國法規資料庫)非公務機關使用第6條以外個人資料的原則與例外
- Addressing the Limitations of Medical Data in AI(U.S. Food and Drug Administration)研究合成資料補充醫療資料的用途與限制
- Synthetic Data in Radiological Imaging: Current State and Future Outlook(arXiv(FDA研究人員))放射影像合成資料的用途、隱私風險與品質檢查
- The Curse of Recursion: Training on Generated Data Makes Models Forget(arXiv(Shumailov et al.))模型反覆學習生成資料時,少見內容逐代消失的研究