日本腎臓学会のテキストマイニング事例
医師が論文検索に「TensorFlow」活用、人間なら心が折れる作業も深層学習で効率化
医師が診療ガイドラインを策定するための論文検索に深層学習を活用した。用いたのはGoogleが開発した「TensorFlow」。人間の労力を減らし、人間が見落としていたものを発掘するなどの効果が得られた。
両手を後ろに回し、腰の辺りを触ってみよう。その奥には腎臓が対となり働いている。腎臓は血液をろ過することで老廃物を体外に排出したり、血圧や体液量を調整したりするなど、人間の体を正常な状態に保つ大切な臓器の1つだ。
腎機能が生活習慣病、肥満、加齢などで低下すると、夜間尿、貧血、倦怠(けんたい)感、むくみ、息切れといった症状が現れ始める。腎障害が長期に及ぶと、総称として「慢性腎臓病」(以下、CKD)と呼んでいる。日本腎臓学会によると、国内のCKD患者数は約1330万人で、成人の8人に1人が該当するという(2005年の推定値)。CKDは新たな国民病として懸念されている。
腎臓は心臓や血管など循環器との関連性も強い。そのため、腎機能が低下すると高血圧を招くなどの影響を及ぼす。東京共済病院の腎臓内科部長、神田 英一郎氏は「CKDの初期段階では自覚症状が少なく、気付く前に脳卒中や心筋梗塞を引き起こしてしまうこともあります」と話す。
併せて読みたいお薦め記事
深層学習とは
深層学習と機械学習の違い
期待される深層学習サービス
CKDが相当に進行すると人工透析が必要になる。CKDを悪化させないためには、いかに機能低下を防ぎ、進行を遅らせるかが重要になる。日本腎臓学会はCKD対策の一環として、かかりつけ医を対象とした「CKD診療ガイドライン」を策定している。ここではエビデンス(科学的な根拠)に基づく標準的な診療指針を可視化しており、CKD診療の向上に寄与している。
現在、CKD診療ガイドラインの改訂委員会は「CKD診療ガイドライン2018」に向けて準備をしている。神田氏も改訂委員の1人だ。CKD診療ガイドラインは学術論文を根拠に診療指針を定めており、客観性や正確性を保つために大量の論文に目を通す必要がある。
神田氏によるとCKDに関連する論文は日本腎臓学会が収集したものだけで1000件ほどあり、最終的にはここから重要そうなものを十数件ほどに絞る。「1次スクリーニング」では、論文の全文ではなくアブストラクトだけを参照する。それでも数が多く、人間が全て手作業でこなそうとすると疲弊してしまう。神田氏と一緒に査読をしている委員が、担当する500件ほどを読み「心が折れました……」とぼやいたそうだ。どんなに必要な作業だとしても、人間なので気力や体力には限界がある。時間もかかる。
そこで神田氏は「テキストマイニングが使えるのではないか」と思い付いた。同氏は医師でIT専門家ではないものの、疫学(個人ではなく集団を対象とし、病気の原因や予防などを研究すること)の経験からプログラミング言語「R言語」などを使った統計処理になじみがあった。また日本腎臓学会にはAI(人工知能)やICTに関する委員会があるなど、情報処理技術に力を入れていたことも後押しとなった。
実現したいのは、大量の論文を読み込み有益な論文を抽出すること。言い換えると、公開されている論文のテキストデータを自然言語処理でテキストマイニングして、探しているテーマと関連性が高い論文をレコメンデーション(推薦)するという流れになる。
コラム:センター試験の“裏技”がテキストマイニング手法に?
テキストマイニングの手法を考えている時、ふと神田氏は大学入試センター試験の「裏技」的解法に利用される、ある傾向を思い出したという。複数の選択肢から回答を選ぶ選択問題では、各選択肢に共通する語を最も多く含む選択肢が、正答となりやすいという傾向だ。同氏はこの傾向をスクリーニングに応用し、人間が選択した論文のアブストラクトに頻出する語を多く含む論文を抽出していった。人間が編み出したテキストマイニング手法ともいえるかもしれない。
1次スクリーニングでは大量の論文から研究デザイン(研究の種類)による選別、検索語による検索、類似論文の検索(ふるい落とした中に取りこぼしがないかどうかを類似傾向から確認)を機械学習で実現した。「2次スクリーニング」では、論文自体の内容で分類して論文検索の精度を高めていくことを機械学習で目指す。機械学習に使用したのは、NVIDIAのGPU(画像処理プロセッサ)「GeForce GTX 1080」を2基搭載したゲーム用PCで、OSは「Windows 10」。そこにPythonと、Googleが開発したオープンソースの機械学習ライブラリ「TensorFlow」をインストールした。
TensorFlowを用いた深層学習では、1000件ほどの論文の中から医師がアブストラクトで選んだ100件の論文を教師データとした。これらの教師データを「これが正解」と機械に教え込み、残りの約900件の論文(アブストラクト)の取捨選択は機械にやってもらった。
データ分析でよく言われることだが、処理を始めるまでが一苦労である。神田氏も実際の労力の多くを機械に読み込ませるテキストデータの準備に費やしたという。準備が済んだら後はすぐ終わる。神田氏は「深層学習の処理自体は1件につき数秒で、あっという間に終わりました」と話す。
前処理に労力をかけたものの「人間の労力をかなり減らすことができました」と神田氏は強調する。人間と機械の結果を比較すると、アブストラクトだけを参照した1次スクリーニングでは、人間は重要そうなアブストラクトを18件抽出し、深層学習は28件抽出したという。人間が見過ごしたとしても、機械がテキストマイニングで論文をレコメンデーションできたことは興味深い。人間の見落としを機械がカバーしたともいえる。今回は1次スクリーニングに深層学習を用いたため、今後は2次スクリーニングへの応用や精度向上を目指すという。
今後の課題として神田氏は、論文のバイアス調査、メタアナリシス(複数の研究結果を統合して分析すること)、エビデンス総体の評価を挙げる。データの前処理の労力をいかに減らすかも課題となりそうだ。
これまで最新かつ最適な診療指針を定めるには、大量の論文にくまなく目を通す必要があった。エビデンスの質を高めるには、複数の研究成果を考慮した方がいいからだ。それを実現するために、これまでは人間が疲弊しながらも人海戦術で論文に目を通していた。そこで教師データという「手本」を一定数用意すれば、深層学習で残りの査読を任せることができる。労力や時間の大幅な削減も期待できる。
人間は頭で考えて正解かどうかを判断できるものの、体力に限界がある。対照的に機械は正解を教えれば無尽蔵の体力で処理ができる。人手が足りないところであれば、こうして人間は機械の力を借りるとよさそうだ。人間と機械の良い共存例として興味深い。
Copyright © ITmedia, Inc. All Rights Reserved.
この記事の著者
関連記事
こんなメディアも見られています
TechTargetジャパンに関連する情報をお探しであれば、こちらのメディアもお役に立てるかもしれません。
ベンダーコンテンツ PR
From Informa TechTarget
SpecialPR
アクセスランキング
-
1
「Excel至上主義」の終わらせ方 丸2日の手作業地獄から情シスと現場を救うには
-
2
取手市がVDIと決別した理由 更改費用「4倍超」を約1.7倍に圧縮
-
3
「Microsoft 365のセキュリティ運用」に関するアンケート
-
4
急増する「AIはこう言ってる」マン 判断を狂わせる「AI忖度」を防ぐには?
-
5
221人調査で分かった「情シス最大のストレス」は?
-
6
「Salesforceのテスト自動化ツール」に関するアンケート
-
7
「データストレージの活用方法」に関するアンケート
-
8
「AI時代の統合基盤・エンタープライズAI管理」に関するアンケート
-
9
AIで人を減らした企業がもう心変わり 「AIブーメラン現象」の実態
-
10
自宅のWi-Fiが「遅い」「途切れる」本当の原因は? Dellが推奨する鉄則
ホワイトペーパーランキング PR
-
1
年収2000万「クラウドセキュリティのプロ」になれる資格とは
-
2
セキュリティソフトをすり抜ける標的型攻撃メール、不審メールの見破り方とは?
-
3
Windows Updateの通信集中で回線が逼迫、ネットワーク刷新事例に学ぶ解決策
-
4
財務を戦略的組織へ進化させるAI活用術、4つの主要な障壁と解消方法
-
5
「NAS」「SAN」「DAS」は何が違う? いまさら聞けないストレージの基礎
-
6
“あのファイル転送”で暗躍するノーウェアランサム
-
7
標的型攻撃メールを見破るには? サンプル文面を例に傾向を解説
-
8
商用利用の安全性を確保し大量のコンテンツを高速で生成する、AI活用の秘訣
-
9
マンガで解説、1日で生成AI環境を構築できるワークショップの中身とは?
-
10
Dark AIが台頭する時代の新発想、「より高度なAIで対抗する」具体的方法とは?
TechTargetジャパン SNS
インフォメーション
注目情報をチェック
TechTargetジャパンをフォロー