ひとことで言うと
医薬品安全性情報の自由記載からMedDRA/J検索語を抽出するAIを開発し、検索結果に合わせて強化学習したLLMの性能を、知識蒸留によって高速・軽量なモデルへほぼ維持したまま移せることを示した研究です。
Keywords
医薬品安全性監視、MedDRA、自然言語処理、AI(機械学習)、医療従事者支援
なぜこの研究をしたのか
医薬品安全性監視(pharmacovigilance)では、患者や医療従事者から寄せられた自由記載の情報を、MedDRAと呼ばれる標準用語に対応付ける作業が行われます。
しかし、実際の問い合わせ記録には口語的な表現や文脈依存の記述が多く、適切なMedDRA用語を探すには専門知識と時間が必要です。また、実務でAIを利用するには、検索精度だけでなく、担当者が繰り返し検索できる十分な応答速度も求められます。
そこで本研究では、AIにMedDRAコードそのものを直接決定させるのではなく、担当者がMedDRA/Jを検索するための「検索語候補」を自由記載から抽出させ、その検索結果が実際に正しい用語へ到達できるかを評価しました。
どう調べたか
製薬企業のコールセンターで実際に処理された問い合わせ記録とMedDRA/Jコードを用い、5,219文書を時系列に学習・開発・テストデータへ分割しました。最終的なテストには2021年の848文書を使用しました。
比較したのは、4Bパラメータの医療LLM(Base)、27Bの大型LLM(Base Large)、4Bモデルを検索結果に基づく報酬で強化学習したPEFT-RL、そしてPEFT-RLの出力を教師データとして学習させた1.32億パラメータの軽量モデルDistill KPEの4種類です。
モデルが抽出した検索語を実際にMedDRA/J検索へ入力し、正しい用語が検索結果の上位に現れるかをnDCG@20とRecall@20で評価しました。また、Distill KPEについてはPEFT-RLに対する非劣性を統計的に検証し、GPU・CPUでの推論速度も比較しました。
何がわかったか
検索順位を重視する主要指標nDCG@20は、Baseが0.209、27BのBase Largeが0.605だったのに対し、検索結果に合わせて強化学習したPEFT-RLは0.693まで向上しました。単純にモデルを大型化するだけでなく、実際の検索性能に合わせて学習することが有効であることが示されました。
さらに、約1/30の規模である1.32億パラメータのDistill KPEでもnDCG@20は0.688で、PEFT-RLに対して事前に定めた非劣性基準を満たしました。推論時間も1文書あたりGPUで中央値0.025秒、CPUでも0.060秒と大幅に短縮されました。
一方、Recall@20はPEFT-RLの0.868に対してDistill KPEでは0.834まで低下しました。特に、妊娠中の曝露や投薬過誤などのSpecial Situation(SS)ではこの低下が大きく、モデルを軽量化する際には検索順位だけでなく候補の取りこぼしにも注意が必要でした。
なぜ大事なのか
生成AIに最終的なMedDRAコードを直接決定させるのではなく、「専門家が検索・確認するための候補を提示する」という人間中心の支援方法を採用した点が、実務導入を考えるうえで重要です。
また、大規模LLMの性能を小型モデルへ知識蒸留することで、GPUを必要としないCPU環境でも高速に動作できる可能性が示されました。医薬品安全性情報を大量に処理する現場で、検索作業の効率化と計算資源の削減を両立できるアプローチにつながります。
次に目指すこと
今回のデータは単一の組織から得られたものであり、他の製薬企業や異なる種類の安全性情報でも同様の性能が得られるかを検証する必要があります。
また、知識蒸留では検索上位への正解の配置はよく維持された一方、Recall@20には低下がみられました。特にSpecial Situationについて、投薬過誤、妊娠・授乳中の曝露、適応外使用などのカテゴリごとにエラーを詳しく解析し、どの情報が軽量化によって失われやすいのかを明らかにすることが今後の課題です。
さらに、多施設・多データソースでの外部検証や、実際のMedDRAコーディング担当者が使用した場合の業務効率・操作性を含めた評価へ発展させることが期待されます。