論文一覧へ

歯科診療録の画像を読む生成AI:限定された記録と設問による比較

押さえるべきポイント

1

匿名化された15患者分、154枚の診療録画像から、計360問の課題を作成した。

2

GPT-5 ThinkingのSBERT意味的類似度の中央値は0.900で、比較したモデル中で最も高かった。これは正答率ではない。

3

複数の記載を統合する課題では、SBERT得点分布の圧縮と低い完全一致率がみられた。

研究を読み解く

原文抄録に基づく日本語要約。全文翻訳ではありません。

単一施設の15患者分の匿名化診療録画像を使い、360問で複数のマルチモーダルLLMを比較した後ろ向き横断ベンチマーク。主要な意味的類似度指標ではGPT-5 Thinkingがモデル中で最も高かったが、複数記載を統合する課題には難しさが残った。編集考察:診療録読解の教材研究として読むべき結果であり、患者診療の安全性や学習効果を示したものではない。

診療との接点を考える

編集上の考察。個別の治療指示ではありません。

編集考察:診療録を読む支援技術では、事実の抽出と複数記載の統合を分けて評価する必要性を考える材料になる。教材としての性能評価を、実際の診療判断を任せられるかという評価に直接置き換えることはできない。

限界と注意点

  • 編集考察:人の比較対象は3年生2人と1年目のレジデント2人に限られる。学生との有意差がない比較を、能力の同等性が証明されたと解釈することはできない。
  • 著者らは単施設ベンチマークであることを踏まえ、施設・専門領域・記録システムをまたぐ外部検証を求めている。

AIによる執筆と別工程の原文照合。歯科医師未監修。初版:2026-09-16、更新:2026-09-16。照合日:2026-09-16

原文・出典

Multimodal Large Language Models for Dental Chart Image Interpretation: Cross-Sectional Benchmarking Study With Students and Clinicians.

Cho AY, Eo SH, Jeon MJ, Kim JH, Ihm J, Seo DG.

JMIR medical education

原著公開:(オンライン公開日)

出典確認:2026-09-16。診療分野:医療の質(仮分類)

PubMed PMID 42696739 · DOI 10.2196/91809

免責事項と情報の読み方