歯科における大規模言語モデルの正答性能:トルコ歯科専門試験の臨床問題を用いた複数モデル研究
押さえるべきポイント
1026問を5モデルに一度ずつ入力して採点した。
多重比較をBonferroni法で補正し、知識問題(p<0.001)と症例問題(p=0.029)の両方でモデル間差を認めた。年度・専門分野でも成績が異なった。
原文での最高正答率は90.6%。Copilot、DeepSeek-R1、Grok 4は有意に低い成績と報告された(p<0.001)。
研究を読み解く
原文抄録に基づく日本語要約。全文翻訳ではありません。
トルコの歯科専門試験13回分の臨床科学問題1026問で、5種類の大規模言語モデルを評価した。各問を一度ずつ入力し、公式解答を基準に採点した。全体正答率は79.2~90.6%で、原文表記のGemini 3.5 Flashが90.6%、ChatGPT-5が88.2%と高かった。性能は年度、専門領域、知識問題か症例問題かによって変動した。著者らは試験学習を支える補助的利用の可能性を示す。編集考察:既存試験の正答率は患者診療の能力や安全性とは異なり、モデル名と版も原文の報告として扱う必要がある。
診療との接点を考える
編集上の考察。個別の治療指示ではありません。
編集考察:学習支援として答案を検討する参考になるが、試験成績を実患者の診断能力や独立した臨床判断の信頼性と同一視できない。
限界と注意点
- 編集考察:同一問題の回答再現性や学習データへの既存問題混入は抄録で検証されていない。モデルの実在・版の独立確認も本要約の範囲外である。
AIによる執筆と別工程の原文照合。歯科医師未監修。初版:2026-09-15、更新:2026-09-15。照合日:2026-09-15
原文・出典
Evaluating the Accuracy of Large Language Models in Dentistry: A Multi-Model Study Using Clinical Questions From Turkey's Dental Specialty Exams.
Acar NK, Sengul F, Celikel P, Erdogan AS.
European journal of dental education : official journal of the Association for Dental Education in Europe
原著公開:(オンライン公開日)
出典確認:2026-09-15。診療分野:医療の質(仮分類)