日本の歯科医師国家試験の口腔外科関連問題に対するChatGPT-4oの性能評価
押さえるべきポイント
問題形式と画像資料が正答性能に及ぼす影響を検討した。
パノラマ画像・模型は正答オッズの低下と関連した。
CT・MRIなどの資料には有意な影響がなかった。
研究を読み解く
原文抄録に基づく日本語要約。全文翻訳ではありません。
日本の歯科医師国家試験の口腔外科関連問題を用い、一般知識・臨床実地、必要正答数、画像資料の有無によるChatGPT-4oの正答性能を検討した。一般知識では比較的良好だった一方、臨床判断や複数の視覚資料を要する問題では低かった。パノラマ画像と歯列模型の提示は正答オッズの低下と関連し、オッズ比はそれぞれ0.46、0.45だった(いずれもp=0.002)。CT・MRIなど他資料に有意な関連はなかった。編集考察:問題数や全体正答率は抄録に示されず、試験問題への対応を患者の診断能力や最新モデルの性能へ一般化することはできない。
診療との接点を考える
編集上の考察。個別の治療指示ではありません。
編集考察:学習支援の回答確認では画像と臨床推論に注意する資料となるが、試験性能を実診療の代替能力として扱うことはできない。
限界と注意点
- 編集考察:使用モデルと問題条件に限定され、問題数、入力条件の詳細、回答再現性は抄録から判断できない。
AIによる執筆と別工程の原文照合。歯科医師未監修。初版:2026-09-15、更新:2026-09-15。照合日:2026-09-15
原文・出典
Evaluation of the performance of ChatGPT-4o on oral surgery-related questions in the Japanese National Dental Examination.
Fukuda H, Morishita M, Takahashi O, Sasaguri M, Habu M.
International journal of oral and maxillofacial surgery
原著公開:(オンライン公開日)
出典確認:2026-09-15。診療分野:医療の質(仮分類)