<?xml version="1.0" ?>
<!DOCTYPE PubmedArticleSet PUBLIC "-//NLM//DTD PubMedArticle, 1st January 2025//EN" "https://dtd.nlm.nih.gov/ncbi/pubmed/out/pubmed_250101.dtd">
<PubmedArticleSet>
<PubmedArticle><MedlineCitation Status="MEDLINE" Owner="NLM" IndexingMethod="Automated"><PMID Version="1">42068655</PMID><DateCompleted><Year>2026</Year><Month>07</Month><Day>16</Day></DateCompleted><DateRevised><Year>2026</Year><Month>07</Month><Day>30</Day></DateRevised><Article PubModel="Print-Electronic"><Journal><ISSN IssnType="Electronic">1873-5223</ISSN><JournalIssue CitedMedium="Internet"><Volume>93</Volume><PubDate><Year>2026</Year><Month>May</Month></PubDate></JournalIssue><Title>Nurse education in practice</Title><ISOAbbreviation>Nurse Educ Pract</ISOAbbreviation></Journal><ArticleTitle>Generative AI and intelligent tutoring systems in nursing education: A systematic review of impacts on higher-order thinking skills and clinical competency.</ArticleTitle><Pagination><StartPage>104847</StartPage><MedlinePgn>104847</MedlinePgn></Pagination><ELocationID EIdType="doi" ValidYN="Y">10.1016/j.nepr.2026.104847</ELocationID><ELocationID EIdType="pii" ValidYN="Y">S1471-5953(26)00149-6</ELocationID><Abstract><AbstractText Label="AIMS" NlmCategory="OBJECTIVE">This review synthesizes the impact of Artificial Intelligence (AI) on nursing students' clinical competency, Higher-Order Thinking Skills (HOTS) and educational outcomes to differentiate between procedural efficiency and deep cognitive retention.</AbstractText><AbstractText Label="BACKGROUND" NlmCategory="BACKGROUND">Generative AI and Intelligent Tutoring Systems (ITS) offer personalized scaffolding. However, their comparative efficacy against conventional pedagogical approaches, such as face-to-face lectures and standard non-AI simulations, remains controversial, particularly regarding the potential trade-off between skill acquisition and cognitive depth.</AbstractText><AbstractText Label="DESIGN" NlmCategory="METHODS">A systematic literature review guided by PRISMA 2020 guidelines.</AbstractText><AbstractText Label="METHODS" NlmCategory="METHODS">A comprehensive search across seven databases (PubMed, EBSCOhost, Scopus, ScienceDirect, ProQuest, IEEE Xplore, JSTOR) from 2015 to 2025 identified 14 eligible studies (7 RCTs, 7 Quasi-experiments) which were synthesized across East Asia, Europe and Africa. Quality was appraised using JBI tools, with the protocol registered in PROSPERO.</AbstractText><AbstractText Label="RESULTS" NlmCategory="RESULTS">Synthesis of 14 studies (n&#x202f;=&#x202f;1107) reveals a critical divergence. AI interventions significantly improved psychomotor application, procedural skills and communication mechanics compared with traditional instructor-led teaching methods. However, findings on HOTS and retention were mixed; while GenAI enhanced inquiry-based problem solving, it occasionally compromised critical reflection and long-term knowledge retention compared with human-led instruction. Furthermore, a "gap in algorithmic empathy" was evident, with AI failing to effectively enhance cultural awareness.</AbstractText><AbstractText Label="CONCLUSION" NlmCategory="CONCLUSIONS">AI functions as a robust "pedagogical scaffold" for procedural simulation but risks inducing "cognitive offloading" if used passively. Educators must adopt a Hybrid-Scaffolded Model: leveraging AI for iterative drills while prioritizing human facilitation for deep cognitive consolidation, ethics and cultural safety.</AbstractText><CopyrightInformation>Copyright &#xa9; 2026 Elsevier Ltd. All rights reserved.</CopyrightInformation></Abstract><AuthorList CompleteYN="Y"><Author ValidYN="Y"><LastName>Nasirun</LastName><ForeName>Hafizs</ForeName><Initials>H</Initials><AffiliationInfo><Affiliation>Faculty of Nursing, Universitas Indonesia, Depok, West Java, Indonesia. Electronic address: hafizs.nasirun@ui.ac.id.</Affiliation></AffiliationInfo></Author><Author ValidYN="Y"><LastName>Mulyono</LastName><ForeName>Sigit</ForeName><Initials>S</Initials><AffiliationInfo><Affiliation>Department of Community Nursing, Faculty of Nursing, Universitas Indonesia, Depok, West Java, Indonesia. Electronic address: sigit@ui.ac.id.</Affiliation></AffiliationInfo></Author><Author ValidYN="Y"><LastName>Hapsari</LastName><ForeName>Ayu Widowati Dwi</ForeName><Initials>AWD</Initials><AffiliationInfo><Affiliation>Faculty of Mathematics and Natural Sciences, Universitas Indonesia, Depok, West Java, Indonesia. Electronic address: Ayu.widowati@ui.ac.id.</Affiliation></AffiliationInfo></Author><Author ValidYN="Y"><LastName>Wiradinata</LastName><ForeName>Hendri Hardi</ForeName><Initials>HH</Initials><AffiliationInfo><Affiliation>Faculty of Nursing, Universitas Indonesia, Depok, West Java, Indonesia. Electronic address: hendri.hardi@ui.ac.id.</Affiliation></AffiliationInfo></Author><Author ValidYN="Y"><LastName>Ratu</LastName><ForeName>Mustika</ForeName><Initials>M</Initials><AffiliationInfo><Affiliation>Faculty of Nursing, Universitas Indonesia, Depok, West Java, Indonesia. Electronic address: mustika.ratu@ui.ac.id.</Affiliation></AffiliationInfo></Author></AuthorList><Language>eng</Language><PublicationTypeList><PublicationType UI="D016428">Journal Article</PublicationType><PublicationType UI="D000078182">Systematic Review</PublicationType></PublicationTypeList><ArticleDate DateType="Electronic"><Year>2026</Year><Month>04</Month><Day>28</Day></ArticleDate></Article><MedlineJournalInfo><Country>Scotland</Country><MedlineTA>Nurse Educ Pract</MedlineTA><NlmUniqueID>101090848</NlmUniqueID><ISSNLinking>1471-5953</ISSNLinking></MedlineJournalInfo><CitationSubset>IM</CitationSubset><MeshHeadingList><MeshHeading><DescriptorName UI="D006801" MajorTopicYN="N">Humans</DescriptorName></MeshHeading><MeshHeading><DescriptorName UI="D002983" MajorTopicYN="Y">Clinical Competence</DescriptorName><QualifierName UI="Q000592" MajorTopicYN="N">standards</QualifierName></MeshHeading><MeshHeading><DescriptorName UI="D013850" MajorTopicYN="Y">Thinking</DescriptorName></MeshHeading><MeshHeading><DescriptorName UI="D000098842" MajorTopicYN="N">Generative Artificial Intelligence</DescriptorName></MeshHeading><MeshHeading><DescriptorName UI="D013338" MajorTopicYN="Y">Students, Nursing</DescriptorName><QualifierName UI="Q000523" MajorTopicYN="N">psychology</QualifierName></MeshHeading><MeshHeading><DescriptorName UI="D001185" MajorTopicYN="Y">Artificial Intelligence</DescriptorName></MeshHeading><MeshHeading><DescriptorName UI="D004506" MajorTopicYN="Y">Education, Nursing</DescriptorName><QualifierName UI="Q000379" MajorTopicYN="N">methods</QualifierName></MeshHeading></MeshHeadingList><KeywordList Owner="NOTNLM"><Keyword MajorTopicYN="N">Artificial Intelligence</Keyword><Keyword MajorTopicYN="N">Clinical Competence</Keyword><Keyword MajorTopicYN="N">Generative AI</Keyword><Keyword MajorTopicYN="N">Higher-Order Thinking Skills</Keyword><Keyword MajorTopicYN="N">Nursing Education</Keyword><Keyword MajorTopicYN="N">Simulation</Keyword></KeywordList><CoiStatement>Declaration of Competing Interest The authors declare that there are no conflicts of interest in the writing and publication of this article</CoiStatement></MedlineCitation><PubmedData><History><PubMedPubDate PubStatus="received"><Year>2026</Year><Month>2</Month><Day>1</Day></PubMedPubDate><PubMedPubDate PubStatus="revised"><Year>2026</Year><Month>4</Month><Day>13</Day></PubMedPubDate><PubMedPubDate PubStatus="accepted"><Year>2026</Year><Month>4</Month><Day>23</Day></PubMedPubDate><PubMedPubDate PubStatus="medline"><Year>2026</Year><Month>5</Month><Day>29</Day><Hour>15</Hour><Minute>44</Minute></PubMedPubDate><PubMedPubDate PubStatus="pubmed"><Year>2026</Year><Month>5</Month><Day>3</Day><Hour>5</Hour><Minute>27</Minute></PubMedPubDate><PubMedPubDate PubStatus="entrez"><Year>2026</Year><Month>5</Month><Day>2</Day><Hour>18</Hour><Minute>2</Minute></PubMedPubDate></History><PublicationStatus>ppublish</PublicationStatus><ArticleIdList><ArticleId IdType="pubmed">42068655</ArticleId><ArticleId IdType="doi">10.1016/j.nepr.2026.104847</ArticleId><ArticleId IdType="pii">S1471-5953(26)00149-6</ArticleId></ArticleIdList></PubmedData></PubmedArticle><PubmedArticle><MedlineCitation Status="PubMed-not-MEDLINE" Owner="NLM"><PMID Version="1">41899896</PMID><DateCompleted><Year>2026</Year><Month>03</Month><Day>28</Day></DateCompleted><DateRevised><Year>2026</Year><Month>03</Month><Day>30</Day></DateRevised><Article PubModel="Electronic"><Journal><ISSN IssnType="Print">2306-5354</ISSN><JournalIssue CitedMedium="Print"><Volume>13</Volume><Issue>3</Issue><PubDate><Year>2026</Year><Month>Mar</Month><Day>20</Day></PubDate></JournalIssue><Title>Bioengineering (Basel, Switzerland)</Title><ISOAbbreviation>Bioengineering (Basel)</ISOAbbreviation></Journal><ArticleTitle>Applications of Large Language Models in Medical Research: From Systematic Reviews to Clinical Studies.</ArticleTitle><ELocationID EIdType="pii" ValidYN="Y">365</ELocationID><ELocationID EIdType="doi" ValidYN="Y">10.3390/bioengineering13030365</ELocationID><Abstract><AbstractText><b>Background</b>: Large Language Models (LLMs) are reshaping medical research workflows. Objective: This narrative review synthesizes evidence on LLM applications across systematic reviews, scientific writing, and clinical research. <b>Methods</b>: We reviewed literature from 2023-2025 examining LLM applications in medical research, identified through PubMed, Scopus, Web of Science, arXiv, medRxiv, and Google Scholar. Studies reporting empirical findings, methodological evaluations, or systematic analyses of LLM applications were included; editorials and commentaries without empirical data were excluded. <b>Results</b>: In systematic reviews, LLMs achieve 80-94% data extraction accuracy and 40% reduction in screening workload, but show only slight-to-moderate agreement (&#x3ba; = 0.16-0.43) in risk-of-bias assessment. In scientific writing, hallucination rates of 47-55% for fabricated references and over 90% prevalence of demographic bias require rigorous verification. For clinical research, LLMs assist with statistical coding and protocol development but require human validation. Critically, excessive reliance on automated tools may cause cognitive offloading that compromises analytical capabilities. <b>Conclusions</b>: LLMs are powerful but unstable tools requiring constant verification. Success depends on maintaining human-in-the-loop approaches that preserve critical thinking while leveraging AI efficiency.</AbstractText></Abstract><AuthorList CompleteYN="Y"><Author ValidYN="Y"><LastName>Gong</LastName><ForeName>Eun Jeong</ForeName><Initials>EJ</Initials><Identifier Source="ORCID">0000-0003-3996-3472</Identifier><AffiliationInfo><Affiliation>Department of Internal Medicine, Hallym University College of Medicine, Chuncheon 24252, Republic of Korea.</Affiliation></AffiliationInfo><AffiliationInfo><Affiliation>Institute for Liver and Digestive Diseases, Hallym University, Chuncheon 24252, Republic of Korea.</Affiliation></AffiliationInfo><AffiliationInfo><Affiliation>Institute of New Frontier Research, Hallym University College of Medicine, Chuncheon 24252, Republic of Korea.</Affiliation></AffiliationInfo></Author><Author ValidYN="Y"><LastName>Bang</LastName><ForeName>Chang Seok</ForeName><Initials>CS</Initials><Identifier Source="ORCID">0000-0003-4908-5431</Identifier><AffiliationInfo><Affiliation>Department of Internal Medicine, Hallym University College of Medicine, Chuncheon 24252, Republic of Korea.</Affiliation></AffiliationInfo><AffiliationInfo><Affiliation>Institute for Liver and Digestive Diseases, Hallym University, Chuncheon 24252, Republic of Korea.</Affiliation></AffiliationInfo><AffiliationInfo><Affiliation>Institute of New Frontier Research, Hallym University College of Medicine, Chuncheon 24252, Republic of Korea.</Affiliation></AffiliationInfo></Author><Author ValidYN="Y"><LastName>Shin</LastName><ForeName>Yong Seok</ForeName><Initials>YS</Initials><AffiliationInfo><Affiliation>Department of Internal Medicine, Hallym University College of Medicine, Chuncheon 24252, Republic of Korea.</Affiliation></AffiliationInfo></Author></AuthorList><Language>eng</Language><PublicationTypeList><PublicationType UI="D016428">Journal Article</PublicationType><PublicationType UI="D016454">Review</PublicationType></PublicationTypeList><ArticleDate DateType="Electronic"><Year>2026</Year><Month>03</Month><Day>20</Day></ArticleDate></Article><MedlineJournalInfo><Country>Switzerland</Country><MedlineTA>Bioengineering (Basel)</MedlineTA><NlmUniqueID>101676056</NlmUniqueID><ISSNLinking>2306-5354</ISSNLinking></MedlineJournalInfo><KeywordList Owner="NOTNLM"><Keyword MajorTopicYN="N">ChatGPT</Keyword><Keyword MajorTopicYN="N">GPT-4</Keyword><Keyword MajorTopicYN="N">artificial intelligence</Keyword><Keyword MajorTopicYN="N">evidence synthesis</Keyword><Keyword MajorTopicYN="N">large language models</Keyword><Keyword MajorTopicYN="N">medical research</Keyword><Keyword MajorTopicYN="N">prompt engineering</Keyword><Keyword MajorTopicYN="N">systematic review</Keyword></KeywordList><CoiStatement>The authors declare no conflicts of interest.</CoiStatement></MedlineCitation><PubmedData><History><PubMedPubDate PubStatus="received"><Year>2026</Year><Month>2</Month><Day>10</Day></PubMedPubDate><PubMedPubDate PubStatus="revised"><Year>2026</Year><Month>3</Month><Day>11</Day></PubMedPubDate><PubMedPubDate PubStatus="accepted"><Year>2026</Year><Month>3</Month><Day>14</Day></PubMedPubDate><PubMedPubDate PubStatus="medline"><Year>2026</Year><Month>3</Month><Day>28</Day><Hour>6</Hour><Minute>41</Minute></PubMedPubDate><PubMedPubDate PubStatus="pubmed"><Year>2026</Year><Month>3</Month><Day>28</Day><Hour>6</Hour><Minute>40</Minute></PubMedPubDate><PubMedPubDate PubStatus="entrez"><Year>2026</Year><Month>3</Month><Day>28</Day><Hour>1</Hour><Minute>27</Minute></PubMedPubDate><PubMedPubDate PubStatus="pmc-release"><Year>2026</Year><Month>3</Month><Day>20</Day></PubMedPubDate></History><PublicationStatus>epublish</PublicationStatus><ArticleIdList><ArticleId IdType="pubmed">41899896</ArticleId><ArticleId IdType="pmc">PMC13024205</ArticleId><ArticleId IdType="doi">10.3390/bioengineering13030365</ArticleId><ArticleId IdType="pii">bioengineering13030365</ArticleId></ArticleIdList><ReferenceList><Reference><Citation>van Dis E.A.M., Bollen J., Zuidema W., van Rooij R., Bockting C.L. ChatGPT: Five priorities for research. Nature. 2023;614:224&#x2013;226. doi: 10.1038/d41586-023-00288-7.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/d41586-023-00288-7</ArticleId><ArticleId IdType="pubmed">36737653</ArticleId></ArticleIdList></Reference><Reference><Citation>Thirunavukarasu A.J., Ting D.S.J., Elangovan K., Gutierrez L., Tan T.F. Large language models in medicine. Nat. Med. 2023;29:1930&#x2013;1940. doi: 10.1038/s41591-023-02448-8.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41591-023-02448-8</ArticleId><ArticleId IdType="pubmed">37460753</ArticleId></ArticleIdList></Reference><Reference><Citation>Gong E.J., Bang C.S. Evaluating the role of large language models in inflammatory bowel disease patient information. World J. Gastroenterol. 2024;30:3538&#x2013;3540. doi: 10.3748/wjg.v30.i29.3538.</Citation><ArticleIdList><ArticleId IdType="doi">10.3748/wjg.v30.i29.3538</ArticleId><ArticleId IdType="pmc">PMC11326091</ArticleId><ArticleId IdType="pubmed">39156498</ArticleId></ArticleIdList></Reference><Reference><Citation>Gong E.J., Bang C.S. Revolutionizing gastrointestinal endoscopy: The emerging role of large language models. Clin. Endosc. 2024;57:759&#x2013;762. doi: 10.5946/ce.2024.039.</Citation><ArticleIdList><ArticleId IdType="doi">10.5946/ce.2024.039</ArticleId><ArticleId IdType="pmc">PMC11637668</ArticleId><ArticleId IdType="pubmed">39206500</ArticleId></ArticleIdList></Reference><Reference><Citation>Gong E.J., Bang C.S., Lee J.J., Park J., Kim E., Kim S., Kimm M., Choi S.-H. Large Language Models in Gastroenterology: Systematic Review. J. Med. Internet Res. 2024;26:e66648. doi: 10.2196/66648.</Citation><ArticleIdList><ArticleId IdType="doi">10.2196/66648</ArticleId><ArticleId IdType="pmc">PMC11699489</ArticleId><ArticleId IdType="pubmed">39705703</ArticleId></ArticleIdList></Reference><Reference><Citation>Liu J., Wang C., Liu S. Utility of ChatGPT in Clinical Practice. J. Med. Internet Res. 2023;25:e48568. doi: 10.2196/48568.</Citation><ArticleIdList><ArticleId IdType="doi">10.2196/48568</ArticleId><ArticleId IdType="pmc">PMC10365580</ArticleId><ArticleId IdType="pubmed">37379067</ArticleId></ArticleIdList></Reference><Reference><Citation>Kim H.J., Gong E.J., Bang C.-S. Application of Machine Learning Based on Structured Medical Data in Gastroenterology. Biomimetics. 2023;8:512. doi: 10.3390/biomimetics8070512.</Citation><ArticleIdList><ArticleId IdType="doi">10.3390/biomimetics8070512</ArticleId><ArticleId IdType="pmc">PMC10669027</ArticleId><ArticleId IdType="pubmed">37999153</ArticleId></ArticleIdList></Reference><Reference><Citation>Borah R., Brown A.W., Capers P.L., Kaiser K.A. Analysis of the time and workers needed to conduct systematic reviews of medical interventions using data from the PROSPERO registry. BMJ Open. 2017;7:e012545. doi: 10.1136/bmjopen-2016-012545.</Citation><ArticleIdList><ArticleId IdType="doi">10.1136/bmjopen-2016-012545</ArticleId><ArticleId IdType="pmc">PMC5337708</ArticleId><ArticleId IdType="pubmed">28242767</ArticleId></ArticleIdList></Reference><Reference><Citation>Landhuis E. Scientific literature: Information overload. Nature. 2016;535:457&#x2013;458. doi: 10.1038/nj7612-457a.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/nj7612-457a</ArticleId><ArticleId IdType="pubmed">27453968</ArticleId></ArticleIdList></Reference><Reference><Citation>Marshall I.J., Wallace B.C. Toward systematic review automation: A practical guide to using machine learning tools in research synthesis. Syst. Rev. 2019;8:163. doi: 10.1186/s13643-019-1074-9.</Citation><ArticleIdList><ArticleId IdType="doi">10.1186/s13643-019-1074-9</ArticleId><ArticleId IdType="pmc">PMC6621996</ArticleId><ArticleId IdType="pubmed">31296265</ArticleId></ArticleIdList></Reference><Reference><Citation>Linardon J., Messer M., Anderson C., Liu C., McClure Z., Jarman H.K., Goldberg S.B., Torous J. Role of large language models in mental health research: An international survey of researchers&#x2019; practices and perspectives. BMJ Ment. Health. 2025;28:e301787. doi: 10.1136/bmjment-2025-301787.</Citation><ArticleIdList><ArticleId IdType="doi">10.1136/bmjment-2025-301787</ArticleId><ArticleId IdType="pmc">PMC12164621</ArticleId><ArticleId IdType="pubmed">40514050</ArticleId></ArticleIdList></Reference><Reference><Citation>Qureshi R., Shaughnessy D., Gill K.A.R., Robinson K.A., Li T., Agai E. Are ChatGPT and large language models &#x201c;the answer&#x201d; to bringing us closer to systematic review automation? Syst. Rev. 2023;12:72. doi: 10.1186/s13643-023-02243-z.</Citation><ArticleIdList><ArticleId IdType="doi">10.1186/s13643-023-02243-z</ArticleId><ArticleId IdType="pmc">PMC10148473</ArticleId><ArticleId IdType="pubmed">37120563</ArticleId></ArticleIdList></Reference><Reference><Citation>Ji Z., Lee N., Frieske R., Yu T., Su D., Xu Y., Ishii E., Bang Y.J., Madotto A., Fung P. Survey of hallucination in natural language generation. ACM Comput. Surv. 2023;55:1&#x2013;38. doi: 10.1145/3571730.</Citation><ArticleIdList><ArticleId IdType="doi">10.1145/3571730</ArticleId></ArticleIdList></Reference><Reference><Citation>Anonymous. Tools such as ChatGPT threaten transparent science; here are our ground rules for their use. Nature. 2023;613:612. doi: 10.1038/d41586-023-00191-1.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/d41586-023-00191-1</ArticleId><ArticleId IdType="pubmed">36694020</ArticleId></ArticleIdList></Reference><Reference><Citation>Flanagin A., Bibbins-Domingo K., Berkwits M., Christiansen S.L. Nonhuman &#x201c;Authors&#x201d; and Implications for the Integrity of Scientific Publication and Medical Knowledge. JAMA. 2023;329:637&#x2013;639. doi: 10.1001/jama.2023.1344.</Citation><ArticleIdList><ArticleId IdType="doi">10.1001/jama.2023.1344</ArticleId><ArticleId IdType="pubmed">36719674</ArticleId></ArticleIdList></Reference><Reference><Citation>Bedi S., Liu Y., Orr-Ewing L., Dash D., Koyejo S., Callahan A., Fries J.A., Wornow M., Swaminathan A., Lehmann L.S., et al. Testing and evaluation of health care applications of large language models: A systematic review. JAMA. 2025;333:319&#x2013;328. doi: 10.1001/jama.2024.21700.</Citation><ArticleIdList><ArticleId IdType="doi">10.1001/jama.2024.21700</ArticleId><ArticleId IdType="pmc">PMC11480901</ArticleId><ArticleId IdType="pubmed">39405325</ArticleId></ArticleIdList></Reference><Reference><Citation>Scherbakov D., Hubig N., Jansari V., Bakumenko A., Lenert L.A. The emergence of large language models as tools in literature reviews: A large language model-assisted systematic review. J. Am. Med. Inform. Assoc. 2025;32:1071&#x2013;1086. doi: 10.1093/jamia/ocaf063.</Citation><ArticleIdList><ArticleId IdType="doi">10.1093/jamia/ocaf063</ArticleId><ArticleId IdType="pmc">PMC12089777</ArticleId><ArticleId IdType="pubmed">40332983</ArticleId></ArticleIdList></Reference><Reference><Citation>Lieberum J.L., Toews M., Metzendorf M.I., Heilmeyer F., Siemens W., Haverkamp C., B&#xf6;hringer D., Meerpohl J.J., Eisele-Metzger A. Large language models for conducting systematic reviews: On the rise, but not yet ready for use&#x2014;A scoping review. J. Clin. Epidemiol. 2025;181:111746. doi: 10.1016/j.jclinepi.2025.111746.</Citation><ArticleIdList><ArticleId IdType="doi">10.1016/j.jclinepi.2025.111746</ArticleId><ArticleId IdType="pubmed">40021099</ArticleId></ArticleIdList></Reference><Reference><Citation>Ahn S. The transformative impact of large language models on medical writing and publishing: Current applications, challenges and future directions. Korean J. Physiol. Pharmacol. 2024;28:393&#x2013;401. doi: 10.4196/kjpp.2024.28.5.393.</Citation><ArticleIdList><ArticleId IdType="doi">10.4196/kjpp.2024.28.5.393</ArticleId><ArticleId IdType="pmc">PMC11362003</ArticleId><ArticleId IdType="pubmed">39198220</ArticleId></ArticleIdList></Reference><Reference><Citation>Omar M., Nadkarni G.N., Klang E., Glicksberg B.S. Large language models in medicine: A review of current clinical trials across healthcare applications. PLoS Digit. Health. 2024;3:e0000662. doi: 10.1371/journal.pdig.0000662.</Citation><ArticleIdList><ArticleId IdType="doi">10.1371/journal.pdig.0000662</ArticleId><ArticleId IdType="pmc">PMC11575759</ArticleId><ArticleId IdType="pubmed">39561120</ArticleId></ArticleIdList></Reference><Reference><Citation>Ferrari R. Writing narrative style literature reviews. Med. Writ. 2015;24:230&#x2013;235. doi: 10.1179/2047480615Z.000000000329.</Citation><ArticleIdList><ArticleId IdType="doi">10.1179/2047480615Z.000000000329</ArticleId></ArticleIdList></Reference><Reference><Citation>Greenhalgh T., Thorne S., Malterud K. Time to challenge the spurious hierarchy of systematic over narrative reviews? Eur. J. Clin. Investig. 2018;48:e12931. doi: 10.1111/eci.12931.</Citation><ArticleIdList><ArticleId IdType="doi">10.1111/eci.12931</ArticleId><ArticleId IdType="pmc">PMC6001568</ArticleId><ArticleId IdType="pubmed">29578574</ArticleId></ArticleIdList></Reference><Reference><Citation>Sukhera J. Narrative reviews: Flexible, rigorous, and practical. J. Grad. Med. Educ. 2022;14:414&#x2013;417. doi: 10.4300/JGME-D-22-00480.1.</Citation><ArticleIdList><ArticleId IdType="doi">10.4300/JGME-D-22-00480.1</ArticleId><ArticleId IdType="pmc">PMC9380636</ArticleId><ArticleId IdType="pubmed">35991099</ArticleId></ArticleIdList></Reference><Reference><Citation>Baethge C., Goldbeck-Wood S., Mertens S. SANRA&#x2014;A scale for the quality assessment of narrative review articles. Res. Integr. Peer Rev. 2019;4:5. doi: 10.1186/s41073-019-0064-8.</Citation><ArticleIdList><ArticleId IdType="doi">10.1186/s41073-019-0064-8</ArticleId><ArticleId IdType="pmc">PMC6434870</ArticleId><ArticleId IdType="pubmed">30962953</ArticleId></ArticleIdList></Reference><Reference><Citation>Wang S., Scells H., Koopman B., Zuccon G. Can ChatGPT write a good boolean query for systematic review literature search? arXiv. 2023 doi: 10.48550/arXiv.2302.03495.2302.03495</Citation><ArticleIdList><ArticleId IdType="doi">10.48550/arXiv.2302.03495</ArticleId></ArticleIdList></Reference><Reference><Citation>Yu F., Kincaide H., Carlson R.B. An Empirical Study Evaluating ChatGPT&#x2019;s Performance in Generating Search Strategies for Systematic Reviews. Proc. Assoc. Inf. Sci. Technol. 2024;61:423&#x2013;434. doi: 10.1002/pra2.1039.</Citation><ArticleIdList><ArticleId IdType="doi">10.1002/pra2.1039</ArticleId></ArticleIdList></Reference><Reference><Citation>Parisi V., Sutton A. The role of ChatGPT in developing systematic literature searches: An evidence summary. J. EAHIL. 2024;20:30&#x2013;34. doi: 10.32384/jeahil20623.</Citation><ArticleIdList><ArticleId IdType="doi">10.32384/jeahil20623</ArticleId></ArticleIdList></Reference><Reference><Citation>O&#x2019;Connor A.M., Tsafnat G., Gilbert S.B., Thayer K.A., Shemilt I., Thomas J., Glasziou P., Wolfe M.S. Still moving toward automation of the systematic review process: A summary of discussions at the third meeting of the International Collaboration for Automation of Systematic Reviews (ICASR) Syst. Rev. 2019;8:57. doi: 10.1186/s13643-019-0975-y.</Citation><ArticleIdList><ArticleId IdType="doi">10.1186/s13643-019-0975-y</ArticleId><ArticleId IdType="pmc">PMC6381675</ArticleId><ArticleId IdType="pubmed">30786933</ArticleId></ArticleIdList></Reference><Reference><Citation>Clark J., Glasziou P., Del Mar C., Bannach-Brown A., Stehlik P., Scott A.M. A full systematic review was completed in 2 weeks using automation tools: A case study. J. Clin. Epidemiol. 2020;121:81&#x2013;90. doi: 10.1016/j.jclinepi.2020.01.008.</Citation><ArticleIdList><ArticleId IdType="doi">10.1016/j.jclinepi.2020.01.008</ArticleId><ArticleId IdType="pubmed">32004673</ArticleId></ArticleIdList></Reference><Reference><Citation>Issaiy M., Ghanaati H., Kolahi S., Shakiba M., Jalali A.H., Zarei D., Kazemian S., Avanaki M.A., Firouznia K. Methodological insights into ChatGPT&#x2019;s screening performance in systematic reviews. BMC Med. Res. Methodol. 2024;24:78. doi: 10.1186/s12874-024-02203-8.</Citation><ArticleIdList><ArticleId IdType="doi">10.1186/s12874-024-02203-8</ArticleId><ArticleId IdType="pmc">PMC10976661</ArticleId><ArticleId IdType="pubmed">38539117</ArticleId></ArticleIdList></Reference><Reference><Citation>Cai X., Geng Y., Du Y., Westerman B., Wang D., Ma C., Vallejo J.J.G. Utilizing Large language models to select literature for meta-analysis shows workload reduction while maintaining a similar recall level as manual curation. BMC Med. Res. Methodol. 2025;25:116. doi: 10.1186/s12874-025-02569-3.</Citation><ArticleIdList><ArticleId IdType="doi">10.1186/s12874-025-02569-3</ArticleId><ArticleId IdType="pmc">PMC12036192</ArticleId><ArticleId IdType="pubmed">40295957</ArticleId></ArticleIdList></Reference><Reference><Citation>Khraisha Q., Put S., Kappenberg J., Warraitch A., Hadfield K. Can large language models replace humans in systematic reviews? Evaluating GPT-4&#x2019;s efficacy in screening and extracting data from peer-reviewed and grey literature in multiple languages. Res. Synth. Methods. 2024;15:616&#x2013;626. doi: 10.1002/jrsm.1715.</Citation><ArticleIdList><ArticleId IdType="doi">10.1002/jrsm.1715</ArticleId><ArticleId IdType="pubmed">38484744</ArticleId></ArticleIdList></Reference><Reference><Citation>Kohandel Gargari O., Mahmoudi M.H., Hajisafarali M., Samiee R. Enhancing title and abstract screening for systematic reviews with GPT-3.5 turbo. BMJ Evid.-Based Med. 2024;29:69&#x2013;70. doi: 10.1136/bmjebm-2023-112678.</Citation><ArticleIdList><ArticleId IdType="doi">10.1136/bmjebm-2023-112678</ArticleId><ArticleId IdType="pmc">PMC10850650</ArticleId><ArticleId IdType="pubmed">37989538</ArticleId></ArticleIdList></Reference><Reference><Citation>Matsui K., Utsumi T., Aoki Y., Maruki T., Takeshima M., Takaesu Y. Human-Comparable Sensitivity of Large Language Models in Identifying Eligible Studies Through Title and Abstract Screening: 3-Layer Strategy Using GPT-3.5 and GPT-4 for Systematic Reviews. J. Med. Internet Res. 2024;26:e52758. doi: 10.2196/52758.</Citation><ArticleIdList><ArticleId IdType="doi">10.2196/52758</ArticleId><ArticleId IdType="pmc">PMC11364944</ArticleId><ArticleId IdType="pubmed">39151163</ArticleId></ArticleIdList></Reference><Reference><Citation>Windisch P., Dennst&#xe4;dt F., Koechli C., Schr&#xf6;der C., Aebersold D.M., F&#xf6;rster R., Zwahlen D.R., Windisch P.Y. The Impact of Temperature on Extracting Information From Clinical Trial Publications Using Large Language Models. Cureus. 2024;16:e75748. doi: 10.7759/cureus.75748.</Citation><ArticleIdList><ArticleId IdType="doi">10.7759/cureus.75748</ArticleId><ArticleId IdType="pmc">PMC11731902</ArticleId><ArticleId IdType="pubmed">39811231</ArticleId></ArticleIdList></Reference><Reference><Citation>Oami T., Okada Y., Nakada T.-A. Optimal large language models to screen citations for systematic reviews. Res. Synth. Methods. 2025;16:859&#x2013;875. doi: 10.1017/rsm.2025.10014.</Citation><ArticleIdList><ArticleId IdType="doi">10.1017/rsm.2025.10014</ArticleId><ArticleId IdType="pmc">PMC12657656</ArticleId><ArticleId IdType="pubmed">41626985</ArticleId></ArticleIdList></Reference><Reference><Citation>Sorich M.J., Mangoni A.A., Bacchi S., Menz B.D., Hopkins A.M. The Triage and Diagnostic Accuracy of Frontier Large Language Models: Updated Comparison to Physician Performance. J. Med. Internet Res. 2024;26:e67409. doi: 10.2196/67409.</Citation><ArticleIdList><ArticleId IdType="doi">10.2196/67409</ArticleId><ArticleId IdType="pmc">PMC11662182</ArticleId><ArticleId IdType="pubmed">39642373</ArticleId></ArticleIdList></Reference><Reference><Citation>Karpathy A.  LLM Council. GitHub; San Francisco, CA, USA: 2025.  [(accessed on 13 March 2026)].  Available online:  https://github.com/karpathy/llm-council.</Citation></Reference><Reference><Citation>Guo E., Gupta M., Deng J., Park Y.-J., Paget M., Naugler C. Automated Paper Screening for Clinical Reviews Using Large Language Models: Data Analysis Study. J. Med. Internet Res. 2024;26:e48996. doi: 10.2196/48996.</Citation><ArticleIdList><ArticleId IdType="doi">10.2196/48996</ArticleId><ArticleId IdType="pmc">PMC10818236</ArticleId><ArticleId IdType="pubmed">38214966</ArticleId></ArticleIdList></Reference><Reference><Citation>Jonnalagadda S.R., Goyal P., Huffman M.D. Automating data extraction in systematic reviews: A systematic review. Syst. Rev. 2015;4:78. doi: 10.1186/s13643-015-0066-7.</Citation><ArticleIdList><ArticleId IdType="doi">10.1186/s13643-015-0066-7</ArticleId><ArticleId IdType="pmc">PMC4514954</ArticleId><ArticleId IdType="pubmed">26073888</ArticleId></ArticleIdList></Reference><Reference><Citation>Schmidt L., Hair K., Graziosi S., Campbell F., Kapp C., Khanteymoori A., Craig D., Engelbert M., Thomas J. Exploring the use of a large language model for data extraction in systematic reviews: A rapid feasibility study. arXiv. 2024 doi: 10.48550/arXiv.2405.14445.2405.14445</Citation><ArticleIdList><ArticleId IdType="doi">10.48550/arXiv.2405.14445</ArticleId></ArticleIdList></Reference><Reference><Citation>Khan M.A., Ayub U., Naqvi S.A.A., Khakwani K.Z.R., Sipra Z.B.R., Raina A., Zhou S., He H., Saeidi A., Hasan B., et al. Collaborative large language models for automated data extraction in living systematic reviews. J. Am. Med. Inform. Assoc. 2025;32:638&#x2013;647. doi: 10.1093/jamia/ocae325.</Citation><ArticleIdList><ArticleId IdType="doi">10.1093/jamia/ocae325</ArticleId><ArticleId IdType="pmc">PMC12005628</ArticleId><ArticleId IdType="pubmed">39836495</ArticleId></ArticleIdList></Reference><Reference><Citation>Konet A., Thomas I., Gartlehner G., Kahwati L., Hilscher R., Kugley S., Crotty K., Viswanathan M., Chew R. Performance of two large language models for data extraction in evidence synthesis. Res. Synth. Methods. 2024;15:818&#x2013;824. doi: 10.1002/jrsm.1732.</Citation><ArticleIdList><ArticleId IdType="doi">10.1002/jrsm.1732</ArticleId><ArticleId IdType="pubmed">38895747</ArticleId></ArticleIdList></Reference><Reference><Citation>Gartlehner G., Kahwati L., Hilscher R., Thomas I., Kugley S., Crotty K., Viswanathan M., Nussbaumer-Streit B., Booth G., Erskine N., et al. Data extraction for evidence synthesis using a large language model: A proof-of-concept study. Res. Synth. Methods. 2024;15:576&#x2013;589. doi: 10.1002/jrsm.1710.</Citation><ArticleIdList><ArticleId IdType="doi">10.1002/jrsm.1710</ArticleId><ArticleId IdType="pubmed">38432227</ArticleId></ArticleIdList></Reference><Reference><Citation>Kim G., Hong T., Yim M., Nam J., Park J., Yim J., Hwang W., Yun S., Han D., Park S. Ocr-free document understanding transformer. arXiv. 2021 doi: 10.48550/arXiv.2111.15664.2111.15664</Citation><ArticleIdList><ArticleId IdType="doi">10.48550/arXiv.2111.15664</ArticleId></ArticleIdList></Reference><Reference><Citation>Wang D., Raman N., Sibue M., Ma Z., Babkin P., Kaur S., Pei Y., Nourbakhsh A., Liu X. Docllm: A layout-aware generative language model for multimodal document understanding. arXiv. 20232401.00908</Citation></Reference><Reference><Citation>Jin Q., Chen F., Zhou Y., Xu Z., Cheung J.M., Chen R., Summers R.M., Rousseau J.F., Ni P., Landsman M.J., et al. Hidden flaws behind expert-level accuracy of multimodal GPT-4 vision in medicine. npj Digit. Med. 2024;7:190. doi: 10.1038/s41746-024-01185-7.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41746-024-01185-7</ArticleId><ArticleId IdType="pmc">PMC11266508</ArticleId><ArticleId IdType="pubmed">39043988</ArticleId></ArticleIdList></Reference><Reference><Citation>Bhattacharyya M., Miller V.M., Bhattacharyya D., Miller L.E. High Rates of Fabricated and Inaccurate References in ChatGPT-Generated Medical Content. Cureus. 2023;15:e39238. doi: 10.7759/cureus.39238.</Citation><ArticleIdList><ArticleId IdType="doi">10.7759/cureus.39238</ArticleId><ArticleId IdType="pmc">PMC10277170</ArticleId><ArticleId IdType="pubmed">37337480</ArticleId></ArticleIdList></Reference><Reference><Citation>Motzfeldt Jensen M., Brix Danielsen M., Riis J., Assifuah Kristjansen K., Andersen S., Okubo Y., J&#xf8;rgensen M.G. ChatGPT-4o can serve as the second rater for data extraction in systematic reviews. PLoS ONE. 2025;20:e0313401. doi: 10.1371/journal.pone.0313401.</Citation><ArticleIdList><ArticleId IdType="doi">10.1371/journal.pone.0313401</ArticleId><ArticleId IdType="pmc">PMC11706374</ArticleId><ArticleId IdType="pubmed">39774443</ArticleId></ArticleIdList></Reference><Reference><Citation>Pitre T., Jassal T., Talukdar J.R., Shahab M., Ling M., Zeraatkar D. ChatGPT for assessing risk of bias of randomized trials using the RoB 2.0 tool: A methods study. medRxiv. 2023 medRxiv:2023.11.19.23298727.</Citation></Reference><Reference><Citation>Kuitunen I., Ponkilainen V.T., Liukkonen R., Nyrhi L., Pakarinen O., Vaajala M., Uimonen M.M. Evaluating the Performance of ChatGPT-4o in Risk of Bias Assessments. J. Evid.-Based Med. 2024;17:700&#x2013;702. doi: 10.1111/jebm.12662.</Citation><ArticleIdList><ArticleId IdType="doi">10.1111/jebm.12662</ArticleId><ArticleId IdType="pmc">PMC11684499</ArticleId><ArticleId IdType="pubmed">39676337</ArticleId></ArticleIdList></Reference><Reference><Citation>Kuitunen I., Nyrhi L., De Luca D. ChatGPT-4o in Risk-of-Bias Assessments in Neonatology: A Validity Analysis. Neonatology. 2025;122:360&#x2013;365. doi: 10.1159/000544857.</Citation><ArticleIdList><ArticleId IdType="doi">10.1159/000544857</ArticleId><ArticleId IdType="pmc">PMC12129414</ArticleId><ArticleId IdType="pubmed">39999815</ArticleId></ArticleIdList></Reference><Reference><Citation>&#x160;uster S., Baldwin T., Verspoor K. Zero- and few-shot prompting of generative large language models provides weak assessment of risk of bias in clinical trials. Res. Synth. Methods. 2024;15:988&#x2013;1000. doi: 10.1002/jrsm.1749.</Citation><ArticleIdList><ArticleId IdType="doi">10.1002/jrsm.1749</ArticleId><ArticleId IdType="pubmed">39176994</ArticleId></ArticleIdList></Reference><Reference><Citation>Lai H., Ge L., Sun M., Pan B., Huang J., Hou L., Yang Q., Liu J., Liu J., Ye Z., et al. Assessing the Risk of Bias in Randomized Clinical Trials With Large Language Models. JAMA Netw. Open. 2024;7:e2412687. doi: 10.1001/jamanetworkopen.2024.12687.</Citation><ArticleIdList><ArticleId IdType="doi">10.1001/jamanetworkopen.2024.12687</ArticleId><ArticleId IdType="pmc">PMC11112444</ArticleId><ArticleId IdType="pubmed">38776081</ArticleId></ArticleIdList></Reference><Reference><Citation>Huang J., Lai H., Zhao W., Xia D., Bai C., Sun M., Liu J., Liu J., Pan B., Tian J., et al. Large Language Model&#x2013;Assisted Risk-of-Bias Assessment in Randomized Controlled Trials Using the Revised Risk-of-Bias Tool: Evaluation Study. J. Med. Internet Res. 2025;27:e70450. doi: 10.2196/70450.</Citation><ArticleIdList><ArticleId IdType="doi">10.2196/70450</ArticleId><ArticleId IdType="pmc">PMC12238788</ArticleId><ArticleId IdType="pubmed">40554779</ArticleId></ArticleIdList></Reference><Reference><Citation>Huang J., Tan M. The role of ChatGPT in scientific communication: Writing better scientific review articles. Am. J. Cancer Res. 2023;13:1148&#x2013;1154.</Citation><ArticleIdList><ArticleId IdType="pmc">PMC10164801</ArticleId><ArticleId IdType="pubmed">37168339</ArticleId></ArticleIdList></Reference><Reference><Citation>Amano T., Gonz&#xe1;lez-Varo J.P., Sutherland W.J. Languages Are Still a Major Barrier to Global Science. PLoS Biol. 2016;14:e2000933. doi: 10.1371/journal.pbio.2000933.</Citation><ArticleIdList><ArticleId IdType="doi">10.1371/journal.pbio.2000933</ArticleId><ArticleId IdType="pmc">PMC5199034</ArticleId><ArticleId IdType="pubmed">28033326</ArticleId></ArticleIdList></Reference><Reference><Citation>Dergaa I., Chamari K., Zmijewski P., Ben Saad H. From human writing to artificial intelligence generated text: Examining the prospects and potential threats of ChatGPT in academic writing. Biol. Sport. 2023;40:615&#x2013;622. doi: 10.5114/biolsport.2023.125623.</Citation><ArticleIdList><ArticleId IdType="doi">10.5114/biolsport.2023.125623</ArticleId><ArticleId IdType="pmc">PMC10108763</ArticleId><ArticleId IdType="pubmed">37077800</ArticleId></ArticleIdList></Reference><Reference><Citation>Gong E.J., Woo J., Lee J.J., Bang C.S. Role of artificial intelligence in gastric diseases. World J. Gastroenterol. 2025;31:111327. doi: 10.3748/wjg.v31.i37.111327.</Citation><ArticleIdList><ArticleId IdType="doi">10.3748/wjg.v31.i37.111327</ArticleId><ArticleId IdType="pmc">PMC12476687</ArticleId><ArticleId IdType="pubmed">41025012</ArticleId></ArticleIdList></Reference><Reference><Citation>Dwivedi Y.K., Kshetri N., Hughes L., Slade E.L., Jeyaraj A., Kar A.K., Baabdullah A.M., Koohang A., Raghavan V., Ahuja M., et al. &#x201c;So what if ChatGPT wrote it?&#x201d; Multidisciplinary perspectives on opportunities, challenges and implications of generative conversational AI for research, practice and policy. Int. J. Inf. Manag. 2023;71:102642. doi: 10.1016/j.ijinfomgt.2023.102642.</Citation><ArticleIdList><ArticleId IdType="doi">10.1016/j.ijinfomgt.2023.102642</ArticleId></ArticleIdList></Reference><Reference><Citation>Walters W.H., Wilder E.I. Fabrication and errors in the bibliographic citations generated by ChatGPT. Sci. Rep. 2023;13:14045. doi: 10.1038/s41598-023-41032-5.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41598-023-41032-5</ArticleId><ArticleId IdType="pmc">PMC10484980</ArticleId><ArticleId IdType="pubmed">37679503</ArticleId></ArticleIdList></Reference><Reference><Citation>Else H. Abstracts written by ChatGPT fool scientists. Nature. 2023;613:423. doi: 10.1038/d41586-023-00056-7.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/d41586-023-00056-7</ArticleId><ArticleId IdType="pubmed">36635510</ArticleId></ArticleIdList></Reference><Reference><Citation>Salvagno M., Taccone F.S., Gerli A.G. Can artificial intelligence help for scientific writing? Crit. Care. 2023;27:75. doi: 10.1186/s13054-023-04380-2.</Citation><ArticleIdList><ArticleId IdType="doi">10.1186/s13054-023-04380-2</ArticleId><ArticleId IdType="pmc">PMC9960412</ArticleId><ArticleId IdType="pubmed">36841840</ArticleId></ArticleIdList></Reference><Reference><Citation>Patel S.B., Lam K. ChatGPT: The future of discharge summaries? Lancet Digit. Health. 2023;5:e107&#x2013;e108. doi: 10.1016/S2589-7500(23)00021-3.</Citation><ArticleIdList><ArticleId IdType="doi">10.1016/S2589-7500(23)00021-3</ArticleId><ArticleId IdType="pubmed">36754724</ArticleId></ArticleIdList></Reference><Reference><Citation>Cascella M., Montomoli J., Bellini V., Bignami E. Evaluating the Feasibility of ChatGPT in Healthcare: An Analysis of Multiple Clinical and Research Scenarios. J. Med. Syst. 2023;47:33. doi: 10.1007/s10916-023-01925-4.</Citation><ArticleIdList><ArticleId IdType="doi">10.1007/s10916-023-01925-4</ArticleId><ArticleId IdType="pmc">PMC9985086</ArticleId><ArticleId IdType="pubmed">36869927</ArticleId></ArticleIdList></Reference><Reference><Citation>Madaan A., Tandon N., Gupta P., Hallinan S., Gao L., Wiegreffe S., Alon U., Dziri N., Prabhumoye S., Yang Y., et al. Self-refine: Iterative refinement with self-feedback. arXiv. 2023 doi: 10.48550/arXiv.2303.17651.2303.17651</Citation><ArticleIdList><ArticleId IdType="doi">10.48550/arXiv.2303.17651</ArticleId></ArticleIdList></Reference><Reference><Citation>Sun S., Yuan R., Cao Z., Li W., Liu P. Prompt chaining or stepwise prompt? Refinement in text summarization. arXiv. 2024 doi: 10.48550/arXiv.2406.00507.2406.00507</Citation><ArticleIdList><ArticleId IdType="doi">10.48550/arXiv.2406.00507</ArticleId></ArticleIdList></Reference><Reference><Citation>Lee P., Bubeck S., Petro J. Benefits, Limits, and Risks of GPT-4 as an AI Chatbot for Medicine. N. Engl. J. Med. 2023;388:1233&#x2013;1239. doi: 10.1056/NEJMsr2214184.</Citation><ArticleIdList><ArticleId IdType="doi">10.1056/NEJMsr2214184</ArticleId><ArticleId IdType="pubmed">36988602</ArticleId></ArticleIdList></Reference><Reference><Citation>Ruta M.R., Gaidici T., Irwin C., Lifshitz J. ChatGPT for Univariate Statistics: Validation of AI-Assisted Data Analysis in Healthcare Research. J. Med. Internet Res. 2025;27:e63550. doi: 10.2196/63550.</Citation><ArticleIdList><ArticleId IdType="doi">10.2196/63550</ArticleId><ArticleId IdType="pmc">PMC11845875</ArticleId><ArticleId IdType="pubmed">39919289</ArticleId></ArticleIdList></Reference><Reference><Citation>Huang Y., Wu R., He J., Xiang Y. Evaluating ChatGPT-4.0&#x2019;s data analytic proficiency in epidemiological studies: A comparative analysis with SAS, SPSS, and R. J. Glob. Health. 2024;14:04070. doi: 10.7189/jogh.14.04070.</Citation><ArticleIdList><ArticleId IdType="doi">10.7189/jogh.14.04070</ArticleId><ArticleId IdType="pmc">PMC10978058</ArticleId><ArticleId IdType="pubmed">38547497</ArticleId></ArticleIdList></Reference><Reference><Citation>Dobler D., Binder H., Boulesteix A.L., Igelmann J., K&#xf6;hler D., Mansmann U., Pauly M., Scherag A., Schmid M., Al Tawil A., et al. ChatGPT as a Tool for Biostatisticians: A Tutorial on Applications, Opportunities, and Limitations. Stat. Med. 2025;44:e70263. doi: 10.1002/sim.70263.</Citation><ArticleIdList><ArticleId IdType="doi">10.1002/sim.70263</ArticleId><ArticleId IdType="pmc">PMC12548020</ArticleId><ArticleId IdType="pubmed">41128019</ArticleId></ArticleIdList></Reference><Reference><Citation>Shahrul A.I., Syed Mohamed A.M.F. A Comparative Evaluation of Statistical Product and Service Solutions (SPSS) and ChatGPT-4 in Statistical Analyses. Cureus. 2024;16:e72581. doi: 10.7759/cureus.72581.</Citation><ArticleIdList><ArticleId IdType="doi">10.7759/cureus.72581</ArticleId><ArticleId IdType="pmc">PMC11602406</ArticleId><ArticleId IdType="pubmed">39610603</ArticleId></ArticleIdList></Reference><Reference><Citation>Evans R., Pozzi A. Using CHATGPT to develop the statistical analysis plan for a randomized controlled trial: A case report. Research Square. 2023 doi: 10.1055/s-0044-1791288.</Citation><ArticleIdList><ArticleId IdType="doi">10.1055/s-0044-1791288</ArticleId></ArticleIdList></Reference><Reference><Citation>Lee J.H., Shin J. How to Optimize Prompting for Large Language Models in Clinical Research. Korean J. Radiol. 2024;25:869&#x2013;873. doi: 10.3348/kjr.2024.0695.</Citation><ArticleIdList><ArticleId IdType="doi">10.3348/kjr.2024.0695</ArticleId><ArticleId IdType="pmc">PMC11444847</ArticleId><ArticleId IdType="pubmed">39344543</ArticleId></ArticleIdList></Reference><Reference><Citation>Suh C.H., Yi J., Shim W.H., Heo H. Insufficient Transparency in Stochasticity Reporting in Large Language Model Studies for Medical Applications in Leading Medical Journals. Korean J. Radiol. 2024;25:1029&#x2013;1031. doi: 10.3348/kjr.2024.0788.</Citation><ArticleIdList><ArticleId IdType="doi">10.3348/kjr.2024.0788</ArticleId><ArticleId IdType="pmc">PMC11524687</ArticleId><ArticleId IdType="pubmed">39473094</ArticleId></ArticleIdList></Reference><Reference><Citation>Ordak M. ChatGPT&#x2019;s Skills in Statistical Analysis Using the Example of Allergology: Do We Have Reason for Concern? Healthcare. 2023;11:2554. doi: 10.3390/healthcare11182554.</Citation><ArticleIdList><ArticleId IdType="doi">10.3390/healthcare11182554</ArticleId><ArticleId IdType="pmc">PMC10530997</ArticleId><ArticleId IdType="pubmed">37761751</ArticleId></ArticleIdList></Reference><Reference><Citation>Liu X., Wu Z., Wu X., Lu P., Chang K.-W., Feng Y. Are llms capable of data-based statistical and causal reasoning? benchmarking advanced quantitative reasoning with data. arXiv. 2024 doi: 10.48550/arXiv.2402.17644.2402.17644</Citation><ArticleIdList><ArticleId IdType="doi">10.48550/arXiv.2402.17644</ArticleId></ArticleIdList></Reference><Reference><Citation>Van Veen D., Van Uden C., Blankemeier L., Delbrouck J.B., Aali A., Bluethgen C., Pareek A., Polacin M., Reis E.P., Seehofnerov&#xe1; A., et al. Adapted large language models can outperform medical experts in clinical text summarization. Nat. Med. 2024;30:1134&#x2013;1142. doi: 10.1038/s41591-024-02855-5.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41591-024-02855-5</ArticleId><ArticleId IdType="pmc">PMC11479659</ArticleId><ArticleId IdType="pubmed">38413730</ArticleId></ArticleIdList></Reference><Reference><Citation>Yan C., Ong H.H., Grabowska M.E., Krantz M.S., Su W.C., Dickson A.L., Peterson J.F., Feng Q., Roden D.M., Stein C.M., et al. Large language models facilitate the generation of electronic health record phenotyping algorithms. J. Am. Med. Inform. Assoc. 2024;31:1994&#x2013;2001. doi: 10.1093/jamia/ocae072.</Citation><ArticleIdList><ArticleId IdType="doi">10.1093/jamia/ocae072</ArticleId><ArticleId IdType="pmc">PMC11339509</ArticleId><ArticleId IdType="pubmed">38613820</ArticleId></ArticleIdList></Reference><Reference><Citation>Jonnagaddala J., Wong Z.S. Privacy preserving strategies for electronic health records in the era of large language models. npj Digit. Med. 2025;8:34. doi: 10.1038/s41746-025-01429-0.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41746-025-01429-0</ArticleId><ArticleId IdType="pmc">PMC11739470</ArticleId><ArticleId IdType="pubmed">39820020</ArticleId></ArticleIdList></Reference><Reference><Citation>Wiest I.C., Ferber D., Zhu J., van Treeck M., Meyer S.K., Juglan R., Carrero Z.I., Paech D., Kleesiek J., Ebert M.P., et al. Privacy-preserving large language models for structured medical information retrieval. npj Digit. Med. 2024;7:257. doi: 10.1038/s41746-024-01233-2.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41746-024-01233-2</ArticleId><ArticleId IdType="pmc">PMC11415382</ArticleId><ArticleId IdType="pubmed">39304709</ArticleId></ArticleIdList></Reference><Reference><Citation>Kugic A., Schulz S., Kreuzthaler M. Disambiguation of acronyms in clinical narratives with large language models. J. Am. Med. Inform. Assoc. 2024;31:2040&#x2013;2046. doi: 10.1093/jamia/ocae157.</Citation><ArticleIdList><ArticleId IdType="doi">10.1093/jamia/ocae157</ArticleId><ArticleId IdType="pmc">PMC11339513</ArticleId><ArticleId IdType="pubmed">38917444</ArticleId></ArticleIdList></Reference><Reference><Citation>Cui H., Unell A., Chen B., Fries J.A., Alsentzer E., Koyejo S., Shah N.H. TIMER: Temporal instruction modeling and evaluation for longitudinal clinical records. npj Digit. Med. 2025;8:577. doi: 10.1038/s41746-025-01965-9.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41746-025-01965-9</ArticleId><ArticleId IdType="pmc">PMC12475073</ArticleId><ArticleId IdType="pubmed">41006898</ArticleId></ArticleIdList></Reference><Reference><Citation>Jin Q., Wang Z., Floudas C.S., Chen F., Gong C., Bracken-Clarke D., Xue E., Yang Y., Sun J., Lu Z. Matching patients to clinical trials with large language models. Nat. Commun. 2024;15:9074. doi: 10.1038/s41467-024-53081-z.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41467-024-53081-z</ArticleId><ArticleId IdType="pmc">PMC11574183</ArticleId><ArticleId IdType="pubmed">39557832</ArticleId></ArticleIdList></Reference><Reference><Citation>Markey N., El-Mansouri I., Rensonnet G., van Langen C., Meier C. From RAGs to riches: Utilizing large language models to write documents for clinical trials. Clin. Trials. 2025;22:626&#x2013;631. doi: 10.1177/17407745251320806.</Citation><ArticleIdList><ArticleId IdType="doi">10.1177/17407745251320806</ArticleId><ArticleId IdType="pmc">PMC12476469</ArticleId><ArticleId IdType="pubmed">40013826</ArticleId></ArticleIdList></Reference><Reference><Citation>Ali R., Connolly I.D., Tang O.Y., Mirza F.N., Johnston B., Abdulrazeq H.F., Lim R.K., Galamaga P.F., Libby T.J., Sodha N.R., et al. Bridging the literacy gap for surgical consents: An AI-human expert collaborative approach. npj Digit. Med. 2024;7:63. doi: 10.1038/s41746-024-01039-2.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41746-024-01039-2</ArticleId><ArticleId IdType="pmc">PMC10923794</ArticleId><ArticleId IdType="pubmed">38459205</ArticleId></ArticleIdList></Reference><Reference><Citation>Zaghir J., Naguib M., Bjelogrlic M., N&#xe9;v&#xe9;ol A., Tannier X., Lovis C. Prompt Engineering Paradigms for Medical Applications: Scoping Review. J. Med. Internet Res. 2024;26:e60501. doi: 10.2196/60501.</Citation><ArticleIdList><ArticleId IdType="doi">10.2196/60501</ArticleId><ArticleId IdType="pmc">PMC11422740</ArticleId><ArticleId IdType="pubmed">39255030</ArticleId></ArticleIdList></Reference><Reference><Citation>Gong E.J., Bang C.S. Interpretation of Medical Images Using Artificial Intelligence: Current Status and Future Perspectives. Korean J. Gastroenterol. 2023;82:43&#x2013;45. doi: 10.4166/kjg.2023.071.</Citation><ArticleIdList><ArticleId IdType="doi">10.4166/kjg.2023.071</ArticleId></ArticleIdList></Reference><Reference><Citation>Jeon S., Kim H.G. A comparative evaluation of chain-of-thought-based prompt engineering techniques for medical question answering. Comput. Biol. Med. 2025;196:110614. doi: 10.1016/j.compbiomed.2025.110614.</Citation><ArticleIdList><ArticleId IdType="doi">10.1016/j.compbiomed.2025.110614</ArticleId><ArticleId IdType="pubmed">40602316</ArticleId></ArticleIdList></Reference><Reference><Citation>Wei J., Wang X., Schuurmans D., Bosma M., Ichter B., Xia F., Chi E., Le Q., Zhou D. Chain-of-thought prompting elicits reasoning in large language models. Adv. Neural Inf. Process. Syst. 2022;35:24824&#x2013;24837.</Citation></Reference><Reference><Citation>Singhal K., Azizi S., Tu T., Mahdavi S.S., Wei J., Chung H.W., Scales N., Tanwani A., Cole-Lewis H., Pfohl S., et al. Large language models encode clinical knowledge. Nature. 2023;620:172&#x2013;180. doi: 10.1038/s41586-023-06291-2.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41586-023-06291-2</ArticleId><ArticleId IdType="pmc">PMC10396962</ArticleId><ArticleId IdType="pubmed">37438534</ArticleId></ArticleIdList></Reference><Reference><Citation>Park S.H., Suh C.H., Lee J.H., Kahn C.E., Moy L. Minimum Reporting Items for Clear Evaluation of Accuracy Reports of Large Language Models in Healthcare (MI-CLEAR-LLM) Korean J. Radiol. 2024;25:865&#x2013;868. doi: 10.3348/kjr.2024.0843.</Citation><ArticleIdList><ArticleId IdType="doi">10.3348/kjr.2024.0843</ArticleId><ArticleId IdType="pmc">PMC11444851</ArticleId><ArticleId IdType="pubmed">39344542</ArticleId></ArticleIdList></Reference><Reference><Citation>Bang Y., Cahyawijaya S., Lee N., Dai W., Su D., Wilie B., Lovenia H., Ji Z., Yu T., Chung W., et al. A multitask, multilingual, multimodal evaluation of chatgpt on reasoning, hallucination, and interactivity. arXiv. 2023 doi: 10.48550/arXiv.2302.04023.2302.04023</Citation><ArticleIdList><ArticleId IdType="doi">10.48550/arXiv.2302.04023</ArticleId></ArticleIdList></Reference><Reference><Citation>Alkaissi H., McFarlane S.I. Artificial Hallucinations in ChatGPT: Implications in Scientific Writing. Cureus. 2023;15:e35179. doi: 10.7759/cureus.35179.</Citation><ArticleIdList><ArticleId IdType="doi">10.7759/cureus.35179</ArticleId><ArticleId IdType="pmc">PMC9939079</ArticleId><ArticleId IdType="pubmed">36811129</ArticleId></ArticleIdList></Reference><Reference><Citation>Busch F., Hoffmann L., Rueger C., van Dijk E.H., Kader R., Ortiz-Prado E., Makowski M.R., Saba L., Hadamitzky M., Kather J.N., et al. Current applications and challenges in large language models for patient care: A systematic review. Commun. Med. 2025;5:26. doi: 10.1038/s43856-024-00717-2.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s43856-024-00717-2</ArticleId><ArticleId IdType="pmc">PMC11751060</ArticleId><ArticleId IdType="pubmed">39838160</ArticleId></ArticleIdList></Reference><Reference><Citation>Zielinski C., Winker M.A., Aggarwal R., Ferris L.E., Heinemann M., Lape&#xf1;a J.F., Jr., Pai S.A., Ing E., Citrome L., Alam M., et al. Chatbots, generative AI, and scholarly manuscripts: WAME recommendations on chatbots and generative artificial intelligence in relation to scholarly publications. Colomb. Med. 2023;54:e1015868. doi: 10.25100/cm.v54i3.5868.</Citation><ArticleIdList><ArticleId IdType="doi">10.25100/cm.v54i3.5868</ArticleId><ArticleId IdType="pmc">PMC10712422</ArticleId><ArticleId IdType="pubmed">38089825</ArticleId></ArticleIdList></Reference><Reference><Citation>Ganjavi C., Eppler M.B., Pekcan A., Biedermann B., Abreu A., Collins G.S., Gill I.S., Cacciamani G.E. Publishers&#x2019; and journals&#x2019; instructions to authors on use of generative artificial intelligence in academic and scientific publishing: Bibliometric analysis. BMJ. 2024;384:e077192. doi: 10.1136/bmj-2023-077192.</Citation><ArticleIdList><ArticleId IdType="doi">10.1136/bmj-2023-077192</ArticleId><ArticleId IdType="pmc">PMC10828852</ArticleId><ArticleId IdType="pubmed">38296328</ArticleId></ArticleIdList></Reference><Reference><Citation>Hill-Yardin E.L., Hutchinson M.R., Laycock R., Spencer S.J. A Chat(GPT) about the future of scientific publishing. Brain Behav. Immun. 2023;110:152&#x2013;154. doi: 10.1016/j.bbi.2023.02.022.</Citation><ArticleIdList><ArticleId IdType="doi">10.1016/j.bbi.2023.02.022</ArticleId><ArticleId IdType="pubmed">36868432</ArticleId></ArticleIdList></Reference><Reference><Citation>Murdoch B. Privacy and artificial intelligence: Challenges for protecting health information in a new era. BMC Med. Ethics. 2021;22:122. doi: 10.1186/s12910-021-00687-3.</Citation><ArticleIdList><ArticleId IdType="doi">10.1186/s12910-021-00687-3</ArticleId><ArticleId IdType="pmc">PMC8442400</ArticleId><ArticleId IdType="pubmed">34525993</ArticleId></ArticleIdList></Reference><Reference><Citation>Price W.N., 2nd, Cohen I.G. Privacy in the age of medical big data. Nat. Med. 2019;25:37&#x2013;43. doi: 10.1038/s41591-018-0272-7.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41591-018-0272-7</ArticleId><ArticleId IdType="pmc">PMC6376961</ArticleId><ArticleId IdType="pubmed">30617331</ArticleId></ArticleIdList></Reference><Reference><Citation>Kaissis G.A., Makowski M.R., R&#xfc;ckert D., Braren R.F. Secure, privacy-preserving and federated machine learning in medical imaging. Nat. Mach. Intell. 2020;2:305&#x2013;311. doi: 10.1038/s42256-020-0186-1.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s42256-020-0186-1</ArticleId></ArticleIdList></Reference><Reference><Citation>Vayena E., Blasimme A., Cohen I.G. Machine learning in medicine: Addressing ethical challenges. PLoS Med. 2018;15:e1002689. doi: 10.1371/journal.pmed.1002689.</Citation><ArticleIdList><ArticleId IdType="doi">10.1371/journal.pmed.1002689</ArticleId><ArticleId IdType="pmc">PMC6219763</ArticleId><ArticleId IdType="pubmed">30399149</ArticleId></ArticleIdList></Reference><Reference><Citation>Morley J., Machado C.C.V., Burr C., Cowls J., Joshi I., Taddeo M., Floridi L. The ethics of AI in health care: A mapping review. Soc. Sci. Med. 2020;260:113172. doi: 10.1016/j.socscimed.2020.113172.</Citation><ArticleIdList><ArticleId IdType="doi">10.1016/j.socscimed.2020.113172</ArticleId><ArticleId IdType="pubmed">32702587</ArticleId></ArticleIdList></Reference><Reference><Citation>Gao L., Biderman S., Black S., Golding L., Hoppe T., Foster C., Phang J., He H., Thite A., Nabeshima N., et al. The pile: An 800 GB dataset of diverse text for language modeling. arXiv. 20202101.00027</Citation></Reference><Reference><Citation>Baack S. Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency. ACM; New York, NY, USA: 2024. A critical analysis of the largest source for generative ai training data: Common crawl.</Citation><ArticleIdList><ArticleId IdType="doi">10.1145/3630106.3659033</ArticleId></ArticleIdList></Reference><Reference><Citation>Omar M., Sorin V., Agbareia R., Apakama D.U., Soroush A., Sakhuja A., Freeman R., Horowitz C.R., Richardson L.D., Nadkarni G.N., et al. Evaluating and addressing demographic disparities in medical large language models: A systematic review. International journal for equity in health. Int. J. Equity Health. 2025;24:57. doi: 10.1186/s12939-025-02419-0.</Citation><ArticleIdList><ArticleId IdType="doi">10.1186/s12939-025-02419-0</ArticleId><ArticleId IdType="pmc">PMC11866893</ArticleId><ArticleId IdType="pubmed">40011901</ArticleId></ArticleIdList></Reference><Reference><Citation>Omiye J.A., Lester J.C., Spichak S., Rotemberg V., Daneshjou R. Large language models propagate race-based medicine. npj Digit. Med. 2023;6:195. doi: 10.1038/s41746-023-00939-z.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41746-023-00939-z</ArticleId><ArticleId IdType="pmc">PMC10589311</ArticleId><ArticleId IdType="pubmed">37864012</ArticleId></ArticleIdList></Reference><Reference><Citation>Zack T., Lehman E., Suzgun M., Rodriguez J.A., Celi L.A., Gichoya J., Jurafsky D., Szolovits P., Bates D.W., Abdulnour R.-E.E., et al. Assessing the potential of GPT-4 to perpetuate racial and gender biases in health care: A model evaluation study. Lancet Digit. Health. 2024;6:e12&#x2013;e22. doi: 10.1016/S2589-7500(23)00225-X.</Citation><ArticleIdList><ArticleId IdType="doi">10.1016/S2589-7500(23)00225-X</ArticleId><ArticleId IdType="pubmed">38123252</ArticleId></ArticleIdList></Reference><Reference><Citation>Haltaufderheide J., Ranisch R. The ethics of ChatGPT in medicine and healthcare: A systematic review on Large Language Models (LLMs) npj Digit. Med. 2024;7:183. doi: 10.1038/s41746-024-01157-x.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41746-024-01157-x</ArticleId><ArticleId IdType="pmc">PMC11231310</ArticleId><ArticleId IdType="pubmed">38977771</ArticleId></ArticleIdList></Reference><Reference><Citation>Parasuraman R., Manzey D.H. Complacency and bias in human use of automation: An attentional integration. Hum. Factors. 2010;52:381&#x2013;410. doi: 10.1177/0018720810376055.</Citation><ArticleIdList><ArticleId IdType="doi">10.1177/0018720810376055</ArticleId><ArticleId IdType="pubmed">21077562</ArticleId></ArticleIdList></Reference><Reference><Citation>Goddard K., Roudsari A., Wyatt J.C. Automation bias: A systematic review of frequency, effect mediators, and mitigators. J. Am. Med. Inform. Assoc. 2012;19:121&#x2013;127. doi: 10.1136/amiajnl-2011-000089.</Citation><ArticleIdList><ArticleId IdType="doi">10.1136/amiajnl-2011-000089</ArticleId><ArticleId IdType="pmc">PMC3240751</ArticleId><ArticleId IdType="pubmed">21685142</ArticleId></ArticleIdList></Reference><Reference><Citation>Quek S.X.Z., Ho K.Y. Artificial Intelligence in Upper Gastrointestinal Diagnosis. Korean J. Helicobacter Up. Gastrointest. Res. 2025;25:251. doi: 10.7704/kjhugr.2025.0024.</Citation><ArticleIdList><ArticleId IdType="doi">10.7704/kjhugr.2025.0024</ArticleId><ArticleId IdType="pmc">PMC12425672</ArticleId><ArticleId IdType="pubmed">40935625</ArticleId></ArticleIdList></Reference><Reference><Citation>Roser D., Meinikheim M., Muzalyova A., Mendel R., Palm C., Probst A., Nagl S., Scheppach M.W., R&#xf6;mmele C., Schnoy E., et al. Artificial Intelligence-assisted Endoscopy and Examiner Confidence: A Study on Human-Artificial Intelligence Interaction in Barrett&#x2019;s Esophagus (with Video) DEN Open. 2026;6:e70150. doi: 10.1002/deo2.70150.</Citation><ArticleIdList><ArticleId IdType="doi">10.1002/deo2.70150</ArticleId><ArticleId IdType="pmc">PMC12178752</ArticleId><ArticleId IdType="pubmed">40548292</ArticleId></ArticleIdList></Reference><Reference><Citation>Abdulnour R.E., Gin B., Boscardin C.K. Educational Strategies for Clinical Supervision of Artificial Intelligence Use. N. Engl. J. Med. 2025;393:786&#x2013;797. doi: 10.1056/NEJMra2503232.</Citation><ArticleIdList><ArticleId IdType="doi">10.1056/NEJMra2503232</ArticleId><ArticleId IdType="pubmed">40834302</ArticleId></ArticleIdList></Reference><Reference><Citation>Marcus G. Deep learning: A critical appraisal. arXiv. 2018 doi: 10.48550/arXiv.1801.00631.1801.00631</Citation><ArticleIdList><ArticleId IdType="doi">10.48550/arXiv.1801.00631</ArticleId></ArticleIdList></Reference><Reference><Citation>Stadler M., Bannert M., Sailer M. Cognitive ease at a cost: LLMs reduce mental effort but compromise depth in student scientific inquiry. Comput. Hum. Behav. 2024;160:108386. doi: 10.1016/j.chb.2024.108386.</Citation><ArticleIdList><ArticleId IdType="doi">10.1016/j.chb.2024.108386</ArticleId></ArticleIdList></Reference><Reference><Citation>Kosmyna N., Hauptmann E., Yuan Y.T., Situ J., Liao X.-H., Beresnitzky A.V., Braunstein I., Maes P. Your brain on ChatGPT: Accumulation of cognitive debt when using an AI assistant for essay writing task. arXiv. 2025 doi: 10.48550/arXiv.2506.08872.2506.08872</Citation><ArticleIdList><ArticleId IdType="doi">10.48550/arXiv.2506.08872</ArticleId></ArticleIdList></Reference><Reference><Citation>Choudhury A., Chaudhry Z. Large Language Models and User Trust: Consequence of Self-Referential Learning Loop and the Deskilling of Health Care Professionals. J. Med. Internet Res. 2024;26:e56764. doi: 10.2196/56764.</Citation><ArticleIdList><ArticleId IdType="doi">10.2196/56764</ArticleId><ArticleId IdType="pmc">PMC11082730</ArticleId><ArticleId IdType="pubmed">38662419</ArticleId></ArticleIdList></Reference><Reference><Citation>Abdel-Rehim A., Zenil H., Orhobor O., Fisher M., Collins R.J., Bourne E., Fearnley G.W., Tate E., Smith H.X., Soldatova L.N., et al. Scientific hypothesis generation by large language models: Laboratory validation in breast cancer treatment. J. R. Soc. Interface. 2025;22:20240674. doi: 10.1098/rsif.2024.0674.</Citation><ArticleIdList><ArticleId IdType="doi">10.1098/rsif.2024.0674</ArticleId><ArticleId IdType="pmc">PMC12134935</ArticleId><ArticleId IdType="pubmed">40462712</ArticleId></ArticleIdList></Reference><Reference><Citation>Acosta J.N., Falcone G.J., Rajpurkar P., Topol E.J. Multimodal biomedical AI. Nat. Med. 2022;28:1773&#x2013;1784. doi: 10.1038/s41591-022-01981-2.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41591-022-01981-2</ArticleId><ArticleId IdType="pubmed">36109635</ArticleId></ArticleIdList></Reference><Reference><Citation>Lewis P., Perez E., Piktus A., Petroni F., Karpukhin V., Goyal N., K&#xfc;ttler H., Lewis M., Yih W.-T., Rockt&#xe4;schel T., et al. Retrieval-augmented generation for knowledge-intensive nlp tasks. arXiv. 20202005.11401</Citation></Reference><Reference><Citation>Singhal K., Tu T., Gottweis J., Sayres R., Wulczyn E., Amin M., Hou L., Clark K., Pfohl S.R., Cole-Lewis H., et al. Toward expert-level medical question answering with large language models. Nat. Med. 2025;31:943&#x2013;950. doi: 10.1038/s41591-024-03423-7.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41591-024-03423-7</ArticleId><ArticleId IdType="pmc">PMC11922739</ArticleId><ArticleId IdType="pubmed">39779926</ArticleId></ArticleIdList></Reference><Reference><Citation>Ren F., Aliper A., Chen J., Zhao H., Rao S., Kuppe C., Ozerov I.V., Zhang M., Witte K., Kruse C., et al. A small-molecule TNIK inhibitor targets fibrosis in preclinical and clinical models. Nat. Biotechnol. 2025;43:63&#x2013;75. doi: 10.1038/s41587-024-02143-0.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41587-024-02143-0</ArticleId><ArticleId IdType="pmc">PMC11738990</ArticleId><ArticleId IdType="pubmed">38459338</ArticleId></ArticleIdList></Reference><Reference><Citation>Tordjman M., Liu Z., Yuce M., Fauveau V., Mei Y., Hadjadj J., Bolger I., Almansour H., Horst C., Parihar A.S., et al. Comparative benchmarking of the DeepSeek large language model on medical tasks and clinical reasoning. Nat. Med. 2025;31:2550&#x2013;2555. doi: 10.1038/s41591-025-03726-3.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41591-025-03726-3</ArticleId><ArticleId IdType="pubmed">40267969</ArticleId></ArticleIdList></Reference><Reference><Citation>Sandmann S., Hegselmann S., Fujarski M., Bickmann L., Wild B., Eils R., Varghese J. Benchmark evaluation of DeepSeek large language models in clinical decision-making. Nat. Med. 2025;31:2546&#x2013;2549. doi: 10.1038/s41591-025-03727-2.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41591-025-03727-2</ArticleId><ArticleId IdType="pmc">PMC12353792</ArticleId><ArticleId IdType="pubmed">40267970</ArticleId></ArticleIdList></Reference><Reference><Citation>Zhu S., Hu W., Yang Z., Yan J., Zhang F. Qwen-2.5 outperforms other large language models in the Chinese National Nursing Licensing Examination: Retrospective cross-sectional comparative study. JMIR Med. Inform. 2025;13:e63731. doi: 10.2196/63731.</Citation><ArticleIdList><ArticleId IdType="doi">10.2196/63731</ArticleId><ArticleId IdType="pmc">PMC11759905</ArticleId><ArticleId IdType="pubmed">39793017</ArticleId></ArticleIdList></Reference><Reference><Citation>Lin K.H., Kao T.H., Wang L.C., Kuo C.T., Chen P.C., Chu Y.C., Yeh Y.C. Benchmarking large language models GPT-4o, llama 3.1, and qwen 2.5 for cancer genetic variant classification. npj Precis. Oncol. 2025;9:141. doi: 10.1038/s41698-025-00935-4.</Citation><ArticleIdList><ArticleId IdType="doi">10.1038/s41698-025-00935-4</ArticleId><ArticleId IdType="pmc">PMC12078457</ArticleId><ArticleId IdType="pubmed">40369023</ArticleId></ArticleIdList></Reference></ReferenceList></PubmedData></PubmedArticle></PubmedArticleSet>