
文章總結與翻譯一、文章主要內容該研究聚焦科研人員學術興趣畫像更新滯后的問題,提出并評估了兩種基于大型語言模型(LLMs)的自動化、可擴展生成方法,以解決傳統人工維護學術畫像耗時且易過時的痛點,具體內容如下:研究背景:現有學術平臺(如Google Scholar、ResearchGate等)的科研人員畫像常存在信息過時、不準確或不完整的問題,Web抓取等傳統構建方式存在局限,阻礙了基于最新研究方向的人才識別與合作搭建,而此前自動化方法僅能提取MeSH術語生成詞云,無法生成流暢的敘事性總結。數據收集:收集了哥倫比亞大學歐文醫學中心(CUIMC)595名教職人員在PubMed上的出版物標題、MeSH術語和摘要,其中167人擁有人工撰寫的在線研究畫像,且篩選時僅納入過去十年內、研究者為前三位作者或資深作者(體現主要貢獻)的出版物,并通過機構隸屬關系解決同名研究者的出版物歧義問題。模型構建:采用兩種LLM(GPT-4o-mini)生成學術興趣畫像的策略。一是基于MeSH術語的生成方法,將關鍵詞分為方法學和健康領域兩類,分別讓模型生成總結后拼接;二是基于摘要的生成方法,采用“分而治之”策略,先通過潛在狄利克雷分配(LDA)將出版物按主題分組,濃縮每組摘要后再進行最終總結,以應對LLM輸入token限制。評估方式:從機器評估和人工評估兩方面展開。機器評估使用ROUGE-L、BLEU、METEOR等詞匯相似度指標,BERTScore語義相似度指標,TF