跳到正文

Jingxi Qiu

我研究大语言模型的可靠性:如何验证检索到的证据是否真的支持答案,如何识别证据不足,以及如何让检索增强生成"有选择地相信"而不是照单全收。近期工作(SURE-RAG、NEI-CAP)表明常用的事实核查基准存在数据构造伪影,会虚高"证据不足"类别的表现,并提出了审计与缓解的方法。

此前我在乔治城大学完成数据科学与分析硕士学位,期间基于大规模纵向病历构建离线强化学习流水线,并分析了逾 12.5 万名患者在 CAR-T 治疗可及性上的差异。我在意的是置信度值得信赖的模型——无论是在语言里还是在医学里。

邮箱 / 简历 / Google Scholar / GitHub

代表论文全部论文 →

近期文章全部文章 →