- 论文:https://arxiv.org/pdf/2409.16497
- 代码:暂未开源
- 机构:Amazon AGI、宾夕法尼亚州立大学
- 领域:Dense Retrieval
- 发表:Accepted at DCAI24 workshop@CIKM2024
研究背景
- 研究问题:这篇文章要解决的问题是如何在零样本情况下通过指令调优预训练的大型语言模型(LLM)来进行无监督文本表示学习,以改进密集检索系统的性能。
- 研究难点:该问题的研究难点包括:缺乏标注数据时如何有效地进行文本表示学习;如何在无监督情况下增强语料库表示;如何在训练和推理过程中保持模型的一致性。
- 相关工作:该问题的研究相关工作有:利用预训练大型编码器(如T5模型)来缓解数据需求;通过合成查询-语料库相关性对来训练密集检索系统;使用预训练的LLM作为少样本查询生成器来构建训练数据。
研究方法
这篇论文提出了一种通过自指令调优预训练编码器-解码器LLM来进行无监督文本表示学习的方法。具体来说,
-
自指令学习:首先,设计两个