Assessing Temporal Information and Reasoning in Large Language Models

828 篇文章

已下架不支持订阅

本文分析了大型语言模型(LLM)在处理时间信息和推理上的局限性,通过TempUN数据集揭示了这些模型的知识缺口。尽管尝试了不同的微调方法,但性能提升不明显。研究提出了六种度量标准,并指出当前LLM在涉及时间的数字信息处理上存在问题。未来工作将扩大数据集以增强模型的时间推理能力。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

本文是LLM系列文章,针对《Remember This Event That Year? Assessing Temporal Information and Reasoning in Large Language Models》的翻译。

还记得当年的这件事吗?大型语言模型中的时间信息评估与推理

摘要

大型语言模型(LLM)正变得越来越普遍,但它们推理和保留时间信息的能力仍然有限。这阻碍了它们在现实世界场景中的应用,在现实世界中,理解事件的顺序性质至关重要。本文在一个新的大规模时间数据集TempUN上对最先进的模型进行了实验,以揭示时间保持和推理能力的显著局限性。有趣的是,闭源模型更频繁地表明知识差距,这可能表明在不确定性意识和错误反应之间存在权衡。此外,探索各种微调方法并没有带来重大的性能改进。相关联的数据集和代码可在以下URL中获得。

1 引言

2 相关工作

3 TempUN数据集

4 实验

5 结果

6 结论和未来方向

在这项工作中,我们发现LLM在理解和处理时间信息和推理能力方面存在不足。为了解决这一差距,

已下架不支持订阅

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值