无需外部数据！AI自问自答实现推理能力进化

SQLM框架：AI自问自答提升推理能力

原创于 2025-08-11 13:29:55 发布 · 716 阅读

·

21

·

CC 4.0 BY-SA版权

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

文章标签：

#人工智能 #机器学习 #语言模型

卡内基梅隆大学团队提出新框架SQLM——一种无需外部数据的自我提问模型。

AI通过自问自答就能提升推理能力？！

这正是卡内基梅隆大学团队提出的新框架SQLM——一种无需外部数据的自我提问模型。

该框架包含提问者（proposer）和解答者（solver）两个角色，提问者生成与给定主题相关的问题，解答者旨在解决问题。

网友们神评，“简直是带有RL的GAN”。

值得一提的是，此团队中又双叒叕现华人身影～

通过强化学习最大化期望奖励

当前大语言模型的训练很大程度上仍依赖人工整理数据集，堪称费时费力。

为了减轻这一负担，研究人员开发了用于强化学习的无监督奖励函数。然而，这些函数仍然依赖于预先提供的高质量输入提示。

因此，问题的难点从“生成答案”转移到了“生成高质量问题”。

这凸显出当前方法的一个关键不足：

缺乏一种可扩展且自我维持的流程，能够在无人干预的情况下自动生成有意义的问题和答案。

为此，研究者提出了SQLM框架，一种非对称的自我博弈框架，其中提问者

，解答者

回答该问题，两者均通过强化学习进行训练，以最大化期望奖励。

其中，提问者生成问题会对解答者形成条件影响，而解答者的表现又反过来为提问者提供奖励，从而不断优化提问者。

由于缺乏真实答案，研究者设计了基于“生成者–验证者差距”的自监督奖励函数。

若生成器-验证器差距小（例如算数问题），则采用多数投票作为代理奖励。

若生成器-验证器差距大（例如编程问题），先由提问者生成测试用例，奖励则基于通过测试的比例。

这种极小极大式的训练框架通过自博弈实现了稳定训练，并使奖励机制能够针对具体问题进行自适应调整。

为了评估模型的不同能力，研究者进行了三部分任务，并使用Qwen2.5-3B-Instruct运行实验。

算术任务

研究人员让提问者生成一个三位数的算数问题，并将其作为解答器的输入。他们按照TinyZero的设置，构建了一组包含4096个三位数乘法问题的测试集。

代数任务

研究者让模型生成最多包含两个变量的线性方程，并在OMEGA基准中的100道线性方程测试题上进行评估。

编程问题

他们让模型生成类似LeetCode中简单题的问题，输入为整数列表，输出为单个整数或另一个列表，并在Codeforces测试集的一个子集上进行评估。

实验结果显示，SQLM将Qwen2.5-3B-Instruct在算术任务上的准确率提高了14%，在代数任务上提高了16%；在编程任务上的准确率提高了7%。

此外，上表还显示出SQLM显著优于格式奖励基线（用于稳定训练和规范输出格式的参考值），表明推理能力的真正提升。

团队介绍

Lili Chen，本科毕业于加州大学伯克利分校，现博士就读于卡内基梅隆大学。

Katerina Fragkiadaki，卡内基梅隆大学机器学习系计算机科学副教授，博士毕业于宾夕法尼亚大，曾在加州大学伯克利分校担任博士后研究员，并于谷歌研究院工作。

Hao Liu，博士毕业于加州大学伯克利分校，曾任谷歌DeepMind研究员，即将出任卡内基梅隆大学机器学习系的助理教授。

Deepak Pathak，Skild AI创始人，本科就读于印度理工学院坎普尔分校，博士毕业于加州大学伯克利分校，曾在Meta担任了一年的研究员，现任卡内基梅隆大学计算机科学学院的助理教授。

AI大模型学习福利

作为一名热心肠的互联网老兵，我决定把宝贵的AI知识分享给大家。至于能学习到多少就看你的学习毅力和能力了。我已将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

一、全套AGI大模型学习路线

AI大模型时代的学习之旅：从基础到前沿，掌握人工智能的核心技能！

因篇幅有限，仅展示部分资料，需要点击文章最下方名片即可前往获取

二、640套AI大模型报告合集

这套包含640份报告的合集，涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师，还是对AI大模型感兴趣的爱好者，这套报告合集都将为您提供宝贵的信息和启示。

因篇幅有限，仅展示部分资料，需要点击文章最下方名片即可前往获

三、AI大模型经典PDF籍

随着人工智能技术的飞速发展，AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型，如GPT-3、BERT、XLNet等，以其强大的语言理解和生成能力，正在改变我们对人工智能的认识。那以下这些PDF籍就是非常不错的学习资源。

因篇幅有限，仅展示部分资料，需要点击文章最下方名片即可前往获

四、AI大模型商业化落地方案

因篇幅有限，仅展示部分资料，需要点击文章最下方名片即可前往获

作为普通人，入局大模型时代需要持续学习和实践，不断提高自己的技能和认知水平，同时也需要有责任感和伦理意识，为人工智能的健康发展贡献力量

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。