AI知识网,一站式人工智能学习平台 | 从入门到精通的 AI 知识库 AI知识网,一站式人工智能学习平台 | 从入门到精通的 AI 知识库
  • 主页
  • AI动态
  • PHP
  • QQ:420220301
    Wechat:w420220301
QQ:420220301
Wechat:w420220301
  • 主页
  • AI动态
  • PHP
首页 AI动态 无需外部数据!AI自问自答实现推理能力进化

无需外部数据!AI自问自答实现推理能力进化

管理员 2025-08-09 16:46:03

摘要:AI通过自问自答就能提升推理能力?!这正是卡内基梅隆大学团队提出的新框架SQLM——一种无需外部数据的自我提问模型。该框架包含提问者(proposer)和解答者(solver)两个角...

AI通过自问自答就能提升推理能力?!


这正是卡内基梅隆大学团队提出的新框架SQLM——一种无需外部数据的自我提问模型。



该框架包含提问者(proposer)和解答者(solver)两个角色,提问者生成与给定主题相关的问题,解答者旨在解决问题。


网友们神评,“简直是带有RL的GAN”。



值得一提的是,此团队中又双叒叕现华人身影~


通过强化学习最大化期望奖励


当前大语言模型的训练很大程度上仍依赖人工整理数据集,堪称费时费力。


为了减轻这一负担,研究人员开发了用于强化学习的无监督奖励函数。然而,这些函数仍然依赖于预先提供的高质量输入提示。


因此,问题的难点从“生成答案”转移到了“生成高质量问题”。


这凸显出当前方法的一个关键不足:


缺乏一种可扩展且自我维持的流程,能够在无人干预的情况下自动生成有意义的问题和答案。




若生成器-验证器差距大(例如编程问题),先由提问者生成测试用例,奖励则基于通过测试的比例。




这种极小极大式的训练框架通过自博弈实现了稳定训练,并使奖励机制能够针对具体问题进行自适应调整。


为了评估模型的不同能力,研究者进行了三部分任务,并使用Qwen2.5-3B-Instruct运行实验。


算术任务


研究人员让提问者生成一个三位数的算数问题,并将其作为解答器的输入。他们按照TinyZero的设置,构建了一组包含4096个三位数乘法问题的测试集。


代数任务


研究者让模型生成最多包含两个变量的线性方程,并在OMEGA基准中的100道线性方程测试题上进行评估。


编程问题


他们让模型生成类似LeetCode中简单题的问题,输入为整数列表,输出为单个整数或另一个列表,并在Codeforces测试集的一个子集上进行评估。



实验结果显示,SQLM将Qwen2.5-3B-Instruct在算术任务上的准确率提高了14%,在代数任务上提高了16%;在编程任务上的准确率提高了7%。


此外,上表还显示出SQLM显著优于格式奖励基线(用于稳定训练和规范输出格式的参考值),表明推理能力的真正提升。


团队介绍



Lili Chen,本科毕业于加州大学伯克利分校,现博士就读于卡内基梅隆大学。



Katerina Fragkiadaki,卡内基梅隆大学机器学习系计算机科学副教授,博士毕业于宾夕法尼亚大,曾在加州大学伯克利分校担任博士后研究员,并于谷歌研究院工作。



Hao Liu,博士毕业于加州大学伯克利分校,曾任谷歌DeepMind研究员,即将出任卡内基梅隆大学机器学习系的助理教授。



Deepak Pathak,Skild AI创始人,本科就读于印度理工学院坎普尔分校,博士毕业于加州大学伯克利分校,曾在Meta担任了一年的研究员,现任卡内基梅隆大学计算机科学学院的助理教授。


参考链接:


[1]https://x.com/iScienceLuvr/status/1953052817012474353


[2]https://arxiv.org/abs/2508.03682


文章来自于微信公众号“量子位”,作者是“时令”。



声明:内容来源公开的各类媒体平台,若收录的内容侵犯了您的权益,请联系邮箱,本站将第一时间处理。

上一篇:哇塞,今天北京被机器人人人人人塞满了!
下一篇:GPT-5,AI的「登月时刻」来了!奥特曼现场发布,三位一体博士级智能体
猜你喜欢
  • 卡内基梅隆大学突破性技术:让3D物体在任意光线下完美重现,就像换个房间换种效果
  • 微软研究院重大突破:用5000道逻辑题训练出会推理的AI,解题能力提升125%!
  • 蚂蚁集团团队颠覆医疗AI训练方式:用医生智慧教AI更懂看病
  • 国务院重磅发布“人工智能+”行动新政:工业全要素智能化加速,三大任务锚定新型工业化
  • 每日数字经济资讯:数字经济领域最新热点资讯汇总(2025年9月5日)
  • 虚拟试衣新突破:NXN Labs研发的"换衣神器"让你秒变时尚博主
  • 人工智能学会了"计划后填空":帝国理工学院和爱丁堡大学联合突破让AI写作效率翻倍
  • 揭秘"CORA":微软与谷歌联手打造的突破性多模态AI模型,让计算机真正"看懂"世界
  • 加州大学洛杉矶分校提出PANINI:让AI像人类一样积累记忆的革命性学习框架
  • 华中科大团队破解AI网页设计痛点:让机器像人类一样"分块思考"生成代码
27 02, 2026
东京理工学院团队革命性突破:让虚拟人像真人一样会聊天互动
Str Tom
站长
Str Tom 网络工作室
663
文章
0
评论
0
获赞
  • 主页
  • AI动态
  • PHP
Powered By AI知识网 © 2025 strtom网络工作室. 公安备案号:冀公网安备13011102001189号 网站备案号:冀ICP备2024070905号-2 网站地图
友情链接: 各类知识收集 PHP接单网 YzmCMS官方网站 YzmCMS交流社区 YzmCMS官方博客