研究圈」共找到 2099 篇相关文章

算法论文8

SFT在帮倒忙?新研究:直接进行强化学习,模型多模态推理上限更高

学界常用「监督微调(SFT)+ 强化学习(RL)」训练大模型。但新研究发现,SFT 会引发「伪推理路径」,阻碍推理进步。相比之下,直接进行 RL 训练,模型多模态推理上限更高,该团队训练的模型还刷新了纪录。

机器之心
新闻资讯7

2025谷歌研究学者计划名单:吴佳俊、Mamba作者Albert Gu、Tri Dao等获奖

本周四,2025年谷歌研究学者计划获奖名单公布。该计划为鼓励与科研人员合作、推动科技进步而设,申请人需为高校教职人员,获奖者最高可获6万美元奖金。本文列出了部分获奖华人学者信息。

机器之心
算法论文8

LLM「拒绝回答」难题有救了!最新研究让AI学会人情世故 | COLM'25

最新研究发现模型规模和通用语言能力与处理敏感内容判断能力无直接关联,开源模型表现不错。通过提出的训练方法,在非推理和推理型模型上缓解过度拒绝问题,提升AI实用性和可靠性。

新智元
新闻资讯7

硅谷AI变天!OpenAI弃微软转投谷歌,LeCun被边缘小扎组队血战复仇

OpenAI抛弃微软,与谷歌达成云服务协议,重塑AI竞争格局。Meta的Llama 4表现不佳,扎克伯格亲自组队50人,斥资150亿收购Scale AI,誓要做出AGI,硅谷AI风云骤变。

新智元
新闻资讯7

顶尖数学家含泪退:熬了多年的博士难题,被AI几周秒杀!

顶尖数学学者Rishikesh Gajjala靠AI攻破博士课题,却宣布退出学术。他认为AI生成证明虽精巧但难验证,“漂亮证明未验证和垃圾无异”。他投身形式化验证领域,而AxiomProver完成“246定理”形式化验证。

新智元
推荐文章7

DeepSeek-R1发布100天后:全面复盘推理大模型复现研究及未来!

推理语言模型(RLMs)发展显著,DeepSeek - R1发布引发广泛影响且未完全开源。MiroMind等总结其复现研究,关注SFT和RLVR方向,介绍数据构建、方法设计、训练过程细节及实验关键发现。

PaperAgent
新闻资讯8

别跟LLM太交心!斯坦福新研究:AI不能完全取代人类心理治疗师

斯坦福大学研究团队测试流行AI模型及商业化AI治疗平台,发现AI治疗师存在根本缺陷与潜在危险,如歧视回应、无法危机干预、谄媚等,但也认可其在心理健康方面的辅助用途。

量子位
新闻资讯8

谢赛宁「踩雷」背后,竟藏着科研更黑真相:Science实锤论文造假+AI滥用!

《Science》揭露科研两大乱象:一是‘论文工厂’形成产业链,编辑、作者、中介相互勾结;二是ChatGPT渗入科研写作,22%计算机论文含AI痕迹。系统性造假与技术滥用,正重塑学术界根基。

新智元
算法论文8

Thinking Machine新研究刷屏!结合RL+微调优势,小模型训练更具性价比了

Thinking Machine新研究提出On - Policy Distillation方法,结合RL与微调优势。该方法让学生模型每步由教师模型指导,用KL散度评估分歧。实验表明其训练小模型性价比高,还能解决AI“灾难性遗忘”问题。

量子位
新闻资讯7

AI辩论能力碾压人类,81.7%概率让你信服!研究登Nature子刊

《自然·人类行为》研究指出,在线辩论中,大语言模型根据对手特征个性化论点时,比人类更具说服力。实验显示,与GPT - 4辩论的参与者有81.7%更高概率认同其观点,应加强对大模型舆论操控的监管。

新智元