新能安」共找到 7771 篇相关文章

算法论文8

攻克AI过度思考难题!美团研究让通过“可验证”过程奖励激活LRM的高效推理

美团等机构研究团队针对LRM“过度思考”问题,提出可验证的过程奖励机制(VSRM)。它结合可验证奖励与步骤级奖励,为推理步骤分配奖励信号。实验显示其降低输出长度并保持性

量子位
算法论文8

奖励模型革命!SWIFT不读文本读“心声”,打造又快又强又省钱的AI裁判

传统Best-of-N方法中的奖励模型成本高、速度慢,限制技术普及。上海交通大学等校研究者提出轻量级技术SWIFT,直接监听模型内部隐藏状态判断信心,效率、准确率等表现出色,为AI发展提供范式。

AINLPer
新闻资讯7

GPT5.5代号“蒜你狠”曝光!OpenAI拉响红色警报加班赶制模型,最快下周就发

面对谷歌攻势,OpenAI奥特曼拉响“红色警报”,集中资源让ChatGPT赶上Gemini 3 Pro。两款模型曝光,一款下周发布,代号Garlic的明年初或发。ChatGPT流量降,OpenAI财务压力大,Garlic否助其破局受关注。

量子位
算法论文8

真实联网搜索Agent,7B媲美满血R1,华为盘古DeepDiver给出开域信息获取解法

华为诺亚方舟实验室提出 Pangu DeepDiver 模型,实现 LLM 搜索引擎自主交互范式。它用真实互联网数据训练,在 WebPuzzle 等基准测试中,7B 的 DeepDiver 媲美 671B DeepSeek - R1,展现强大信息获取与泛化力。

机器之心
产品应用7

卓开发被Vibe Coding接管了?谷歌把搓App门槛彻底打下来,一周搓出25万个

谷歌近期状况不佳,不过 Google AI Studio 上线免费生成原生 Android App 功挽回颜面。上线一周多创建超 25 万个 App,99% 以上用户此前未做过卓开发,无需代码就开发,还支持 Remix。实测显示效果不错。

机器之心
产品应用7

实测国内首个对话式AI音乐创作Agent:聊个天就谱曲填词混剪生成MV

实测国内首个对话式AI音乐创作Agent Tunee,玩法像Suno+ChatGPT结合体。它操作简约功全,反复修改创作,还具备多模态内容处理力,虽有小瑕疵,但体现国产AIGC应用发展趋势。

量子位
算法论文8

揭秘LLM“思考”之谜:推理即“梯度下降”,元学习框架解构训练过程,还给优化提供思路

上海AI Lab团队提出RaML框架,从梯度下降和元学习角度揭示LLM“思考”机制。通过实证验证推理轨迹作为参数更的合理性,还对比不同训练策略,指出RaML为优化LLM性提供思路。

量子位
开源动态8

「世界理解」维度看AI视频生成:Veo3和Sora2水平如何?基准来了

近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大学等团队提出评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。

量子位
新闻资讯8

Anthropic 深夜祭出 Claude Sonnet 4.5,自主连续工作 30 小时!CEO:它更像你的同事

昨夜凌晨,Anthropic 推出一代模型 Claude Sonnet 4.5,官方称其是世界上最好的编码模型等。它自主连续工作 30 小时,还同步推出多项产品功及 Claude Agent SDK 开发工具包。

AI前线
产品应用8

阿里电影级视频模型万相2.6系列上线,功比Sora2还全,人人都当导演

12月16日,阿里发布通义万相2.6系列模型,5款模型同时上线,覆盖图像到视频多环节。它是国内首个支持角色扮演的视频模型,功比Sora2全,已上线阿里云百炼和万相官网。

AI前线