模型训推」共找到 8000 篇相关文章

算法论文8

像开发软件一样造世界,Agent2World来了,把世界模型做成可运行的符号环境

为让模型真正“能行动”,需可执行、可验证的符号世界模型,但现有自动生成路线有困局。研究团队提出 Agent2World,经实验验证有显著效果,能稳定产出高质量符号世界模型,开辟 AI 理解现实环境新可能。

机器之心
产品应用7

突袭Cursor,Windsurf抢发自研大模型!性能比肩Claude 3.5、但成本更低,网友好评:响应快、不废话

当地时间5月16日,Windsurf出首个AI软件工程模型家族SWE - 1。此系列含三款模型,性能比肩Claude 3.5且成本更低。开发者试用评价不错,但也指出存在幻觉问题。Windsurf旨在提升软件开发速度,后续将持续投入。

InfoQ
开源动态8

OpenAI去年挖的坑填上了!奖励模型首现Scaling Law,1.8B给70B巨兽上了一课

全新奖励模型「POLAR」采用对比学习范式,摆脱对海量人工标注依赖,有强大Scaling潜力。它衡量练与目标策略「距离」作奖励信号,用自动化合成数据预练,小模型能超越大数十倍规模对手。

新智元
开源动态8

模型结构化理优势难复制到垂直领域!最新法律AI评估标准来了,抱抱脸评测集趋势第一

多个机构研究人员联合发布全新多语言法律理基准数据集LEXam,它含4886道题,每道长篇题有答案和理路径。研究显示现有大模型应对法律理难,LEXam引入评估新模式,还对不同模型做了测试。

量子位
产品应用8

马斯克挖不动的清华学霸,一年造出 “反内卷 AI”!0.027B 参数硬刚思维链模型理完爆 o3-mini-high

新加坡 Sapient Intelligence 出小型模型 HRM,参数仅 2700 万却能解决复杂理难题,其不依赖“思维链”,借鉴人类大脑工作方式。该模型准确率超先进思维链模型理能力强,具经济性,可提升任务效率。

InfoQ
开源动态8

4B小模型数学理首超Claude 4,700步RL练逼近235B性能 | 港大&字节Seed&复旦

香港大学NLP团队联合字节跳动Seed、复旦大学发布Polaris强化学习练配方,让4B模型数学理能力超商业大模型,且Polaris-4B可在消费级显卡部署,相关内容已全部开源。

量子位
算法论文8

英伟达揭示RL Scaling魔力!练步数翻倍=理能力质变,小模型突破理极限

学界对强化学习能否让模型学会新理技能争论已久,过去研究多悲观。英伟达研究指出,问题源于任务在基础模型练数据中过度呈现及练步数不足。其ProRL框架提升练步数,释放小模型潜力,还构建技术组合拳。

机器之心
算法论文8

Lumina-mGPT 2.0:自回归模型华丽复兴,媲美顶尖扩散模型

上海人工智能实验室等团队提出Lumina - mGPT 2.0自回归模型,统一多种图像任务。它采用独立练架构、统一多任务处理框架和高效理策略,实验表现优异,后续将优化采样时间并扩展至多模态理解。

机器之心
开源动态8

AI能帮忙厨房看火了!面壁智能开源全模态模型MiniCPM-o4.5,边看边听还能主动抢答

面壁智能开源全模态模型MiniCPM-o4.5,能边看边听还主动抢答。它引入全双工多模态实时流机制,在多方向达全模态模型领先水平。该模型是端侧原生,将与开发板配套,助力端侧智能硬件开发。

量子位
新闻资讯7

上下文窗口限制被打破:Subquadratic出了一个1200万Token的窗口

2026 年前沿模型宣传至少 100 万 Token 上下文窗口,但利用不佳。Subquadratic 出能处理 1200 万 Token 窗口的模型,称可绕过问题,还将 5000 万窗口模型,其 SSA 架构有优势,基准测试成绩佳。

InfoQ