V3.1模型」共找到 9068 篇相关文章

算法论文8

1.5B推理模型新SOTA,RL训练新解法打破「简单题过拟合、难题学不动」的魔咒

QuestA通过在训练中注入解题提示,实现两项成果:在1.5B模型上实现Pass@1的SOTA性能,还提升了Pass@k性能。它解决了RL训练中简单与困难任务的权衡问题,为开发强推理模型打开大门。

机器之心
产品应用8

vivo发布端侧多模态模型,只有3B可理解GUI界面,20项评测表现亮眼

vivo AI Lab发布端侧多模态模型BlueLM - 2.5 - 3B,融合文本与图文能力,支持长短思考模式切换。它在20余项评测中表现出色,参数量小,训练和推理成本低,有精巧结构、高效策略,还有高质量数据和高性能平台支撑。

量子位
开源动态8

性能逼近闭源最强,通义实验室开源Mobile-Agent-v3刷新10项GUI基准SOTA

通义实验室开源 Mobile-Agent-v3,覆盖多平台,7B 超同类开源,32B 挑战闭源强手。它有基于云环境的全链路开源方案、全栈 GUI 能力构建和可扩展环境强化学习体系,降低部署开销。

机器之心
开源动态8

补齐OpenClaw进化拼图!AReaL v1.0开源,智能体强化学习「一键接入」

2026 年 Agent 仍是热门赛道,OpenClaw 热度持续。但 Agent 强化学习训练缺乏成熟体系。蚂蚁和清华联合打造的 AReaL v1.0 开源,实现 Agent 一键接入 RL 训练,还革新了训练引擎,降低开发门槛。

机器之心
算法论文8

首个多轮LLM Router问世, Router-R1可让大模型学会「思考–路由–聚合」

在大语言模型种类爆炸的时代,如何智能分配任务成新挑战。伊利诺伊大学香槟分校团队发布 Router - R1,让 LLM 学会‘思考–路由–聚合’,用强化学习平衡性能与成本,在七大基准测试表现出色。

机器之心
新闻资讯7

刚刚,马斯克Grok4干翻谷歌Gemini!o3杀入首届大模型对抗赛决战

首届大模型国际象棋对抗赛第二轮结果出炉,o3以4比0击败o4 - mini,Grok 4在加赛中战胜Gemini 2.5 Pro,二者挺进决赛。8月7日将迎来终局之战,国际象棋冠军将解说。

新智元
算法论文8

首个3D动作游戏专用VLA模型,打黑神话&只狼超越人类玩家 | ICCV 2025

淘天集团未来生活实验室团队提出首个3D动作游戏专用VLA模型CombatVLA,已被ICCV 2025接收。它能处理视觉输入输出动作指令,在战斗理解准确率和执行速度上表现优异,还构建了评测基准等。

量子位
产品应用8

这一次,谷歌Veo 3.1教Sora做视频!角色0变形,4K竖屏直接满分

谷歌Veo 3.1迎来重磅升级,优化移动端体验,上传素材图片就能创作有趣视频。亮点包括素材生视频一致性强、支持原生竖屏输出、有业界领先的1080p和4K超分辨率,现已可在多平台体验。

新智元
开源动态8

腾讯混元世界模型HY-World 1.5开源,24 FPS的实时交互世界建模

腾讯混元世界模型HY - World 1.5开源,实现24 FPS实时交互世界生成。它采用双重动作表征等技术,解决了长程生成问题,还通过强化学习等优化,在多方面表现出色,为具身智能场景模拟奠基。

AIGC开放社区
开源动态8

OpenClaw 能“边用边训”了:智能体强化学习训练框架 AReaL v1.0 稳定版发布

3月4日,蚂蚁集团联合清华发布开源强化学习训练框架AReaL v1.0稳定版,主打‘Agent一键接入RL训练’。它解决现有智能体框架接入训练成本高、缺乏持续进化能力的问题,还推出原生训练引擎Archon,集成AI辅助开发体系。

InfoQ