人在回路」共找到 8730 篇相关文章

开源动态7

致敬Kimi K2:基于slime的全流程INT4量化感知RL训练

受Kimi K2团队启发,SGLang RL团队落地INT4量化感知训练流程方案,强化学习多方面取得进展,还slime框架复现全流程方案,实现媲美BF16精度,提高Rollout效率,为社区提供开源参考。

机器之心
算法论文8

DeepSeek-GRPO重要性权重设计错误?详解Qwen3新强化学习算法GSPO

论文指出GRPO大语言模型训练中不稳定,因其重要性权重设计错误易引入高方差噪声。为此提出GSPO算法,从序列维度计算梯度,解决了MoE模型RL训练的稳定性问题,Qwen3上效率更高。

深度学习自然语言处理
产品应用8

腾讯混元Hy3发布:Agent能力和产品体验跃升

7月6日腾讯混元Hy3发布,智能水平强于同尺寸模型,比肩大尺寸旗舰模型,定价降低。它已接入多个业务,API上线腾讯云TokenHub。多领域表现出色,性价比高,采用开源协议,将多平台上线。

腾讯技术工程
算法论文8

加速近5倍!北大与字节团队提出BranchGRPO,用「树形分叉 + 剪枝」重塑扩散模型对齐

北京大学与字节团队提出 BranchGRPO 新型树形强化学习方法,通过扩散反演中引入分叉与剪枝,解决扩散/流匹配模型类偏好对齐难题。该方法图像与视频生成任务中表现优异,迭代时间最高近 5 倍加速。

机器之心
新闻资讯7

连OpenAI都偷偷重仓!大模型的下一站,是「入侵」类大脑

AI巨头入局使脑机接口升温,格式塔科技获1.5亿融资刷新中国纪录。全球超声赛道投资热,OpenAI等参与。超声波路径优势多,格式塔聚焦医疗,产品有望落地,AI融合是关键,未来脑机接口或成基础设施。

新智元
产品应用8

测 Demo,我已经用MiniMax M2.1跑通了整个产品开发流程

作者黄叔用自研产品「降噪」测试 MiniMax M2.1,从 Skills 优化、页面样式、沉浸式交互、智能搜索四个维度检验实战能力。结果显示 M2.1 优势明显,虽有不足,但已能满足多数日常开发任务。

AI产品黄叔
新闻资讯8

30团队震撼英伟达!Jim Fan自曝三个教训,重押世界模型

英伟达Jim Fan带队创立GEAR实验室,30团队产出惊,涵盖机器学习完整技术栈。团队有GR00T基础模型等成果,Jim Fan还分享三个教训,重注视频世界模型,提出仿真世界三阶段,指出物理AI未来是新基础设施。

新智元
算法论文8

换个地面/身体,机器策略就失灵?让扩散策略读懂「动力学」| ICML'26

扩散策略成机器控制热门路线,但真实世界动力学多变,策略易失灵。UC Berkeley等联合提出DADP,训练统一策略,零样本跨域控制任务表现强,尤其OOD场景优势明显,还给出工程补充结果。

新智元
新闻资讯7

「硬创 Conclave」邀请函丨15闭门局,聊透消费级家庭机器的真问题

雷峰网硬创邦与山行资本联合发起消费级家庭机器闭门会,探讨刚需真伪、端侧算力等真问题。活动遵循不直播等原则,2026年6月25日举办,限15,需审核报名。

AI科技评论
推荐文章7

OpenClaw 闭门局:和 30 位创业者一起聊聊,真正值得关注的 Agent 生态位哪?

OpenClaw带火了Agent,带来整个Agent生态重建机会。第四期AI产品市集Meetup上,30多位创业者探讨创业机会,涉及Token消耗、支付、硬件、记忆等方面,还讨论了创业策略。

Founder Park