训练机制」共找到 2825 篇相关文章

开源动态8

我们对 Coding Agent 的评测,可能搞错了方向

用户对 Agent 不满常因它「做得不好」,不遵循指令和规范。当前主流评测体系以结果为导向,与真实场景错位。MiniMax 开源 OctoCodingBench 评测集,结果显示模型过程规范遵循不足,未来训练需引入过程监督。

Founder Park
算法论文8

人形机器人控制新突破!敏捷稳定两不误,一个策略让人形机器人完成叶问蹲和跳舞|港大&英伟达&清华

港大、NVIDIA和清华联合团队提出AMS统一人形机器人全身控制框架,首次在单一策略实现动态运动跟踪和极限平衡控制。通过异构数据源、混合奖励机制和自适应学习策略,解决数据限制和优化目标冲突问题。

量子位
算法论文8

告别随机性:Thinking Machines Lab如何实现了LLM推理的完全确定性?

文章指出LLM推理非确定性根源并非GPU并发和浮点非结合性,而是批大小变化致核函数非不变性。作者提出实现批不变操作的策略,实验验证有效,还阐述其对训练、系统可靠性等方面的意义。

深度学习自然语言处理
算法论文8

极简RL新范式:一半算力刷新1.5B模型推理SOTA

过去为提升中小参数量模型推理能力,开发者构建复杂RL流水线。JustRL论文提出极简、单阶段、固定超参训练方案,在两主流1.5B模型上刷新SOTA,节省2倍算力,消融实验还揭示部分技巧会致性能退化。

深度学习自然语言处理
开源动态8

Qwen3深夜开源新系列:文本表征模型,3种尺寸可选,超越商业API拿下SOTA

Qwen3深夜上新Embedding系列,专为文本表征等任务设计,在Qwen3基础模型上训练,有0.6B/4B/8B三种尺寸,8B版本在MTEB榜单排第一,性能超商业API,已在多平台开源。

量子位
算法论文8

长程任务飙升98%,斯坦福Skill原生LLM来了

普林斯顿、CMU、斯坦福、牛津等提出Skill-Native大模型,提出Skill Entropy度量技能切换难度,搭建Skill²-Bench评测,还将熵用作训练信号提出Skill-Entropy RL,提升多模型准确率,且技能熵可复用。

PaperAgent
产品应用8

QClaw V2 升级:微信里直接用的龙虾,真正走入你生活和工作的个人助理

3月8日QClaw发布后文章爆火,近期产品迭代快。QClaw V2引入Multi - Agent机制,可创建多角色AI助手并行工作,还能连接主流办公工具,集成龙虾管家保障安全,实测功能强大,优势明显。

特工宇宙
开源动态8

开源屠刀!400美元炼成「代码副脑」,硅谷天价模型成废铁

AI2开源Open Coding Agents,以最低数百美元算力成本,能训练贴合私有代码库的专属编程智能体。SERA-32B表现惊艳,其软验证生成技术降低成本,新代码易部署且兼容Claude Code。

新智元
开源动态8

谷歌Gemma 4全系开源:3.8亿激活超越20倍体量模型,手机秒变AI工作站

谷歌发布Gemma 4全系列开源模型,有4个尺寸。它在硬件适配、注意力机制等方面革新,能在手机等设备运行,在测试中成绩出色,还获多平台支持,谷歌发起挑战赛鼓励开发者。

AIGC开放社区
新闻资讯8

又一华为天才少年入局具身创业!用视频生成数据训家用机器人,首个模型登顶具身基模榜单

又一华为天才少年周凯文加入具身创企诺因智能。该公司成立不到一年,专注ToC家用具身智能机器人,用视频生成数据训练模型,其KnowinBrain模型登顶具身基模榜单,团队人才密度高。

量子位