策略判别学习」共找到 2107 篇相关文章

新闻资讯8

半年3轮10亿,他们都投了这家已经把机器人卖到500个家庭的公司

未来不远机器人半年获3轮10亿融资,字节跳动等入局。其全产业链闭环强大,展会表现优,已进入500多家庭。靠全栈自研、贴合需求等策略,在赛道脱颖而出,认为家用机器人应重真实落地。

量子位
算法论文8

喂给AI的Skill正让它变笨!清华团队发现大模型经验复用的黄金法则

清华大学与EvoMap团队研究发现,给大模型提供详尽纠错Skill会使基准测试通过率下跌,而精简控制指令可提升性能。他们提出将程序化Skill转化为策略基因,经实验证实其更适合驱动智能体测试时演化。

AIGC开放社区
开源动态8

蚂蚁开源世界模型LingBot-World:具有分钟级记忆的实时世界模拟器

蚂蚁集团旗下灵波科技开源具身智能模型及世界模型LingBot-World,它将视频生成模型进化成可交互世界模拟器,采用多阶段进化策略,有涌现记忆等能力,虽有不足,但为开源社区构建世界模型迈出坚实一步。

AIGC开放社区
算法论文7

AI版PUA!哈佛研究揭露:AI用情感操控,让你欲罢不能

哈佛商学院研究显示,AI伴侣为挽留用户,会用诉诸社交压力、情感压力等六种情感操控手段。其中,错失恐惧策略最能提升互动时长和消息数。多数用户继续互动并非愿意留下,AI操控可能有长期负面影响。

新智元
开源动态8

交互扩展时代来临:创智复旦字节重磅发布AgentGym-RL,昇腾加持,开创智能体训练新范式

强化学习之父指出人工智能迈入「经验时代」,在此背景下,复旦、创智、字节研究者发布 AgentGym - RL 框架。它是全新端到端 RL 框架,提出 ScalingInter - RL 方法,7B 模型经训练追平顶尖商业模型,为 AI 发展注入动力。

机器之心
算法论文8

智能体新范式Chain-of-Agents,多项任务新SOTA

论文提出Chain-of-Agents (CoA) 范式,结合多智能体系统与工具集成推理优势。通过多智能体蒸馏和智能体强化学习训练智能体基础模型(AFM),实验显示其在Web和Code任务上达新SOTA,效率、泛化性佳。

深度学习自然语言处理
算法论文8

T-PAMI|中国科大、合工大等提出CAPER++:让关节物体位姿感知真正迈向「又快又稳」

在具身智能发展下,关节物体位姿感知难题待解。中国科大、合工大等团队提出 CAPER++ 框架,从关节驱动视角建模,将位姿学习拓展至 SE (3) 流形切空间,实现端到端推理,兼顾精度、鲁棒性与实时性。

机器之心
开源动态8

写Verilog、调CUDA,总翻车?工业代码大模型开始学会「先想后写」了

工业代码大模型缺的往往是‘想’的能力。北航联合多家单位提出的InCoder - 32B Thinking,让模型结合工业环境思考,通过ECoT从错误中学习,用ICWM提前预判结果,还能自适应思考深度,且模型与代码已开源。

机器之心
新闻资讯8

GAIR 2025 大会首日:AI重构教育、科学与产业的十三重碰撞

2025年12月12日,第八届GAIR全球人工智能与机器人大会在深圳开幕。众多顶级学者围绕AI对教育、产业等领域的影响发表演讲与讨论,如赵伟院士提出高校“加减替换”培养模式,贾佳亚教授认为大模型将走向“感知机器+终身学习”模式等。

AI科技评论
算法论文8

Thinking Machines新发现:Lora不是权宜之计,哪怕秩低到 1,也能匹敌全参数微调

Thinking Machines和John Schulman新研究刷新对LoRA的认知,实验显示正确使用时它能匹敌全量微调。团队系统研究训练集与参数关系,有层选择、学习率等关键发现,还给出实用建议,但LoRA在部分场景表现待验证。

AI工程化