人类反馈强化学习」共找到 1980 篇相关文章

算法论文8

把VLM塞进隐式世界模型,小鹏机器人新框架让机器人长出物理直觉

机器人大脑架构中VLM和VAM路线各有短板,香港大学、小鹏机器人等团队提出DIAL框架,让VLM在原生特征空间做隐式世界建模,解耦认知决策与底层执行,在机器人部署中表现优异。

量子位
新闻资讯7

GPT-5系列咋都爱说「哥布林」?原因找到了

OpenAI发布博客解释模型迷上「哥布林」的原因。原来是训练“Nerdy”人格时,奖励信号偏爱怪物词汇,强化学习将风格固化并扩散到普通对话。此前DeepSeek V3.1也出现过「极」字Bug。

机器之心
新闻资讯7

寻找 8 支 AI Native 硬件团队,好产品应该被更多人看见

今年是AI硬件爆发年,AI硬件重新定义人与设备关系。百度智能云联合Founder Park在Create 2026百度AI开发者大会设「AI硬件产品快闪」,邀8支团队展示三类AI Native硬件,还将提供多种支持。

Founder Park
新闻资讯7

对话地平线前高管牛建伟:万亿参数大模型如何重塑具身智能

具身智能赛道分“VLA派”“智驾降维派”和“大模型派”。地平线前高管牛建伟认为VLA是弯路,主张用分层架构,以万亿参数“空间智能大模型”做大脑,VA小模型执行操作,目标是做物理世界的OpenClaw。

AI科技评论
产品应用8

懂方言,通诗词,精通30国语言,阿里发布语音识别大模型Fun-ASR1.5

阿里发布语音识别大模型Fun - ASR1.5,可精准识别30种语言,覆盖中文七大方言体系及二十余种地方口音,强化古诗词诵读专项识别,后处理环节优化标点预测和文本归一化,降低人工成本。

千问大模型
产品应用7

Claude Opus 4.7来了,公开模型里的SOTA!不过用起来GPT味好浓

Anthropic推出Claude Opus 4.7,虽有像GPT的争议,但在多方面表现出色。它在高级软件工程、视觉能力等四大方向升级,且具备防护措施和记忆增强。全平台开放,与Opus 4.6同价,使用有注意事项。

量子位
开源动态7

Agent = LLM + Memory + Planning + Tool Use

文章指出LLM设计无状态,产生幻觉,超长上下文窗口也无法解决记忆问题。介绍人类记忆的三个系统,阐述Agent记忆四层演化及每层问题,推荐开源项目Cognee将向量、图、关系型结合互补。

CourseAI
新闻资讯7

奥特曼遭遇死亡威胁:凌晨家中被投燃烧瓶

当地时间凌晨3:45,OpenAI CEO奥特曼家中遭20岁男子投掷燃烧瓶,嫌疑人已被捕。奥特曼发文报平安,还分享家人照片,同时写下对AI行业现状思考及与马斯克等冲突的反思。

量子位
开源动态8

对话港大黄超、任旭滨:龙虾热潮、nanobot、CLI与AI开源方法论|甲子光年

本文是甲子光年对港大黄超、任旭滨的访谈实录。二人介绍多个开源项目,如nanobot、ClawWork、CLI - Anything等,探讨OpenClaw热潮,认为焦虑与机会并存,还分享团队开源理念与研究方向选择方法。

甲子光年
产品应用8

比「小龙虾」更能打,中国AI视频大模型悄悄登顶全球第一

昆仑万维旗下 SkyReels-V4 Preview 版在权威评测平台超越 OpenAI、Google 等模型,登顶全球第一。它提升语义理解和逻辑能力,新增参考任务,还支持多语言短剧生成、视频编辑等,将在中关村论坛亮相。

机器之心