人类反馈强化学习」共找到 1976 篇相关文章

新闻资讯7

就是阻击OpenAI,Claude抢先数十分钟发布Claude Opus 4.1

就在Sam Altman官宣两个开源推理模型前半小时,Anthropic抢先发布新模型Claude Opus 4.1。该模型能力提升,适用多平台,定价公布,企业用户反馈良好,还提供混合推理模式,不过订阅费遭吐槽。

机器之心
新闻资讯7

啊?猫猫也会老年痴呆

《欧洲神经科学杂志》新研究表明,老年猫大脑会积累淀粉样蛋白β斑块,可能导致痴呆样行为。研究成果或助开发猫痴呆症疗法,也为人类阿尔兹海默症提供新见解。

量子位
开源动态7

毫秒响应延迟!开源统一语音对话模型Voila

Voila是开源统一语音对话模型,能以自发、实时且有情感的方式与人类互动。它采用全新端到端架构,响应延迟仅195毫秒,支持超百万种预构建声音,适用于多种语音应用。

带你学AI
新闻资讯7

谷歌Gemini-0605发布,全球大模型第一!

昨晚谷歌发布Gemini 0605版本,官方称其回归0325版本效果。该版本在多项基准测试中领先,Elo评分提升。谷歌针对反馈改进,使Gemini 2.5 Pro回答更优,还取消日期后缀,输入输出Token价格有优势。

探索AGI
新闻资讯8

马斯克生日惊喜!全球首例Model Y无人「自驾交付」,30分钟见证历史

昨天,一辆特斯拉Model Y从得州超级工厂无人自驾,最高时速115公里,30分钟到车主家门口,完成人类首次工厂到用户的闭环交付。马斯克激动祝贺,此场景复杂度超竞争对手。

新智元
新闻资讯7

ChatGPT的记忆机制被公开了

OpenAI推出ChatGPT聊天历史记录记忆功能,默认关闭需手动开启,因未全面开放,技术大佬逆向工程破解机制。记忆系统分保存记忆、聊天记录等,体验反馈两极分化,有优势也有诸多bug。

量子位
新闻资讯7

突发 | Meta 挖走的OpenAI 核心研究员Jason Wei,离职前留下这样的一段话

OpenAI研究员Jason Wei和Hyung Won Chung跳槽至Meta,Wei在离职前发推文分享强化学习感悟及验证不对称性概念,引发网友猜测与共鸣,这场AI人才争夺战正愈演愈烈。

AGI Hunt
算法论文8

“这个怎么组装?”一句无害的问题,如何让AI产生危险输出

Amazon团队发现全新威胁模型“视觉排他性”,提出MM - Plan框架,通过强化学习训练智能体自动发现攻击策略。实验显示其对Claude 4.5 Sonnet和GPT - 5攻击成功率可观,代码和数据集已开源。

深度学习自然语言处理
推荐文章8

欧洲科学与艺术院长 Klaus Mainzer:通用人工智能的终极通关秘籍,藏在思想史里 GAIR Live | 018

雷峰网专访欧洲科学与艺术院院长 Klaus Mainzer,他指出通用人工智能瓶颈在思想史,AGI 障碍是“具身性”哲学鸿沟。还提及量子计算等新兴技术前景,强调教育要整合,人类要担起 AI 时代责任。

AI科技评论
新闻资讯7

宇树机器人“撞人逃逸”火到国外,王兴兴回应:下次不遥控了

宇树机器人“撞人逃逸”片段在国外疯传,引发对机器人安全性的担忧。分析发现,“元凶”可能是人类控制员交接遥控器时未及时避让。宇树创始人王兴兴表示下次让机器人自主奔跑,还透露未来有更多突破。

量子位