发明史」共找到 483 篇相关文章

算法论文8

关键突破:理论验证了 RL for LLM 路线的可行性

传统RLHF依赖人工标注偏好数据训练奖励模型,成本高且难扩展。本文现任何通过Next - token预测训练的LLM内部隐含通用奖励模型,从理论和实验证明其可高效实现模型对齐。

深度学习自然语言处理
新闻资讯8

刚刚,首个能在机器人上本地运行的具身Gemini来了

谷歌DeepMind推出Gemini Robotics On-Device,这是首个可部署在机器人上的VLA模型,无需联网,能让机器人适应新任务和环境。还将布SDK助开者评估。此外,谷歌下调Gemini免费额度,推出图像生成模型Imagen 4和Imagen 4 Ultra。

机器之心
算法论文8

AI哪怕答案正确,逻辑链却惨不忍睹,奥数级不等式证明成功率不到50%| 斯坦福&伯克利&MIT

斯坦福、伯克利、MIT等联合研究,系统评估29个大模型在奥数级不等式证明任务的能力。研究现,模型答案正确多靠猜,推理漏洞多,参数大、思考久也不能提升推理严谨度,但自我反思和定理线索策略有改善效果。

量子位
开源动态8

统一20+多智能体方法,MASLab震撼

由十机构联合推出的 MASLab,带来大模型多智能体系统代码库,统一 20+主流 MAS 方法。有方法全、评估准、结构清晰特性,经大量实验刻画性能图谱,还提出新方法,且起开源社区。

机器之心
算法论文8

爆火论文颠覆RL认知!「错误奖励」让LLM推理暴涨24.6%,学界惊了

最新爆火论文颠覆传统RL训练认知,华盛顿大学等团队证实「伪奖励」可让LLM推理性能提升。研究设置多种伪奖励形式实验,现其对Qwen模型有效,但并非对所有模型都有效。

新智元
新闻资讯7

梁圣一涨价,马斯克的订阅突然成了地球上最划算的。

DeepSeek官涨价第三天,峰谷定价且整体涨幅大,实际体感比价格表夸张,Opencode go也涨价降额度。而马斯克的Supergrok heavy成全球性价比之王,买它送Cursor ultra,还附赠多项权益。

探索AGI
新闻资讯7

DeepSeek还有多少个“郭达雅”?扒完27篇论文,我们现了一群“多边形战士”|甲子光年

本文梳理DeepSeek近两年27篇核心论文,现其研团队无部门墙,“兵团+小组”配合高效,顶级高校背景研究者多,研不设限。虽核心作者被挖,但人才密度厚,技术路线已内化,还开放数据侦探工具包。

甲子光年
推荐文章7

AI最大的礼物,是让你能廉价地失败100次

文章指出AI最大的礼物不是让人成功,而是让人能廉价地失败。AI让开成本降低、心力节省,增加了尝试机会。但人们需布产品获取反馈,构建可演化系统,让失败为后续铺路。

花叔
新闻资讯7

谷歌首度证实:黑客已开始用AI动真实网络攻击!

谷歌5月12日报告,犯罪黑客用AI大模型现零日漏洞并准备攻击,谷歌拦截。还现PromptSpy恶意软件调用Gemini API自主决策。目前攻击方借助AI加速,美国政府紧急行动但监管有分歧。

新智元
新闻资讯7

MiniMax修改开源授权被骂疯了!限制M2.7商用、强制标注来源,却没完全撤下MIT标识

近日,MiniMax M2.7 模型变更开源使用条款,收紧商业授权,引社区热议。MiniMax 称此举为防第三方‘阉割降级’模型。但标注‘Modified - MIT’却限制商用引开者质疑,此前 MiniMax 一直完全开源。

AI前线