多阶段强化学习」共找到 2109 篇相关文章

新闻资讯8

上任两年,吴泳铭为阿里 AI 定调:终局是 ASI

吴泳铭出任阿里 CEO 两年,在云栖大会提出 AI 终局是 ASI。阿里云升级全栈 AI 体系,通义大模型 7 连发,百炼平台更新。吴泳铭判断通往 ASI 分三阶段,阿里为此推进 3800 亿建设计划。

InfoQ
新闻资讯8

DeepMind 创始人 Hassabis 语出惊人:百万 token 只是在贴胶带,AGI 在 2030 年

DeepMind创始人Hassabis在访谈中评估AGI进展,认为当前范式是最终架构一部分,但持续学习等问题待解决,预计2030年左右实现AGI,还探讨了Agent、蒸馏等多方面内容,并给创业者建议。

MacTalk
算法论文8

RL 效率无损飙升 3 倍:厦大-Shopee-清华联合首创,将投机解码首次引入 RL,推理能力稳如初!

传统RLVR训练中,rollout阶段耗时成瓶颈。厦大 - Shopee - 清华联合团队提出SPEC - RL,将投机解码引入RL,训练提速2 - 3倍,避免重复生成,与主流算法兼容,在多项基准测试中性能稳定。

深度学习自然语言处理
算法论文8

MIT发布自适应语言模型!新任务,自生成远超「GPT-4.1合成训练数据」

麻省理工学院提出自适应语言模型框架SEAL,让大模型生成微调数据和更新指令适应新任务。实验显示,其生成的合成数据微调效果超GPT - 4.1,在少样本学习和知识整合任务表现优异。

新智元
产品应用7

智能体请求暴增 9.4 倍,token 账单却没涨:Uber 公开 AI 软件工厂省钱方法

AI 工具已嵌入 Uber 软件开发各阶段,智能体请求量增长 9.4 倍,但 AI 总支出自 4 月相对稳定。文章介绍其软件工厂思考,包括智能体会话层级、成本公式、指标测算及优化手段,还提及未来举措。

InfoQ
算法论文8

五倍推理加速,激发自回归潜能,苹果新工作让LLM预测未来

近年来自回归训练方法成语言模型主流范式,但推理阶段计算开销大。苹果研究人员开发框架,让预训练自回归大模型多 token 预测,代码和数学任务推理加速达 5.35 倍,一般任务约 2.5 倍。

机器之心
推荐文章8

深度对话 Benchmark 合伙人:AI 打破了 SaaS 的 3322 规则改变创造本质

Benchmark 合伙人 Eric Vishria 与 Banana Capital 合伙人 Turner Novak 对话,分享 AI 时代创业看法、投资策略等。他认为 AI 打破 SaaS 增长法则,关注创始人叙事、学习能力,坚持投资非凡公司,还谈了对上市、估值等的观点。

投资实习所
产品应用7

支持中文!NotebookLM自动生成播客

Google宣布NotebookLM语言摘要功能支持50多种语言,包括中文,可将上传文档转成播客对话形式。以一篇AI进化论文为例展示效果,其音频和内容质量不错,学习输入立体,还能助力AI播客创作。

newtype AI
开源动态7

Anthropic开源Claude小企业插件:不用写prompt,15套现成流程顶半个运营团队

Anthropic开源面向小企业的Claude插件,有15个基础技能、15套业务工作流及懂大白话的路由模块。支持Claude Cowork和Claude Code,操作待确认。日常使用几乎无学习成本,安装配置较简单,亮点是降低交互门槛。

AI工程化
新闻资讯7

去往 Capital One 的俞栋,曾是 Hinton 的「救命恩人」

近日原腾讯AI Lab副主任俞栋加入Capital One。此前他和邓力曾在微软为Geoffrey Hinton雪中送炭,挽救深度学习研究。如今邓力、俞栋等技术大佬纷纷投身金融公司,或是因薪资、挑战和资源等因素。

AI科技评论