「强化学习算法」共找到 1910 篇相关文章
DeepMind 创始人 Hassabis 语出惊人:百万 token 只是在贴胶带,AGI 在 2030 年
DeepMind创始人Hassabis在访谈中评估AGI进展,认为当前范式是最终架构一部分,但持续学习等问题待解决,预计2030年左右实现AGI,还探讨了Agent、蒸馏等多方面内容,并给创业者建议。
RL 效率无损飙升 3 倍:厦大-Shopee-清华联合首创,将投机解码首次引入 RL,推理能力稳如初!
传统RLVR训练中,rollout阶段耗时成瓶颈。厦大 - Shopee - 清华联合团队提出SPEC - RL,将投机解码引入RL,训练提速2 - 3倍,避免重复生成,与主流算法兼容,在多项基准测试中性能稳定。
MIT发布自适应语言模型!新任务,自生成远超「GPT-4.1合成训练数据」
麻省理工学院提出自适应语言模型框架SEAL,让大模型生成微调数据和更新指令适应新任务。实验显示,其生成的合成数据微调效果超GPT - 4.1,在少样本学习和知识整合任务表现优异。
从0到1拆解FreeWheel ChatBI:大模型如何重塑视频广告智能数据分析新生态
本文结合 FreeWheel 实际应用经验,分享构建 ChatBI 系统核心实践。介绍其核心功能、技术实践,如让 LLM 理解业务、智能选表等,还提及系统架构、算法服务,最后总结上线效果并展望未来优化方向。
比SOTA快9倍,谷歌DeepMind时空重建,把视频变成时空搜索引擎
谷歌DeepMind联合团队发布D4RT时空重建框架,颠覆传统视频转3D方法。它按需提问,像搜索引擎,处理动态视频高效。内部结构分编码、解码两步,速度快,还发明聪明收割机算法,在多项测试中表现优异。
深度对话 Benchmark 合伙人:AI 打破了 SaaS 的 3322 规则改变创造本质
Benchmark 合伙人 Eric Vishria 与 Banana Capital 合伙人 Turner Novak 对话,分享 AI 时代创业看法、投资策略等。他认为 AI 打破 SaaS 增长法则,关注创始人叙事、学习能力,坚持投资非凡公司,还谈了对上市、估值等的观点。
支持中文!NotebookLM自动生成播客
Google宣布NotebookLM语言摘要功能支持50多种语言,包括中文,可将上传文档转成播客对话形式。以一篇AI进化论文为例展示效果,其音频和内容质量不错,学习输入立体,还能助力AI播客创作。
经纬领投2000万美元,Aether AI让机器人学会举一反三|甲子光年
6月18日,Aether AI获约2000万美元首轮融资。创始人黄碧薇认为主流大模型学的是相关性而非因果性,她将LLM和因果算法结合,打造因果世界模型,搭建“因果大脑”,并选择具身智能作为落地场景。
Anthropic开源Claude小企业插件:不用写prompt,15套现成流程顶半个运营团队
Anthropic开源面向小企业的Claude插件,有15个基础技能、15套业务工作流及懂大白话的路由模块。支持Claude Cowork和Claude Code,操作待确认。日常使用几乎无学习成本,安装配置较简单,亮点是降低交互门槛。
去往 Capital One 的俞栋,曾是 Hinton 的「救命恩人」
近日原腾讯AI Lab副主任俞栋加入Capital One。此前他和邓力曾在微软为Geoffrey Hinton雪中送炭,挽救深度学习研究。如今邓力、俞栋等技术大佬纷纷投身金融公司,或是因薪资、挑战和资源等因素。