「持续强化学习」共找到 1805 篇相关文章
ICML 2025 | 千倍长度泛化!蚂蚁新注意力机制GCA实现16M长上下文精准理解
在大语言模型发展中,长文本建模挑战大。蚂蚁研究团队提出注意力机制GCA,可端到端学习检索相关片段,实现超长序列处理与泛化,其Triton kernel实现已开源,论文被ICML 2025接收。
Claude Code 强大的秘密究竟是什么?
Claude Code 强大源于其强大模型基础、丰富实用的内置工具、不压缩上下文信息及无 IDE 包袱等优势。相比之下,OpenAI 的 Codex 因模型能力、强化训练不足等落后,Anthropic 还靠亏本推广积累数据。
年前看到最有深度的AI下半场Agents记忆机制综述
本文是一篇83页的基础智能体记忆机制综述,由27家机构联合发表。提出AI研究范式转变,记忆是填补理想与现实差距的关键。构建三维统一分类框架,介绍记忆操作、学习策略、评估体系、应用场景及未来方向。
登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球
今年8月,清华赵明国教授团队联合字节跳动Seed等在《Science Robotics》发表论文,提出视觉驱动的反应式足球技能学习框架。该研究历经22年技术接力,成果在真机和赛事中验证,加速进化平台助力研究。
审美在线、随叫随到、月薪19刀——Lovart把AI设计师这件事做认真了
Lovart适合无设计预算的人,将专业设计师装进AI工具。其Brand Kit解决风格不稳定问题,Font Generator可生成专属字体,Create Skill能固化学习成本,还有Export PSD、Mock Up等实用功能,月费仅19美元。
揭秘存储超级周期下的机遇与挑战
随着AI算力需求爆发与存储行业超级周期开启,存储芯片价格飙升,引发全产业链连锁反应。这源于AI需求引发的结构性供需失衡,涨价将持续至2026年,还推动半导体产业结构升级。
GPT-6要「活」了?MIT新作曝光,AI「自进化」不远了
麻省理工学院推出全新自适应大模型框架「SEAL」,让模型从「被动学习者」变为「主动进化者」。网友猜测GPT - 6可能整合其能力,成为能自主学习的模型,研究虽有局限,但为大模型自进化提供新路径。
单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器
人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。
刚刚,马斯克终极大招Grok Bot来了!
SpaceXAI发布Grok Bot早期测试版及将发布4.6版本。它是云原生AI Agent,能24小时工作、多Bot并行协作,还能跟班学习。它是600亿收购Cursor的成果,对标Anthropic的Claude Cowork。
现场围观腾讯广告算法大赛,我都想入职了
腾讯广告算法大赛冠军可得200万奖金,赛题是「全模态生成式推荐」,涉及多AI方法,贴近真实业务且挑战多。比赛持续四月多,氛围友好。腾讯借此揽才,也为学生提供进大厂通道。