「强化学习系统」共找到 3004 篇相关文章
CVPR 2026 三维视觉趋势梳理:从 RGB 感知,到真实世界建模
计算机视觉行业从追求识别能力转向关注视觉系统对真实世界的理解。CVPR 2026研究中,多视角、事件视觉、开放集3D生成和相机运动轨迹被引入视觉理解,多篇论文从不同侧面推动视觉系统走向对真实世界的理解。
斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4
斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等大模型。论文解决了RL在代理环境中可变时长动作优化偏差和稀疏奖励两大挑战,为AI代理发展指明方向。
胡俊杰、吴佳俊、刘子纬等获奖,微软学者奖学金公布
2026 年微软学者奖学金名单公布,获奖者研究聚焦面向全球与社会影响的人工智能等前沿领域,项目汇聚创新社区推动协同演进,还介绍了入选的华人学者及其研究方向。
刚刚2岁的Llama,「爸妈」都跑了!小扎手拆Meta AI,LeCun保持独立
面对谷歌、OpenAI等劲敌及Llama 4翻车、人才流失困境,小扎决定重组Meta GenAI团队,设三大架构。2023年Llama首版论文14名作者只剩3人,Llama 4也问题不断,而LeCun坚持自己的路线。
ICLR 2026|与上海AI实验室里约相见:北极星X星启交流会邀约全球AI英才
ICLR 2026 将于 4 月 23 日至 27 日在巴西里约热内卢召开,收到超 1.9 万篇有效投稿,录取率约 28%。同期上海 AI 实验室将举办交流会,邀全球 AI 英才,搭建学术与产业对话桥梁。
第 2 章 主流 Agent 模式深度解析
文章深度解析主流 Agent 模式,用生活化类比介绍了 ReAct、Plan - and - Execute、Tool Use、Reflection / Self - Critique 四种模式,阐述其技术要点、优缺点及适用场景,还对多模式进行对比。
顶尖数学家含泪退圈:熬了多年的博士难题,被AI几周秒杀!
顶尖数学学者Rishikesh Gajjala靠AI攻破博士课题,却宣布退出学术圈。他认为AI生成证明虽精巧但难验证,“漂亮证明未验证和垃圾无异”。他投身形式化验证领域,而AxiomProver完成“246定理”形式化验证。
AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用
深势科技推出玻尔·跃迁实验室,解决传统实验室设备割裂、经验依赖、数据离散、部署低效等痛点,围绕计算 - 实验 - 数据 - 计算无缝闭环底层重构,与传统 ELN/LIMS 不同。
DeepMind 最新研究:智能体就是世界模型!
DeepMind研究科学家Jon Richens团队在ICML 2025发表论文,从第一性原理证明智能体就是世界模型,回答了AI界多年的根本问题,还带来多个有趣推论,引发AI社区热烈讨论。
14小时近500 Star!快速进阶LLM/AI的必读系列
文章推荐快速进阶LLM/AI必读系列,涵盖Tokenization、Vectorization等多方面,列举大量论文及资料链接,如BERT、TensorFlow等相关资料,助力读者学习。