「RL 优化技术」共找到 4038 篇相关文章

算法论文8

公里级场景也能稳住了,国产团队把长视频3D重建又往前推了一步

浙江大学、地平线机器人和之江实验室的新工作 Scal3R 要解决长视频 3D 重建问题。它借助 test - time training 技术,设计全局上下文模块和同步机制,提升长序列重建稳定性和精度,能处理超万帧几千米的场景。

机器之心
新闻资讯7

独家|RoboScience 机器科学完成10亿元融资,资金将用于强化 VLOA 大模型与本体

AI科技评论独家消息,RoboScience机器科学近日完成10亿元A轮融资,将深化VLOA大模型技术,推进自研机器人本体工程化与量产。其VLOA大模型有创新性架构,能实现通用泛化,还将发布自研机器人本体。

AI科技评论
新闻资讯8

老黄秘密武器曝光:AI一夜设计芯片,顶人类顶级工程师10个月!

英伟达在GTC大会揭露用AI设计GPU,原本8名工程师10个月的任务,AI一夜完成。其开发NB - Cell、Prefix RL等工具,还推出内部大模型Chip Nemo和Bug Nemo,不过完全端到端自动化设计仍有距离。

新智元
开源动态8

读完这篇,你就搞懂 DeepSeek v4 了

2026年4月24日,DeepSeek全新系列模型DeepSeek - V4预览版上线并开源,评分接近‘闭源三巨头’。该模型强在1.6T参数+1M上下文,还有从attention到kernel的系统级重构与优化,在架构和工程层面均有创新。

腾讯技术工程
推荐文章7

任务自适应 Harness:从 Trace 到多 Coding Agent 的协作记忆

作者为AI Coding准备的端到端方案未落地,后在Routa项目找到新落点。基于ACP协议的Agent Trace可记录关键行为,用于分析优化。还介绍了Feature Explorer、Kanban Harness及任务自适应Harness,探讨多Agent协作记忆。

phodal
新闻资讯7

这周六,聊聊具身数据、模型与落地场景|沙龙报名

当下具身智能进入加速期,但具身模型从Demo走向真实世界运行路径复杂,存在技术路线未收敛、数据匮乏等问题。量子位等联合发起沙龙,4月25日周六14:00,一线从业者与研究者将分享经验,探讨具身智能关键环节。

量子位
新闻资讯7

Meta 143亿挖角后首个作品来了:Alexandr Wang 推出闭源模型,杨立坤点赞

沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,Meta还披露技术实现细节。不过闭源引争议,且模型在长时程智能体等方面有短板。

AI前线
产品应用8

重磅!Anthropic又一个平台级产品炸场:Harness难题一次性解决,把Agent宠物变成牲口

Anthropic推出Claude Managed Agents,一套为云端大规模构建和部署智能体设计的API套件,已在Claude Platform上线公测。它全托管基础设施,专为Claude模型优化,多家企业已在生产环境使用,还同步发布工程博客解释架构设计思路。

AI寒武纪
开源动态8

Agent 自我改进的六条路

文章梳理了让 AI Agent 不重新训练就能变强的六种机制,包括输出自审、持久记忆、进化搜索、对抗训练、自我修改和编排自优化,介绍了各机制代表项目及成果,指出 AI 学习正从训练溢出到部署阶段。

AGI Hunt
新闻资讯7

卡帕西都整破防了:AI Coding没门槛,可部署环节真嗯啊的难

AI Coding界明星卡帕西公开吐槽,代码不再是AI编程瓶颈,部署才是。他以自己开发「菜单图片生成器」的经历为例,指出部署环节问题频发。他认为应让AI调用和配置,还推荐了Stripe Projects等优化产品。

量子位