RL训练框架」共找到 3490 篇相关文章

算法论文7

科学家把大脑切片接上机械手,它自己学会了弹琴

法国国家科学研究中心等机构研究人员将死者脑切片放培养皿,连接机械手,经训练机械手学会曲子。研究证实学习依赖神经活动,虽成果距应用远,但为脑科学研究提供观察窗口,也引发伦理思考。

DeepTech深科技
新闻资讯7

独家 | 破壳机器人完成亿美元级融资:「操作」才是具身落地的最大挑战

AI科技评论获悉,通用具身智能公司破壳机器人完成亿美元级Pre - A轮融资。其聚焦机器人操作能力,采用“WAM×RL×DATA”飞轮体系实现快速迭代,还推进软硬件联合研发探索具身落地。

AI科技评论
算法论文8

微小目标漏检只是因为小?从数据到代码:一文读懂 AI-TOD-R 与 DCFL 如何解决旋转微小目标检测

此文指出旋转微小目标检测存在数据空白、学习偏差、特征易丢失等难题,提出AI-TOD-R数据集、全检测范式基准和DCFL框架。DCFL可缓解偏差,在8个数据集达SOTA,还给出实战代码案例。

机器学习AI算法工程
算法论文8

Agentic的风又吹到了世界模型~

这篇42位作者联合完成、综述400余篇工作的论文,第一次用'能力×法则'双轴框架,把所有叫'世界模型'的系统放到同一张地图上,为领域建立公共语言,还得出了关键结论。

PaperAgent
产品应用8

自媒体误读了 DeepSeek-OCR:一图胜千言

近期,DeepSeek-OCR引发关注,但很多媒体误读其为OCR工具,实际是视觉语言模型。它是为大文档等场景优化的视觉压缩与识别系统,架构新颖,训练讲究,效果出色,为行业带来新思路。

MacTalk
算法论文8

NeurIPS 2025 Spotlight | GeoSVR:稀疏体素的新潜力——超越3DGS系列的高精度三维表面重建

计算机视觉中表面重建难题待解,现有方法有瓶颈。北航等团队提出 GeoSVR 框架,围绕几何约束与表面正则化设计,在多数据集超现有方法,兼顾精度、完整性与效率,为多领域提供支持。

机器之心
开源动态8

具身智能从此「边听边说」,智源研究院开源原生全双工语音大模型RoboBrain-Audio

北京智源研究院联合多方发布原生全双工语音对话大模型 RoboBrain - Audio,采用新架构和创新训练范式,在性能上全面领先,革新音频 - 文本对齐方式,丰富了 RoboBrain 全栈体系,推动具身智能发展。

机器之心
开源动态8

阿里新开源提出建设性安全对齐方案,向“让用AI的人安全”新范式跃迁

阿里巴巴集团安全部联合多高校发布技术报告,提出建设性安全对齐理念并集成到Oyster - I模型。该理念突破传统防御式机制,构建新博弈框架,实验显示该模型在安全和通用能力上达SOTA水平。

量子位
算法论文8

腾讯提出SPO,告别Group

腾讯团队提出Single - stream Policy Optimization(SPO),回归单流策略梯度范式,解决组基方法瓶颈。它有多项亮点,如告别组同步、采用自适应价值跟踪等,在实验中提升了模型性能和训练吞吐。

深度学习自然语言处理
开源动态7

蚂蚁开源MedResearcher-R1医学知识图谱+多跳推理

医学领域需处理复杂关系,现有医学AI系统缺乏对罕见实体和复杂关系的推理能力。MedResearcher - R1通过专门图谱和检索工具,结合两阶段训练范式解决问题,在医学基准测试取得新成果。

CourseAI