RL训练方法」共找到 3361 篇相关文章

推荐文章8

刚刚,商汤内部两万字复盘曝光:多模态通往AGI核心路线首次公开

商汤科技联合创始人林达华撰写万字长文,剖析将「多模态通用智能」视为技术战略核心引擎的原因,探索组织及战略层面的思考。文章回顾商汤多模态之路,探讨多模态通向AGI的原因、构建路径等关键问题。

新智元
新闻资讯7

安全噩梦:Docker 警告 MCP 工具链中存在的风险

Docker 发文警告,基于 MCP 构建的 AI 开发工具存在安全漏洞,如凭证泄露、代码执行等。MCP 协议发展快但部分实现有隐患,Docker 分析发现诸多漏洞,还提出强化方法应对。

InfoQ
新闻资讯7

LLM抢人血案:强化学习天才被挖空,一朝沦为「无人区」!

斯坦福AI+CS博士Joseph Suarez回顾强化学习历史,指出其曾因学术短视、学界追名逐利走向衰落。如今他坚持用小模型从零开始的RL,重建标准,让研究速度和效果大幅提升。

新智元
新闻资讯8

Anthropic 反杀 OpenAI,LLM 企业市场新格局

Menlo Ventures 报告显示,Anthropic 超越 OpenAI 成企业 LLM 市场新王者。代码生成成杀手级应用、强化学习成扩展路径、Agent 时代到来支撑其胜利。企业重性能,支出从训练转向推理。

AI工程化
新闻资讯7

别只盯着李飞飞!AI的「3D数据底座」已被这家中国公司悄悄建好

群核科技构建具身智能时代的「3D版ImageNet」,其SpatialVerse平台为机器人提供三维数据与仿真环境。借助新技术发布全球首个3D语义数据集InteriorGS,还与多机构合作,成果获学术和产业认可。

新智元
开源动态8

阿里开源电影级AI视频模型!MoE架构,5B版本消费级显卡可跑

阿里开源新一代视频生成模型通义万相Wan2.2,含文生视频等功能。它率先将MoE架构用于视频生成扩散模型,5B版本可在消费级显卡部署。对比前代和Sora表现更优,还推出电影级美学控制系统。

量子位
算法论文8

真实物理加持,人物动画再也不像塑料人!UIUC华人让角色活起来了 | ICCV'25

PhysRig是UIUC与Stability AI联合提出的面向角色动画的可微物理绑定框架。它用物理建模替代传统绑定权重设计,解决传统LBS无法克服的问题,显著提升角色动画真实感,还适用于动作迁移任务。

新智元
算法论文8

快慢Reasoning综述!

大型语言模型在复杂推理任务中有‘无差别计算’缺陷,阻碍其在多场景应用。本文提出双层效率优化框架,梳理两类前沿技术,通过实验揭示瓶颈,为轻量化推理指明路径。

深度学习自然语言处理
算法论文8

UIUC提出隐式监督新范式:无需标注/RM即可全面提升多模态Reasoning的感知能力

大型多模态模型在复杂多模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在多模态基准上表现优异,还解决了KL黑客问题。

深度学习自然语言处理
算法论文8

合成数据>人工数据,绝对性能暴涨超10个点!仅需任务定义,高效微调大模型

为解决基础模型在专业领域表现不佳、依赖人工标注数据的难题,北大、MIT等机构提出「合成数据强化学习」框架。该框架仅需任务定义,能生成合成数据微调模型,在多领域基准上性能提升显著,代码已开源。

新智元