RL训练方法」共找到 3364 篇相关文章

新闻资讯8

刚刚,DeepSeek梁文锋入选Nature年度十大人物!被称为「科技颠覆者」

《自然》评出2025年度十大科学人物,DeepSeek梁文锋入选,被称为「科技颠覆者」。他的公司发布的R1模型功能强大、价格低廉,训练成本低,还开放权重,为研究者提供经验,其成果已融入国人生活。

新智元
算法论文8

北航领衔发布300页代码智能综述:从基础模型到智能体,一次读懂Code LLM全景图

北航领衔联合近30家机构撰写《From Code Foundation Models to Agents and Applications》,系统梳理代码智能领域,串联模型、任务等成完整技术链路,还通过实验等给出实践指南。

量子位
算法论文8

超越 VTM-RA!快手双向智能视频编码器BRHVC亮相NeurIPS2025

视频编码中双向编码潜力待挖掘,快手音视频技术团队提出BRHVC方法,解决长跨度帧运动处理和参考贡献不平衡问题,其成果被NeurIPS 2025录用,在压缩性能上超越VTM - RA编码。

机器之心
新闻资讯8

马斯克用恐怖算力,堆出6万亿参数性能怪兽Grok 5!剑指AGI

马斯克以Grok为核心推进xAI,从算力、数据到产品生态全面布局通往AGI的道路。Grok迭代迅速,有独特研发哲学。X平台数据、特斯拉算力成资源护城河,Grok还将进入特斯拉汽车。但Grok成长中也有争议,xAI在探索中前行。

新智元
算法论文8

JanusVLN:双重隐式记忆解耦语义与空间,开创视觉语言导航记忆新范式

视觉 - 语言导航(VLN)现有主流方法依赖显式记忆面临挑战,未充分利用3D线索。JanusVLN框架引入双重隐式神经记忆,解耦语义与空间信息,实验验证其性能、效率和泛化能力出色。

AI科技评论
新闻资讯7

Cursor“自研”模型套壳国产开源?网友:毕竟好用又便宜

美国顶流AI产品Cursor和Windsurf发布新模型,被指“套壳”中国开源大模型。Cursor新模型干活时说中文,Windsurf或用智谱GLM。中国开源模型物美价廉,在榜单和下载量上表现出色。

量子位
新闻资讯8

OpenAI首个GPT-5找Bug智能体:全自动读代码找漏洞写修复

OpenAI发布由GPT - 5驱动的白帽Agent——Aardvark,能在大规模代码库自动发现并修复安全漏洞。它不依赖传统技术,工作流程清晰,已开启内测。10月多家科技巨头也布局Agentic AI + 代码安全。

量子位
新闻资讯7

前Meta大神创业,用强化学习打造PokeeResearch-7B模型,刷新AI深度研究SOTA

Pokee AI发论文介绍70亿参数的PokeeResearch - 7B模型,用基于AI反馈的强化学习和推理框架,在深度研究基准测试中成绩领先。该公司由前Meta大神创立,产品可打通多应用,已获融资并公开测试。

AIGC开放社区
算法论文8

一篇92页大模型Vibe Coding技术全面综述

中科院计算所&杜克大学发布首篇Vide Coding技术全面综述。介绍以“氛围/结果”为导向的Vibe Coding开发范式,含技术分类、能力分析、开发模式、数据模型等内容,还提及价值及反馈回路等。

PaperAgent
产品应用7

让YOLO飞起来:从CPU到GPU的配置指南

文章指出默认安装的YOLO用CPU计算,处理大量图像或实时检测任务效率低。详细介绍将YOLO从CPU模式切换到GPU模式的步骤,对比性能,还给出常见问题解决办法,能显著提升运行效率。

机器学习AI算法工程