逆强化学习」共找到 1490 篇相关文章

算法论文8

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

大模型微调(SFT)是主流LLM落地方案,但大家默认训练完就是学完了。腾讯混元团队发现SFT存在不完全学习现象(ILP),论文完成了定义ILP、找根因、提诊断框架和验证干预等工作。

量子位
新闻资讯8

显卡为什么卖得越来越贵?NVIDIA 副总裁:别争了,摩尔定律早就死透了

NVIDIA应用深度学习研究副总裁Bryan Catanzaro在播客中指出,嘲笑中国AI“套壳抄袭”是偏见,中国在开源协作上是全球领跑者。他认为摩尔定律已死,显卡难降价,还分享了对开源闭源、模型技术等看法。

AI科技大本营
算法论文8

让大模型学会「自己教自己」!京东&中科院信工所连发三篇论文定义Self-Taught RLVR

京东和中科院信工所开展Self - Taught RLVR系列研究,连发三篇论文。从RLSD、NPO、CoPD三个维度探索让大模型自我指导。如RLSD解决信息泄漏,NPO引入有效学习信号,CoPD整合多专家能力,各有创新与良好效果。

量子位
推荐文章7

没有AI也能活得很好的公司,才能用好AI

多数企业推进AI时,虽采纳率高但效果不佳,投入大回报低。问题核心不在AI,而在企业自身组织学习和集成准备度。能从AI获益的是原本就运营良好的公司,当下应审视自身是否适合用AI。

DeepTech深科技
产品应用8

龙虾史上最大升级!但接了微信的千万别更

时隔九天,虾父Peter带来龙虾全新版本2026.3.22-beta.1,堪称有史以来最大更新。更新亮点包括插件升级、模型更新、交互优化、安全强化等,也修复了多个关键安全漏洞,但部分用户更新后遇到微信、WhatsApp使用问题。

量子位
开源动态7

刚刚,马斯克开源基于 Grok 的 X 推荐算法!专家:ROI 过低,其它平台不一定跟

马斯克时隔近三年再次开源X推荐算法,该算法基于Grok,采用端到端学习预测用户兴趣。不过有争议认为这或是因现实压力。专家称其ROI低,其他平台不一定跟进,且此次开源对学术研究价值不大。

AI前线
新闻资讯8

通往通用人工智能的关键一步?DeepMind放大招,3D世界最强AI智能体SIMA 2

Google DeepMind发布SIMA 2,这是能在虚拟3D世界自主游戏、推理和学习的通用AI智能体。它集成Gemini模型,从指令跟随到主动认知跃进,泛化性能提升,还具备自我提升能力,为AI和机器人技术发展提供新路径。

机器之心
开源动态8

YOLO12改进引入DINOv3少样本目标检测精度飙升,分享训练自定义数据集代码

Meta 人工智能研究院的 DINOv3 是基于自监督学习的视觉大模型,解决诸多问题且无需微调,在多任务表现出色。将其引入 YOLO12 后,在不同规模数据集上检测性能显著提升,还分享训练自定义数据集代码。

机器学习AI算法工程
开源动态7

2万开源项目已用上,OpenAI下了盘大棋,Cursor,Codex智能体纷纷支持

据彭博社消息,DeepSeek计划年底发布可自主执行多步任务、自我学习进化的AI Agent。OpenAI开源的AGENTS.md已获5k星,为编码智能体提供使用说明,还给出示例和使用指南,相关智能体已用于2万开源项目。

PaperAgent
新闻资讯7

CEO们的AI焦虑:一张黑白漫画在硅谷疯传

一张CEO喊着‘要AI’的黑白漫画在硅谷疯传。风投出身的Trace Cohen指出高管与基层对AI转型认知有差距,中层被董事会和技术团队拉扯,危险循环正在形成,真正革命或要从高管学习开始。

AI工程化