深度学习推荐系统2.0」共找到 4200 篇相关文章

算法论文8

RL在Agentic Reasoning中的作用:拨开迷雾,看清本质

近年大语言模型在推理任务能力惊人,但使用外部工具存挑战。传统SFT无法让模型自主调用工具,强化学习虽被引入,但在智能体推理中面临训练效率、稳定性和泛化能力难题。论文从多维度解构智能体强化学习,提出有效方法。

深度学习自然语言处理
算法论文8

无需验证器的RL:RLPR解锁LLM通用推理潜能

现有依赖强化学习与可验证奖励(RLVR)提升大语言模型(LLM)推理能力的方法,受限于领域特定验证器。本文提出RLPR框架,利用LLM生成正确答案的固有概率作奖励信号,实现无需外部验证器的通用领域强化学习,效果显著。

深度学习自然语言处理
算法论文8

RL加持的3D生成时代来了!首个「R1 式」文本到3D推理大模型AR3D-R1登场

强化学习首次被系统性拓展到文本到3D生成领域,上海人工智能实验室等机构研究者提出首个强化学习增强的文本到3D自回归模型AR3D - R1,还提出Hi - GRPO范式和MME - 3DR基准,实验显示其性能优异。

机器之心
新闻资讯8

阿里一口气发了N款新模型,让我们向源神致敬。

阿里云栖大会发布众多模型,有Qwen3 - Max、Wan2.5等。Qwen3 - Max对标顶尖模型;Wan2.5支持音画同出;Qwen3 - VL是强大视觉语言模型且已开源;Qwen3 - Omni是全模态模型。此外还有多个新模型,构建全场景生态。

开源星探
开源动态8

腾讯智能体开源大动作!关键技术都拿出来了,开发平台还全面升级

在2025腾讯全球数字生态大会上,腾讯云智能体开发平台3.0(ADP3.0)面向全球上线,关键智能体技术将持续开源。新版本功能更新多,还有多个落地案例,如帮伊利、华住等落地智能体。腾讯优图实验室也有开源计划。

量子位
新闻资讯8

Karpathy 回应争议:RL 不是真的不行,Agent 还需要十年的预测其实很乐观

Andrej Karpathy 在与知名播客主持人 Dwarkesh Patel 的对谈中指出当下 LLMs 研究进展、Agents 存在的实际问题,如‘AGI 仍需十年时间’‘LLM 认知有缺陷’‘强化学习很糟糕’等。他还对关键争议点做了补充回应,包括对 AGI 时间线、强化学习局限性等的看法。

Founder Park
推荐文章7

CuteDSL-2: 基本操作

文章为Cute - DSL第二篇,整理官方notebook介绍基本操作。涵盖数据类型、张量、结构体等基本操作,还介绍了控制流(For、If - Else、While循环等)及TensorSSA的相关操作,如LD/ST、运算、切片等。

GiantPandaLLM
推荐文章7

扩散语言模型深度思考

作者探讨扩散语言模型(dllm),认为其建模方式或冲击AR。团队在AAAI报告介绍多项工作,还整理当前diffusion问题及观点,如推理架构、词表、优化范式等,并附项目网站和agent demo。

机器之心
推荐文章7

Anthropic:现在学习FDE,年薪百万!

Anthropic大佬分享FDE岗位价值,指出其非外包,是面向客户的软件工程师。还阐述适合的人才、团队,纠正三大误区,强调客户买的是解决问题的过程,现场沟通能力正升值。

探索AGI
推荐文章7

Prompt三则(2)

文章给出三则Prompt。一是找行业‘老司机’俯瞰行业,设定前辈身份,强调实用指引;二是穿透语言看‘内核特质’,如剥洋葱般挖掘;三是将一句话‘画面化’,让抽象概念成感官盛宴。

李继刚