深度学习研究」共找到 3476 篇相关文章

算法论文8

首次解释LLM如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

西北大学与Google、谷歌DeepMind团队质疑传统强化学习与反思的关系,提出贝叶斯自适应强化学习方法,首次解释为何、如何及何时反思探索新策略,还给出决策数学形式,实验显示其性能更优。

量子位
推荐文章7

实战·Agentic 上下文工程(下):实现一个可自我学习与进化的智能体原型

文章参考ACE论文架构与提示词设计,实现可自我学习与进化的ACE智能体原型。介绍整体架构、各模块实现逻辑、工作流组装测试,也指出当前问题如LLM表现波动大等,并给出改进方向。

AI大模型应用实践
开源动态7

Sglang 源码学习笔记(三)- 分布式和并行(以deepseek 为例)(WIP)

文章是 sglang 源码学习笔记,聚焦分布式和并行,以 deepseek 为例。介绍通信域类型,分析 ZMQ 和 torch.dist 通信,阐述 TP、DP、EP 实现,包括初始化、使用等,还涉及不同 Linear 层 TP 及 MoE 不同实现情况。

GiantPandaLLM
新闻资讯8

机器学习先驱Daphne Koller警告:AI制药不是魔法棒,下一代药物发现还缺1000倍数据

知名学者 Daphne Koller 在 a16z News 发文指出,AI 制药当前最受关注的进展多在分子设计,但新药研发难题在上游,疾病机制的靶点选择错误导致大量临床试验失败,且当前数据距构建完整生物学因果模型差约 1000 倍。

DeepTech深科技
开源动态8

阿里通义的视觉RAG革命!VRAG-RL:基于强化学习的视觉感知RAG框架,性能飙升30%

阿里巴巴通义实验室推出VRAG - RL,融合视觉感知、多模态推理与强化学习,已在GitHub开源。它破解传统RAG处理视觉数据难题,通过创新机制提升性能,在多数据集表现出色,还将向更拟人化和低幻觉方向发展。

开源星探
算法论文8

网络基础设施如何支撑大模型应用?北京大学刘古月课题组5大方向研究,相关论文入选ACM SIGCOMM 2025

在智能计算和网络演进背景下,北大刘古月课题组聚焦网络研究。其 5 篇论文入选 ACM SIGCOMM 2025,从架构、数据、运维、安全四个维度形成技术闭环,推动新一代网络系统发展。

AI前线
算法论文8

突破高分辨率图像推理瓶颈,复旦联合南洋理工提出基于视觉Grounding的多轮强化学习框架MGPO

先进多模态大模型处理高分辨率图像有瓶颈,复旦和南洋理工研究者提出基于视觉Grounding的多轮强化学习方法MGPO,能让模型精准推理,还可使模型从答案反馈中涌现视觉定位能力,避免依赖昂贵标注。

机器之心
开源动态8

Kimi K2技术报告正式发布:“保姆级”深度解析,一文读懂万亿参数智能体的所有秘密

Kimi K2技术报告发布,Moonshot团队用万亿+参数稀疏MoE架构等打造接近Claude - Opus的通用大模型。围绕训练稳定性等改进,有预训练、架构设计等多方面创新,为智能体领域提供可行路径。

AI寒武纪
算法论文7

清华唐杰新作:大模型能打掼蛋吗?

清华、北邮等团队联合研究表明大模型能打掼蛋等8种棋牌。不同模型在不同棋牌表现有差异,如GPT - 4o综合佳,GLM4是“全能型选手”。研究还探讨学习方法、模型性能影响因素及游戏间相互作用等。

量子位
算法论文7

小扎「梦之队」首批论文上线!LLM自举进化,单步性能狂飙22%

Meta超级实验室MSL新论文探索用强化学习微调大语言模型。提出探索迭代(ExIt)法,基于RL自动课程学习,训练仅需单步任务,模型学会多步自我改进。在MLE - bench上,ExIt相对GRPO提升约22%。

新智元