训练技术」共找到 4606 篇相关文章

开源动态7

数学编码超越O3-high,英伟达版「DeepSeek R1二代」推理模型开源~

Nvidia开源OpenReasoning-Nemotron系列模型合集,采用Qwen2.5架构,基于500万条轨迹训练。评测输出长度最高64K token,多版本刷新SOTA。其‘heavy’模式有独特能力,32B版在数学与编程基准超越O3(High)。

PaperAgent
产品应用8

0成本升级,快手OneSearch-V2全量上线,生成式搜索进入「懂你」时代

快手技术团队在 OneSearch 基础上推出 OneSearch-V2 框架,解决电商搜索复杂查询理解不足等问题。该系统全量上线,不增成本与时延,业务收益显著,还缓解信息茧房与长尾稀疏问题。

机器之心
开源动态8

动态RAG新工作:效果爆了,代码已开源

大语言模型幻觉问题突出,现有动态RAG方法信号不可靠。QuCo-RAG从预训练语料库挖掘统计证据,用客观频率替代主观置信度,实现毫秒级幻觉检测与动态检索触发,代码已开源。

PaperAgent
新闻资讯8

GAIR 2025 「数据&一脑多形」分论坛,激辩 AI 演进路径

在 12 月 13 日 GAIR 大会“数据&一脑多形”分论坛上,探讨了数据价值重构与“一脑多形”架构革命。多位嘉宾围绕具身智能数据、“一脑多形”技术展开分享与讨论,为人工智能发展提供新思路。

AI科技评论
开源动态7

【CUDA-MODE学习笔记】Lecture 40: CUDA Docs for Humans(文末送书

本文是CUDA-MODE课程笔记,介绍Modal公司GPU术语词汇表项目,讲师分享职业历程,强调理解CUDA技术栈各层次重要性,还讨论了项目短、中、长期目标,是助力开发者掌握CUDA的教育项目。

GiantPandaLLM
算法论文8

AEPO:智能体熵平衡策略优化,让探索更稳,推理更深!

中国人民大学与快手团队联合提出 AEPO 算法,解决熵驱动式智能体强化学习训练不稳等问题。它设计两项核心机制,在 14 个基准上优于主流算法,在 X 等平台获高关注。

机器之心
算法论文8

均值至上假繁荣!北大新作专挑难题,逼出AI模型真本事

当强化学习成大模型后训练核心工具,主流方法陷入「均值优化陷阱」,推理能力停滞。北大团队提出RiskPO,将风险规避理念融入优化目标,用MVaR+捆绑策略双管齐下,三大任务表现优异。

新智元
算法论文8

大模型推理学习新范式!ExGRPO框架:从盲目刷题到聪明复盘

上海人工智能实验室等团队提出经验管理和学习框架ExGRPO,能科学管理经验。与传统RLVR方法比,它在不同基准提升性能,尤其复杂推理任务,还揭示滚雪球效应,为模型推理训练提供新思路。

量子位
新闻资讯8

Google封神,计算机视觉的GPT3时刻来了!

Google Deepmind称在CV领域做出类似GPT-3的成果,Veo 3经大规模训练涌现通用视觉理解和推理能力,能以图片+提示词完成复杂视觉任务,还具备感知、建模等四大超能力。

探索AGI
算法论文8

Depth Anything再出新作!浙大&港大出品:零样本,优化任意深度图

浙江大学与港大团队推出「Prior Depth Anything」,融合深度传感器数据与AI深度图,一键补洞、降噪、提分辨率。无需额外训练,可提升3D模型深度质量,零样本刷新多项深度处理纪录。

新智元