双模式退火训练」共找到 2162 篇相关文章

算法论文8

「推理革命」爆发100天:DeepSeek-R1复现研究全揭秘!

本文深入梳理围绕DeepSeek-R1的复现研究,解析监督微调、强化学习等关键技术细节,介绍相关数据集、训练方法及奖励机制等,还探讨了推理语言模型更多发展方向,为研究提供基础。

新智元
开源动态8

阿里云通义点金发布DianJin-R1金融领域推理大模型,32B模型荣膺榜首

阿里云通义点金团队与苏州大学合作推出DianJin-R1金融领域推理大模型,介绍其开源数据集与模型、基于通义点金平台的数据合成,展示了其在性能测试中的优异表现,推动金融科技智能化进程。

机器之心
新闻资讯8

陈大年复出,入局大模型

国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在信通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。

量子位
产品应用7

长程执行成具身智能必考题,墨奇的答案是Agentic-Native|甲子光年

具身智能中长程执行成关键问题,墨奇智能发布具身模型架构MoRA,提出Agentic - Native技术路线,让Agentic能力原生存在于策略模型中,还介绍了模型内部设计、所需数据等内容。

甲子光年
新闻资讯8

2026CSDI:AGI前夜,属于懂Agent、更懂模型的长期深耕企业

本文围绕2026年AI行业发展展开,指出竞争基本单位正从模型变为体系,AGI成组织目标,同时介绍了算力、数据等核心要素变化;还提及Agent与模型关系及编程新范式,最后宣传了2026CSDI峰会。

AIGC开放社区
新闻资讯7

离开OpenAI和Google后,两位大模型核心负责人决定卷下一代架构

曾是OpenAI的「强化学习最大主义者」Jerry Tworek,与谷歌Gemini预训练负责人Rohan Anil,共同创办Core Automation。他们探讨当前AI路线问题,认为下一代架构要能持续学习,还计划打造自动化AI实验室。

机器之心
8

刚刚,国产Agent模型闯入全球第一梯队!限时免费

昆仑万维发布SkyClaw-v1.0及其轻量版SkyClaw-v1.0-lite Agent模型,性能达全球第一梯队,价格仅主流顶尖模型一半甚至更低,适配主流Agent框架,还兼容OpenAI接口,现限时免费,后续将逐步开源。

量子位
算法论文8

让大模型学会「自己教自己」!京东&中科院信工所连发三篇论文定义Self-Taught RLVR

京东和中科院信工所开展Self - Taught RLVR系列研究,连发三篇论文。从RLSD、NPO、CoPD三个维度探索让大模型自我指导。如RLSD解决信息泄漏,NPO引入有效学习信号,CoPD整合多专家能力,各有创新与良好效果。

量子位
开源动态8

让大模型理解真实医疗视频,全球首个开源技术方案来了!

AI 进入医疗领域需谨慎,此前美国引入不成熟 AI 致手术失误频发。全球首个医疗视频理解大模型元智医疗视频理解大模型发布并开源,解决了医疗视频领域的任务优化、数据缺失和无法评测痛点。

机器之心
新闻资讯8

全球自动驾驶激战,滴滴与清华走出一条技术新路

2026年全球自动驾驶竞赛白热化,Waymo高歌猛进,特斯拉遇困境。滴滴与清华合作,成立实验室,发布STAPO算法,打通产学研链路。滴滴自动驾驶低调务实,掌握全栈技术,将出海阿联酋,其主业优势保障稳健发展。

新智元