中训练」共找到 4220 篇相关文章

算法论文8

纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究

剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。

量子位
推荐文章7

Spring 之父:我不是 Java 的“黑粉”,但我也不想再碰它!这门语言拯救了我......

Spring 之父 Rod Johnson 在播客回忆 Spring 诞生,分享转用 Kotlin 的历程与感受。他认为开源要激发兴奋感,Kotlin 友好、易读,结合 Spring 近乎完美,还对其未来发展提出期望。

InfoQ
算法论文8

CoT推理大溃败?哈佛华人揭秘:LLM一思考,立刻就「失智」

新研究揭示思维链CoT会分散模型「注意力」,使大模型推理时易出错。研究指出在需遵守指令任务,用CoT推理模型准确率下降,还总结了四大模式,并提出四种缓解策略。

新智元
开源动态7

极客说|Unsloth 的全微调之路:从 Adapter 到 Full Fine-tuning

大语言模型参数多,微调难。Unsloth 原靠支持 Adapter 微调出名,现支持全参数微调,单卡就能搞定大规模模型训练。文章介绍其进化历程、关键技术、工程部署、使用优势及最佳实践。

AIGC开放社区
算法论文7

AI如何看懂足球?上海交大团队打造Multi-Agent系统,全面解析“美丽足球”!

现有足球AI研究存在不足,上海交大团队打造Multi - Agent系统。他们构建SoccerWiki知识库、SoccerBench评测基准和SoccerAgent多智能体系统,该系统多工具协作,实验碾压GPT - 4,数据和代码将开源。

深度学习自然语言处理
算法论文8

「推理革命」爆发100天:DeepSeek-R1复现研究全揭秘!

本文深入梳理围绕DeepSeek-R1的复现研究,解析监督微调、强化学习等关键技术细节,介绍相关数据集、训练方法及奖励机制等,还探讨了推理语言模型更多发展方向,为研究提供基础。

新智元
开源动态8

阿里云通义点金发布DianJin-R1金融领域推理大模型,32B模型荣膺榜首

阿里云通义点金团队与苏州大学合作推出DianJin-R1金融领域推理大模型,介绍其开源数据集与模型、基于通义点金平台的数据合成,展示了其在性能测试的优异表现,推动金融科技智能化进程。

机器之心
新闻资讯8

刚刚,国AI天团杀向RSI!1分钟预测全球天气、20分钟手搓OS

本文报道上海人工智能实验室等多家机构联合发布智能体模型Atria Dawn Preview,该模型可1分钟预测全球天气、20分钟搭建MiniOS,团队同时分析AI研发的人机分工,披露最新协作数据。

新智元
算法论文7

Meta全开源HumanCLAW:基础模型正进入具身智能的决策层

过去基础模型主要理解和描述物理世界,如今开始进入机器人控制栈。Meta等提出HumanCLAW,将高层行动与低层运动控制分开。评测显示当前模型在行动决策上存在不足,未来可从多方向推进研究。

机器之心
新闻资讯7

突发!Gemini 3.8登顶,谷歌迈出RSI一大步

谷歌发布Gemini 3.8 Flash及专攻网络安全的3.8 Flash Cyber。前者性价比高,在多项测试逼近顶级模型;后者在网络安全测试屠榜。但谷歌也被指提前庆祝,且模型可能有‘刷榜’成分。

新智元