「深度学习模型训练」共找到 8552 篇相关文章
突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度
在多模态大语言模型应用多元的当下,对模型理解人类意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。
公开模型一切,优于DeepSeek-R1,英伟达开源Llama-Nemotron家族
英伟达推出面向高效推理的 Llama-Nemotron 系列模型,包括 Nano、Super、Ultra 等规模,具备卓越推理能力与效率,采用开放许可。模型支持动态推理切换,训练结合多方法,性能优于 DeepSeek-R1 等。
强化学习之父Richard Sutton最新采访:LLM是“死路一条”
强化学习之父Richard Sutton在采访中批判当前由LLMs主导的AI发展路径,认为其是死胡同,缺乏真实世界模型与目标。他构想‘经验时代’新范式,预言权力向更高级智能转移,也指出未来面临腐败与价值观挑战。
统计学和机器学到底有什么区别?
文章探讨统计学和机器学习的区别,指出两者目的不同,统计模型重推断关系,机器学习重预测。以线性回归为例说明差异,还澄清常见误解,表明机器学习基于统计学但涉及多领域,最后称选方法要看目标。
AI应用如何落地政企?首先不要卷通用大模型
ISC.AI 2025大会显示智能体技术加速渗透产业。360政企AI业务与智能体深度绑定,其落地有三重逻辑:不追通用大模型,聚焦小场景;用“乐高式”工厂赋能;安全与AI深度融合是必选项。
OpenAI的开源,补全了亚马逊云科技模型生态的最后拼图
8月5日OpenAI上线两款开源模型,亚马逊云科技随即在旗下平台上线。此前微软借合作优势使Azure高速增长,如今OpenAI开源,亚马逊云科技模型生态更丰富,其产品受客户好评,增长势头难挡。
只因一个“:”,大模型全军覆没
一篇论文发现冒号等符号、“Thought process:”等语句能欺骗LLM,让虚假回答通过。实验表明所有测试模型都会触发假阳性响应。研究人员构建新“评委”模型Master - RM,可让假阳性率接近0%。
大模型进入研发体系后,我们看到了这些变化
InfoQ《极客有约》X AICon 直播邀请同程、网易、百度工程师探讨大模型入研发体系的变化。指出其在提效、协作、分工上作用大,还分析了适用场景、工程师收益类型及核心竞争力等,也提及效率评估、代码生成等问题。
AgentCPM-Explore开源,4B 参数突破端侧智能体模型性能壁垒
清华大学、中国人民大学等联合研发的 AgentCPM-Explore 开源,基于 4B 参数在深度探索任务上表现出色,打破参数壁垒,开源全流程基建,还探索出提升小模型性能的方法。
英伟达叫板DeepSeek?怒投260亿美元,要打造最强开源模型
英伟达已成为人工智能时代基础设施的一部分,2023年11月推出首个Nemotron模型进入通用大模型领域。未来五年将投260亿美元构建开源模型,还发布了性能最强的开源模型Nemotron 3 Super。