「大规模数据」共找到 6830 篇相关文章
大模型思维链推理速度倍增!——RoT新框架把思维链「画」进隐空间
随着大模型规模扩展,思维链(CoT)成处理复杂推理任务标准范式,但显式CoT依赖长序列生成,隐式CoT面临优化挑战。腾讯提出RoT新框架,利用视觉编码器将文本推理步骤转为视觉嵌入,实现Token压缩与推理加速,且过程可分析。
每2秒吃透一道高数大题!华为终于揭秘准万亿MoE昇腾训练系统全流程
华为揭秘准万亿MoE昇腾训练系统全流程,通过“昇腾+Pangu Ultra MoE”实现国产算力与模型自主可控训练闭环,从集群利用率、单节点算力、后训练技术三方面突破,实现大模型高效训练。
大模型是「躲在洞穴里」观察世界? 强化学习大佬「吹哨」提醒LLM致命缺点
加州大学伯克利分校副教授、强化学习大牛Sergey Levine在博客指出,当前大语言模型(LLM)只是对人类大脑和思维的间接「扫描」,如同被困洞穴看人类智慧「投影」,无法代替真正思维。
国产游戏理解模型刷新SOTA,对话逗逗AI CEO:开源模型+行业数据是突破关键
2025年末国产开源模型影响力凸显,东京电玩展上逗逗AI的游戏理解模型LynkSoul VLM v1超顶尖闭源模型。其CEO刘斌新表示,开源模型结合行业数据是突破关键,还探讨了产品技术、交互及发展趋势等。
性能比肩DeepSeek-R1,MiniMax仅花380万训出推理大模型性价比新王|开源
MiniMax开源推理大模型MiniMax - M1,原生支持100万token输入、8万输出,性能比肩DeepSeek - R1,仅花380万训成。采用Lightning Attention机制与CISPO算法,在多领域表现出色,模型权重可在HuggingFace下载。
从大厂设计师到超级一人公司:6000字回顾我和AI的2025
作者回顾2025年,身份从大厂设计师变为自由职业者,用AI加持做超级一人公司。自媒体上各平台粉丝量增长,开始做视频;社群活动帮创业者和会员;创作涵盖Vibe Coding、Agent、图像视频等;还介绍合作产品,展望2026年AI趋势。
社区供稿丨如何抑制大模型的“过度反思”:Yuan3.0 Flash 中的强化学习范式
大模型在企业落地时存在“过度反思”问题,浪费算力。YuanLab.ai团队在Yuan3.0 Flash模型中提出RIRM与RAPO,前者奖励“思考过程”,后者优化训练框架,实现推理效率提升,适用于企业场景。
劝人退学、庆幸没读博浪费5年,26岁DeepMind“传奇人物”:大厂内部分散,AI研究很低效
26岁的Neel Nanda是DeepMind“传奇人物”,他涉足机械可解释性研究四年成果丰硕。在与主持人对话中,他分享经验,认为大厂内部分散、AI研究低效,还谈及读博、AI安全研究、公司决策等看法。
Figure人形机器人首秀灵巧手叠衣服!神经网络架构不变,只增加数据集就搞定
Figure人形机器人首秀用灵巧手叠衣服,在未改变神经网络架构、仅增加数据的情况下,让原本用于物流场景的它习得新技能,完成了端到端的操作,还实现自然多模态交互。
群核科技开源两款空间大模型,想解决 Genie3 没能彻底解决的问题
2025年8月25日群核科技举办TechDay,发布专注3D室内场景的空间大模型,开源SpatialLM 1.5和SpatialGen。两款模型分别解决理解交互和空间一致性问题,有实际应用价值,还介绍了数据飞轮效应及模型相关问答。