「训练系统」共找到 3651 篇相关文章
关于多模态大模型Token压缩技术进展,看这一篇就够了
多模态大模型跨模态融合带来高计算成本,催生MLLM Token Compression研究。北大等机构人员基于压缩位置对方法系统归类,讨论特定场景压缩机制选择,还探讨了挑战与前景方向。
网易云音乐前 CTO 曹偲:代码越来越不重要,好的架构才是软件工程核心
网易云音乐前CTO曹偲推出AI Coding产品Toco AI,旨在将确定性和工程性带入AI Coding。他认为架构决定软件开发上下限,代码会逐渐黑盒化,业务架构更重要且难被AI取代,产品可助力软件开发。
卢宗青团队新作:人类先验打底,统一动作对齐,通用机器人模型正在落地
机器人行业核心问题是让机器在真实世界稳定行动。卢宗青团队论文《Being - H0.5: Scaling Human - Centric Robot Learning for Cross - Embodiment Generalization》给出通用操控路线,系统性解决多形态平台部署问题。
Anthropic:大模型开始意识到自己在想什么!
Anthropic的Jack Lindsey论文《Emergent Introspective Awareness in Large Language Models》对大模型做神经科学受控实验。发现Claude Opus 4/4.1能感知内部念头,区分内外状态,通过检查内部状态一致性判断输出意图。
Data+AI 新年特辑:2025 的顿悟时刻与 2026 的关键十问 | Q推荐
过去一年,Data + AI 关注点从模型能力转向企业承载 AI 的系统能力。InfoQ 联合 Snowflake 发起直播活动,邀多行业人士复盘与前瞻,有认知回顾、十问环节,结尾嘉宾留 2026 预测。
微软:DeepSeek-R1等推理模型循环的原因找到了
前几天,DeepSeek - R1论文更新,披露诸多细节。重点是推理模型在低温/贪心解码下易循环,根源是学得不对,如风险规避式复读、时序相关错误复读,还给出解决方案。
黄仁勋CES2026最新演讲:三个关键话题,一台“芯片怪兽”
北京时间1月6日,英伟达CEO黄仁勋在CES2026演讲。回顾过去一年开源模型发展,本次围绕系统与基础设施、模型、应用落地三条主线演讲,展示Rubin架构等成果,推动推理型AI发展及应用。
“养团队造语言”时代终结?Rust传奇人物用Claude造出新开源编程语言,AI写下万行代码:大模型上限很高,我学会了高效用它!
Rust核心贡献者Steve Klabnik借助Claude写了新语言Rue并开源。他曾是AI怀疑论者,现认为大模型在编程中‘真的有用’。Rue目标是不依赖垃圾回收提供内存安全,使用体验更顺手,开发深度依赖Claude。
突发!快手AI掌舵人周国睿即将离职,下一站爆出
多个媒体爆料,快手副总裁、基础大模型及推荐模型负责人周国睿即将离职,目前本人在快手内部系统显示为休假状态。其去向不明,有传加入Meta或TikTok,官方未回应。
QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5
通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三大“法宝”重塑模型能力,效果显著,相关代码已开源。