「训练硬件」共找到 2569 篇相关文章
AI竞争正酣,靠什么取胜?8个要点,一篇讲清楚
全球AI竞赛进入下半场,赛道转向‘谁更能干活’。我国有工业体系、应用场景和市场优势,取胜关键是‘通专融合’。文中提炼上海人工智能实验室周伯文长文8个要点,给出应对之策。
速度提升,能力却暴跌?扩散模型做智能体的残酷真相
南洋理工大学陶大程教授团队联合发布评测报告,揭示扩散语言模型在智能体能力上有系统性缺陷,落后自回归模型。还分析其失败原因,提出评测框架,明确能力边界并给出研究建议。
Soul App 又放大招!把 42000 小时数据喂出的“歌神” SoulX-Singer 开源了!
语音合成近年爆发式增长,开源领域也有强大音乐模型。Soul APP联合多机构开源的SoulX - Singer,喂了42000小时数据,主打零样本歌声合成,支持双控制方式,多语言与跨语言能力强,架构先进,评测表现优。
3万员工+亲儿子全卖!甲骨文血色梭哈,全押OpenAI
为给OpenAI凑3000亿美金算力投名状,甲骨文裁员3万、卖医疗巨头Cerner抵债。其陷入信用危机,还改结算规则转嫁风险,订单交付迟,OpenAI或转单。甲骨文这场豪赌输赢未知。
5 分钟搞懂开源大模型选型核心维度,16G显卡也能选对
文章以作者自身经历引入,指出开源大模型选型易陷入‘越大越好’误区。讲透选型4个核心维度,含实操步骤与避坑指南,还介绍选后评估方法,助新手快速锁定适配模型。
拒绝计算“一视同仁”!Elastic Attention:让大模型学会“看人下菜碟”
现代大语言模型用全注意力机制计算复杂度高,现有混合注意力策略是静态的。为此提出Elastic Attention,引入轻量级Attention Router,具备动态路由等亮点,在主流模型测试中效果好。
卢宗青团队新作:人类先验打底,统一动作对齐,通用机器人模型正在落地
机器人行业核心问题是让机器在真实世界稳定行动。卢宗青团队论文《Being - H0.5: Scaling Human - Centric Robot Learning for Cross - Embodiment Generalization》给出通用操控路线,系统性解决多形态平台部署问题。
Anthropic:大模型开始意识到自己在想什么!
Anthropic的Jack Lindsey论文《Emergent Introspective Awareness in Large Language Models》对大模型做神经科学受控实验。发现Claude Opus 4/4.1能感知内部念头,区分内外状态,通过检查内部状态一致性判断输出意图。
刚刚,苹果官宣iphone搭载最强AI,每年给Google 10亿,不愿在信ChatGPT。
早上苹果与Google官宣的新闻刷屏,下一代苹果基础模型将基于Gemini构建。苹果因自研来不及且人才流失,选择花10亿买Google模型。还分析了未选OpenAI的原因,以及隐私方面的问题。
微软:DeepSeek-R1等推理模型循环的原因找到了
前几天,DeepSeek - R1论文更新,披露诸多细节。重点是推理模型在低温/贪心解码下易循环,根源是学得不对,如风险规避式复读、时序相关错误复读,还给出解决方案。