「新物质发现」共找到 4433 篇相关文章
中科大 × 华为联合突破!SparseRM:1% 参数实现 LLM 偏好建模高效革新
中科大与华为联合提出SparseRM轻量级偏好建模方案,基于稀疏自编码器构建低参可解释奖励模型。实验显示它用不到1%可训练参数,在多任务中性能优,还能融入下游对齐流程,为LLM高效对齐提供新可能。
苹果高级副总裁下岗!AI大败局,靠血洗AI团队解决?
刚进入12月,掌管苹果AI与机器学习战略七年的高级副总裁约翰·詹南德里亚卸任。苹果AI乏力非其一人之过,是谷歌流派与苹果文化冲突所致。此次人事调整后,AI回归软件工程本位,不过人才流失成新挑战。
马斯克悄然发布Grok 4.1,霸榜大模型竞技场所有排行榜
马斯克发布Grok 4.1,同时霸榜大模型竞技场第一和第二。它在思考与非思考模式表现出色,还在新专家榜和职业榜霸榜。此外,它在情商测试表现佳,还加强快速回复、改善幻觉问题,已向所有用户开放。
能懂孩子、懂爸妈、还懂宠物,这届AI硬件太会了
在AI终端生态大会上,荣耀携手伙伴展示AI新用法,发布八大AI场景化生态解决方案,覆盖多高频场景。其构建的AI生态网让AI从‘能用’到‘好用’,还重新定义硬件与人的关系,让AI更懂生活。
三大头部互联网企业交锋,AI时代可观测边界出现了吗?
InfoQ《极客有约》X AICon 直播栏目邀阿里云张城等探讨AI时代可观测新边界。嘉宾们认为AI与可观测技术双向赋能,传统算法与大模型互补,未来有望实现半自治运维,还分享了数据治理等经验。
Thinking Machines又发高质量博客:力推LoRA,不输全量微调
Thinking Machines 博客力推 LoRA 并与全量微调对比。研究发现小数据量任务中 LoRA 与全量微调效果接近,大数据量稍吃力,强化学习中低秩 LoRA 也能接近全量微调。还揭示了 LoRA 关键要素、超参数规律等。
云栖大会阿里掀桌子了!Qwen3-Max、VL、Omini、Agent ... 统统发布!
云栖大会上,阿里云智能首席技术官介绍千问多款新模型发布及一款升级。如万亿参数的Qwen3 - Max,代码和Agent能力强;还有Qwen3 - Coder - Plus、Qwen3 - VL、Qwen3 - Omni、Qwen3 - LiveTranslate等模型各有亮点。
让NCCL性能起飞的NCCL symmetric memory是啥黑科技?— part1
本文是NCCL 2.27新特性系列首篇,介绍symmetric memory。它类似NVSHMEM,现仅支持单节点通信,未来将支持跨节点。其低延迟内核能提升小数据通信性能,还介绍使用示例、CUDA内存管理及Symmetric Memory实现等内容。
清华唐杰新作:大模型能打掼蛋吗?
清华、北邮等团队联合研究表明大模型能打掼蛋等8种棋牌。不同模型在不同棋牌表现有差异,如GPT - 4o综合佳,GLM4是“全能型选手”。研究还探讨学习方法、模型性能影响因素及游戏间相互作用等。
烧了2000美金后,我发现Vibe Coding“已死”!
作者黄叔分享科研成果Spec Coding,称Vibe Coding已死,因其Prompt易逝、迭代混乱。Spec Coding复杂度高于提示词工程,文中给出从0到1及迭代的提示词和步骤,还提及额外好处及理念特性。