梯度下降」共找到 190 篇相关文章

算法论文8

Attention Sink产生的起点?清华&美团首次揭秘MoE LLM中的超级专家机制

清华和美团研究聚焦MoE LLM,首次发现超级专家子集。通过多模型实证分析,揭示其分布规律、重要性及对注意力机制的影响,开发识别工具,为模型压缩提供新方向。

机器之心
新闻资讯8

AI正在淘汰“中间层”!昆仑万维方汉:要么冲进前10%,要么学会“向下兼容”

InfoQ专访昆仑万维方汉,他认为AI将推动“智能化”,是全面提升行业效率的“催化剂”,会淘汰“中间层”从业者。企业应快速试错,出海要选好市场、做好本地化。此外还探讨了开源、AI应用等话题。

AI前线
算法论文8

大模型"温故而知新"实现了!无需历史数据,Octopus 效果超越全数据训练|CVPR‘26 Octopus

上海交通大学与vivo团队提出全新持续学习框架Octopus,首创无需历史数据的梯度正交化技术。实验显示,它在UCIT基准上表现超SOTA方法,还实现正向后向迁移,适合端侧部署。

量子位
产品应用7

GitHub 如何用 AI 重构反馈处理机制

GitHub 引入由 AI 驱动的工作流,将无障碍反馈转化为工程工作。系统基于 GitHub Actions、Copilot 和 Models APIs 构建,集中管理报告、分析合规性、协调问题解决。采用后问题解决比例提升,时间下降

InfoQ
新闻资讯7

Claude Code越更越废?!大厂AI主管公开怒喷思考深度暴跌,官方回应更被怼爆 :菜成AI“玩具”

开发者 Stella Laurenzo 分析称,Claude Code 在 2 月更新后,思考深度下降 67%、算力消耗大增,无法用于复杂工程任务。她提出改进建议,开发者对此认同,负责人回应遭反驳,部分人考虑转用 Codex。

AI前线
新闻资讯7

谷歌、Anthropic双重围剿下的OpenAI,正面临「生死抉择」

进入2026年,OpenAI将部分重心转向企业级市场,CEO奥特曼召集企业高管聚会,传达服务企业用户意向,还将推新方案助企业AI转型。其发力企业市场,是因流量被谷歌等竞品追赶,似走到转型十字路口。

机器之心
算法论文8

让扩散模型「可解释」不再降质,开启图片编辑新思路

过去三年扩散模型席卷图像生成领域,但可解释性研究是‘黑箱’,且现有尝试常致性能下降。香港中文大学与上海人工智能实验室团队提出TIDE框架,可解释且不降质,还带来新图像编辑方式。

机器之心
算法论文8

GRPO训练不再「自嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化

GRPO在视觉生成流模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务中表现良好。

机器之心
7

硅谷10万大裁员真相:AI根本没想取代你,是老板想干掉你

美国科技公司正大规模裁员,10月裁员人数暴涨。出版业大亨认为AI或致全民失业或经济崩盘,Meta用AI辅助绩效评估。AI常成裁员借口,实则与盲目扩招、财务压力等有关,美国大学文凭也在贬值。

新智元
新闻资讯7

Nature:锂可逆转老年痴呆

Nature报道,补充大脑锂储备可预防甚至逆转阿尔茨海默病。研究通过小鼠实验发现,乳清酸锂能逆转神经病变、消除记忆障碍。此前锂多用于精神药物,此次发现或为老年痴呆治疗带来新方向。

量子位