「深度学习推荐系统2.0」共找到 4193 篇相关文章
Anthropic发最高警告:0day大爆发即将来临!全球巨头瞬间蒸发数十亿
Anthropic发布新模型预览版Claude Mythos Preview,它在测试中表现惊人,致网络安全巨头Cloudflare股价暴跌。这动摇了SaaS帝国根基,Anthropic启动计划发布生存指南,却遭顶级黑客质疑。
从「悟道」到「悟界」,智源走进大模型的新时代
在2025智源大会上,智源研究院院长王仲远表示大模型技术演进未到终点。会上推出「悟界」系列大模型,包含Emu3、见微Brainμ等,推动AI从数字走向物理世界。还介绍了具身智能成果,且与企业合作打造生态。
Thinking Machines曝LoRA终极指南:10倍学习率,媲美全参微调
Thinking Machines推出论文《LoRA Without Regret》,研究LoRA与FullFT达到相近表现的条件。通过实验发现,把握关键细节,LoRA可与FullFT性能相当,还探讨了关键因素、批大小效应等内容。
大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO
本文介绍了大型语言模型稳定强化学习新路径——几何平均策略优化GMPO。它是GRPO稳定化版本,通过优化几何平均替代算术平均,解决GRPO训练不稳定问题,在多任务实验中显著优于GRPO。
Nature重磅:AI和人脑的根本区别找到了,我们对“聪明”的理解可能全错了
2025年《自然·机器智能》研究指出AI和人类在‘泛化能力’上本质不同。人类泛化靠抽象,学习高效;AI泛化靠统计,学习笨重。未来AI与人应互补协作,而非谁取代谁。
深度讨论 Online Learning :99 条思考读懂 LLM 下一个核心范式|Best Ideas
文章围绕Online Learning展开深度讨论,指出其或为LLM下一个核心范式。探讨了它是通往更高层次智能的关键路径,分析概念定义、非共识,还阐述做好它的方法,以及架构、算力和评估范式等问题。
函数向量对齐技术,让大模型持续学习不“失忆”丨ICLR 2025
中国科学技术大学等校团队破解大语言模型灾难性遗忘之谜,发现遗忘源于模型激活带偏差新功能,非覆盖旧功能。还设计FVG训练法,保留并对齐函数向量,保护模型能力。相关论文被ICLR2025接收,代码开源。
告别「利用率崩溃」:GIPO开启大模型强化学习高效训练新方法 | ICML 2026
树根科技与三一集团团队联合提出 GIPO 算法,在机器人操控及大语言/视觉动作模型强化学习训练中,缓解了策略滞后痛点,改善了 PPO 硬截断引发的‘利用率崩溃’问题。介绍了 GIPO 算法原理、优势及实验结果。
SFT在帮倒忙?新研究:直接进行强化学习,模型多模态推理上限更高
学界常用「监督微调(SFT)+ 强化学习(RL)」训练大模型。但新研究发现,SFT 会引发「伪推理路径」,阻碍推理进步。相比之下,直接进行 RL 训练,模型多模态推理上限更高,该团队训练的模型还刷新了纪录。
深度剖析 MCP SDK 最新版: Streamable HTTP 模式正式发布,为你实测揭秘
MCP SDK 新版本 v1.9.0 发布,新增 streamable HTTP 传输模式。本文对该模式全面剖析与实测,涵盖快速上手、核心参数、session - id 等内容,还介绍开发服务端及多应用实例模式,指出新模灵活性提升但有不足。