「算法与神经网络」共找到 6864 篇相关文章
Identity-GRPO:阿里开源多人物定制化视频生成的后训练优化算法
阿里团队提出Identity - GRPO算法解决多人物视频生成身份一致性问题。构建约15000个标注样本数据集,基于Qwen2.5VL设计奖励模型,多项策略增强训练稳定性,实验验证性能提升显著。
Claude Opus 4.7发布:更严谨的长任务处理与自我验证能力
Anthropic发布Claude Opus 4.7模型,相比4.6版处理长任务更严谨,能自我验证输出。它在视觉、指令遵循、记忆等能力上提升,企业级应用表现出色,还有新功能与安全特性,不过使用成本更高。
与Banana Pro过过招,国产Libcom图像合成工作台开启Labubu漫游记
2025年AIGC热度再创新高,通用图像编辑大模型虽功能强大,但在细分领域有不足。上海交通大学牛力团队推出并升级了Libcom图像合成工作台,与Nano Banana Pro对比,其在图像合成上表现更稳定。
ICCV 2025 | HERMES:首个统一3D场景理解与生成的世界模型
本文介绍HERMES,首个统一3D场景理解与生成的世界模型。它由华中科技大学等团队合作研发,通过共享LLM驱动两大任务,解决了输入处理和任务融合难题,实验效果显著,为自动驾驶提供新范式。
刚刚,Claude独立攻克图论猜想,仅用31步!算法祖师爷高德纳震惊发文
Claude Opus 4.6仅用31步独立攻克图论猜想,算法祖师爷高德纳震惊发文,认为需重新评估生成式AI在数学研究中的作用。这标志着AI在自动推理和解决创造性问题上达到新里程碑。
以星为舵:LLM的Post-Train与Rest-Time奖励学习综述
这篇论文提出奖励信号像AI的“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期的三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。
DataBuddy:数据语义驱动的企业 Agent Runtime 设计与落地|AICon 深圳
2026年AICon深圳站8月21 - 22日举办,聚焦多关键方向。腾讯彭锦文将分享《DataBuddy:数据语义驱动的企业Agent Runtime设计与落地》,拆解DataBuddy相关架构,还介绍演讲痛点、听众收益等,大会有10个专题论坛。
DeepSeek-GRPO重要性权重设计错误?详解Qwen3新强化学习算法GSPO
论文指出GRPO在大语言模型训练中不稳定,因其重要性权重设计错误易引入高方差噪声。为此提出GSPO算法,从序列维度计算梯度,解决了MoE模型RL训练的稳定性问题,在Qwen3上效率更高。
小米陈龙团队首作:统一具身与自动驾驶的开源模型
小米具身智能团队发布首篇论文,提出统一具身智能与自动驾驶的新模型MiMo-Embodied。该模型在多任务中领先,其四阶段训练框架打通两领域边界,为行业提供新范式。
复制失败与脏碎片:Linux 页面缓存漏洞影响所有主流发行版
一周内,两处 Linux 内核本地权限提升漏洞“复制失败”和“脏碎片”被披露,可使无特权本地用户获 root 权限。前者由 Theori 用 AI 工具发现,后者由 Hyunwoo Kim 发布,均影响页面缓存,与“脏管道”属同一类漏洞。