「大型神经网络」共找到 239 篇相关文章
通过零开销逐层权重卸载技术将SGLang Diffusion wan2.2的推理速度加速60%
文章介绍在优化SGLang对Wan2.2视频生成模型支持时,发现双Transformer架构下第1步和第19步推理慢的问题。通过零开销逐层权重卸载技术,将整体推理速度提升60%,还突破显存墙,且该优化可扩展到其他模型。
303页年度最佳AI Code综述:阿里、字节、快手30家顶级机构出品
分享303页《从代码基础模型到智能体与应用:代码智能实践指南》,由近30家顶尖机构出品。介绍2021 - 2025年代码大型语言模型发展,分析通用与代码专用LLM能力,阐明研究 - 实践差距,还开展实验。
可攻可防,越狱成功率近90%!六大主流模型全中招 | EMNLP'25
研究人员聚焦大型语言模型(LLMs)安全漏洞,提出全新越狱攻击范式SCP与防御策略POSD。SCP基于DTD机制,在6个主流模型上平均攻击成功率达87.23%;POSD能有效抵御攻击,还提升模型泛化能力。
RL在Agentic Reasoning中的作用:拨开迷雾,看清本质
近年大语言模型在推理任务能力惊人,但使用外部工具存挑战。传统SFT无法让模型自主调用工具,强化学习虽被引入,但在智能体推理中面临训练效率、稳定性和泛化能力难题。论文从多维度解构智能体强化学习,提出有效方法。
从静态模型到数字生命体:自进化AI Agent综述
近年大型语言模型催生AI智能体发展,但现有系统依赖人工预设,难适应动态环境。论文提出自进化AI智能体,可通过环境反馈自动优化,还提出三定律、四阶段范式演进模型等,开源EvoAgentX框架。
该工作引来马斯克回复,让Gork破防:CoT是真正的推理,还是训练数据的统计插值?
大型语言模型(LLMs)的思维链(CoT)推理能力被视为突破性进展,但论文揭示CoT可能只是数据分布内的模式匹配幻象,通过实验证明其在分布偏移时表现急剧退化,挑战主流认知。
机器人的「GPT时刻」来了?丰田研究院悄悄做了一场最严谨的VLA验证实验
丰田研究院(TRI)团队研究大型行为模型(LBM),在近1700小时机器人数据上训练并大量部署评估。发现LBM性能提升显著,预训练小数据量也能带来增益,预示机器人通用大模型或到来。
综述 | 从“说出来”到“脑中算”:Latent Reasoning的范式跃迁与无限可能
大型语言模型用显式思维链推理有局限,潜在思维链(Latent CoT)让推理在连续隐藏状态空间进行。论文梳理该领域,建立框架,介绍方法,探讨可解释性与无限深度推理,指出价值、挑战与未来方向。
当AI遇到物理学 —— AAAI大会主题演讲(Daniel)
2026年AAAI大会上,物理学家Daniel Whiteson演讲探讨机器学习与基础物理。指出粒子物理用还原论解释宇宙,虽发现基础粒子,但仍有诸多未知。粒子对撞实验复杂,需机器学习辅助,深度学习已广泛应用,还能助力发现新粒子。
AI 编程别光凭感觉:手把手实操 SDD,把 Vibe Coding 拉回工程轨道。
在AI编程中,“Vibe Coding”模式在大型项目上存在弊端,易带来架构不一致等问题。规范驱动开发(SDD)应运而生,它将重心移到“定义规范”。文章介绍了SDD理念、工具、流程,还给出实操步骤与落地建议。