「训练机制」共找到 2825 篇相关文章
LLM-in-Sandbox:给大模型一台电脑,激发通用智能体能力
来自中国人民大学、微软研究院和清华的研究者提出LLM - in - Sandbox范式,让大模型在代码沙盒完成任务,实验显示其能提升多领域表现,无需额外训练,还能减少token消耗,研究者认为应取代纯LLM推理。
AI又封神了!华人新作直出憨豆+《猫和老鼠》,平行宇宙对上戏了
新智元报道,阿联酋MBZUAI团队论文提出CCE和CCA机制,解决AI让不同风格角色同框时的“风格错乱”问题。让憨豆、汤姆等角色自然互动,模型在多角色任务指标上领先,或重写虚构边界。
LeCun预言成真!790年长视频,炼出最强开源「世界模型」
2025年‘世界模型’成AI巨头战场,谷歌、李飞飞团队等纷纷布局。上周北京智源研究院发布Emu3.5,340亿参数,基于790年长视频数据训练,其架构优越,推理快,能力强,还公开技术报告邀全球探索。
告别Transformer!北大、北邮、华为开源纯卷积DiC:3x3卷积实现SOTA性能,比DiT快5倍!
北大、北邮和华为研究提出纯卷积扩散模型 DiC,抛弃自注意力机制回归 3x3 卷积。它性能超 DiT,推理速度快 5 倍,证明精心设计的卷积网络在生成任务中也能表现卓越。
LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%
最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试集考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。
21
本文聚焦vllm v1中管控模型分布式推理的核心Executor部分,介绍其4种类型及适用场景,以mp类型为例阐述Executor - Workers架构,还说明了大小数据在两者间的传输机制及原理。
CMU&NYU最新工作解释:存储在权重里的“智能”是从哪来的?
论文《From Entropy to Epiplexity》指出经典信息论在AI面前有三大悖论,提出用Epiplexity度量信息。它将数据信息拆为Time - bounded Entropy和Epiplexity,通过神经网络训练近似计算,实验验证其有效性,并给出启示。
AI真的需要「像人类」那样思考吗?AlphaOne揭示属于大模型的「思考之道」
近年大模型在推理任务有进展,但缺乏推理节奏调控能力。伊利诺伊大学厄巴纳 - 香槟分校和加州大学伯克利分校研究提出 AlphaOne 框架,引入 α - moment 实现无需训练的推理调控,实验显示其能提升准确率和效率。
阿里新研究:统一了VLA和世界模型
阿里达摩院等提出WorldVLA框架,融合视觉语言动作模型与世界模型。它用三套分词器编码,解决传统自回归模型问题,经联合训练,实验显示其性能优,两模型还能相互助力。
“掩码即武器”,四款扩散LLM全部破防 ? 上交&上海AI Lab发现dllm致命安全缺陷
上海交通大学、上海人工智能实验室等团队研究指出,扩散语言模型(dLLMs)有根本性架构安全缺陷。他们提出DIJA攻击框架,能让多个dLLMs大概率生成有害内容,还呼吁从多方面加强dLLM安全。