「LLM训练」共找到 2867 篇相关文章
Ilya 最新访谈,预训练时代终结后,AI行业来到了哪里?
Ilya接受90多分钟深度访谈,指出当前大模型泛化能力远不如人,Scaling时代终结,研究时代回归。还谈到AI经济影响与跑分不匹配、泛化能力鸿沟、情感价值等问题,预测超级智能5 - 20年到来。
谢赛宁、李飞飞、LeCun联手提出多模态LLM新范式,「空间超感知」登场
纽约大学助理教授谢赛宁与李飞飞、Yann LeCun 合作提出「Cambrian - S」,迈出视频空间超感知探索第一步。该研究引入 VSI - Super 基准,还提出预测性感知范式,在空间认知任务上有提升,相关论文值得视频多模态研究者参考。
扩散LLM推理新范式:打破生成长度限制,实现动态自适应调节
随着扩散大语言模型成为热门,但其推理时存在预设固定长度的限制。香港中文大学 MMLab 等提出 DAEDAL,赋予模型根据问题自主调整回答长度的能力,在性能和计算效率上有提升。
0.016%参数撬动18%性能:关键表征微调破解LLM推理瓶颈
大语言模型在推理任务依赖思维链技术,传统PEFT方法需修改大量参数,新兴ReFT虽只需调整少量参数,但存在不足。本文提出CRFT,仅用0.016%参数量就提升性能,为轻量化推理增强开辟新路径。
万字长文!大模型(LLM)推理优化技术总结(非常详细)
文章聚焦大模型推理优化技术,介绍推理过程分预填充与解码阶段,还阐述模型并行、注意力机制优化、模型优化及服务技术等,如多查询注意力减少内存,FlashAttention 优化计算顺序。
强化学习之父:LLM主导只是暂时,扩展计算才是正解
新晋图灵奖得主、强化学习之父Richard Sutton在新加坡国立大学演讲时预测,大模型主导是暂时的,未来五年甚至十年内不是技术前沿。他认为AI应从依赖人类数据转向体验学习,强化学习潜力需靠扩展计算支撑。
CoT推理大溃败?哈佛华人揭秘:LLM一思考,立刻就「失智」
新研究揭示思维链CoT会分散模型「注意力」,使大模型推理时易出错。研究指出在需遵守指令任务中,用CoT推理模型准确率下降,还总结了四大模式,并提出四种缓解策略。
Lady Gaga进军AI生物科技:用“活体皮肤”训练模型,筛选抗衰老成分
当地时间8月21日,美国歌手Lady Gaga公开参与创办的生物技术公司Outer Biosciences及核心平台Yuna,该司用机器学习等结合离体人体皮肤,从海量化合物中找新护肤成分,已融资约2300万美元。
硅谷今日最热具身模型!不用后训练,看一遍就学会
北美具身初创Skild AI发布全新机器人基础模型S1,主打上下文学习,能看示范视频完成复杂操作。在未见过任务上成功率达66%,远高于传统方法。其发展或让开发机器人技能像给ChatGPT写Prompt。
LLM 竟然会内省!Anthropic 整了个大活:首次揭开 AI 意识
Anthropic最新研究《大语言模型中涌现的内省意识》,首次通过直接操控模型内部状态验证AI能否觉察自己思想。研究采用概念注入技术,发现AI有内省能力,且不同模型表现有差异。