「参数效率」共找到 1819 篇相关文章
一盘大棋!OpenAI「截胡」IMO金牌,奥特曼为GPT-5献上「核弹级」预热
OpenAI用全新通用推理模型拿下IMO金牌,抢了谷歌DeepMind的风头。此模型是融合新通用技术的推理LLM,在推理时间跨度和效率上有进步。奥特曼借此为GPT - 5预热,陶哲轩指出缺乏统一标准时对比AI表现无意义。
AI正在淘汰“中间层”!昆仑万维方汉:要么冲进前10%,要么学会“向下兼容”
InfoQ 专访昆仑万维董事长兼 CEO 方汉。他指出 AI 会全面提升行业效率,促使从业者“向上”或“向下”发展;企业出海要选好市场、做好本地化和差异化;还探讨了 AI 商业化、开源等问题,认为开源能满足长尾需求、带来销售线索。
RAG技巧与底层代码剖析
文章深入剖析 RAG 技巧与底层代码,从用 Python 基础库构建 RAG 系统,到多种优化方法如上下文增强检索、添加上下文块标题等,还涉及查询改写、重排序等技术,最后介绍了上下文压缩、反馈机制等提升系统效率和质量的方法。
“不用 Cursor和 ChatGPT、手写代码的开发者,怕不是疯了?”
本文围绕开发者是否应使用AI辅助编程展开讨论。支持者认为大模型能提升效率,解决琐碎问题;反对者则质疑其可靠性。文中还分析了大模型在编程中的优缺点,如能生成代码但也有幻觉等问题,并反驳了一些反对观点。
一篇多模态大模型推理技术最新综述
华东师大&字节跳动系统回顾基于强化学习的MLLMs推理进展,涵盖关键算法设计、奖励机制创新及实际应用,探讨了RL在LLMs/MLLMs中的关键设计与优化策略,还涉及多模态大模型推理多方面内容。
苹果提出原生多模态Scaling Law!早融合+MoE,性能飙升秘密武器
如今打造强大多模态模型是AI重要目标,常用方法有局限。法国索邦大学、苹果研究人员开展原生多模态Scaling Laws研究,对比早融合与后融合,探讨多种因素对模型性能影响,发现早融合、多模态MoE优势,为后续研究指明方向。
消费级显卡可以快速上手跑!面壁智能MiniCPM-o 4.5发技术报告
面壁智能联合多方发布MiniCPM-o 4.5技术报告。该模型是业界首个端到端全双工全模态大模型,参数约9B,依托Omni - Flow框架,多项性能对标前沿大模型,还推出多种使用方式,兼顾普通用户与开发者需求。
多模态大语言模型的核心技术架构与训练方法的进化
文章深入剖析多模态大语言模型核心技术架构与训练方法的进化,涵盖建模范式、视觉编码器、语言骨干网络、模态对齐、生成范式及训练方法等方面,介绍其演进路径与代表模型,还提及国内模型创新及开源模型OpenVLA。
NUS LV Lab新作|FeRA:基于「频域能量」动态路由,打破扩散模型微调的静态瓶颈
在大模型时代,参数高效微调(PEFT)已成为迁移大规模扩散模型至下游任务的标准范式。但现有微调方法多采用「静态」策略,忽略扩散生成过程内在规律。新加坡国立大学LV Lab等机构提出FeRA框架,通过频域能量动态路由,实现高效微调。
大模型如何"不训练"也能学习?——上下文学习的隐式权重更新机制
大型语言模型能通过上下文学习(ICL)在推理时即时学习新任务,无需修改模型参数。本文首次证明自注意力层与MLP层组合能隐式将上下文信息转为MLP层低秩权重更新,解释了ICL原理,为构建AI系统开辟新路径。