「端侧推理模型」共找到 8134 篇相关文章
刚刚,智谱正式成“全球大模型第一股”,开盘涨超3%!10位董事7个清华背景,专家:国内IPO抢收“确定性”,OpenAI们豪赌“无限性”
今天,智谱在港交所正式挂牌上市,成“全球大模型第一股”。其有技术、产品、商业化等竞争力,但未盈利,研发投入大。专家认为国内大模型厂商上市是抢收确定性,而OpenAI等是扩展无限性。
快手发布Keye-VL-1.5,同量级SoTA,让模型真正看懂视频!
近年来,多模态大语言模型兴起,但视频理解仍是难题。快手Keye团队推出Keye-VL-1.5,通过Slow-Fast编码策略、渐进式四阶段预训练和全面后训练流程等创新,实现视频理解突破,综合性能领先。
ACL'25 | CIGEval:一种基于多模态大模型的可控生图评测智能体
阿里国际AI团队提出CIGEval,这是基于多模态大模型驱动的图像生成评估智能体框架。它集成多功能工具箱,通过任务拆解与工具调度提升评估准确性与可解释性,已在ComfyUI - Copilot上线。
北大校友、OpenAI前安全副总裁Lilian Weng关于模型的新思考:Why We Think
北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算研究进展,探讨激励模型思考方式,介绍思维链、并行采样、序列修订等策略,还提及强化学习、外部工具使用及未来研究方向。
从自己出题到自己选题:耶鲁新方法让大模型 Self-Evolution 又进一步
本文解读了耶鲁、斯坦福等多机构联合提出的INFUSER大模型自进化新方法,针对现有方法仅以难度筛选训练数据的缺陷,提出用影响力分数筛选高价值训练题,实现双模型协同动态进化,实验验证效果显著。
碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强
国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。
DeepMind 最新研究:智能体就是世界模型!
DeepMind研究科学家Jon Richens团队在ICML 2025发表论文,从第一性原理证明智能体就是世界模型,回答了AI界多年的根本问题,还带来多个有趣推论,引发AI社区热烈讨论。
5700问答对全面评估拷问AI空间感!最新空间智能评测基准来了丨浙大&成电&港中文
当前视觉语言大模型空间信息学习片段化,缺乏多维度空间推理能力。浙大、成电和港中文团队提出ViewSpatial - Bench基准体系,评估主流模型,揭示其缺陷,并开发MVSM优化跨视角空间理解。
重磅开源!首个全异步强化学习训练系统来了,SOTA推理大模型RL训练提速2.77倍
清华大学和蚂蚁技术研究院联合团队开源全异步强化学习训练系统 AReaL-boba²,坚持“全面开源、极速训练、深度可定制”理念,实现异步 RL 训练,训练速度最高提升 2.77 倍,支持多轮智能体强化学习训练。
仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!
剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。