「小参数量模型」共找到 8194 篇相关文章
推荐系统进入“大模型时刻”:昇腾NPU如何支撑千亿级生成式推荐落地
文章基于华为郭威在2025 AICon大会演讲,复盘华为推荐技术探索。介绍FuXi-α、β模型设计,解决训练和推理难题;分享“多阶段统一建模”进展,提出Performance Law;还介绍了训推系统优化及未来聚焦“强算力”“强模型”融合。
开源模型竟被用于窃取下游微调数据?清华团队揭秘开源微调范式新型隐藏安全风险
清华、墨尔本大学团队研究指出,基于开源模型微调专有模型存在新型隐藏安全风险,开源模型发布者可埋后门窃取下游微调数据,新风险难检测、危害大,目前攻防方法待改进。
AI能否「圣地巡礼」?多模态大模型全新评估基准VIR-Bench来了
来自日本高校和企业团队提出多模态大模型评估基准 VIR-Bench,用于评测 AI 对旅行视频中地理位置与时间顺序的理解。它将任务拆解,构建数据集,实验显示模型虽有改进但性能远未达标,指明了大模型进化方向。
ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案
多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。
逐个token太慢!大模型原生并行出token,CMU、英伟达新作Multiverse
卡耐基梅隆大学(CMU)和英伟达研究者提出Multiverse,这是能实现原生并行生成的新型生成模型。它解决了现有并行生成模型缺乏连贯性等问题,通过多方面协同设计构建推理模型,还开源了生态系统。
ICML 2025 | 大模型能在信息不完备的情况下问出正确的问题吗?
当前大语言模型推理研究多聚焦被动推理,主动推理研究少,制约其在现实场景应用。为此提出 AR - Bench 基准评估大模型主动推理能力,实验显示大模型主动推理能力严重不足,并指出后续拓展方向。
杨植麟当主持人的大模型圆桌:张鹏罗福莉夏立雪都放开说了
中关村论坛上,杨植麟、罗福莉、张鹏、夏立雪、黄超齐聚,共论agent的下一代演进。各位大咖观点硬核,如罗福莉认为中国大模型团队优势在‘算力受限下的最优解能力’,张鹏解释智谱新模型涨价原因等。
直播预约 | SwS: 强化学习训练能否不依赖外部知识优化模型的弱点?
该论文提出强化学习场景下的启发式数据合成流程(SwS),利用模型自我感知弱点驱动自动化问题生成,弥补推理缺陷。对其扩展后适应性更广,在多基准测试集和模型上验证有效,性能提升显著。
深度解析世界模型:新范式的路线之争,实时交互与物理仿真
文章认为2026年多模态技术将有大发展,世界模型轮廓渐清。文中对比语言、视频生成模型,指出世界模型优势,分析实时视频与3D结构化两条路线,介绍不同公司产品并以四象限框架分类。
小扎挖走四名顶尖华人震惊Sam Altman,OpenAI最新内部全员信:奉陪到底,薪资大调整
小扎挖走OpenAI四名顶尖华人研发领导,震惊OpenAI。OpenAI首席研究官Mark Chen发全员信,承诺与小扎正面交锋,重新调整薪酬。小扎给钱激进,还挑OpenAI员工休整时挖人。