大模型数据」共找到 9982 篇相关文章

开源动态8

不只DeepSeek,阶跃等开源JetSpec:模型解码提速近10倍

近期,DeepSeek 推出 DSpark,阶跃星辰提出 JetSpec,都关注模型推理效率。DSpark 关注验证效率,JetSpec 提高有效 Token 生成率。二者切入点不同,但都显示模型行业进入新阶段,推理效率成 Agent 落地基础变量。

机器之心
新闻资讯8

《多模态语言模型技术发展报告》正式发布 | 中科算网算泥社区

2月5日,中科算网算泥社区发布《多模态语言模型技术发展报告》。报告回顾多模态模型发展历程,剖析核心技术创新,展示应用实践,分析挑战与机遇,为各界提供参考,推动多模态AI技术发展。

AIGC开放社区
算法论文8

ICML 2025 | 模型能在信息不完备的情况下问出正确的问题吗?

当前语言模型推理研究多聚焦被动推理,主动推理研究少,制约其在现实场景应用。为此提出 AR - Bench 基准评估模型主动推理能力,实验显示模型主动推理能力严重不足,并指出后续拓展方向。

机器之心
新闻资讯7

官宣!姚顺雨出任腾讯首席AI科学家,带队语言模型、AI Infra

12月17日腾讯官方消息,腾讯升级模型研发架构,新成立AI Infra部等。姚顺雨出任首席AI科学家,兼任AI Infra部、语言模型部负责人,他在智能体方向成果多,论文总引用超1.9万。

机器之心
开源动态7

直播预约 | LightMem:面向模型的轻量化可插拔记忆系统

本报告聚焦语言模型长期记忆构建与轻量化机制。现有外部记忆系统有记忆臃肿、组织低效、更新代价高问题。为此提出LightMem架构,能为模型提供轻量、高效、可扩展记忆组件。

深度学习自然语言处理
新闻资讯7

开源模型TOP5,被中国厂商包圆了

10月公开数据显示中国开源模型占据榜单前五,阿里Qwen系列和DeepSeek影响力深远。从LMArena榜单、HuggingFace数据看,国产模型表现佳。还提及Llama 5相关传闻。

量子位
开源动态8

解码加速15倍!EdgeRazor助推模型在PC/移动端“狂飙”

语言模型参数膨胀,端侧部署难,量化成主流轻量化方案。开源工具库EdgeRazor由南京学和微软联合推出,采用MPQAD打破极低比特语言模型“能力塌陷”,在性能、效率、易用性等方面表现出色,打通AI全生态链路。

机器之心
推荐文章8

无问芯穹曾书霖谈 AI 2.0 时代的模型推理:从模型到硬件的协同优化

本文整理自无问芯穹总经理曾书霖博士在 2025 年 QCon 全球软件开发会演讲。他介绍软硬件协同优化提升智能系统能效成果,结合华为昇腾集群实践,探讨 AI 推理系统演进趋势,还从云、端维度分享模型推理实践与挑战。

InfoQ
推荐文章8

概是我读过关于AI模型最全面、好读又易懂的文章了

文章从神经网络入手,介绍其概念、学习过程,进而引出语言模型,阐述其原理、训练方法,还提及AI浪潮下基础设施及模型使用方式,如Agent、MCP等,展现神经网络和模型发展现状与前景。

腾讯技术工程
开源动态7

视频推理界的“福尔摩斯测试”:所有模型,统统不及格 | 论文代码开源

腾讯ARC Lab和香港城市学推出Video - Holmes,这是视频推理界的‘福尔摩斯测试’,能展现多模态模型复杂视频推理能力的边界,规避现有Benchmark痛点,测试中所有模型全部不及格,代码已开源。

量子位