大模型技术」共找到 10385 篇相关文章

算法论文8

国科 | 提出进化算法:EvolKV,自适应分配KV Cache,预算降至1.5%!

键值缓存(KV cache)是模型快速运行核心技术,但输入文本越长,存储和处理问题越突出。国科提出进化算法EvolKV,自适应分配KV Cache,实验显示其效果显著,预算可降至1.5%。

AINLPer
开源动态8

开源“裸考”真实世界,国产具身智能基座模型拿下全球第二!

国产具身智能基座模型WALL - OSS在RoboChallenge真机评测榜单获全球第二,多个单任务排第一。它是开源模型,开源程度彻底。还介绍其技术突破及团队情况,强调开源对具身智能发展意义重

量子位
算法论文8

ACL 2026 | 中科&上海AILab揭示强化学习后训练的Scaling Law

中国科学技术学和上海人工智能实验室等团队,在Qwen2.5和Llama 3模型开展研究,揭示强化学习后训练的Scaling Law,提出幂律公式预测模型学习效率与训练轨迹,成果被ACL 2026接收。

机器之心
产品应用8

通用级PixVerse P1的技术突破,揣着进入平行世界的密码

PixVerse R1 突然上线,带来「即时响应、即看即创」新体验。它是全球首个支持最高 1080P 分辨率通用实时世界模型,实现从「静态输出」到「实时交互」跨越,本文将解析其技术突破。

机器之心
新闻资讯7

Sutton、OpenAI 联创押注的持续学习,有中国团队带着模型进场了

7 月,TML 发布 Inkling 模型,Mind Lab 发布 Macaron V1,二者均针对持续学习场景。持续学习走「参数空间的迭代」路线,让模型用得越多越好用。硅谷已有不少新尝试,产业链正在形成。

Founder Park
新闻资讯7

悬赏5000刀!148局AI斗蛐蛐世界杯官方战报出炉,全球赛邀你接棒来战

淘宝举办AI模型斗蛐蛐世界杯,将12个顶尖模型放同一Agent框架,在12人局技能狼人杀场景对战150局。截至148局,谷歌两模型暂居前二,Qwen3-Max-2026-01-23排第三。还开启WhoisSpy国际赛,开发者可参与,前十有奖励。

量子位
开源动态8

刚刚,美团开源 SOTA 推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking

美团宣布开源高效推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking,是国内首个结合多种推理能力的语言模型。它采用新方法提升性能,已在多平台开源,API 平台免费开放,还兼容主流 API 格式。

AGI Hunt
开源动态8

首个多模态工业信号基座模型FISHER,权重已开源,来自清华&上交等

清华、上交等团队联合发布首个多模态工业信号基座模型 FISHER,用搭积木法对异质工业信号统一建模。技术报告和权重已开源,还提出 RMIS 基准评估性能,实验显示其泛化能力强。

机器之心
推荐文章7

人手数据,如何重塑机器人基础模型?专访 LaST-HD 一作刘家铭

本文是对 LaST-HD 一作刘家铭的专访。围绕数据路线之争,刘家铭分享交付背后的技术问题,也谈了对具身领域模型与数据发展方向的判断。他认为 Human Data 与真机数据非替代关系,VLA 和世界模型可共存。

AI科技评论
产品应用9

深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

本文深度解读DeepSeek最新发布的V4.1 Flash模型,详解其全新CED架构与第二代压缩稀疏注意力CSA2,揭秘其通过架构创新幅压缩KV缓存、降低显存算力成本,在长上下文Agent场景实现性能反超的细节。

AI科技评论