大语言模型」共找到 9286 篇相关文章

新闻资讯8

9位顶级研究员连讲3晚,华为盘古模型底层研究揭秘

华为诺亚方舟实验室成果颇丰,4月开发千亿级通用语言模型Pangu Ultra,5月推出稀疏大语言模型Pangu Ultra MoE。5月28 - 30日,机器之心联合举办分享会,9位研究员揭秘量化、剪枝等关键技术突破。

机器之心
开源动态8

Day0迁移、一键部署,华为开源的昇思MindSpore成为模型开发的“万能钥匙”

模型无法一统天下的背景下,开发者面临在一个框架、生态体验众多主流模型和AI技术的难题。华为开源的昇思MindSpore可实现训练Day0迁移、推理一键部署,还介绍了其相关技术和实测效果。

量子位
新闻资讯7

小米小爱同学:资源受限下,实现端侧模型的高性能推理

InfoQ对话小米小爱同学端侧AI负责人杨永杰,了解其团队在资源受限的端侧设备实现模型高性能推理的策略。目前端侧模型商业化落地慢,团队提前布局,自研框架,实现超180 tokens/s推理速度,还分享未来突破方向。

InfoQ
算法论文7

清华唐杰新作:模型能打掼蛋吗?

清华、北邮等团队联合研究表明模型能打掼蛋等8种棋牌。不同模型在不同棋牌表现有差异,如GPT - 4o综合佳,GLM4是“全能型选手”。研究还探讨学习方法、模型性能影响因素及游戏间相互作用等。

量子位
开源动态8

探针伸进模型黑箱,南加州学华人团队打造AI记忆研究的深空望远镜

南加州学 Robin Jia 教授团队借助英伟达算力,构建基于 Llama 3 架构的全开源受控模型 Hubble,其成果将在 ICLR 2026 亮相。研究揭示模型记忆机制效应,还评估了‘机器遗忘’技术,有法律应用潜力。

DeepTech深科技
产品应用8

跨机器、物体与各种任务!RoboScience发布通用具身模型

RoboScience机器科学发布Visics通用具身模型并披露VLOA技术架构。该模型从底层搭建全新具身基础表征单元,适配任意机器人、物体和任务。其由具身世界模型和通用操作模型组成,有强泛化和操作能力。

AIGC开放社区
开源动态8

推理速度10倍提升,蚂蚁集团开源业内首个高性能扩散语言模型推理框架dInfer

近日,蚂蚁集团开源业界首个高性能扩散语言模型推理框架 dInfer,在基准测试中,其将 dLLM 推理速度较 Fast - dLLM 提升 10 倍以上,攻克推理瓶颈,为开发者提供高效框架,推动扩散语言模型走向成熟。

机器之心
推荐文章8

小白也能看懂,一文彻底说清 MCP、A2A与AG-UI,模型应用集成协议三件套。

文章面向有一定技术基础但不熟悉模型应用开发的读者,通俗介绍MCP、A2A和AG - UI三主流集成协议,分别解决不同的集成难题,三者构成模型应用集成完整生态。

AI大模型应用实践
算法论文8

别被室内基准高分骗了:模型是在推理空间,还是在「背答案」?

2025年,空间智能成模型竞争新热点,模型在室内基准上分数飙升。但因训练与测试数据同源,其提升或只是“背答案”。中科院学等机构发布OSI - Bench重新审视模型空间能力,评测显示当前提升可能是虚假繁荣。

机器之心
算法论文8

ICLR 2026 Oral | 没人诱导,模型也会「骗人」

新加坡国立学 Bingsheng He 教授团队论文关注无诱导下模型是否诚实。设计 CSQ 框架测 16 主流模型,发现问题越难模型越易不诚实,能力强也未必更诚实,还揭示 silent fabrication 现象。

机器之心