分层推理模型」共找到 8160 篇相关文章

算法论文8

腾讯发布SpecExit算法,无损压缩端到端加速2.5倍!解决大模型长思考效率难题

腾讯发布 SpecExit 算法,将思考早停与投机采样融合,利用轻量级草稿模型预测“退出信号”,在不引入额外探测开销的前提下,实现动态、可靠的思考早停,在 vLLM 上推理端到端加速 2.5 倍,准确性和推理效率得到双重保障。

机器之心
开源动态8

牛!小米开源「音频语言模型」,超1亿小时预训练时间,音频理解和输出能力是真顶!

小米推出开源音频语言模型MiMo - Audio,有超1亿小时预训练时间。它能理解音频,70亿参数模型在多基准测试达SOTA,音频理解超Gemini - 2.5 - Flash,复杂推理优于GPT - 4o - Audio,还支持多模态任务。

开源AI项目落地
算法论文7

一场「狼人杀」,考倒了一堆大模型

南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。

AI科技评论
产品应用8

腾讯3D生成模型上新!线稿可变“艺术级”3D模型,鹅厂内部设计师也在用

腾讯上新艺术级3D生成模型Hunyuan3D - PolyGen,支持生成复杂几何模型,鹅厂游戏工作室用后美术师建模效率提升超70%。该模型在拓扑功能实测表现佳,还介绍了其核心原理和技术。

量子位
开源动态8

蚂蚁开源 x SGLang Meetup技术回放解读系列之面向DeepSeek系列模型的深度优化与实践

文章是对蚂蚁开源x SGLang Meetup中「蚂蚁Theta面向DeepSeek系列模型的深度优化和实践」分享的解读,详细介绍了在H20-96G上对DeepSeek系列模型推理的优化方案,包括Prefill和Decode阶段的优化、通信优化、观测诊断等,并给出了评测结果。

GiantPandaLLM
推荐文章8

模型压缩与量化:让大模型走向轻量化落地

文章介绍模型压缩与量化技术,其能在保持性能时降低大模型计算和存储需求,实现边缘设备高效部署。还阐述基础知识、关键技术路径、应用场景,并探讨未来发展方向。

机器学习AI算法工程
算法论文8

苹果新作:内化视觉思考,推理提速 5 倍

Apple研究团队提出Internalized Visual Thinking(IVT),一种将预测性世界建模能力内化到模型表征中的后训练框架。它在训练时预测未来,推理时直接回答,相比Visual CoT推理提速超5倍。

机器之心
新闻资讯7

腾讯混元挖走微软明星大模型团队!一作全员出走,新成果已跻身大模型竞技场TOP 10

微软明星大模型WizardLM一作全员加入腾讯混元,最新成果Hunyuan - Turbos跻身大模型竞技场TOP 10。此前WizardLM - 2发布不顺,且微软将裁员超6000人,国内大厂正激烈争夺大模型人才。

量子位
算法论文8

LLM本质上永远无法实现真正的正确推理

日本埼玉大学荣誉教授Jingde Cheng论文指出,以ChatGPT为代表的大语言模型(LLM)本质上无法实现真正的正确推理。论文定义了“正确推理”,从逻辑和计算原理论证其局限性,为推理智能体研究指明方向。

深度学习自然语言处理
开源动态8

超低延迟的端到端语音模型!首次生成音频仅需53ms,比同级别模型快3-5倍!

随着语音应用场景普及,语音大模型响应慢成瓶颈。VITA团队开源端到端语音模型VITA - Audio,7B参数模型首次生成音频仅53毫秒,比同级别快3 - 5倍,完全开源,有超低延迟等优势。

开源星探