「异构混合推理」共找到 2243 篇相关文章
3B小模型,编程得分比肩Opus 4.5,神秘模型引发热议,原是国产
最近,3B小模型VibeThinker - 3B在X上火了,它在编程等推理任务上比肩前沿大模型,体积却小很多。它是国产模型,来自新浪微博团队,在各项基准测试表现出色,不过在通用知识领域表现欠佳。
碾压DeepSeek V3!阿里开源新版Qwen-3,屠榜级断层第一
今天凌晨1点,阿里巴巴开源Qwen3系列新版本Qwen3 - 235B - A22B - 2507。它是非思维推理的指令微调模型,性能强劲,在多类测试基准中大幅超DeepSeek开源的新版V3 - 0324及月之暗面的kimi - k2。
“最强具身VLA大模型”,究竟强在哪儿?
机器人基础模型π*0.6刷屏,能让机器人高效完成多项任务。它引入Recap学习法,突破传统模仿模式。其核心方法RECAP让VLA用奖励反馈和人类介入训练,还能从异构数据学习,实现自我进化。
华为超树HTP:不写示例、不调PDDL,AI规划约束通过率飙升62.6%
文章介绍华为超树HTP,它是完全自主、可泛化的推理新范式。能让LLM在超树结构上完成规划,不依赖人工示例和外部规划器,在复杂规划benchmark上实现SOTA准确率并降低token成本,还阐述其原理、创新点及应用实例。
冲上热搜!美团大模型,靠「快」火了
国内外开发者亲测,美团新开源的LongCat - Flash - Chat模型速度超快,推理速度超每秒100个token。它来自美团LongCat - Flash系列,官网可直接用。该模型架构创新,训练方法高效,还做了专属和系统级优化,跑起来又快又便宜。
MSRA清北推出强化预训练!取代传统自监督,14B模型媲美32B
微软亚洲研究院联合清北提出全新预训练范式RPT,将强化学习融入预训练,把预训练语料库重构为推理问题集。实验显示RPT-14B表现出色,在多方面媲美甚至超越32B模型,未来RL或在LLM预训练掀起风暴。
从deepseek v4的受限流线型超链接mHC谈架构优化
文章围绕DeepSeek v4的受限流线型超链接mHC探讨架构优化。指出过去十年深度学习重扩展层内计算,忽视层间通信。介绍多种层间通信改进方法,提出用检索替代累加,还提及深度注意力机制及混合深度注意力的成果。
AI Agent的未来之争:任务规划,该由人主导还是AI自主?——阿里云RDS AI助手的最佳实践
文章以阿里云RDS AI助手实践为例,探讨AI Agent任务规划该由人主导还是AI自主。实测发现大模型自主规划效果不佳,企业更需稳定可靠,人工规划是最佳选择,还提出用‘混合规划’兼顾灵活与可靠。
CVPR2026满分论文:Proxy-GS为结构化3D高斯溅射引入统一遮挡先验
上海交通大学钟志航团队等在CVPR 2026提出Proxy - GS,面向基于MLP的结构化3D高斯溅射,用轻量级代理网格将遮挡关系变为可见性信号。在推理和训练阶段发挥作用,在遮挡密集场景实现渲染加速,画质与速度均优。
一场对话,我们细扒了下文心大模型背后的技术
信通院大模型推理能力评估中,文心X1 Turbo获最高级“4+级”。百度AI Day上,副总裁吴甜解析文心4.5 Turbo和文心X1 Turbo,从多模态、深度思考等方面介绍技术,还展示其在多场景应用成果。