训练推理加速」共找到 3983 篇相关文章

新闻资讯7

DeepSeek-R2要来了?

DeepSeek-R1发布一周年之际,其存储库更新引用全新「model 1」模型,极可能是R2。HuggingFace发文称R1降低技术、采用、心理三重壁垒。R1以推理优先,改变多项认知,故事仍在继续。

新智元
新闻资讯8

Hinton与姚期智对谈:认为人类的意识特殊,那是危险的无稽之谈

图灵奖得主Geoffery Hinton与姚期智对谈AI相关话题。Hinton认为人脑可给AI借鉴,还探讨人类未来与AI道德,强调训练善良AI重要;他觉得大模型有理解能力,将人类意识特殊化是危险无稽之谈。

AI科技评论
算法论文8

清华刘洋团队论文:揭示为何 70B 的医疗模型,反而不如 8B 会问诊丨ILCR 2026

在医疗AI领域,模型静态评测与临床问诊能力存在断层。清华刘洋团队提出DOCTOR - R1,将临床问诊建模为POMDP,用强化学习训练。实验验证了其有效性,对医疗AI发展有深远启示。

AI科技评论
开源动态8

Transformers v5 中的分词系统:更简洁、更清晰、更模块化

文章聚焦 Transformers v5 分词系统,介绍分词概念、流程、主流算法,对比 transformers 和 tokenizers 库。着重讲 v5 改进,如架构与词表分离,解决 v4 黑盒问题,还能从零训练专属分词器。

Hugging Face
产品应用8

Hybrid Model Support:阿里云 Tair 联合 SGLang对 Mamba-Transformer 等混合架构模型的支持方案

文章介绍阿里云 Tair KVCache 团队与SGLang社区在推理框架上支持混合架构模型的工程化实践。分析混合架构崛起原因、面临挑战,阐述内存管理、关键技术优化方案,验证性能,并指出未来演进方向。

阿里云开发者
开源动态8

The Batch: 864 | GLM-4.5:一款开放的智能体竞争者

大型语言模型推动智能体能力交互竞赛正酣,中国 Z.ai 推出 GLM - 4.5 系列开源权重模型,在推理、编程等基准测试中表现出色,还介绍了其工作原理、研究和测试结果等。

DeeplearningAI
开源动态8

英伟达发布并开源Alpamayo:自动驾驶终于开始讲道理了|甲子光年

北京时间今天凌晨,英伟达在CES现场发布Alpamayo系列开源AI模型、仿真工具及数据集,旨在推动推理型自动驾驶汽车开发。其核心模型Alpamayo 1可展示决策逻辑,此次发布是英伟达在该领域开放程度最高的尝试。

甲子光年
推荐文章8

AI 医疗全景更新:为什么硅谷 healthcare 领域出现了最多的 AI 独角兽?

本文基于对全美700余位医疗行业高管的调研及关键人物访谈,梳理AI医疗落地路径与商业化逻辑。指出医疗行业正推动AI商业化,投资增长催生独角兽,落地呈现“非线性加速”,还介绍了投资格局、应用场景等情况。

海外独角兽
算法论文8

Anthropic 在 Claude 内部发现"全局工作空间",可以直接读取模型没说出口的想法

Anthropic发布研究,在Claude内部发现J - space(雅可比空间),即“全局工作空间”,它在训练中自发形成。用雅可比透镜技术可读取其内容,还验证了其功能属性,可用于对齐审计等。

AI工程化
算法论文8

3D-R1:让AI理解3D世界的下一步

文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。

机器之心