混合注意力模型」共找到 7869 篇相关文章

开源动态7

“养团队造语言”时代终结?Rust传奇人物用Claude造出新开源编程语言,AI写下万行代码:大模型上限很高,我学会了高效用它!

Rust核心贡献者Steve Klabnik借助Claude写了新语言Rue并开源。他曾是AI怀疑论者,现认为大模型在编程中‘真的有用’。Rue目标是不依赖垃圾回收提供内存安全,使用体验更顺手,开发深度依赖Claude。

InfoQ
开源动态8

想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下

阿里达摩院推出 RynnBrain 模型,从底层出发将时空记忆和物理空间推理训进模型,在 16 项具身 Benchmark 上达 SOTA。还开源 7 个模型,解决通用大模型在物理世界的局限,在多项任务表现出色。

机器之心
开源动态7

腾讯助力Deepseek完善DeepEP,RoCE提升100%,InfiniBand提升30%

Deepseek团队合并腾讯提交的代码完善DeepEP,称有巨大速度提升,RoCE提升100%,InfiniBand提升30%。DeepEP是为混合专家模型和专家并行设计的通信库,有多项创新特性,适合现代AI应用。

CourseAI
算法论文8

RL加持的3D生成时代来了!首个「R1 式」文本到3D推理大模型AR3D-R1登场

强化学习首次被系统性拓展到文本到3D生成领域,上海人工智能实验室等机构研究者提出首个强化学习增强的文本到3D自回归模型AR3D - R1,还提出Hi - GRPO范式和MME - 3DR基准,实验显示其性能优异。

机器之心
开源动态8

比NanoBanana更擅长中文和细节控制!兔展&北大Uniworld V2刷新SOTA

兔展智能与北京大学的UniWorld团队推出图像编辑模型UniWorld - V2,它提出UniWorld - R1框架,在权威测试中超越顶尖闭源模型。该框架通用性强,能提升其他基础模型性能,相关论文、代码和模型已开源。

量子位
新闻资讯7

The Batch: 844 | AI 天气预测加速推进

美国国家飓风中心与 Google 的 Weather Lab 合作,利用新模型预测风暴。该模型能比传统方法更准确预测风暴形成、路径和强度,最长提前 15 天,测试表现优于 Google 之前的 GenCast 模型和 ENS 模型

DeeplearningAI
算法论文7

The Batch: 881 | 一千万 token 的输入上下文

Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务中表现佳,但小模型,大规模表现未知。

DeeplearningAI
产品应用8

搜狐架构演进技术实践:我们如何用 MCP Registry 根治 AI Agent 的“千具之灾”

本文讲述搜狐团队在构建企业级 AI Agent 时遭遇‘千具之灾’,当前路由模型方案引发‘治理噩梦’。后通过研究 MCP Registry 获新思路,设计新架构,构建 PoC 原型,并对混合路由等问题展开思考。

InfoQ
产品应用8

DeepSeek-V3.1 发布,官方划重点:Agent、Agent、Agent!

2025年8月21日,DeepSeek V3.1正式发布。它采用混合推理架构,支持双模式,网页端、App、API均升级,上下文拓展至128K。其智能体能力增强,思考与输出效率提升,还具备API新特性,模型已开源,价格也将调整。

Founder Park
推荐文章7

中美 NeoLab 对话:模型和 Agent 如何实现「持续学习」?

在新加坡 AGI Playground 2026 舞台上,AMI Labs 林敏和 Mind Lab Andrew Chen 深度对谈,探讨 Agent 如何将经验转化为能力、持续学习。两人对持续学习给出不同答案,还讨论记忆、学习等基础问题及解决办法。

Founder Park