训练 - 推理不匹配」共找到 3650 篇相关文章

推荐文章8

长上下文不再难:KV Cache 全生命周期优化实战

长上下文大语言模型发展带来计算和内存挑战,现有基准测试多忽视 KV 缓存完整生命周期。微软姜慧强在 AICon2025 分享 SCBench 工具,梳理推理优化方法,介绍 MInference 等,还提出 Tri - shape 方法等成果。

AI前线
算法论文7

递归神经网络的复兴:Mixture-of-Recursions

Google DeepMind研究者设计的语言模型,能判断关键单词并进行深度递归计算,通过轻量级“路由器”节省计算资源,在同等训练成本下表现显著优于传统模型,文中还提及其他解决动态算力分配问题的思路。

PaperAgent
新闻资讯7

爬网页要收费了!AI应用成本再度增高!Cloudflare宣布新实验

Cloudflare宣布“按爬取付费”实验,新注册服务网站默认阻止AI爬虫,爬虫需附带支付意图才能访问。此举旨在让内容创作者从AI公司获利,不过也会使AI训练成本上升,还可能引发连锁反应。

AI工程化
新闻资讯7

「超级智能」终极拼图曝光!小扎连撬OpenAI灵魂研究员,Meta梦之队已成形

扎克伯格从OpenAI等机构挖来九位AI顶级人才,涵盖数据、模型、推理等领域,组建无短板「梦之队」,全力冲刺Meta通向超级智能的最后一跃。此前Meta曾高价挖角OpenAI联合创始人,均遭拒绝。

新智元
算法论文8

RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈

大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。

深度学习自然语言处理
推荐文章7

将思维链(CoT)引入具身世界,哪种路径能真正打通机器人「知行合一」?

文章围绕将思维链(CoT)引入具身智能领域展开。介绍CoT从语言层面到成为机器人行为核心认知机制的转变,分析分层架构与端到端模型两种技术路径,还阐述自变量机器人统一架构的优势和能力。

AI科技评论
新闻资讯7

刚刚,谷歌AI路线图曝光:竟要抛弃注意力机制?Transformer有致命缺陷!

谷歌未来AI路线图曝光,Gemini全模态是重点,模型向智能体转变,推理能力将扩展。谷歌还需突破现有注意力机制限制实现无限上下文。此外,文中盘点了OpenAI、DeepSeek等大厂AI年中表现。

新智元
算法论文8

AI自己给自己当网管,实现安全“顿悟时刻”,风险率直降9.6%

大型推理模型有安全风险,此前监督微调泛化能力有限。SafeKey团队提出创新的SafeKey框架,发现大模型信息“越狱”两大核心,通过双通路安全头和查询遮蔽建模强化模型安全,实验验证其有效性。

量子位
产品应用8

The Batch:827 | Claude 4 推动代码生成能力再升级

Anthropic 发布 Claude 4 Sonnet 和 Claude 4 Opus 模型,支持“推理模式”,能并行调用工具。还发布 Claude Code 编程智能体及 SDK。两款模型输入输出能力强,功能亮点多,性能表现佳,有多种使用渠道和定价。

DeeplearningAI
算法论文7

微软等提出「模型链」新范式,与Transformer性能相当,扩展性灵活性更好

随着大语言模型发展,扩展 Transformer 架构成趋势,但参数规模增长带来训练负担。微软等研究者提出 CoR 概念,构建模型链学习范式,应用于语言模型得 CoLM 系列,实验显示其性能相当且扩展性、灵活性更好。

机器之心