精细化Token管理」共找到 1205 篇相关文章

推荐文章7

C端热战,B端暗涌:大模型真正的战场才刚刚开始 | 《中国大模型落地应用研究报告 2025》正式发布

InfoQ研究中心联合中欧AI与管理创新研究中心发布《中国大模型落地应用研究报告2025》,从驱动因素、C端产品现状到B端落地现状,勾勒大模型应用转折期的图景,分析应用难的原因及各端现状。

InfoQ
开源动态8

SimpleTIR:让大模型“边写代码边思考”不再崩溃

SimpleTIR可解决多轮工具调用中训练崩溃问题。作者指出崩溃原因是分布偏移、低概率token链式雪崩和梯度爆炸。它采用void turn过滤,掐断崩溃链路,训练稳定,还催生多样推理行为,且工程友好已开源。

AI科技评论
产品应用8

特工现场实录|纳米 AI 如何构建 L4 蜂群系统?

纳米AI更新发布L4级多智能体蜂群系统,将“协作”能力写入Agent系统底层。该系统采用三层架构管理运行逻辑,通过协作空间与A2A通信协议配合,实测稳定性佳。平台降低开发门槛,后续规划聚焦多方向。

特工宇宙
产品应用8

Claude Code 快速入门,高频使用点 + 生态工具,一篇搞定!

本文是Claude Code快速入门教程,涵盖安装、常用命令、使用技巧等内容,还介绍成本控制、新功能及访问方案,最后给出不同阶段使用咒语,助用户发挥其最大效能。

AI进修生
新闻资讯7

996 工作制席卷硅谷!招聘启事惊现“加班警告”:接受就是年薪翻倍+股权暴增,不接受就滚蛋

996工作制正席卷硅谷,尤其在AI等领域成部分公司“成长密码”。部分初创企业公开要求员工接受996,也有公司分层推进。不过,此举引发争议,还存在法律风险,网友也对此有不同看法。

AI前线
产品应用7

R2没来,却等来综合性能更优的DeepSeek R1T2

抱抱脸热门排行榜出现R1变体模型DeepSeek-TNG-R1T2,构建于多个父模型之上,在智能与输出token长度间达新平衡点,速度快且测试表现佳,还给出与不同模型对比的选择建议。

PaperAgent
新闻资讯7

小米小爱同学:资源受限下,实现端侧大模型的高性能推理

InfoQ对话小米小爱同学端侧AI负责人杨永杰,探讨大模型端侧部署难题。团队自研推理框架,实现180 tokens/s推理速度,采用共享基座架构支持多业务。未来端侧大模型突破依赖硬件提升与架构演进。

AI前线
产品应用7

大模型终于能“听懂”云操作了?

本文介绍通过MCP Server和大模型结合实现云产品管理的自然语言操作。作者分享上手体验、探究原理、进行代码验证,解决使用问题,还提出后续优化方向和未来展望,如拆分MCP Server、建立云产品Agent等。

阿里云开发者
开源动态8

MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding

文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行时设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。

GiantPandaLLM
新闻资讯8

Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化模型长程任务能力是关键

Anthropic 两位研究员在采访中表示 2025 年强化学习在大语言模型训练奏效,如 Opus 4 能处理长周期任务。还探讨模型发展方向,如用户与多模型交互、模型可解释性等,认为未来会有白领 AI 员工。

Founder Park