token效率」共找到 1758 篇相关文章

算法论文8

SearchAgent-X: 打破效率桎梏,释放下一代「AI搜索智能体」的真正潜能

论文提出SearchAgent-X框架解决AI搜索智能体效率难题。研究剖析效率瓶颈,发现精度和延迟问题,提出优先级感知调度与无停顿检索技术,经评估大幅提升性能且不牺牲答案质量。

PaperAgent
新闻资讯7

号称1200万token上下文的模型来了,数据亮眼但疑点重重

当地时间5月5日,Subquadratic公司推出模型SubQ,称是LLM智能重大突破,有1200万token上下文。数据亮眼,如在1M token场景比FlashAttention快52倍等,但也引发质疑,有人推测是对开源模型微调,官方未公布详细模型卡。

DeepTech深科技
算法论文8

南开 && UIUC | SearchAgent-X,打破「效率瓶颈」,让复杂「AI搜索智能体」走向现实

南开大学和伊利诺伊大学厄巴纳 - 香槟分校的研究提出SearchAgent - X框架,解决大型语言模型驱动的搜索智能体效率痛点。它剖析制约效率的原因,通过两大‘加速引擎’优化性能,实验显示效果显著。

AINLPer
产品应用8

3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!

文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在多个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。

CourseAI
产品应用8

微软深夜发布SambaY架构,Phi-4min加速10倍推理

微软基于Phi - 4 - mini微调出Phi - 4 - mini - Flash - Reasoning 3B模型,扩展到200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行速度比前代快10倍,有诸多优点。

CourseAI
算法论文8

ACL 2026 Main|混合推理模型也会「钻空子」:南大移动团队提出TNT,破解「假装不思考」骗奖励

大型推理模型存在「过度思考」问题,训练混合推理模型易出现奖励欺骗。南大等团队提出 TNT 方法,利用思考模式解答部分为问题动态设非思考模式 token 上限,解决奖励欺骗,实现准确率与效率双赢。

机器之心
产品应用8

微软深夜发布SambaY架构,Phi-4min加速10倍推理

微软基于Phi-4-mini版本,针对特定推理任务微调出Phi-4-mini-Flash-Reasoning 3B模型,将其扩展到200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行快10倍,有诸多优点。

PaperAgent
算法论文8

ACL 2026|答得更准还写得更短?华为泰勒实验室提出SHAPE,给LLM推理装了个「推理税」

华为泰勒实验室等团队提出 SHAPE,给推理链装「里程碑 + 推理税」机制。它分三步,能统一势能增益度量、阶段难度感知和 token 效率约束。实验显示,它提升准确率、降低 token 消耗,还解决了推理坍缩等问题。

机器之心
开源动态7

感谢 OpenClaw,国产大模型终于知道怎么挣钱了

OpenClaw作为免费开源项目,重新定义Token消耗量级,催生‘超级Token耗散场景’,倒逼模型厂商推出‘Token Plan’。多家国产模型厂商跟进推出‘龙虾套餐’,云平台也下场布局。但OpenClaw面临配置门槛、任务稳定性和必用场景等问题。

Founder Park
推荐文章8

模型之上,才是真正的资产

微软CEO萨蒂亚·纳德拉在《没有生态的前沿,立不住》中提出,每家公司未来要构建人力资本与Token资本。强调Token资本构建靠学习闭环,还提出检验公司是否拥有Token资本的方法,呼吁避免价值集中到少数模型公司。

五源资本 5Y Capital