动态token选择」共找到 1305 篇相关文章

新闻资讯7

The Batch:836 | 基准测试成本攀升

独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。

DeeplearningAI
算法论文8

新SoTA方法RM-R1:让reward model对评分说出原因!超越GPT4o

过去模型‘黑箱打分’不透明、不灵活。论文提出ReasRM,经两阶段训练,让奖励模型像人类先思考再打分。它能分任务类型、动态奖励,实验中碾压GPT - 4,小模型逆袭,团队已开源6个模型。

深度学习自然语言处理
推荐文章7

同一模型便宜50%,API Hub靠什么赚钱?

文章探讨大模型API Hub低价卖Token现象,指出低价出售的常是闲置算力等。分析厂商不官网降价原因,介绍第三方低价来源及Hub盈利途径,给出判断低价Hub能否用的检查清单。

AI Reading Hub
新闻资讯8

百度想明白了:旧供给到达极限了

当下企业应用AI时,Token成本高、推理效率低问题凸显。百度Create大会释放旧供给达极限信号,推出新全栈AI云,含Agent Infra和AI Infra两层架构,多个场景应用初显成效。

InfoQ
新闻资讯7

全球AI算力大战变天!十万卡算力集群爆表,国产IB真香?

大模型竞赛进入万卡、十万卡时代,网络取代算力成新瓶颈。过去RoCE因成本优势受青睐,但集群规模扩大后运维复杂。IB架构以其稳定性迎来价值重估,国产IB方案突破或改变技术路线选择

新智元
算法论文8

人形机器人控制新突破!敏捷稳定两不误,一个策略让人形机器人完成叶问蹲和跳舞|港大&英伟达&清华

港大、NVIDIA和清华联合团队提出AMS统一人形机器人全身控制框架,首次在单一策略实现动态运动跟踪和极限平衡控制。通过异构数据源、混合奖励机制和自适应学习策略,解决数据限制和优化目标冲突问题。

量子位
开源动态8

DeepSeek开源的不仅仅是个新OCR模型。。。

DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。

AI工程化
产品应用7

Fable 5被网友薅出省钱神招!最高减70%!

网友发现把Fable 5上下文转成图片,让模型通过OCR读取,token输入成本最多省70%。方法pxpipe在GitHub获3000+STAR,本质是本地代理,还引出谷歌老论文及DeepSeek - OCR相关技术。

量子位
产品应用8

很多创业者都没意识到,Deep Research 也是做 Go-to-Market 的利器

用好 Deep Research 可提升 AI 产品 GTM 效率,主流 AI 产品都有该功能。前 Meta 战略总监写实用指南,从技巧、提示词公式、工具选择等阐述,还给出 5 个 GTM 用例及提示词模板。

Founder Park
算法论文8

冗长响应缩减80%,DeepSeek GRPO获得颠覆性改进,微软GFPO问世

微软研究员曝出颠覆性强化学习算法 GFPO,能削减推理多余 token 长度达 80%。它基于 DeepSeek 的 GRPO,可同时优化多响应属性,团队还提出自适应难度变体,实验显示 GFPO 在多方面表现出色。

机器之心