「token危机」共找到 759 篇相关文章
震惊!如果AI掌控核按钮,95%的情况它会按下去
伦敦国王学院研究者让GPT - 5.2、Claude Sonnet 4和Gemini 3 Flash三款模型模拟核危机博弈。不同时间框架下模型表现不同,还展现复杂战略推理能力,95%对局用了战术核武,暴露诸多问题。
半量工具,双倍效能:ARPO革新大模型强化学习
大语言模型在多轮工具调用场景有挑战,传统强化学习算法有探索效率低和资源消耗大问题。本文提出ARPO,通过量化token熵分布变化设计自适应探索机制,降低工具调用成本且提升多轮推理性能。
黄仁勋:芯片公司的时代已经结束了,现在是 AI 工厂的时代
Lex Fridman 采访黄仁勋,黄仁勋谈对 AI 行业理解,认为 AI 是工业产品,NVIDIA 像建 AI 工厂。还提及算力是智能扩展关键,计算从检索转向生成,Token 细分市场,以及公司组织、架构、开源等多方面观点。
陈立武的无限战争
本文讲述陈立武在半导体领域的辉煌成就,他曾执掌楷登电子,华登国际投资超100家半导体企业。他出任英特尔CEO后虽带来投资,但因推动收购自家孵化企业引发信任危机,不过长期看其地位或难动摇。
曦望,死磕AI推理成本|甲子光年
1月27日,国产GPU厂商曦望发布新一代推理GPU芯片启望S3等。启望S3面向大模型推理定制,设计系统级重构,单位Token推理成本降约90%。曦望还推出超节点方案及推理云计划,目标是极致推理性价比。
Gemini 2.5 Pro 负责人:最强百万上下文,做好了能解锁很多应用场景
谷歌DeepMind长上下文预训练联合负责人Nikolay Savinov在播客中分享Gemini 2.5长上下文技术。他认为长上下文能革新产品交互,与RAG协同,未来千万级token上下文将成标配,但当前百万级未达完美时扩规模意义不大。
Code Arena全球可用模型第一!智谱GLM-5.2上线并开源
智谱上线并开源GLM-5.2,在Code Arena等平台表现优异,长任务跑分出色,架构有突破,支持100万token上下文,还引入控制功能。模型在常用编程智能体可用,适配国产算力平台,以MIT协议开源。
哈佛CS博士月入4000,抢GPU搞科研!硅谷百万年薪挖人,学界疯狂逃离
AI人才大战使学术界陷入危机,博士生津贴低、抢显卡搞科研,面对硅谷百万年薪和大厂千亿算力投入诱惑,加速流向产业。教授担心学生跳槽,高校补救难,产业还推出“折中方案”,学术界考验才刚开始。
EMNLP 2025 | 动态压缩CoT推理新方法LightThinker来了
随着AI发展,大语言模型处理复杂推理任务能力提升,但推理产生大量中间步骤和文本,拖慢计算速度、增加资源压力。研究者提出LightThinker,模仿人类思考模式,动态压缩推理步骤,削减tokens数量,降低成本。
2026,一篇不错的高效Agents技术全面综述
上海AI Lab等9所高校联合发表《迈向高效智能体(Agents):记忆、工具学习与规划综述》。文章介绍了高效智能体概念,分析其效率危机,阐述提升效率的三大战略方向,涵盖多种记忆、工具学习和规划方法。