运行成本」共找到 2017 篇相关文章

算法论文8

阿里通义发布并行计算新策略:1.6B等效4.4B,内存消耗骤降95%

阿里通义团队提出PARSCALE并行计算新策略,受CFG双路径推理机制启发,将并行思想扩展到训练和推理全流程。能让1.6B模型性能接近4.4B模型,内存占用大降,还可用于现有模型,无需从头训练。

量子位
产品应用7

再见Bug!谷歌超级编码智能体Jules上线,免费使用直连GitHub

谷歌推出编程智能体Jules,进入全球测试阶段,有Google账户的开发者可免费试用每日5次。它基于Gemini 2.5 Pro模型,能写代码、修Bug等,还可连GitHub简化流程,预计今年晚些时候推更多功能和企业版。

新智元
新闻资讯7

The Batch: 972|Grok 的 Cursor 联盟获得回报

SpaceXAI发布与Cursor联合开发的视觉 - 语言模型Grok 4.6,已向开发者开放。介绍其输入/输出、特性等信息,阐述工作原理、性能表现,还提及相关新闻背景、重要原因及期望。

DeeplearningAI
新闻资讯7

AI开始替人类调用AI!token用量已是人类5.2倍

据OpenRouter统计,截至8月10日,Agent类token用量半年涨14倍,人类仅2.8倍。差距源于用法差异,虽智能体部分token计价低,但用量大仍烧钱。省钱关键在配套,且智能体任务验收缺人手。

新智元
算法论文8

紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力

视觉Token冗余是多模态模型高效推理与落地的瓶颈,传统筛选方法有缺陷。紫东太初团队提出GMC核心集剪枝方法,具双阶段架构,优势多,实验显示其能在减少Token同时保持性能。

量子位
开源动态7

4.4w颗星!又一个CC Switch,几乎支持所有模型

Free CC(FCC)是本地 API 代理 + 协议转换层,能让客户端透明使用任意 OpenAI 兼容或专用上游模型,保留客户端能力。支持多提供商,架构分层、设计清晰,还有多种技术特性,文中给出安装、启动等步骤。

GitHubStore
开源动态8

openJiuwen协同昇腾打造智能体「算力亲和」技术,首token时延砍半,推理存储占用下降25%

传统推理引擎难以理解 Agent 任务状态,导致推理时延久、显存占用高等问题。openJiuwen 协同昇腾打造智能体「算力亲和」技术,建立语义协同机制,优化 KV Cache 管理,提升 Agent 系统运行效率。

机器之心
算法论文8

LLM后训练太烧钱?清华&腾讯有了破解法门:关键是得会Rollout

大模型强化学习后训练中,rollout预算易成瓶颈,且并非所有rollout都有用。清华和腾讯研究者提出TRACE框架,将Agent轨迹视为树,分配预算给易产生“成功/失败对比”的节点,实验显示其效果良好。

量子位
产品应用7

Cursor、OpenClaw 同时出手,“口袋编程”时代来了:程序员只用“动嘴”!

Cursor 推出 iOS 移动应用 Cursor Mobile,与桌面版打通,可远程管理编程智能体,还支持语音输入。OpenClaw 也官宣有原生移动应用,登陆 iOS 和安卓平台。这标志开发模式向移动化转变,但也有成本等问题。

InfoQ
产品应用7

Anthropic发布Claude Science,AI开始像研二学生一样做科研

当地时间6月30日,Anthropic发布科研产品Claude Science。它运行Claude Opus 4.8,亮点在使用方式,将科研所需整合,还能拆分任务。早期用户反馈良好,与OpenAI、谷歌竞争,已开放测试版。

DeepTech深科技