成本降低」共找到 2042 篇相关文章

算法论文8

ICML 2025 Spotlight|华为诺亚提出端侧大模型新架构MoLE,内存搬运代价降低1000倍

华为诺亚和北大研究人员提出端侧大模型新架构MoLE。它解决传统MoE显存开销大、传输延迟高问题,推理时将专家输入改embedding token,用查找表替代矩阵运算,实验显示性能与MoE相当,大幅降推理延迟。

机器之心
开源动态8

首篇自进化智能体系统技术报告出炉:Token成本直降近10倍,省钱又高效!

全球首个基于‘上下文信息密度最大化’的自进化智能体系统GA发布技术报告。它在多基准测试表现惊艳,能省近10倍Token,还能自我进化。报告深度解读设计理念,剖析自进化能力与智能体设计思路。

机器之心
算法论文8

DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角

DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态大模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。

AI寒武纪
推荐文章7

一个任务50次调用,成本狂砍90%?Manus首次公开上下文工程秘诀,一堆反复重写换来的教训

Manus项目团队分享上下文工程秘诀。他们押注于此,使产品发布改进更快。还阐述围绕KV缓存设计、掩码非移除工具、用文件系统作上下文等原则,助构建AI Agent者少走弯路。

AI前线
新闻资讯8

从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!

90 后华裔女高管 Cat Wu 推动 Anthropic 产品按天迭代。她介绍团队分工、产品决策围绕安全 AGI 使命,还谈及源码泄露、模型使用等问题,分享工具使用场景及对 PM 能力要求,鼓励用 AI 自动化工作。

AI前线
新闻资讯8

黄仁勋 GTC 2026 演讲实录:所有SaaS公司都将消失;Token成本全球最低;“龙虾”创造了历史;Feynman 架构已在路上

北京时间 2026 年 3 月 17 日,英伟达 CEO 黄仁勋在 GTC 演讲,介绍一整套 AI“全家桶”。回顾 CUDA 20 年,提及数据处理新软件库,还展示 Vera Rubin 平台等,预测 SaaS 公司将消失,英伟达 2027 年营收或达万亿美元。

InfoQ
新闻资讯7

一个“蠢问题”改写模型规则!Anthropic联创亲曝:瞄准Claude 5开发爆款应用,最强模型的价值会让人忽略成本负担

Anthropic联合创始人Jared Kaplan在YC分享Scaling Law对大模型发展的影响及对Claude等模型的意义。他认为AI发展不平衡,建议构建未完全跑通的产品,还介绍了Claude 4优化,探讨人机协作等内容。

InfoQ
推荐文章7

一个“蠢问题”改写模型规则!Anthropic联创亲曝:瞄准Claude 5开发爆款应用,最强模型的价值会让人忽略成本负担

Anthropic联合创始人Jared Kaplan在YC分享Scaling Law对大模型发展的影响及Claude模型意义。他指出Scaling Law源于问“蠢问题”,是推动AI进步核心动力,还给出产品构建建议,介绍Claude 4优化。

AI前线
新闻资讯7

告别Sora!从巅峰到黯然离场不到一年半,团队将转向物理AI

2026年3月24日,OpenAI宣布关闭视频生成应用Sora。Sora曾惊艳全球,但因合规麻烦、行业阻击、算力成本高、商业回报低等问题走向关停。团队将转向物理AI,聚焦世界模拟研究。

AIGC开放社区
产品应用8

探索 GPU 加速向量检索:NVDIA Cagra 在微信大规模推荐系统中的应用实践

本文分享腾讯团队将 Cagra GPU 图索引大规模应用于微信核心线上推荐业务的实践。介绍 Cagra 算法原理与优势,讲述线上化改造、架构演进、CPU/GPU 协同优化等,展示业务落地显著收益。

腾讯技术工程