长上下文问题」共找到 4089 篇相关文章

新闻资讯7

DeepSeek 为什么把缓存涨了 11 倍?上下文需求暴涨,得交点「存储税」了

8月17日,DeepSeek V4 Pro API输入和输出价格上涨,空闲时段缓存命中价涨5倍,高峰时涨11倍。此前其因高缓存命中率成性价比之选,但上下文需求爆发致后端“缓存颠簸”,只能通过涨价收“存储税”。开发者可提高缓存命中率应对。

AI科技评论
产品应用7

阿里云的野心,不在 Agent Builder

近期云厂商动作整齐,如阿里云推出企业级 Agent 全栈服务平台 Agent Studio。企业做 Agent 面临基础设施难题和高成本问题,业内探索了自建、用开发框架、企业级 Agent 平台三种路径,阿里云 Agent Studio 在多方面替企业解决麻烦,还可能改变云服务模式。

InfoQ
推荐文章8

从“暴力烧Token”到“系统工程”:OpenAI与华为的两条 AI 编程路径

文章对比OpenAI与华为的AI编程路径,指出模型中心派靠推高上下文窗口但有成本高、延迟大等问题;工具驱动派如Cursor和华为云码道重构IDE工具。码道将任务解耦,通过多技术实现性价比,还介绍了底层基石及其实测表现。

InfoQ
新闻资讯8

王小川:医疗行业对大模型有三大刚性要求,但通用模型一条都不达标

5月22日百川智能展示医疗大模型Baichuan - M4与AI家庭医生「百小医」。王小川指出通用大模型用于医疗有问题,医疗对大模型有低幻觉、强循证、会提问的刚性要求,而通用模型不达标。Baichuan - M4表现出色,百小医也有独特定位和优势,且与三家顶尖医院合作成果显著。

Founder Park
开源动态8

让本地大模型不再重复推理的缓存技巧

本地跑大模型时,同样问题换说法问,模型又要重新推理。`constraint-cache`这个Python库可解决此问题,它将语义相似查询规范化为统一缓存键,实现近乎即时的重复查询响应,还避免了随机性响应问题

AI工程化
算法论文7

POF | 西北工业大学宋家豪、张伟伟等:一种基于伴随方法的物理信息神经网络预处理框架

物理信息神经网络(PINNs)在正问题中的病态是其应用于复杂工程问题的局限。该研究设计针对损失函数的预处理框架,通过降低PDE系统条件数缓解PINNs病态,还引入伴随方法解决网络参数梯度缺失问题

力学与人工智能
开源动态7

AI 还在装失忆?1 万 Star 开源 EverOS 有点东西,把 Agent 记忆塞进 Markdown

EverOS 是 EverMind - AI 开源的项目,有 10325 Star。它给 AI Agent 等提供 local - first 期记忆运行时,把记忆源头放 Markdown 里,以 SQLite 和 LanceDB 管理和检索。介绍了其优势、链路、适用场景等。

小华同学ai
新闻资讯7

Zendesk:生成式 AI 让代码不再稀缺,研发瓶颈转向“吸收能力”

Zendesk 提出生成式 AI 改变软件交付核心制约因素,从编写代码转为‘吸收能力’。文章阐述该概念,提出四项应对措施,还指出 AI 对不同系统的影响,深化了编码非瓶颈的观点。

InfoQ
推荐文章7

一个极度实用的深度思考Prompt,帮你挖出最本质的答案。

作者分享推特上一个让大模型深度思考的Prompt,调研后引入‘钢人论证’概念,指出其能避免AI谄媚。作者还写双向钢人Prompt,介绍其作用,并以公司司庆日选择为例展示效果。

数字生命卡兹克
开源动态8

社区供稿 | VibeVoice实现90分钟、多角色播客生成,拓展语音合成新边界

微软亚洲研究院提出全新语音生成模型 VibeVoice,采用 next - token diffusion 机制,能将文字脚本转为最 90 分钟、最多 4 人对话的高质量播客音频,在多方面有显著优势,未来潜力大。

Hugging Face