推理服务基础设施」共找到 2938 篇相关文章

推荐文章7

分享2个模型省钱大法

文章分享两个大模型API省钱技巧。一是文本转截图,适用于输入长输出短、费用花在输入token的任务;二是音频加速识别,OpenAI语音识别模型Whisper按音频时长收费,加速音频可省钱,还可包装成API服务盈利。

AGI Hunt
推荐文章8

AI的窗口期还剩多久,不同窗口处于什么阶段?战略上车来得及吗

文章指出AI窗口期并非单一窗口,而是一组接力出现的窗口。分析了基础设施投资、AI人才、AI应用创业等五个维度的窗口期阶段,给出识别窗口期的框架,还为普通人抓住窗口期提供了实操策略。

AI Reading Hub
算法论文8

华为超树HTP:不写示例、不调PDDL,AI规划约束通过率飙升62.6%

文章介绍华为超树HTP,它是完全自主、可泛化的推理新范式。能让LLM在超树结构上完成规划,不依赖人工示例和外部规划器,在复杂规划benchmark上实现SOTA准确率并降低token成本,还阐述其原理、创新点及应用实例。

CourseAI
开源动态8

冲上热搜!美团大模型,靠「快」火了

国内外开发者亲测,美团新开源的LongCat - Flash - Chat模型速度超快,推理速度超每秒100个token。它来自美团LongCat - Flash系列,官网可直接用。该模型架构创新,训练方法高效,还做了专属和系统级优化,跑起来又快又便宜。

机器之心
算法论文8

MSRA清北推出强化预训练!取代传统自监督,14B模型媲美32B

微软亚洲研究院联合清北提出全新预训练范式RPT,将强化学习融入预训练,把预训练语料库重构为推理问题集。实验显示RPT-14B表现出色,在多方面媲美甚至超越32B模型,未来RL或在LLM预训练掀起风暴。

量子位
新闻资讯8

聊聊 Token 出海的生意经:模型开源给世界,中国赚什么?

本文围绕中国开源模型展开,介绍了 Cursor 使用 K2.5 模型事件,阐述了开源模型供应链,分析了中国开源模型受欢迎原因,探讨小公司技术机会,还提及开源面临的挑战及未来趋势,指出其正改变全球 AI 基础设施格局。

刘言飞语
新闻资讯7

MiniMax 技术闭门会分享:长上下文是 Agent 的 Game Changer

MiniMax 7月10日举办M1技术研讨会,探讨模型架构创新等领域。会议围绕RL能否赋予模型新能力、预训练价值等展开,指出长上下文是Agent的Game changer,混合架构将成主流,还分享了混合架构推理实践及M1相关问答。

Founder Park
开源动态8

谷歌开源“Agent Skill 超级工具箱”,云、库、引擎、AI全线打通,开发者狂喜

在大模型竞争白热化背景下,谷歌为解决开发者难题推出 Agent Skills。官方仓库含多项技能,涵盖谷歌云核心服务及架构支柱技能,还提供常见任务流程指南,兼容多平台,能省开发代码。此前还有 Addy Osmani 开源的技能库。

InfoQ
算法论文8

CVPR2026满分论文:Proxy-GS为结构化3D高斯溅射引入统一遮挡先验

上海交通大学钟志航团队等在CVPR 2026提出Proxy - GS,面向基于MLP的结构化3D高斯溅射,用轻量级代理网格将遮挡关系变为可见性信号。在推理和训练阶段发挥作用,在遮挡密集场景实现渲染加速,画质与速度均优。

机器之心
产品应用8

一场对话,我们细扒了下文心大模型背后的技术

信通院大模型推理能力评估中,文心X1 Turbo获最高级“4+级”。百度AI Day上,副总裁吴甜解析文心4.5 Turbo和文心X1 Turbo,从多模态、深度思考等方面介绍技术,还展示其在多场景应用成果。

量子位