「推理部署」共找到 2654 篇相关文章
超越英伟达Describe Anything!中科院 & 字节联合提出「GAR」,为DeepSeek-OCR添砖加瓦
中科院与字节联合提出「GAR」,为构建自然图像的Dense Caption提供新思路。GAR具备精准描述、关系建模和组合推理能力,通过引入新组件,兼顾细粒度与全局上下文,在多测试集表现优异,且代码等已开源。
LLM 长文本处理的“不可能三角”?我们用 E2LLM 把它破解了!
长文本理解与推理是LLM的难题,存在效果、速度、兼容性的“不可能三角”。蚂蚁集团和华东师范大学提出E2LLM新范式,实现三者平衡,在效果和效率上表现出色,开启长文本处理新篇章。
训练成本暴降99%,35秒出1分钟高清视频!英伟达MIT等引爆视频AI革命
英伟达联合MIT、港大团队提出SANA - Video架构,其核心是创新的全局线性注意力Diffusion Transformer训练框架和全局显存恒定的KV缓存机制。它训练成本低、速度快、可部署,重新定义AI视频生成效率极限。
“像把大象塞进冰箱一样困难”,端侧大模型是噱头还是未来?
InfoQ《极客有约》X AICon 直播聚焦端侧大模型,探讨其落地挑战与破局思路。专家指出端侧部署有隐私、可用性等优势,但面临内存、精度等难题。华为、支付宝等分享方案,还探讨应用场景、商业模式及未来趋势。
为 OpenAI 秘密提供模型测试, OpenRouter 给 LLMs 做了套“网关系统”
OpenRouter成立于2023年初,为用户提供统一API Key调用各类模型,OpenAI会用其秘密测试。平台token用量高速增长,还发布模型用量排行榜引关注。创始人认为大模型非赢家通吃,未来想成agent最佳推理层。
配置驱动的动态Agent架构网络:实现高效编排、动态更新与智能治理
本文提出配置驱动的独立运行时 Agent 架构,解决低代码/平台化 Agent 方案企业级落地难题。介绍其核心架构、注册中心、配置定义等,还提及 Agent Studio、执行引擎等,阐述运行部署、协作、治理,提供通用可落地范式。
AI 原生应用全栈可观测实践:以 DeepSeek 对话机器人为例
本文以 DeepSeek 对话机器人为例,介绍 AI 原生应用架构可观测需求、挑战与方案实践。分析 AI 领域痛点,提出阿里云 AI 全栈可观测架构,剖析大模型应用可观测技术,分享实战案例,还给出未来规划。
基于LLM的Agentic Reasoning框架综述:从方面到场景的全面总结
近年来,大型语言模型虽能力强但有局限,研究者构建基于LLM的智能体系统。此综述论文提出系统、统一分类法梳理智能体推理框架,建立统一描述语言和通用算法,分析其在不同场景表现与评估方法。
9K Star 开源工作流爆火!超轻量直观的AI Agent 工作流构建器!
在AI应用开发领域,将大语言模型与业务逻辑和外部工具结合是重点。GitHub上获9K Star的Sim项目是AI Agent工作流构建器,提供Figma式拖拽界面,无需手写代码,降低配置、调用和部署门槛。
实测GPT-5 Pro:别被普通版骗了!Pro才是OpenAI真正的顶级模型
新智元实测发现GPT-5表现飘忽,但其Pro版本实力强劲。在编程、推理计算、图像识别等多方面表现出色,网友实测后也赞不绝口。此外,文中还介绍了GPT-5提示指南及OpenAI放出旧模型的彩蛋。