通用大模型」共找到 9503 篇相关文章

算法论文8

博士宿舍激情脑暴,革新了Scaling Law?Qwen和浙联手推出新定律,直接干掉95.5%推理内存!

近日,阿里与浙合作提出并行计算缩放定律 ParScale,可在不增参数下提升模型能力,推理效率更高。它通过引入并行流实现,在数学、编程等任务表现佳,适合边缘设备,代码已开源。

AI前线
新闻资讯7

为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体

LinkedIn推出认知记忆智能体(CMA),作为生成式AI技术栈一部分,解决语言模型缺乏状态记忆问题。CMA有三层记忆,集成多种机制,在多智能体系统中作用关键,还将人工校验融入招聘应用。

InfoQ
新闻资讯7

小红书 AI 搜索负责人高龑确认出席 QCon 上海,分享小红书搜索的 LLM 进化之路

10月23 - 25日,QCon全球软件开发会将在上海举办,聚焦多热门话题。小红书AI搜索负责人高龑将分享《从“搜内容”到“问AI”:小红书搜索的LLM进化之路》,介绍搜索实践及模型应用经验。

InfoQ
开源动态8

追平GPT-4o,数学基测96.3%高分,Hermes4 来了

Nous Research推出新一代模型Hermes 4系列,其有混合推理和长度控制机制,还能用DataForge“造”数据,经Atropos质检。它在数学等领域表现佳,追平GPT - 4o,是开源AI对巨头的挑战。

AIGC开放社区
推荐文章8

长上下文不再难:KV Cache 全生命周期优化实战

长上下文语言模型发展带来计算和内存挑战,现有基准测试多忽视 KV 缓存完整生命周期。微软姜慧强在 AICon2025 分享 SCBench 工具,梳理推理优化方法,介绍 MInference 等,还提出 Tri - shape 方法等成果。

AI前线
推荐文章7

与三位前沿研究者聊AI Agent:规则、环境与热潮下的真问题|五源小酒馆Vol.31

五源小酒馆对话三位AI Agent前沿研究者,探讨其发展进展、挑战。他们分享对Agent定义、能力边界判断等,提及过去技术突破,如DeepSeek工作,也指出通用Agent瓶颈,探讨未来模型能否提有价值问题等。

五源资本 5Y Capital
新闻资讯7

市场还没爆发,但AI眼镜已经卷死了

今年5月多款AI眼镜新品上线,市场竞争激烈。硬件上芯片向高端手机靠拢,软件借AI模型落地功能,还出现代工产业链。不过,国内AI眼镜在AI和软件功能上有不足,与市场需再磨合。

芯师爷
算法论文7

一文解读 LLM Posting-Train技术

文章解读了语言模型后训练(Post-training)技术,介绍其核心价值,从微调、强化学习、测试时拓展三方面展开,分析现有技术瓶颈,指出前沿研究方向,还给出实践指南和工具链推荐。

海边的拾遗者
算法论文8

CMU&NYU最新工作解释:存储在权重里的“智能”是从哪来的?

论文《From Entropy to Epiplexity》指出经典信息论在AI面前有三悖论,提出用Epiplexity度量信息。它将数据信息拆为Time - bounded Entropy和Epiplexity,通过神经网络训练近似计算,实验验证其有效性,并给出启示。

深度学习自然语言处理
推荐文章7

从 SQL 到自然语言,下一代 Lakehouse 为何必须「AI 优先」

随着模型技术爆发,数据分析范式重构,未来数据多模态、分析复杂、查询方式转变。文章指出构建下一代 AI-First Lakehouse,要在存储计算、内核能力、架构适配、平台自治等方面升级,打破数据壁垒。

InfoQ