「动态混合专家架构」共找到 1009 篇相关文章
LLM将是又一个“惨痛教训”?强化学习之父Sutton再放炮:万亿美金AI泡沫可能破裂
强化学习之父Sutton在采访中认为,LLMs过度依赖人类知识,违背‘惨痛教训’原则,发展将遇瓶颈,当前投资和期望或致泡沫破裂。讨论还涉及LLM与强化学习、人类模仿方式差异及AI领域经济动态等。
企业数据“LLM ready”与“小Palantir”们的崛起 | AGIX PM Notes
文章指出当前 AI 仍处准备阶段,企业数据未就绪是落地大障碍,深层问题是流程 AI 原生化转型。还介绍本周市场、多家科技企业动态,以及巴菲特和芒格对 ETF 的看法及投资建议。
百度 TURA 三阶段架构:让 AI 检索 “动” 起来
现有检索增强生成(RAG)系统只能读取已索引的静态网页,无法满足用户实时数据需求。百度 TURA 架构用工具调用将 RAG 升级为动态交互,分检索、规划、执行三阶段,已在百度亿级流量场景跑通。
扩散模型+自进化:这篇论文让Deep Researcher错误率直降70%
论文提出测试时扩散深度研究代理(TTD-DR),将报告生成建模为扩散过程,有组件自进化机制和动态闭环设计。实验显示其在多领域研究任务超现有方案,为AI研究助手落地提供新范式。
腾讯混元A13B用130亿参数达到千亿级效果,Flash Attention作者点赞
腾讯混元A13B模型仅130亿激活参数,却能和千亿级大模型竞争,获Flash Attention作者赞叹。它精准卡位性能与效率‘甜蜜点’,依托高质量预训练和结构化后训练,多方面表现突出且已全面开源。
弃 Python 拥抱 JVM,Spring 之父 20 年后再造“革命性框架”:我从未如此确信一个新项目的必要性
Spring 之父 Rod Johnson 开源专为 JVM 生态设计的 AI 智能体框架 Embabel,旨在弥合生成式 AI 的‘承诺’与‘现实’差距。它采用 GOAP 方法保证确定性,有弹性执行与动态重规划能力,还引入多种机制确保可控性与安全性。
大概念模型:AI 推理的新范式
大概念模型(LCM)是自然语言处理新范式,侧重结构化推理和理解,与 LLM 不同。它依赖结构化知识,可模拟专家思维,解决当前 AI 缺陷,文章还介绍其架构、应用、局限,探讨与 LLM 结合的未来发展。
华为盘古首次露出,昇腾原生72B MoE架构,SuperCLUE千亿内模型并列国内第一
当前传统 MoE 有专家激活不均衡问题,华为盘古团队提出 MoGE 解决。基于此架构的盘古 Pro MoE 大模型在昇腾集群高效训练,推理性能强,在 SuperCLUE 榜单千亿内模型并列国内第一,赋能业务落地。
OpenAI 黑科技 Deep Research 诞生记:一个工程师的“不务正业”如何改变 AI 战争格局
OpenAI宣布美国用户可免费使用集成于ChatGPT的AI研究助手Deep Research。OpenAI负责人分享其背后故事,探讨起源、人类专家数据作用等,还提及RFT时机、代理安全性等,并展望其能访问私有数据,适用于具体任务。
AI Coding 的下一步不是写得更快,而是可验收:蚂蚁数科 Harness 工程实践
蚂蚁数字科技资深技术专家魏长征在AICon大会分享AI Coding实践。指出当前产能提升快,但验证能力可能跟不上,容易引发质量风险。介绍了Harness工程思路及在新项目和存量项目中的应用,还提及AI协作的未来挑战。