模型性能提升」共找到 9366 篇相关文章

算法论文8

揭秘LLM“思考”之谜:推理即“梯度下降”,元学习框架解构训练过程,还给优化提供新思路

上海AI Lab团队提出RaML框架,从梯度下降和元学习角度揭示LLM“思考”机制。通过实证验证推理轨迹作为参数更新的合理性,还对比不同训练策略,指出RaML为优化LLM性能提供新思路。

量子位
推荐文章7

AI Agent 十问十答,降低认知摩擦

文章以问答形式梳理技术术语与价值信息,介绍AI Agent定义、与传统软件区别、演进原因等,还阐述组件、原理、提升输出效果方法,探讨Workflow与LLM关系及单/多智能体系统相关内容。

阿里云开发者
产品应用8

从99行代码复刻冰雪奇缘,到引领3D AI,胡渊鸣的公司凭什么「爆火欧美」?

胡渊鸣创立的 Meshy AI 爆火欧美,其产品 Meshy 带来 3D 建模效率革命。新模型 Meshy 6 精度高、可用性强,采用“3D 原生”路线。它还理顺生产流程,获大厂青睐,未来在技术、产品形态和游戏领域均有布局。

机器之心
新闻资讯8

梁文锋、马斯克同时开火!DeepSeek V4 Pro,Grok 4.6 发布

刚刚,DeepSeek悄悄上线DeepSeek V4 Pro正式版,马斯克高调推出Grok 4.6,两者性能直逼顶级闭源甚至有超越。每百万输出Token,Grok 4.6和DeepSeek价格优势明显。两者在多项评测中表现出色,且后续还有大招。

AIGC开放社区
新闻资讯8

中国AI芯片迎「华为时刻」

国内AI芯片市场正经历变革,“去英伟达化”成热词。科技巨头推动自研,9月国产芯片捷报频传,性能追赶超越英伟达。这既因地缘政治致供应链风险,也是AI从训练到推理转变下的必然选择。

芯师爷
推荐文章7

优化搜索系统:平衡速度、相关性和可伸缩性

这篇文章基于作者在 2024 年旧金山 QCon 大会演讲,探讨搜索系统优化。以优步外卖为例,分析其在数据索引、检索和排名方面挑战,介绍优化技术及对用户体验和系统性能影响,还提及架构、分片技术等内容。

InfoQ
新闻资讯8

谷歌“世界模拟器”深夜上线!一句话生成3D世界,支持分钟级超长记忆

谷歌DeepMind发布新一代通用世界模型Genie 3,只需一句话就能生成可实时交互的3D世界。性能大幅升级,支持720P画质等,还能推动具身智能体研究,谷歌期待其助力迈向AGI。

量子位
开源动态8

MIRIX重塑AI多模态长期记忆:超Gemini 410%,节省99.9%内存,APP同步上线

UCSD和NYU团队推出开源的MIRIX,全球首个多模态、多智能体AI记忆系统。它表现亮眼,在多任务中超越传统方法,有类人记忆系统等特点,还上线Mac端应用,开启大模型从对话生成到长期记忆驱动心智的新周期。

机器之心
算法论文8

成本暴降88%!通义实验室、北大发布ZeroSearch,无需搜索即可激活LLM检索能力

信息检索能力对提升大语言模型推理表现至关重要,但现有方法在训练中面临文档质量不可控和搜索 API 成本高昂两大挑战。为此,通义实验室和北大提出 ZeroSearch 框架,无需真实搜索即可激活 LLM 检索能力,显著降低成本。

机器之心
新闻资讯8

又来了!OpenAI 发布 Sora 2,同时推出 AI 版Tiktok

9月30日,OpenAI发布新一代视频生成模型Sora 2,相比Sora 1有显著提升。同时推出iOS社交应用Sora,类似TikTok。应用有安全措施,已在美加iOS平台邀测。社区反应两极分化,OpenAI野心大但或面临挑战。

AI工程化