「大模型应用」共找到 10287 篇相关文章
Ray异构融合底座重构数据管道:架构演进与万卡落地实践
文章指出大模型发展下,传统大数据引擎在多模态数据处理局限性凸显。腾讯基于Ray构建新一代数据管道,介绍了云原生调度与计算范式融合架构,详述容错、资源利用等方面优化实践,展示了重构收益。
监督学习也能从错误中学习反思?!清华英伟达联合提出隐式负向策略爆炸提升数学能力
清华大学与英伟达、斯坦福联合提出监督学习方案NFT,在RFT算法基础上构造“隐式负向模型”利用负向数据训练。该策略弥合监督与强化学习差距,其损失函数梯度和GRPO在On - Policy条件下等价。
从技术狂欢到企业落地,智能编程的全球破局战
智能编程是AI应用增长快的赛道,正从代码补全迈向AI自主开发。国内模型能力提升,阿里Qwen3 - Coder超越部分闭源模型。阿里云通过多策略破局,其产品助力企业落地,但仍面临适配、安全等挑战。
刚刚,OpenAI把1GW超算中心直接给了印度!奥特曼即将亲赴三哥办事处
OpenAI计划在印度建设至少1GW规模的数据中心,这是「星际之门」计划首次大规模进入亚洲。印度用户增长潜力大,还有多语言应用场景。虽奥特曼淡出CEO角色,但亲自推动全球算力布局,印度是关键起点。
SGLang支持GPT-OSS:从Day 0支持到性能增强
SGLang宣布重大更新,聚焦openai/gpt - oss - 120b模型深度性能优化与新功能。预填充和解码阶段吞吐量显著提升,支持多GPU,有推测解码等功能,还支持智能体应用程序,且不损害模型推理能力。
AI编码不是梦:手把手教你指挥Agent开发需求
文章聚焦AI实践应用,以后端开发为例,介绍用AI编码实现需求的流程,涵盖工程结构、各层代码生成等。还分析AI编程问题,提出解决方案,给出生产案例,最后展望AI在研发中的应用前景。
成本暴降88%!通义实验室、北大发布ZeroSearch,无需搜索即可激活LLM检索能力
信息检索能力对提升大语言模型推理表现至关重要,但现有方法在训练中面临文档质量不可控和搜索 API 成本高昂两大挑战。为此,通义实验室和北大提出 ZeroSearch 框架,无需真实搜索即可激活 LLM 检索能力,显著降低成本。
他们还没毕业,就在用AI搭建自己的世界|五源小酒馆Vol.30 x AI Native创造者
本期五源小酒馆邀请三位年轻AI Native创造者,分享AI学习与创造经历。他们谈及AI对生活工作的改变、关注的产品及模型,探讨资源分配、AGI突破等问题,还交流了未来能力培养和给十年后自己的话。
剑指“美国版 DeepSeek!”Ai2 科学家 Nathan Lambert 最新访谈:剖析 RLVR、激辩智能体与后训练
艾伦人工智能研究所科学家 Nathan Lambert 在访谈中剖析 RLVR、激辩智能体与后训练。他所在团队用 Olmo 和 Tulu 模型揭开后训练魔法,带火 RLVR 概念。他还谈到开源 AI 未来,想打造“美国版 DeepSeek”。
黄仁勋不信泡沫,OpenAI需要“印钞机”
文章围绕OpenAI与AMD、英伟达等的“股权换订单”合作展开,分析AI行业泡沫问题。指出OpenAI收入与投入落差大引发担忧,但也有人认为这次泡沫或不同。还提及科技公司资本支出增长,AI发展空间大。