「端到端训练」共找到 4182 篇相关文章
AI Infra 工程师们如何应对大模型流水线里的“暗涌”?
InfoQ《极客有约》X AICon 直播邀请华为、蚂蚁集团等专家探讨大模型 Infra 工程师实战日常。涉及大模型工程高频问题、版本迭代冲突处理、推理部署成本优化、开源项目挑战及 GPU 虚拟化趋势等内容。
2025 AI Cloud 100 China榜单发布:6个赛道,34家新上榜,DeepSeek、Manus上榜
6月22日,靖亚资本等发布2025 AI Cloud 100 China榜单,聚焦GenAI商业落地企业。还发布行业趋势报告,总结融资、技术等情况,预测未来五大趋势,如AI应用从Copilot升级到Autopilot等。
更多thinking≠更好结果,精准thinking可砍掉一半长度
当前大模型如GPT - 4、DeepSeek推理又长又啰嗦,论文发现其在简单题目上过度推理。作者提出‘无效思考’概念,还给出解决原则,用LC - R1方法训练,效果显著,揭示精准思考才是王道。
硅谷顶尖产品教练万字干货,一针见血揭示产品失败真相
文章回顾 Jim Morris 演讲,指出多数团队混淆“产出”与“成果”,迷恋“虚荣指标”。以 Power Reviews 为例,强调做对事才驱动客户价值。还介绍衡量成功的指标及应用案例,说明指标关联与先行指标作用。
火山引擎,「出击」Agent
2025 年年中大模型竞争进入下半场,Agent 成焦点。文章分析其 2B 与 2C 落地困境,介绍火山引擎新开发范式,如 TRAE、豆包大模型 1.6、PromptPilot 等,助企业解决 B 端落地难题。
轻量级语音模型Vui开源,支持本地部署,笑声停顿全拟真,4万小时练出人类对话感!
近日,Fluxions - AI团队在GitHub开源轻量级语音模型Vui,可设备端运行。它能精准模拟语气词、笑声等,有三款模型,适用于语音助手、播客生成等场景,解决了传统模型的痛点。
Meta联合Google新作:语言模型到底“记”了多少东西?
Meta和Google合作的论文探讨现代语言模型对训练数据的“记忆”情况。研究发明新方法精确测量“记忆”量,发现模型记忆有上限且与参数线性相关,还揭示学习转折、隐私规律等重要结论。
LLM省钱大测评!48块GH200,首个百亿级参数量实证
EfficientLLM项目聚焦LLM效率,提出三轴分类法和六大指标,实验覆盖多方面。研究表明效率优化需权衡,最优策略因任务和模型规模而异,且相关技术可迁移到跨模态模型,成果将开源。
爆火论文颠覆RL认知!「错误奖励」让LLM推理暴涨24.6%,学界惊了
最新爆火论文颠覆传统RL训练认知,华盛顿大学等团队证实「伪奖励」可让LLM推理性能提升。研究设置多种伪奖励形式实验,发现其对Qwen模型有效,但并非对所有模型都有效。
大模型微调知识与实践分享
文章详细介绍大型语言模型(LLM)微调知识与实践,包括模型结构、参数量等知识,以及Prompt工程、数据构造、LoRA微调等技术点。还给出微调实践流程,介绍相关平台和框架,如星云、TuningFactory等。