「大规模数据」共找到 6879 篇相关文章
转译:AI 为啥这么爱用破折号?
文章探讨AI爱用破折号的原因,指出让模型不用破折号很难。分析了几种解释,如从训练数据学来、因“万金油”特性、受RLHF工作者方言影响等,认为训练数据混入大量纸质扫描书是最可能的原因。
五倍推理加速,激发自回归潜能,苹果新工作让LLM预测未来
近年来自回归训练方法成语言模型主流范式,但推理阶段计算开销大。苹果研究人员开发框架,让预训练自回归大模型多 token 预测,代码和数学任务推理加速达 5.35 倍,一般任务约 2.5 倍。
独家丨商汤科技将成立独立的具身智能公司
AI科技评论独家消息,商汤科技将成立独立具身智能公司,核心班底有王晓刚、陶大程等大咖,正在招人。此前商汤已布局该领域,今年4月展示成果、达成合作,WAIC将发布大模型及平台。
成本暴降88%!通义实验室、北大发布ZeroSearch,无需搜索即可激活LLM检索能力
信息检索能力对提升大语言模型推理表现至关重要,但现有方法在训练中面临文档质量不可控和搜索 API 成本高昂两大挑战。为此,通义实验室和北大提出 ZeroSearch 框架,无需真实搜索即可激活 LLM 检索能力,显著降低成本。
AI Agent的未来之争:任务规划,该由人主导还是AI自主?——阿里云RDS AI助手的最佳实践
文章以阿里云RDS AI助手实践为例,探讨AI Agent任务规划该由人主导还是AI自主。实测发现大模型自主规划效果不佳,企业更需稳定可靠,人工规划是最佳选择,还提出用‘混合规划’兼顾灵活与可靠。
Vibe Coding成AI主战场:22个明星玩家值得关注
AI产品下半场,氛围编程成赛道焦点。国外大厂推新,国内大厂双轮发力。量子位2025Q3 AI 100榜单显示,开发层产品多增强Agent功能,介绍了旗舰100和创新100中的明星产品。
Scaling Law 仍然成立,企业搜广推怎么做才能少踩“坑”?
InfoQ《极客有约》X AICon 直播邀请京东颜林等探讨生成式推荐落地洞察。指出搜广推场景 scaling law 成立且在上升,还分享大模型对搜广推的改变、架构成长方式,及平衡成本等方面的经验。
谷歌的DeepSeek时刻:LLM推理加速被干到了8倍
谷歌TurboQuant论文介绍量化算法,能为大语言模型和向量搜索引擎大规模压缩。可将大语言模型KV缓存内存减至少6倍、加速达8倍且精度零损失,还介绍其工作原理及实验结果。
一场实战派圆桌实录:解码严谨行业智能体落地的硬核突围|甲子光年
2025年7月28日,在世界人工智能大会相关论坛的圆桌对话里,来自不同行业的实战派探讨企业级AI智能体落地。他们分享落地踩坑经验、应对数据等问题的办法,还预测了未来智能体大规模应用的行业。
LLM也会emo,Claude玻璃心、Gemini社恐,Kimi/GLM/ DeepSeek如何?
华东师大和复旦大学研究8大模型家族是否有“情感链”。实验覆盖8大家族20+模型,发现各家族有独特“人设”,如Claude像“文艺青年”。还揭示模型在不同情境下的情绪变化及影响,给出实用建议。