「slop 问题」共找到 3211 篇相关文章
DeepSeek-OCR降本增效,10×暴力压缩还能读得清
Deepseek - OCR模型发布,通过光学压缩技术解决长文本处理的计算效率问题,能控制大模型token消耗成本。介绍了其架构设计、数据引擎及训练流程,还展示其用较少token超越现有模型的能力。
为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本
近年来大模型推理开销增长,MoE架构虽能避免计算量同比增,但带来扩展性差、容错性低、负载不均等问题。为此作者提出全新「专家即服务」推理架构EaaS,实验显示它能锐减37.5%成本。
产品经理也能“开发”需求?淘宝信息流从需求到上线的AI端到端实践
淘宝推荐信息流业务被“需求多、技术栈杂、协作慢”困扰,上线周期长。WaterFlow这一AI驱动的端到端开发实践,让部分需求两天内上线,产品经理也能参与。文章揭秘其落地及协作模式改变,还展示了实践效果。
西湖大学打造了一个AI科学家,突破人类SOTA,还能自己发论文
西湖大学文本智能实验室推出能自主探索的AI科学家DeepScientist,两周完成人类三年科研量。它在三个前沿AI任务刷新SOTA纪录,还能写论文。文中介绍其科研历史、工作方式、成果及面临的伦理问题。
为什么 OpenAI 们都要搞 AI 基建?Groq 创始人把背后的逻辑讲透了
文章通过对Groq创始人Jonathan Ross的访谈,探讨AI基建问题。指出AI应用增长受限算力,算力提升易见效,自研芯片可掌控命运。还分析芯片制造难点、市场供需、能源需求等,预测AI将带来用工短缺和新产业。
GPT-6或将比GPT-5强10倍!奥特曼揭秘ChatGPT如何诞生
奥特曼在访谈中表示ChatGPT从1到10的艰难已过,未来从10到100或更易。他还探讨AI变革、企业洗牌、工作替代等问题,揭秘ChatGPT诞生过程,阐述OpenAI愿景及AI普惠方案。
AI花17小时写了篇30页学术论文!自主选题,包含实验,还符合APA格式规范
Virtuous Machines AI系统花17小时、114美元,找288个真人做实验,写了篇30页认知心理学领域学术论文,从选题到成稿全自动化。其架构独特,不过也存在理论误解等小缺点。
NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理
面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视化推理。该方法在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。
华为超节点:用「一台机器」的逻辑,驱动AI万卡集群
在华为全联接大会2025上,华为基于自研灵衢互联协议创新超节点架构,重新定义大规模有效算力新范式。它能解决传统集群通信问题,还推出覆盖全场景的产品组合,并强调‘硬件开放、软件开源’生态战略。
SGLang × RoleBasedGroup(RBG):打通大模型推理PD分离架构规模化落地的“最后一公里”
PD分离架构对大模型推理部署意义重大,SGLang支持该架构且性能佳。但从测试到生产落地难,存在部署、资源、可靠性等问题。SGLang开源RBG项目,结合二者为PD分离架构生产化落地提供方案。