边际成本」共找到 1519 篇相关文章

开源动态8

GitHub 1.3k 一款能“填色回忆”的神器:DDColor 让老照片鲜活又逼真

DDColor是阿里达摩院团队提出的新一代图像自动着色模型,基于双重设计,能实现高保真、真实感强的黑白图转彩色图。它兼容多种类型图片,有诸多核心功能,相比传统模型优势明显,应用场景广泛。

小华同学ai
产品应用8

火山引擎AI开发「全家桶」大升级,Agent再也没有门槛。

火山引擎Force原动力大会后,其AI开发“全家桶”升级。会上展示多个开源项目,如DeerFlow、veRL、UI - TARS。还提出AI云原生概念,另有MCP、PromptPilot等产品,助力开发者降本增效。

开源AI项目落地
产品应用8

长文本推理 5 倍提速!面壁MiniCPM4 端侧模型发布,0.5B模型效果秒杀同级

近日,面壁发布 MiniCPM4.0 端侧模型,有 8B、0.5B 两种规模。其在基准测试表现出色,长文本推理提速,缓存锐减,还做了架构创新。此外,面壁有自研推理框架,科学化建模产线,6 月 27 - 28 日 AICon 北京站将探讨 AI 趋势。

AI前线
推荐文章7

大模型 Token 究竟是啥:图解大模型Token

文章详细解释大模型Token概念,指出分词器会把文字切成Token,不同分词器切分结果不同。还介绍分词器的分词方法,通过统计文字出现频率打包成Token并编号,不同模型切分结果有差异。

机器学习AI算法工程
新闻资讯7

o3崛起,但推理模型离「撞墙」只剩一年?

OpenAI的o3推理模型诞生不到一年能力突飞猛进,算力暴增10倍。但Epoch AI等警告,最多一年推理模型或撞上算力资源极限。还从其他模型和业内人士看法分析推理算力,指出算力与性能有关联,也有发展瓶颈。

新智元
产品应用8

还得是华为!Pangu Ultra MoE架构:不用GPU,你也可以这样训练准万亿MoE大模型

华为盘古团队发布Pangu Ultra MoE模型架构与训练方法的中文技术报告。该模型全流程在昇腾NPU上训练,团队在架构和训练方法创新,实现准万亿MoE模型训练,还在多方面优化提升性能。

机器之心
产品应用7

Multi-Agent 的灵活编排之路

文章从Copilot 3.0架构规划模块出发,结合DeepSeek R1强化学习训练实践,探讨多智能体架构下大模型编排智能体解决问题。分析Copilot 2.0局限并介绍3.0升级,指出难点,展示效果对比及解决方案。

阿里云开发者
算法论文8

博士宿舍激情脑暴,革新了Scaling Law?Qwen和浙大联手推出新定律,直接干掉95.5%推理内存!

近日,阿里与浙大合作提出并行计算缩放定律 ParScale,可在不增参数下提升大模型能力,推理效率更高。它通过引入并行流实现,在数学、编程等任务表现佳,适合边缘设备,代码已开源。

AI前线
算法论文8

Qwen突破:用「并行计算」代替「堆参数」,新方法内存降22倍、延迟降6倍

LLM进化依赖「堆参数」,存在训练成本高、推理慢等问题。论文提出ParScale,用「并行计算」代替「堆参数」,让模型「分头思考」,推理效率提升22倍,旧模型也能改造,落地价值大。

深度学习自然语言处理
算法论文8

长程 Agent 越跑越乱?ContextPilot 用细粒度 RL 教会模型主动管理上下文

长程 Agent 推理时,传统方法使上下文臃肿、推理成本高。清华、腾讯等团队提出 ContextPilot 框架,扩展管理工具集、采用新采样和信用分配方法。实验显示其用短上下文获高分,降低推理开销。

深度学习自然语言处理