「开发团队模型」共找到 10010 篇相关文章
AI生图免训练提速1000%,办法:最简洁的“三阶段流水线”
AI画图速度慢,过往主流加速方法有局限。MrFlow团队提出三阶段流水线,在Qwen - Image等模型上实现10倍以上端到端加速,生成效果好,优势显著,还能与时间步蒸馏叠加,且完整开源。
Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布
近年来,Coding Agent 发展迅速,「AI 软件工程师」渐成现实。但目前缺少系统评测其从设计稿开发产品能力的公开 Benchmark。为此,多校研究团队推出 VISTA,可多维度评测 Coding Agent 开发能力,且持续更新。
VLM剪枝新SOTA:无需重训练,注意力去偏置超越6大主流方案
常用的attention机制存在位置偏置和padding异常,影响剪枝效果。上海大学曾丹团队提出无需重新训练的attention去偏方法,在多模型、剪枝策略及基准上验证有效,为多模态模型部署提供新思路。
推翻「预测下一个token」范式!微信AI新研究:把token压缩成连续向量更具性价比
微信AI和清华团队提出新范式CALM,把token打包成连续向量,让大模型从预测下一个token转变为预测下一个向量。实验表明它能减少生成步骤,在平衡性能和计算成本时性价比更高。
The Batch: 919 | 本地 AI 能否替代云端?
大语言模型预测输出需求推动数据中心扩建,研究人员探讨本地小型模型能否分担算力负荷。斯坦福与Together AI团队研究发现,本地系统单瓦特智能量与云端有差距但在缩小,若准确率相近可节省能耗。
150PB工业数据+智能体革命,西门子开启AI制造新纪元
西门子在工业AI领域成果显著。其工业智能体系统贯穿工业脉络,Industrial Copilot提升开发效率。工业基础模型扎根150PB工业数据,与主流大模型路径不同。西门子靠数据和行业know - how构筑护城河。
OpenAI和Anthropic费尽心机加密的思维链,竟然能被轻松提取?
围绕大模型蒸馏争议已久,此前外部团队难获闭源模型完整推理。8 月 10 日研究者公开方法,可让弱模型读取旗舰模型密文并输出推理,还发现公开智能体轨迹存在隐私泄露问题,不过未为蒸馏指控提供决定性证据。
算力成本大降!马尔可夫思考机来了,LLM推理成本直接降为线性
用强化学习让LLM具备推理能力耗费颇高,计算量会二次级增长。Mila和微软研究院等团队提出马尔可夫式思考机,重构强化学习形式,让计算量呈线性,实验效果显著,还能与先进模型兼容。
跨芯片统一优化,DLCompiler与DLBlas驱动算子极致表现
9月10日,上海AI实验室DeepLink团队开源DLCompiler和DLBlas。前者是扩展Triton的深度学习编译器,后者是面向大模型的高性能算子库。它们有跨架构DSL扩展等亮点,在多芯片上实现性能优化,还解决了DSA芯片优化难题。
错过它=落伍!只用一张照片+14秒,腾讯开源 HunyuanVideo-Avatar 带你玩转多角色数字人
HunyuanVideo-Avatar 是腾讯混元团队最新开放的多模态数字人生成模型。上传一张人物图片,再配上一段音频,模型即可在约 14 秒内输出分辨率最高 720p、情绪可控、动作丰富且支持多角色同屏的短视频。