「模型能力提升」共找到 9962 篇相关文章
手机上实现AI视频实时生成,DiT模型上移动端
扩散变换器在视频生成任务性能强,但计算成本高,在手机上难实用。Snap提出创新优化法,加速视频生成,能在iPhone 16 Pro Max上每秒超10帧,不过也存在细节退化等局限。
Transformer上限触顶,Mobius能否引发下一代模型架构的革命?
自ChatGPT问世,Transformer上限备受关注。前OpenAI、Google负责人称其走到尽头。国内改进架构受算力限制。上海人工智能实验室的书生Mobius团队提出分离知识与推理的架构,有望解决商用等关键问题。
从0开发大模型的17种Agent架构演进详细拆解
文章详细拆解从0开发大模型的17种Agent架构演进,介绍各架构解决的问题、状态、拓扑、路由、失败模式等,指出Agent架构本质是控制流设计,还给出架构选择建议及判断新架构的方法。
快手进军AI编程!“模型+工具+平台”一口气放三个大招
AI编程竞争激烈,快手发布AI编程产品矩阵进军该赛道。其“三位一体”矩阵含顶尖自研模型、智能开发工具和MaaS平台,KAT - Coder - Air轻量版免费。各产品亮点多,助力构建AI编程新生态。
无VAE扩散模型! 清华&可灵团队「撞车」谢赛宁团队「RAE」
清华大学智能视觉团队和快手可灵团队联合推出《Latent Diffusion Model without Variational Autoencoder》,提出 SVG 框架,用预训练视觉特征编码器替代传统 VAE,解决了传统「VAE + Diffusion」范式的效率与通用性痛点。
如何将 AI 代码采纳率从30%提升到80%?
文章指出AI编码采纳率低,原因在于信息不对称、任务粒度过大等。提出通过规范化文档体系和Issue管理规范解决前两个问题,还介绍了未来扩展方向及多种开发实践技巧,最后分享项目实战效果。
Insanely Fast Whisper:开源社区让音频转录速度提升19倍
Insanely Fast Whisper工具将OpenAI Whisper转录速度提升19倍,采用Flash Attention 2技术,零质量损失。它集成多语言支持、说话人分离等实用功能,还支持跨平台,免费运行。最初是基准测试demo,值得音频处理用户关注。
感觉这次扣子 2.0 触碰了模型和工程的天花板
2026 年,真正好用的 AI Agent 应能拆解目标、推进过程和交付验收。扣子 2.0 正式发布,从“给指令的工具”变为“能干活的工作伙伴”,有技能和长期计划两大核心升级,还具备扣子编程功能,拓宽了 AI 能力边界。
当AI开始过度思考「hey」这个字…
两张对话截图展现语言模型缺陷,用户发简单问候,模型过度分析,从问候语正式程度到表情符号语义权重,这种过度分析让对话不自然,错过人类交流重点。
老黄杀入OpenClaw战场!最强开源「龙虾」模型直逼Opus 4.6
英伟达推出新一代开源模型Nemotron 3 Super,专为大规模AI智能体打造,有1200亿参数,推理快、吞吐量高,性能直逼Claude Opus 4.6等。它解决了Agent应用的难题,还开源了相关数据和训练方法。此外,英伟达还在打造NemoClaw开源AI智能体平台。