多实例分割」共找到 4150 篇相关文章

开源动态8

加速200倍,单显卡1.8秒生成5秒高清视频!清华与Vidu解开了视频扩散模型的速度枷锁

清华、生数科技与伯克利联手用TurboDiffusion解开视频扩散模型速度枷锁。它改造注意力机制、引入步数蒸馏和量化策略,在模型测试中加速100 - 205倍,且画质几乎无损。

AIGC开放社区
算法论文8

时空压缩!剑桥大学提出注意力机制MTLA:推理加速5倍,显存减至1/8

在大语言模型发展中,Transformer自注意力机制有计算复杂度问题且KV缓存成推理瓶颈。剑桥大学提出MTLA,结合时空压缩策略,提升推理效率,在任务中表现出色,代码已开源。

机器之心
新闻资讯8

苹果放王炸!开放大模型访问权、全家桶集成ChatGPT,人人能开发AI应用

苹果在“WWDC 2025”大会宣布在设备集成Apple Intelligence功能,含ChatGPT图像生成等。开放基础模型访问权,开发者可开发适配应用。新功能将逐步开启测试,今年秋季部分用户可用。

AIGC开放社区
产品应用7

声音自然、接近真人,只要 3 秒音频就能完成声音克隆,可本地跑保护隐私的TTS!

Neuphonic出品端侧TTS模型NeuTTS,能在本地设备高效运行,无需云服务。它有真正端侧运行、低延迟、高质量自然语音等特性,支持语言,项目还给出安装、使用方法及支持模型等信息。

GitHubStore
推荐文章7

tokens烧钱太快?试试这个四层模型组合

ClaudeCode等智能体兴起,开发者面临tokens不够用、主流模型降智问题。网络给出模型策略缓解,网友将2026年主流模型分四档,还介绍了实际路由策略、部署建议,指出单模型依赖危险。

AI工程化
产品应用7

上手“设计界的Manus”,朱啸虎点赞,Lovart这波魔法破圈了丨TIP 002

国产出海产品Lovart被称为“设计界的Manus”,获朱啸虎点赞。它是设计领域首个Agent,能用自然语言驱动生成模态视觉作品,可生成VI体系、短片等,适合文创领域,还能人工编辑,调用模型。

鲸选AI
开源动态8

Google开源Workspace CLI,让AI在终端操作办公全家桶

Google开源Workspace CLI项目,把全套办公工具装进命令行。它动态构建命令结构,输出为结构化JSON。内置超100个Agent Skills,支持MCP客户端,认证灵活,还集成Gemini CLI扩展。

AI工程化
开源动态8

开源项目 | 用自然语言做视频剪辑,人人都能用的 AI 视频剪辑工具

FireRed - OpenStoryline是开源AI视频剪辑智能体,理念是‘你说话,它剪片’。工作流程为‘理解→执行→输出’。具备智能素材搜索、文案生成等项能力,适用于场景,介绍了安装方式、优缺点。

小华同学ai
算法论文8

打破视觉Token的算力诅咒,RedundancyLens如何为模态大模型推理减负

模态大模型的 Decoder - only 架构处理视觉 Token 有计算冗余。合合信息团队提出无需额外训练的动态计算削减方法,在不影响性能前提下降低推理成本,适用于场景。

PaperAgent
产品应用7

刚刚,真正好用的Windows版「Cowork」上线了

国产大模型昆仑天工发布 Windows 原生「Cowork」—— 天工 Skywork 桌面版,为全球用户提供「Cowork 平替」。它能自动化处理本地文件,支持模型,功能丰富,价格实惠,还能高效完成复杂任务。

机器之心