「图像分割」共找到 484 篇相关文章
MMLab@HKU 闪耀 CVPR 2025!与全球顶尖学者共话 AI 前沿
CVPR 2025 于 6 月 11 日至 15 日在美国纳什维尔举行,MMLab@HKU 携 24 篇高质量论文亮相。其还是三项国际竞赛的发起与主办方,主办六项前沿活动,研究成果展示了多领域进步。
奥特曼怕了!GPT-5.5「大蒜」决战谷歌,红色警报紧急拉响
三年前ChatGPT让谷歌恐惧,如今OpenAI被谷歌逼得拉响‘红色警报’。OpenAI计划发布新推理模型,‘Garlic’预训练有突破,还启动下一代模型。OpenAI调整策略,聚焦提升ChatGPT体验。
显存暴降92%!哈工大为线性注意力开辟了新道路
哈尔滨工业大学等团队发现线性注意力性能不足根源是查询范数丢失等。基于此提出NaLaFormer,在ImageNet - 1K准确率最高提7.5%,超分任务峰值内存降92.3%,为线性注意力发展开辟新道路。
首篇,系统盘点扩散模型高危漏洞!看懂攻击方式和防御体系
随着扩散模型广泛应用,其安全问题凸显。天津大学团队论文系统梳理文生图模型攻击方式、风险类型、威胁场景与防御体系,指出当前防御不足,需建立更体系化防护体系。
仅2G内存可跑,刚刚,谷歌开源Gemma 3n,端侧原生多模态!
谷歌全面发布Gemma 3n,将多模态AI功能带入边缘设备并在Hugging Face开源。它原生支持多模态输入输出,针对设备端优化,内存占用低,采用开创性架构,Gemma系列质量也不断突破。
全新线性注意力范式!哈工深张正团队提出模长感知线性注意力!显存直降92.3%!
哈工深张正团队联合多团队发布论文,提出 NaLaFormer 框架,解决线性注意力两大核心缺陷,保持线性复杂度同时精度超越,在多任务表现出色,如超分任务显存降 92.3%。
ICCV25 Highlight|格灵深瞳RICE模型狂刷榜单,让AI「看懂」图片的每个细节
格灵深瞳公司灵感团队自研的视觉模型基座RICE(MVT v1.5)刷榜多项视觉任务,在ICCV25获Highlight荣誉。它延续MVT系列理念,提升图片内部视觉特征差异性,在多任务验证中表现优异。
无Tokenizer时代真要来了?Mamba作者再发颠覆性论文,挑战Transformer
Mamba作者之一Albert Gu参与的论文提出分层网络H - Net,用动态分块取代tokenization。Tokenization虽能压缩序列但有缺点,H - Net在多方面表现出色,或预示无需Tokenizer训练时代到来。
UofT、UBC、MIT和复旦等联合发布:扩散模型驱动的异常检测与生成全面综述
多伦多大学、麻省理工学院等高校研究者合作完成长文综述,聚焦扩散模型在异常检测与生成领域的应用,梳理图像、视频等异常检测任务进展,提供分类体系,展望未来趋势。
PDF解剖大师来了!LandingAI开源神器,这个Python库让百页文档秒变结构化数据!
复杂文档处理是数据分析痛点,传统方法常因布局复杂失准。LandingAI团队在GitHub开源Python库Agentic - Doc,可从复杂文档提取结构化数据,支持多格式,新增多项功能,提升处理效率和准确性。