掩码扩散语言模型」共找到 1311 篇相关文章

开源动态8

Google 开源 InkSight,把手写笔记直接变成可编辑数字笔记!

Google 开源 InkSight,能将手写照片转为数字墨迹,与传统 OCR 不同,它可「还原书写方式」。具备离线转在线、多语言支持等功能,核心是「阅读 + 书写」双重训练,有两种使用模式。

开源星探
算法论文8

轻量高效,即插即用:Video-RAG为长视频理解带来新范式

现有视觉语言模型处理长视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多模态辅助文本检索增强生成,解决长视频理解问题,适用于多场景。

机器之心
算法论文8

AI打通第一/第三人称视觉,跨视角视觉理解新SOTA|ICCV 2025 Highlight

INSAIT、复旦大学等联合提出ObjectRelator框架,让AI精准匹配不同视角下同一物体,实现跨视角统一表征与理解。它在Ego转Exo和Exo转Ego任务上超基线模型,已被ICCV 2025接收,代码开源。

量子位
算法论文8

谢赛宁团队用RAE实现从8%到84%的飞跃,宣告VAE时代结束

谢赛宁团队用RAE新架构将ImageNet图像生成FID刷到1.13,宣告VAE组件过时。RAE结合先进表征学习成果与强大生成模型框架,解决诸多问题,还为其高维潜空间定制DiTDH架构,性能优异。

AIGC开放社区
开源动态8

无需训练,即插即用:西湖大学发布世界模型WorldForge,让普通视频模型秒变「世界引擎」

自Sora亮相,AI视频可控性成瓶颈。西湖大学AGI实验室团队提出WorldForge框架,在推理时为视频模型注入「时空几何」,无需训练,实现单图360°环绕视频生成和视频重运镜等,降低创作门槛。

机器之心
开源动态8

群核科技开源两款空间大模型,想解决 Genie3 没能彻底解决的问题

2025年8月25日群核科技举办TechDay,发布专注3D室内场景的空间大模型,开源SpatialLM 1.5和SpatialGen。两款模型分别解决理解交互和空间一致性问题,有实际应用价值,还介绍了数据飞轮效应及模型相关问答。

Founder Park
新闻资讯7

拒稿警告,靠大模型「偷摸水论文」被堵死,ICLR最严新规来了

ICLR 2026出台大语言模型使用政策,规范作者与审稿人使用LLM做法,明确需如实披露使用情况并担责,违规将受处罚。其他顶会如NeurIPS、ICML等也有相关规定。

机器之心
算法论文8

从需求分析到代码生成,LLM都能干点啥?一文读懂291个软工Benchmark!

语言模型重塑软件工程各环节,但缺乏评估其在该领域表现的系统工具。浙江大学等机构团队首次对291个软件工程Benchmark系统综述,分析现状、痛点并给出改进方向。

新智元
算法论文8

ICML 2025 | 多智能体的ChatGPT时刻?上交MAS-GPT实现工作流一键生成

上海交通大学等机构推出 MAS - GPT,提出生成式 MAS 设计范式,可一键生成可执行的 MAS。它解决了现有 MAS 方法无适应性、成本高、泛化性低等问题,实验显示其表现出色,未来潜力大。

机器之心
算法论文7

物理学家靠生物揭开AI创造力来源:起因竟是“技术缺陷”

两位物理学家以生物系统自我组装过程为参考,提出并验证假设:扩散模型去噪过程类似细胞分化重组,AI的‘创造力’是模型架构直接且必然的结果,本质是确定性过程。

量子位