「创新」共找到 888 篇相关文章
超越免训练剪枝:LightVLA引入可微分token剪枝,首次实现VLA模型性能和效率的双重突破
文章介绍LightVLA框架,它是用于提升VLA推理效率和性能的视觉token剪枝框架。针对VLA模型计算开销大、推理延迟高问题,提出两大创新,在LIBERO实验中性能超经典模型,还实现推理加速。
重磅!DeepSeek R1论文经过同行评议登上Nature封面,梁文锋作为通讯作者再次创造历史
DeepSeek R1论文《DeepSeek - R1 incentivizes reasoning in LLMs through reinforcement learning》登上Nature封面,梁文锋为通讯作者。它是首个经同行评议的有全球影响力的LLM,训练成本低,创新使用‘纯粹强化学习’方法,启发众多研究。
PosterGen:告别学术海报制作烦恼,从PDF一键生成「演示级」可编辑PPTX学术海报
许多研究者制作学术海报耗时费力,现有自动化方法有缺陷。联合团队推出PosterGen,能将论文PDF转成可编辑PPTX海报。它有核心创新,遵循四大设计原则,工作流由四个智能体构成,实验证明其有效。
IROS 2025 | 机器人衣物折叠新范式,NUS邵林团队用MetaFold解耦轨迹与动作
新加坡国立大学邵林团队提出MetaFold框架用于机器人衣物折叠。它创新分层架构,解耦任务规划与动作预测。构建开源数据集,经实验在多指标超现有方法,还验证了从仿真到现实的迁移能力。
语音界Sora!微软刚开源新模型,一次生成90分钟语音、3200倍压缩率
今天凌晨微软研究院开源创新音频模型VibeVoice - 1.5B,有诸多技术突破,如可合成90分钟语音、支持4名发言人、3200倍音频压缩等,还首创双tokenizer协同架构。未来微软还会开源更大参数模型。
RSS 2025 软硬件全开源,智源清华带来混动灵巧脸Morpheus
清华大学赵昊团队联合多家机构发布高拟真机器人面部系统Morpheus,融合三项关键技术,能实时生成多种细腻表情。它在核心指标表现出色,有三大创新突破传统瓶颈,为下一代情感机器人奠定技术基座。
用2D数据解锁3D世界:首个面向运动学部件分解的多视角视频扩散框架
张昊等提出 Stable Part Diffusion 4D (SP4D) 框架,由 Stability AI 与 UIUC 联合完成。它能从单目视频生成多视角 RGB 与运动学部件序列,解决运动学部件分解及自动 rigging 问题,实验效果显著,被 Neurips 2025 接受为 Spotlight。
以「场景」定义算力:AI时代,通用算力不只“通用”
当AI狂欢席卷全球,阿里云和AMD通过‘一芯三用’重新定义AI时代算力选型逻辑,从‘参数崇拜’回归‘业务本质’。联合发布三款基于AMD Zen 5架构‘Turin’处理器的全新ECS实例,精准匹配不同业务场景需求。
一篇400+文献最新RAG技术系统性综述
本文对RAG技术进行系统性综述,通过筛选5大数据库、128篇高被引文献、343个数据集,给出技术地图、评估框架与未来路线,梳理技术全景、评估指标,还介绍主流数据集,指出RAG已演变为复杂系统。
实测爆火的阶跃星辰Step 3,性能SOTA,开源多模态推理之王
在 WAIC 2025 前一天,阶跃星辰推出新一代基座模型 Step 3,它是开源 VLM 新晋之王,性能超同类别开源模型,与顶尖闭源 VLM 也有一战之力。该模型具备多开好省特点,还展示了宏大技术生态与商业化布局。