「语义解耦」共找到 268 篇相关文章
61.3%!「人类最后一场考试」AI终于及格了,揭秘Agent自我进化新路径
上海交通大学等联合团队提出MemRL框架,在不微调模型参数下,让AI在“人类最后一场考试”中准确率跃至61.3%。该框架受人类认知科学启发,解耦推理与记忆,实验表现出色,或为AGI提供高效路径。
锁死一致性!Vidu Q2「参考生」可算来了,新功能强到离谱,APP全面进化
生数科技Vidu Q2「参考生」功能全球正式上线,APP端全面改版。新上线「视频延长」功能,最长扩展5分钟,还在一致性、速度、成本等方面优化,在镜头语言、语义理解等表现出色,APP社交体验好。
更少的token生成更好的图!香港大学联合阶跃星辰等让AI绘画真正理解了再画
香港大学、阶跃星辰等用VFMTok新方法,让图像生成模型借用顶级视觉AI的眼睛看世界,实现更快、高质量图像生成,且无需复杂引导技巧。它改变图像理解方式,将像素死记硬背转为语义理解。
刚刚,千问杀入汽车座舱!阿里不止做超级APP,更要做超级入口
阿里AI助手千问被接入红旗汽车智能座舱,这是通用AI助手首次以完整形态登陆车载场景。千问能完成复杂语义理解和任务规划,还将拓展至更多硬件,阿里要把它打造成AI时代超级入口。
AAAI 2026|新突破:北大彭宇新团队提出可见光-红外终身行人重识别方法CKDA
终身行人重识别有重要应用价值,但现有方法在学习特定模态新知识时,会阻碍跨模态公共旧知识保留。北大彭宇新团队提出CKDA方法,解耦并净化不同模态信息,实现跨模态知识权衡,在相关基准上取得最优性能。
把VLM塞进隐式世界模型,小鹏机器人新框架让机器人长出物理直觉
机器人大脑架构中VLM和VAM路线各有短板,香港大学、小鹏机器人等团队提出DIAL框架,让VLM在原生特征空间做隐式世界建模,解耦认知决策与底层执行,在机器人部署中表现优异。
Light-X来了!全球首个「镜头×光照」双控4D视频生成框架,单目视频秒变电影级
新加坡南洋理工大学等科研机构联合推出Light - X,全球首个「镜头×光照」双控4D视频生成框架。它解耦相机与光照,在扩散模型中融合,还构建Light - Syn数据管线,实验显示其效果显著优于现有方法。
SIGGRAPH Asia 2025 | OmniPart框架,让3D内容创作像拼搭积木一样简单
香港大学等机构研究者推出OmniPart框架,解决3D内容创作难题,已被SIGGRAPH Asia 2025接收。它将生成任务解耦为两阶段,保证部件独立又能完美组合,质量和效率超现有方法,应用潜力大。
ACL 2026|打破推理同质化!阿里达摩院新作让RLVR从重复采样走向有效探索
阿里达摩院智能决策团队提出面向RLVR后训练的探索增强框架I²B-LPO,改进rollout策略,在关键节点生成更具区分度的推理轨迹,结合信息瓶颈自奖励机制,在多个数学基准上提升准确率与语义多样性。
画数独、烧蜡烛都不翻车了?浙大&阿里让AI先三思再下笔|ACL 2026
当下视觉生成中,开源模型在逻辑推理生成任务上频频翻车,与闭源模型有差距。浙大与阿里团队提出Unified Thinker,将思考与执行解耦,构建数据集、采用创新算法,实验显示其有效提升逻辑执行准确度。