「多模态条件控制」共找到 1472 篇相关文章
NIPS2025 | A-Mem让Agent拥有动态自我记忆功能,达到新SoTA
近年来,LLM代理需长期内存系统,但现有系统缺乏灵活性。论文提出A - Mem能动内存系统,受Zettelkasten启发,能让记忆‘自我整理’和‘自我更新’,在多基准测试领先,也指出了局限性和未来方向。
InfiniteTalk:音频驱动的从口型到全身动作同步方法
近年来视频AIGC推动音频驱动人体动画变革,但传统视频配音局限口部。中国科学院大学提出稀疏帧视频配音范式,推出InfiniteTalk生成器,结合多种技术实现全身动作与音频同步,实验表现突出。
90%打工人「自费买AI上班」,开启To P革命!每月花20刀效率翻倍
面对AI淘汰焦虑,大量职场人主动自费买AI工具,开启「自我拯救」运动,催生出To P新赛道。文章分析其发展快的原因,也提及To B和To C赛道后续发展的条件。
2025临界点:AI智商超越人类,经济规则即将改写
AI平均智商超110,2025年将参与经济全链条操作。AI经济浮现,具备全天候自动运行、无劳动力供给限制、或成非稀缺经济等特点,还能降低交易成本、减少非理性决策,或带来人类第三次理性化浪潮。
抄作业了!让AI产品告别“上线就崩”的CC/CD框架,6步搞定,拿走不谢。
文章指出AI产品因大模型不确定性,易上线翻车。介绍海外流行的CC/CD开发框架,阐述AI产品不确定性原因,强调自主与控制平衡,还给出该框架落地的6步工作流。
阿里开源 Vivid-VR!带来逼真连贯的视频修复
阿里开源 Vivid - VR 用于视频修复,基于 T2V 模型结合 ControlNet 保证画面一致性。它引入概念蒸馏训练策略,设计控制特征投影器和双分支 ControlNet 连接器,实验展现出优异表现。
一篇200+文献的视觉强化学习技术最新综述
NUS、浙江大学和香港中文大学对强化学习与视觉智能交叉领域进行系统梳理,归纳200余篇工作为四大主题支柱,剖析算法等进展,提炼关键趋势,还介绍LLM的RL方法、视觉RL阵地等。
用户集体大逃亡!Cursor“自杀式政策”致口碑崩塌:“补贴”换来的王座,正被反噬撕碎
很多开发者吐槽和弃用 Cursor,其付费后砍功能、技术变差、营销成“障眼法”,引发信任危机。部分用户转向 Claude Code,AI 编程工具竞争焦点升级,未来有向智能体演进等趋势。
Nature Machine Intelligence颠覆有机化学研究范式,上海交大发表化学合成大语言模型
上交大AI4S团队依托平台,联合多团队在AI for Chemistry领域获突破。相关研究发表于《Nature Machine Intelligence》,介绍白玉兰化学合成大模型Chemma,它加速有机合成全流程,在多任务表现出色,还能解决数据稀疏等问题。
ACL首届博士论文奖公布,华人学者李曼玲获荣誉提名
自然语言处理顶会 ACL 公布首届计算语言学博士论文奖,获奖者是华盛顿大学的 Sewon Min,其论文聚焦大型语言模型数据使用。此外,还有三篇论文获提名,包括李曼玲等学者的成果。