视频生成框架」共找到 3887 篇相关文章

算法论文8

中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考

上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。

机器之心
算法论文8

CVPR2025|MCA-Ctrl:多方协同注意力控制助力AIGC时代图像精准定制化

中国科学院计算技术研究所团队提出无需微调的通用图像定制方法 MCA - Ctrl,利用扩散模型内部知识,结合条件语义与主体内容。实验显示其在编辑和生成任务表现优,解决了现有技术瓶颈。

机器之心
算法论文8

ICML 2026|让AI自动发现前沿风险:创智×复旦×牛津发布AutoControl-Arena

当AI智能体走向真实应用,前沿风险藏于复杂长尾场景,难以靠人工覆盖。创智、复旦、牛津联合发布AutoControl Arena框架,自动合成可执行测试环境,还构建X - BENCH验证,已在GitHub开源。

机器之心
新闻资讯7

直播预约 | 世界模型,点燃下一个AI爆点(第二期)

本周三‘世界模型’沙龙反响热烈,决定加场。4月23日19:00 - 20:30,机器之心集结4位专家探讨世界模型前沿话题,包括刘子纬、赵行、贾奎、刘桂良,直播在机器之心视频号进行。

机器之心
开源动态7

AI Agents的DeepSeek顿悟时刻:AutoHarness

文章介绍开源项目「Aha」— AutoHarness,这是面向AI Agent的自动化Harness Engineering轻量级治理框架,能让智能体迎来顿悟时刻。对比了其与LangGraph、OpenAI SDK能力,还给出核心架构、安装及使用示例。

PaperAgent
算法论文8

4D通用世界模型!中科院NeoVerse用百万单目视频直接构建

中国科学院自动化研究所与CreateAI团队构建4D世界模型NeoVerse,它用全新端到端架构,从单目视频高效重建4D高斯泼溅,模拟成像退化提升生成鲁棒性,在多任务表现卓越。

AIGC开放社区
算法论文8

一篇Graph+AI Agents最新技术综述

该综述提出分类框架组织Graph与AI Agents领域研究进展,详细探讨图技术在AI代理规划、执行、记忆和多代理协调等核心功能中的作用,还提及代表性应用、挑战和未来机遇。

PaperAgent
推荐文章7

开发者不仅编写代码,也在创造世界

智能GitHub Copilot副驾驶等生成式AI技术出现,使编程从“指令式”转向“意图式”。开发者需具备对问题、模型、交互的新“品味”,微软相关工具顺应此趋势,峰会将探讨相关话题。

AIGC开放社区
算法论文8

训练提速4.6倍!FP4+BF16双轨并行,NVIDIA×港大×MIT联手重新定义扩散模型训练速度上限

NVIDIA、港大、MIT团队提出Sol - RL,采用「FP4先探索、BF16再训练」框架,将扩散模型训练收敛速度最高提至4.64x,在速度与对齐效果间给出工程可行解法。

机器之心
新闻资讯7

ICLR 2026 放榜了!28%接收率,欢迎投稿机器之心

ICLR 2026 官方深夜发论文接收结果,会议 2026 年 4 月在巴西举行,收稿约 19000 篇,录取率约 28%。网友晒成绩,不过本届堪称“史上最乱”,有审稿问题,还被质疑用 AI 生成意见。

机器之心