新视角合成」共找到 3851 篇相关文章

新闻资讯7

Agent创业者的天塌了,OpenAI发布ChatGPT Agent

昨晚OpenAI发布ChatGPT Agent,这让Agent创业者紧张。它整合多种能力,功能强大,支持多操作。模型经强化学习调优,在多基准测试中表现佳,或挤压初创公司通用Agent赛道空间。

花叔
算法论文8

ETT:打破原生多模态学习视觉瓶颈,重塑视觉tokenizer优化范式

本文由多机构联合完成,针对传统视觉 tokenization 方法优化与下游任务训练割裂问题,提出 ETT 调优方法。它实现联合优化,在多模态理解、生成、重构任务表现出色,虽有局限但带来突破。

机器之心
算法论文8

用3D几何先验驱动视频扩散,实现更一致的世界生成

视频扩散模型生成视角视频时,现有方法缺显式3D结构。智象未来提出DreamWorld,用3D先验与两阶段框架,结合结构和生成能力,在多基准测试表现领先。

机器之心
推荐文章8

吴昊:AI 重构 SaaS,成本降百倍需求增千倍

SaaS市场经历‘惊魂六十天’,‘SaaS终结论’甚嚣尘上。但吴昊指出,AI让软件开发成本降100倍、需求增1000倍,会使行业洗牌,旧护城河崩塌,壁垒出现,企业需转型。

AI科技评论
新闻资讯7

发 token 当工资?工程师不只拿现金和期权,开始按 token 分身价了

硅谷正用 token 吸引人才,国内也有类似趋势。AI 使用成本渐成人力成本关键,token 对应算力争夺,其价格上涨,大厂还想将 token 变成价值单位,引发质疑。

InfoQ
开源动态8

QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5

通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三大“法宝”重塑模型能力,效果显著,相关代码已开源。

AINLPer
算法论文8

图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果

百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。

量子位
新闻资讯7

AI赋能创玩法点燃星际热浪,2025星际争霸2锦标赛冠军出炉!

近日,2025星际争霸2锦标赛总决赛结束。赛事有全种族加入、视角移动功能增加等创,玩法和观赛体验升级。经多轮比拼,XingMing击败caonima夺冠,赛事重塑玩家与游戏关系。

AIGC开放社区
新闻资讯8

陶哲轩:AI 正在让“想法”变得廉价,而真正的瓶颈从未改变

数学家陶哲轩与Dwarkesh Patel访谈,探讨AI在科学发现中的作用。他指出AI让‘想法生成’成本降为零,验证想法成瓶颈;AI擅长广度,人类擅长深度;AI负责找证明,人类提炼‘理解’与‘智慧’。

力学与人工智能
8

无限长、零掉帧!StableAvatar口型同步全技术

当前音频驱动头像视频生成扩散模型合成长视频时难兼顾音频同步与身份一致,瓶颈在音频建模。复旦大学提出StableAvatar,首个端到端视频扩散Transformer,能无限时长生成,还介绍原理与演示效果。

带你学AI