「视频智能体」共找到 4308 篇相关文章
AI又来带货了!字节推出DreamActor-H1自动对齐手势和商品
在电商和数字营销领域,现有框架呈现效果不佳。字节推出DreamActor - H1框架,基于扩散变换器,集成Seaweed - 7B模型,能生成高保真人机交互视频,有效果突破但也存在局限。
Paper2Page: 让每一篇论文都能“自己长出”一个项目主页
AI领域论文众多,研究者难让工作脱颖而出,精美项目主页很重要但制作繁琐。AutoPage是多智能体协作框架,能将论文一键转为项目主页,经三步协作,在速度、成本、质量等方面表现出色,代码已开源。
AI玩拼图游戏暴涨视觉理解力,告别文本中心训练,无需标注的多模态大模型后训练范式
在多模态大模型后训练浪潮中,现有方法多以文本为中心。MMLab@南洋理工大学提出Visual Jigsaw,将拼图任务用于后训练,让模型不依赖标注强化视觉感知与理解,在图片、视频和3D模态验证有效。
Google研究发现:Multi-Agent的核心竟然是Prompt设计!
Google和剑桥大学研究多智能体系统,发现提示设计影响大,有效拓扑结构占比小。提出Mass框架分三阶段优化,实验用Gemini 1.5 Pro和Flash模型,对比多种方法,在多任务上性能显著提升。
AGI失控率>90%!MIT教授算出「康普顿常数」,AI地球「夺权率」已锁定?
MIT教授研究指出,即使采用理想监督机制,人类成功控制超级智能概率仅52%,全面失控风险超90%。研究通过量化分析提出嵌套可扩展监督等理念,并在四个真实监管场景验证,探讨如何优化现实监管系统。
千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师
以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。
「动嘴办公」火起来了!TRAE SOLO让打工人张嘴就能干活
新智元报道,TRAE SOLO与Insta360联名推套装,实现「动嘴办公」。它能智能转录、修正语义、直调功能,可处理代码、文件等。还能过滤口语、理解语义,降噪拾音。4月底将上线实时问答互动。
阿里成立Token Hub事业群,打碎钉钉,做成龙虾!
阿里巴巴成立Alibaba Token Hub事业群,首席执行官吴泳铭挂帅。旗下设5大事业部,目标是创造、输送和应用Token。还发布企业级旗舰应用悟空,重写底层架构,打造专属文件系统与Skill生态,展示多款智能硬件。
ICLR 2026|多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案
多模态大模型迅速发展,但能否理解人类情绪存疑,且缺乏系统性评测框架。香港中文大学和阿里通义实验室团队提出 MME - Emotion 评测基准,评测 20 个主流模型,发现模型情感智能不足,为后续研究提供参考。
AI时代,最老的设计哲学反而最有效
50年前的Unix哲学‘万物皆文件’和‘文件夹即应用’正以意想不到的方式回归。过去因‘人类可理解性’被推崇,如今因AI能操作而重获重要性,文件夹成‘智能空间’,AI成其操作系统。