算法论文8
DeepMind:Veo 3或开启视觉领域新变革
AIGC开放社区
AI 摘要
谷歌DeepMind研究团队发现,视频模型Veo 3能零样本处理多种视觉任务,能力分四层。定量评估显示其性能提升大。研究认为机器视觉或迎范式转变,视频模型有望成通用模型。
阅读原文 · AIGC开放社区
视觉领域的GPT-3时刻!DeepMind首次证明Veo3模型实现对物理世界建模和推理
谷歌DeepMind研究团队论文显示,视频模型Veo 3学会‘无师自通’,能处理多种没学过的视觉任务。研究人员将其能力分四级,还做了定量评估。研究认为机器视觉或正处范式转变边缘。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
新闻资讯7
谷歌拆分DeepMind,布林力促Gemini
DeepMind换帅一周后震荡持续,谷歌将拆分它,把部分非技术团队转入谷歌汇报体系。谷歌联合创始人谢尔盖·布林重新介入Gemini。此外,Gemini因算力、内讧、官僚等问题落后。
量子位
开源动态7
新视频模型发布,视频Agent竞争升级
7月31日MiniMax H3和字节跳动Seedance 2.5同日发布,3天后H3开源,8月7日Seedance 2.5开放api。模型变强使产品层要做的事更多,视频Agent需解决生产问题,竞争走向模型层之上。
Founder Park
产品应用8
MiniMax H3 开源,视频创作成本大降
本文实测 MiniMax H3 视频模型,它 8 月 3 日开源,成本低至 0.5 元/秒,在编辑榜成绩佳。它定位全模态生成,能多素材输入。实测效果好,价格约为 Seedance 2.5 的三分之一,还支持原生剪辑,适配多芯片与工具。
特工宇宙
算法论文7
大模型看图能力差,与人类有近 9 倍鸿沟
本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。
机器之心