跨视角视觉理解」共找到 1460 篇相关文章

新闻资讯8

Claude Opus 4.7发布!这是你在别的公众号看不到的五个发现

Anthropic发布Claude Opus 4.7,编码和视觉能力提升,但长上下文能力下降。其231页的System Card藏着不少有趣发现,如Opus 4.7非最强模型、Claude知道被测试、模型审查自身评估等。

花叔
新闻资讯8

种子轮10.3亿美元!谢赛宁加入,LeCun的世界模型公司太吸金了

图灵奖得主 Yann LeCun 创办的先进机器智能实验室(AMI)官宣起航,完成 10.3 亿美元种子轮融资,估值 35 亿美元,谢赛宁加盟。AMI 目标是做理解现实世界的 AI,想走世界模型路线。

机器之心
产品应用8

从操作系统到Agent Team,字节Seed 2.0来了!

作者受字节内测邀请,对豆包大模型Seed 2.0进行多方面测试。在APP开发、多模态理解、操作系统构建、Skills调用、真实项目开发等测试中表现出色,虽有小缺点,但整体提升大,值得试用。

AI产品黄叔
新闻资讯7

刚刚,Google Veo 3.1 发布,Sora 还香吗?

Google 发布 Veo 3.1,重新定义 AI 视频生成天花板。它对叙事深度理解,新增音频生成,有四大核心能力。网友将其与 Sora 2 对比,二者各有千秋。还介绍了 Veo 3.1 使用方式及 Flow 平台成果。

AGI Hunt
产品应用8

揭秘!腾讯如何训练多智能体像专家一样设计游戏场景

腾讯游戏提出游戏场景自动布局生成系统IntelliScene 2.0,利用图像引导生成3D场景。它构建多智能体工作流,结合高质量数据集,经模型微调、视觉解析等步骤生成场景,经评估效果良好,为AI生成三维信息提供新路径。

腾讯技术工程
开源动态8

性能超越李飞飞,他们把10亿高斯点的3D世界装进浏览器

群核科技开源3D高斯浏览器Aholo Viewer,渲染速度和大场景加载性能超Spark2.0,能让任何设备浏览器流畅运行10亿+粒子的超大3D场景。它还带动信息载体范式跃迁,推动AI理解三维世界。

机器之心
新闻资讯8

黑马图像模型被Nano Banana技术负责人点赞!15人华人小队,DDIM之父&CVPR最佳论文作者带队

Luma AI推出全新图像模型Uni - 1,对标谷歌Nano Banana Pro和GPT Image 1.5。它是统一图像理解与生成模型,多项评测表现出色。背后是不到15人的华人团队,由DDIM之父和CVPR最佳论文作者带队。

量子位
算法论文8

多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开

上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。

量子位
产品应用7

Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了

由前OpenAI CTO创办的Thinking Machines Lab推出的首款产品Tinker API有重大更新。取消候选名单面向所有用户,还可微调Kimi K2 Thinking,新增兼容OpenAI API接口,支持Qwen3 - VL视觉输入,降低模型训练门槛。

机器之心
新闻资讯7

ClockBench:一个简单的钟表测试让AI全线溃败

ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。

AI工程化