图像级推理」共找到 3168 篇相关文章

新闻资讯7

阿里巴巴大模型品牌统一为千问

今天,阿里巴巴AI总称和核心品牌统一为千问,涵盖基础与专业领域模型,千问APP是C端旗舰应用。今年除夕开源千问3.5,多款中小型模型上榜,春节用户下单近2亿次,DAU大增成国民助手。

千问Qwen
产品应用8

字节最强多模态模型登陆火山引擎!Seed1.5-VL靠20B激活参数狂揽38项SOTA

5月13日,火山引擎在上海发布5款模型和产品,其中豆包1.5・视觉深度思考模型(Seed1.5-VL)最吸睛。它激活参数20B,性能与Gemini2.5 Pro相当,38个评测基准达SOTA,推理成本低,已开放API。

机器之心
开源动态8

参数砍到 1B,这个小钢炮拿下多模态第一

面壁智能发布并开源参数量仅 1.3B 的 MiniCPM-V 4.6,虽小但多模态综合能力在 1B 别中夺冠。它推理快,效率高,靠两大架构创新实现,还为开发者提供完整工具链。

AGI Hunt
新闻资讯8

清华2年前预言,正成为全球共识!Meta等三大AI机构已得出同一结论

全球三家AI研究机构结论曲线斜率几乎重合,而中国面壁智能和清华联合团队两年前提出的“密度定律”与它们一致。该定律改写行业假设,如推理成本下降、端侧智能爆发临近、大模型策略反转等。

新智元
新闻资讯8

华尔街彻夜难眠!Gemini 3屠榜金融「最难考试」,AI砸了「金饭碗」?

被誉为「黄金职业通行证」的CFA考试被AI攻陷,推理模型不仅全部通过三考试,部分科目接近满分。如Gemini 3.0 Pro在一考试创97.6%最高纪录。不过AI仍有局限,还不能完全替代分析师。

新智元
新闻资讯7

聊聊腾讯 AI 的「松弛感」

文章通过播客内容探讨腾讯AI现状、大厂进击及2025年AI行业趋势。指出腾讯AI存在感弱与策略有关,其以连接器战略拓展;今年场景和用户体验优先提高,大厂有内部提效等隐形壁垒。

刘言飞语
算法论文8

首个实例理解3D重建模型!NTU&阶越提出基于实例解耦的3D重建模型,助理场景理解

人类能自然感知3D世界的几何与语义,但AI做到“两者兼得”是挑战。NTU联合StepFun提出IGGT,将空间重建与实例上下文理解融为一体,还构建了InsScene - 15K数据集,解决了传统方法的问题。

量子位
产品应用8

谷歌2.5 Image:『你是我的神』,准备丢掉PS了

谷歌新出的大模型Gemini 2.5 Flash Image实现AI图像创作一致性、真实性新高度。它能理解手绘图表、解答问题及完成复杂编辑指令,可在Gemini和Google AI Studio免费使用,表现出色,有望取代很多PS任务。

鲸选AI
新闻资讯8

DeepMind 发布超真实世界模型 Genie 3,AGI 向前一步

谷歌旗下DeepMind发布通用型世界模型Genie 3,可通过文本提示生成动态世界并实时交互,其生成内容物理一致性达分钟。它功能丰富,也受业内好评,但有行动空间有限等局限,对迈向AGI意义重大。

AI科技评论
算法论文8

英伟达港大联手革新视觉注意力机制!GSPN高分辨率生成加速超84倍

香港大学与英伟达联合推出广义空间传播网络(GSPN)。它采用二维线性传播与“稳定性 - 上下文条件”,将计算量降低,保留图像空间连贯性。在多视觉任务刷新性能纪录,如高分辨率生成加速超84倍。

量子位