视觉能力评估」共找到 4093 篇相关文章

算法论文8

AAAI 2026 Oral | 告别注意力与热传导!北大清华提出WaveFormer,首创波动方程建模视觉

北大清华团队在AAAI 2026 Oral论文中提出WaveFormer,首创用波动方程建模视觉。它将特征传播写成欠阻尼波动方程,实现频率 - 时间解耦,在多任务验证中速度、效率与精度全面超越。

机器之心
开源动态8

Jina-VLM:可在笔记本上跑的多语言视觉小模型

Jina AI 发布 2.4B 参数量的视觉语言模型 Jina-VLM,在多语言视觉问答任务达 SOTA。它引入注意力池化,连接视觉与语言基座,支持 29 种语言,能高效处理问答等任务,对硬件需求低。

Jina AI
8

刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA

普林斯顿刘壮团队、陈丹琦参与推出开源通用视觉推理RL框架Vero。它构建的视觉推理器在30多项测试达8B视觉语言模型SOTA,解决了开源RL方案的问题,所有数据、代码、模型均已开源。

量子位
推荐文章7

对谈 Memories AI 创始人 Shawn: 给 AI 做一套“视觉海马体”|Best Minds

本文是对 Memories AI 创始人 Shawn 的访谈。他指出当下 AI 记忆多为“上下文工程”,其团队致力于打造视觉记忆层 LVMM。还探讨了视觉与文本记忆区别、LVMM 架构及应用场景等,认为视觉记忆将成下一代 AI 核心。

海外独角兽
算法论文8

给定"标价"的 LLM 智能体,能规划出"最优"路径吗?

在LLM智能体多轮工具使用中,评估成本是难题。来自多所高校的团队推出CostBench基准,围绕旅行规划构建评估环境。评估顶尖模型发现其规划与适应能力有短板,并分析失效根源,还指出下一代智能体演进方向。

深度学习自然语言处理
开源动态8

首个故事可视化综合评估框架来了!80个故事单元53种类别,20种技术方案全面对比

随着AIGC技术进步,故事可视化引发关注。阶跃星辰携手上科大、西湖大学提出ViStoryBench可视化评估框架,通过构建多元化数据集、建立多维度评估指标,对超20种技术方案评测,为行业发展提供评估工具。

量子位
新闻资讯8

瓦卡奖AI视觉创意大赛·从人工智能专家跨文化对话到全球AI厂商的竞技

10月17 - 19日,第二届瓦卡奖AI视觉创意大赛在深圳举行。期间AI全球视觉工作坊汇聚专家探讨AI与艺术融合,竞技日集结全球AI视频厂商民间团队参赛。大赛还发布国内首部《AI视觉创意应用蓝皮书》。

MANA新媒体艺术站
算法论文8

谷歌提出破局Self-Consistency计算瓶颈!LLM推理效率革命,推理加速不牺牲精度

Google Research等团队提出CISC,通过给推理路径赋予置信度权重,少量样本即可超越传统自洽性效果,平均减少40%计算成本,还提出WQD指标揭示模型自评估能力本质。

深度学习自然语言处理
算法论文8

AI打通第一/第三人称视觉,跨视角视觉理解新SOTA|ICCV 2025 Highlight

INSAIT、复旦大学等联合提出ObjectRelator框架,让AI精准匹配不同视角下同一物体,实现跨视角统一表征与理解。它在Ego转Exo和Exo转Ego任务上超基线模型,已被ICCV 2025接收,代码开源。

量子位
新闻资讯7

GPT-5.2发布,OpenAI十周年纪念版更新。

OpenAI在成立十周年之际发布GPT-5.2。此次更新让其在真实工作场景更实用,包括PPT/表格制作能力升级、前端编码能力惊艳、视觉能力细节处理更强、工具调用意识领先等。

开源AI项目落地