跨视角视觉理解」共找到 1460 篇相关文章

算法论文8

ICLR 2026 | 7B小模型干翻GPT-5?AdaResoner实现Agentic Vision的主动「视觉工具思考」

文章介绍了AdaResoner模型,它学会‘何时用工具’,在拼图推理上击败GPT - 5。Google为Gemini 3 Flash引入‘Agentic Vision’,与AdaResoner殊途同归。AdaResoner有独特训练方法,提升小模型性能。

机器之心
开源动态8

华为开源7B多模态模型,视觉定位和OCR能力出色,你的昇腾端侧“新甜点”来了

华为推出开源多模态模型openPangu-VL-7B,适配昇腾端侧。它推理性能性价比高,在多核心任务表现突出,技术报告还披露核心技术细节,为昇腾使用者带来新选择,丰富昇腾生态。

量子位
开源动态8

别问树模型了!死磕结构化数据,清华团队把大模型表格理解推到极限

AI 时代处理结构化数据成痛点,LLM 大模型难以满足生产要求。清华大学与稳准智能联合发布的 LimiX 系列模型,做到真正通用,在跑分和实际落地表现出色,其轻量级版本 LimiX - 2M 适合边缘设备和科研场景。

机器之心
算法论文8

Nature重磅:AI和人脑的根本区别找到了,我们对“聪明”的理解可能全错了

2025年《自然·机器智能》研究指出AI和人类在‘泛化能力’上本质不同。人类泛化靠抽象,学习高效;AI泛化靠统计,学习笨重。未来AI与人应互补协作,而非谁取代谁。

AIGC开放社区
开源动态8

视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理

快手开源能看懂视频并跨模态推理的大模型Keye-VL 1.5,其有时序定位、描述和推理能力,跑分领先。采用三段式架构和Slow-Fast编码策略,经四阶段预训练和多阶段后处理,团队成果多,推动多模态技术落地。

量子位
新闻资讯8

资本视角下的智造落地战:五位投资人划定关键赛道与投资红线|甲子引力X

在「2025甲子引力X中国科技产业投资大会」上,五位投资人共议智能制造。他们认为当前制造业面临降本增效等挑战,投资时“团队”是关键,中国智能制造在多领域有成长空间,创业者要内修能力、外抓需求。

甲子光年
开源动态8

大模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单

蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。

量子位
算法论文8

ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」

现有第一人称视频助手难以自主判断何时介入服务用户。大连理工大学等团队提出Vinci2,含评测基准EgoServe和智能体EgoMemo。它已被ECCV 2026接收,代码和标注均开源。

机器之心
产品应用7

理解归 AI,正确归引擎:从一句话到一条实时数据链路(0代码搭建实时任务)

文章分享直播数据团队搭建AI辅助、指标驱动的实时数据端到端开发系统的实践与思考。从案例介绍用户使用流程,再深入系统内部讲链路构建与演进,阐述设计方法论,最后提出未来规划。

阿里云开发者
开源动态8

4.5K Star 超极简!挖到一款更轻量的“纳米级 OpenClaw”,8 分钟直接理解源码!

作者挖到更极简的OpenClaw复刻项目NanoClaw,开源3天获4.5K Star。它基于Claude Agent SDK构建,抛弃臃肿设计,拥抱“定制即代码”理念。功能特性丰富,安全模型升级,核心仓库极简能力可无限扩展。

开源星探