多模态视觉理解模型」共找到 1934 篇相关文章

算法论文8

ICLR 2026 | 机器人不够聪明?VLMgineer让大模型自己「发明工具」,从设计到使用全自动

宾夕法尼亚大学研究者提出 VLMgineer,一个全自动工具设计与使用框架,利用视觉语言模型和进化搜索,让机器人自主设计并使用工具。该工作已被 ICLR 2026 接收。实验显示,它在工具设计上优于人类提示和现有 Benchmark 工具。

机器之心
开源动态8

TabClaw:让 AI 真正读懂你的表格数据

TabClaw 是面向表格数据的 AI 分析 Agent,能让 AI 真正读懂表格数据。它核心标签是全透明与持续进化,工作流分显式和隐式两层,目标是成为真正理解用户、能一起成长的表格分析伙伴,项目已开源。

PaperAgent
算法论文8

北大大牛团队最新顶会,首次让AI能够生成真实火焰

北京大学陈宝权教授团队提出 FieryGS 框架,被 AI 顶会 ICLR 2026 接收。它将多模态大模型、燃烧物理仿真与 3D 高斯溅射融合,首次在 3D 重建中实现物理可信、语义感知且可控的火焰合成,推动数字孪生发展。

新智元
开源动态7

长视频会议纪要、访谈节目精剪AI神器

WhisperVideo是用于长篇幅、多说话人视频的简洁演示系统,专为真实对话构建。它有SAM3视频分割、TalkNet主动说话人检测等功能,具备视觉关联说话人归属等特性,文中还介绍了安装、运行等内容。

GitHubStore
开源动态8

不止是 Claude Code 平替:这个开源 CLI 还支持“多模型协作 + 子代理并行”

Kode 定位是在终端中完成代码库理解、文件编辑、命令执行等开发流程,有三大亮点:将多模型协作设为核心能力;支持 AGENTS.md 文档模式;终端体验好,有强大的补全系统。还介绍了使用方法和适用人群。

小华同学ai
开源动态8

突然,被GLM-4.7的Coding交付能力惊到了

国内大模型圈因智谱启动A股上市而兴奋时,GLM系列再展“卷王”姿态,本月开源旗舰GLM - 4.7。它从代码大模型变为任务交付引擎,实测在多场景表现出色,能理解复杂意图、交付高质量代码。

PaperAgent
8

AI引发K型分化:Gemini 3 加剧技术劳动力分化,判断力为王,基础岗位将被AI完全替代,程序员也不例外

2025年11月Google发布Gemini 3,依托多模态MoE架构和“Deep Think”模式,在软件工程等领域实现推理能力质的飞跃。它使前端开发工作重心转移,重构软件工程工作流,赋能白领但带来隐患,还冲击劳动力市场,提升软件掌握门槛。

AI Reading Hub
开源动态8

英伟达新架构引爆全模态大模型革命,9B模型开源下载即破万

英伟达推出全模态大模型OmniVinci并开源,其90亿参数规模性能超同级别甚至更高级别模型,训练数据效率是对手6倍,能精准解析视频和音频,在多模态应用场景中表现卓越,下载量破万。

新智元
算法论文8

刘鹏飞组发布上下文工程2.0:人机交互的全新视角

刘鹏飞组论文《Context Engineering 2.0: The Context of Context Engineering》重新梳理上下文工程领域。它追溯其20多年历史,给出形式化定义与四阶段模型,探讨关键问题,将其从技术技巧升为系统学科,为理解人机交互提供新视角。

深度学习自然语言处理
新闻资讯7

李飞飞一年前究竟说了啥?怎么又火了

AI教母李飞飞一年前访谈再引关注,她指出大语言模型或许并非真正智能,其基于一维语言信号训练,在理解三维物理世界存在局限。相关实验也证实大模型在物理任务表现差,不过也有人提出不同观点。

量子位