视觉理解」共找到 1302 篇相关文章

开源动态8

SmolVLA: 让机器人更懂 “看听说做” 的轻量化解决方案

文章介绍轻量级开源视觉 - 语言 - 动作 (VLA) 模型 SmolVLA,专为机器人领域设计,可在消费级硬件运行。它用公开数据集训练,架构经优化,还引入异步推理堆栈,性能超部分大模型,降低研究门槛。

Hugging Face
产品应用7

Manus突发上新文生图!告别“抽卡”,Agent+深度思考联合创作

Manus深夜官宣支持生成图像,与一般AI绘图工具不同,它能理解画图目的,规划方案后再生成。它可完成如房间装修可视化、饮料瓶设计等任务。目前已开放注册,不过付费价格遭网友吐槽。

量子位
产品应用7

用AI把一段视频变成可视化网页,Google的新模型又卷飞了。

Google更新Gemini 2.5 Pro至05 - 06版。此版代码能力在WebDev Arena盲测登顶,超Claude 3.7 Sonnet;还提升视频理解,可将视频转为可视化网页,虽有产品打磨问题,但进步值得肯定。

数字生命卡兹克
算法论文7

Meta全开源HumanCLAW:基础模型正进入具身智能的决策层

过去基础模型主要理解和描述物理世界,如今开始进入机器人控制栈。Meta等提出HumanCLAW,将高层行动与低层运动控制分开。评测显示当前模型在行动决策上存在不足,未来可从多方向推进研究。

机器之心
新闻资讯8

斯坦福吴佳俊「计算机与思想奖」获奖演讲全文:从一张照片,逆推一个世界|IJCAI 2026

8月20日,斯坦福大学吴佳俊在IJCAI 2026发表“计算机与思想奖”获奖演讲。他指出像素是表象,物理结构才是因果,提出以物理代码为桥,融合基础模型泛化力与物理模拟因果性,构建视觉与物理智能。

AI科技评论
产品应用8

Claude Opus 5发布,砍掉了Claude Code 80%的系统提示词

Anthropic发布Claude Opus 5,接近Claude Fable 5智能且价格减半,测评成绩出色,科研和视觉输出能力也有进步。同时发现砍掉Claude Code 80%系统提示词,编码评测分数不变,还总结出上下文工程新方法论。

AIGC开放社区
推荐文章7

OpenClaw 类自主智能体生态构建

文章围绕OpenClaw类自主智能体生态展开,从生态视角、记忆系统、上下文管理等多方面阐述其构建,还分析了安全风险、治理体系、角色分工及面临的挑战与机会,为理解和发展Agent生态提供参考。

AIGC开放社区
新闻资讯7

华为具身大脑一号位创业,用认知科学造世界模型,获亿元级融资

2026年世界模型成AI热门,资本人才汇聚让AI理解物理世界。具脑磐石获亿元融资,由曾任华为云AI算法创新Lab主任的朱森华创立,用认知神经科学重做机器人脑模型,构建认知世界模型。

量子位
新闻资讯8

帮大家总结了一下凌晨的Google I/O 2026开发者大会。

本文总结Google I/O 2026开发者大会成果,涵盖AI模型、产品、Agent系统、视觉生成、搜索、电商等多领域。如推出Gemini 3.5 Flash,升级产品功能,发布新Agent系统,推进电商协议,还有科研成果与硬件更新。

数字生命卡兹克
产品应用8

比「小龙虾」更能打,中国AI视频大模型悄悄登顶全球第一

昆仑万维旗下 SkyReels-V4 Preview 版在权威评测平台超越 OpenAI、Google 等模型,登顶全球第一。它提升语义理解和逻辑能力,新增参考任务,还支持多语言短剧生成、视频编辑等,将在中关村论坛亮相。

机器之心