视觉语义场景补全」共找到 2593 篇相关文章

新闻资讯8

UC伯克利大牛预警:留给人类能干的活,只剩5年了!

UC伯克利教授Sergey Levine预言,2030年前机器人将进入真实世界,接手厨房、客厅等场景,甚至工厂、仓储和数据中心建设。其基于Robot Foundation Models等进展,认为‘自我进化飞轮’启动后不会停下,还会带来经济冲击。

新智元
开源动态8

GAIA 榜首,杀疯了!高并发、多任务京东开源的JoyAgent秒杀行业巨头

本公众号关注AI前沿技术,分享实战案例与课程。京东开源轻量化通用多智能体产品JoyAgent - JDGenie,可挂载新场景功能,在GAIA榜单准确率超行业知名产品,还介绍了其架构特点与创新点。

CourseAI
开源动态8

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

openJiuwen社区发布业界最早工程化落地的多模态Skill范式Skill-Omni,让Agent经验从‘读得懂’升级为‘看得见’。它能将网页和视频视觉知识沉淀为多模态Skill,还介绍了生成及读取方式和适用任务。

量子位
开源动态8

19K star 霸榜,下一代的浏览器自动化神器!

做爬虫或Web自动化测试常因网页结构变动需重写脚本。Github上超火的Skyvern项目是基于浏览器的自动化代理,不依赖XPath或CSS选择器,用视觉识别结合大模型推理完成任务,已获19k+ star。

开源先锋
产品应用7

全新唇同步技术OmniSync,遮挡,侧脸不在话下

唇同步对创建逼真视频内容很重要,但现有方法在身份一致、姿势变化等方面有局限。中国人大携手快手提出OmniSync,引入无需掩膜的训练范式,保证身份和姿态一致,能适应复杂场景,还建立AIGC - LipSync基准。

带你学AI
新闻资讯8

李飞飞发布Atlas,世界模型进入新时代

李飞飞创业公司 World Labs 发布新一代世界模型 Atlas,它是全模态模型,能处理四模态数据。其核心为空间上下文设计,评测成绩不错,应用场景丰富,公司发展节奏密集,产品路径有转向。

机器之心
开源动态8

打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑

当前主流相机可控图像编辑基于图像扩散模型,应对连续相机运动易出现问题。近日,浙大联合哈佛发布UniGeo框架,在三核心层面注入统一几何引导,克服结构退化,提升视觉质量与跨视角一致性。

新智元
开源动态7

AI 终于能"玩手机"了:Mobile MCP 让大模型直接操控你的 iOS 和 Android

Mobile MCP 是开源 MCP Server,让支持 MCP 协议的 AI 客户端操控 iOS 和 Android 设备,通过自然语言指令完成操作,解锁自动化测试等场景,但成功率有待提升,目前更适合探索性测试等。

AI Reading Hub
开源动态8

开源知识库,从 0 到上线,UltraRAG 企业知识库全流程实战 ,也许这是RAG最好的框架之一~~~

UltraRAG是基于MCP架构的轻量级RAG开发框架,核心设计工程友好。其3.0版强调推理可视化,适用于科研复现、企业知识库问答等场景,还介绍了使用方式,能解决RAG落地痛点。

小华同学ai
开源动态8

6.6K标星!微软开源Agent自我优化框架,为智能体注入持续学习能力!

开发AI Agent常面临部署后难自动优化的问题。微软开源的Agent Lightning,加几行代码就能让Agent自动学习、持续优化,有事件追踪等核心能力,安装简单,应用场景丰富。

开源星探