通用视觉感知系统」共找到 1588 篇相关文章

产品应用8

4K超分Agent修图师来了!一键救活所有模糊照片

传统图像放大模型应对复杂情况力不从心,4KAgent应运而生。它基于多智能体设计,有感知、复原等模块,能为图像定制4K超分方案,在多领域测试中表现出色,无需特定领域再训练。

量子位
新闻资讯7

AI为啥不懂物理世界?李飞飞、杨立昆:缺个「世界模型」,得学大脑新皮质工作

近来,杨立昆计划离开Meta创立以‘世界模型’为核心的AI公司;此前李飞飞也发文指出大语言模型弊端,强调建立‘世界模型’重要性。该模型源于对大语言模型局限的反思,能让AI理解物理世界。

量子位
产品应用8

将导游装在口袋里:AI 对景区游览新赋能

同程旅行研发的“同程伴游”AI助理,能为景区游客答疑解惑,实现原生数字化导览。它可按需讲解、避免走回头路,还能生成数字旅行日记。其基于高精度定位和大语言模型,未来还将持续升级。

AI前线
开源动态8

开源即爆火!英伟达重磅推出OmniVinci全模态大模型

英伟达在华盛顿GTC大会开源OmniVinci全模态大语言模型,实现视觉、音频、语言统一理解。它性能超竞品,架构有创新,数据引擎庞大。实验有重要洞察,在多场景表现佳,代表全新AI范式。

机器之心
推荐文章7

舍弃 VAE,预训练语义编码器能让 Diffusion 走得更远吗?

纽约大学谢赛宁团队、清华&快手 Kling 团队的研究者指出 VAE 制约当前 Diffusion 范式,提出用预训练视觉模型作语义编码器改进。介绍了 VAE 不足及 RAE、SVG 工作如何解决问题,将扩散模型从‘压缩优先’转为‘语义优先’。

机器之心
开源动态8

DeepSeek开源新模型,提出上下文光学压缩:LLM的新记忆方式

DeepSeek开源OCR模型,探索用多少视觉信息让LLM理解文本。实验表明1000字文档约需100个vision tokens,压缩比10倍、准确率97%。还提出模拟人类遗忘等想法,有多种应用场景,且完全开源。

花叔
产品应用8

AI 原生设备爆发,操作系统迎来更智慧、更流畅、更安全的范式革命

AI原生设备爆发,传统操作系统面临挑战,将迎来范式革命。vivo蓝河操作系统3(BlueOS 3)全栈自研,具备“天生更智慧、更流畅、更安全”特质,本文以此为例解读操作系统架构重塑。

InfoQ
产品应用8

Notion 3.0 |AI转型最成功的互联网产品是怎么做的?

Notion更新3.0,可视为有所有上下文的通用Agent产品,能调用顶尖模型。它有基础AI能力,如选模型、加上下文等,还升级了Agent创建、MCP等功能,依托生态让提示词可变现。

歸藏的AI工具箱
产品应用8

字节跳动Seed推出「机器人大脑」Robix:让机器人学会思考、规划与灵活互动

近日,字节跳动Seed团队发布「机器人大脑」Robix,它将推理、任务规划与人机交互整合到单个端到端多模态模型。通过层次化架构分工,它能灵活互动,经三阶段训练,在多方面表现出色,为具身智能体发展奠基。

机器之心
开源动态7

阿里最新开源王炸Agent!性能全面SOTA!

阿里WebAgent更新频繁,基本一月一版。它是类似DeepResearch的通用智能体,历经WebWalker到WebWatcher多阶段演进,各阶段解决不同问题,如网页导航、自主信息搜集等,还不断优化训练数据生成与处理方式。

探索AGI