通用视觉语言」共找到 2219 篇相关文章

产品应用8

超越Runway!Adobe发布新神器:P视频比P图还简单

Adobe联合多高校推出AI模型EditVerse,它将图片和视频编辑整合,解决传统视频编辑复杂、数据稀缺问题。通过通用视觉语言、上下文学习能力和知识迁移,其效果超Runway,还展现涌现能力。

新智元
8

大模型思维链推理速度倍增!——RoT新框架把思维链「画」进隐空间

随着大模型规模扩展,思维链(CoT)成处理复杂推理任务标准范式,但显式CoT依赖长序列生成,隐式CoT面临优化挑战。腾讯提出RoT新框架,利用视觉编码器将文本推理步骤转为视觉嵌入,实现Token压缩与推理加速,且过程可分析。

腾讯技术工程
开源动态8

万帧照片级仿真,打通视觉机器人学习的感知与物理鸿沟:国产仿真器GS-Playground入选RSS 2026

清华大学等联合提出高通量视觉高保真仿真器GS - Playground,被RSS 2026录用。它解决现有仿真器渲染开销高、资产制作依赖人工、Sim2Real迁移鸿沟大等问题,是全栈重新设计的仿真基础设施。

机器之心
开源动态8

社区供稿 | 开源多模态大模型新突破,书生·万象3.5发布,通用能力、推理能力与部署效率全面升级

2025年8月26日上海AI实验室开源发布书生·万象InternVL3.5,通过创新技术实现推理、部署和通用能力全面升级。它有多种尺寸模型,多项性能领先,还加强了智能体核心能力,应用场景广泛。

Hugging Face
推荐文章7

从 3 个月业余项目到全球第一语言!Python 之父坦言:当年“将就”的代码,如今全都真香了

Python 之父 Guido van Rossum 在 Python 编程语言峰会上提出‘Worse is better’理论现在是否还适用的问题。回顾早期开发,Python 受 UNIX 精神影响,以‘够用就好’理念快速推出,如今面临新功能开发慢、社区贡献不均等问题。

InfoQ
算法论文8

仅保留35% Token,性能反超原模型!快手可灵等用视觉信息引导音频压缩,推理时间直降42%

Omni - LLM计算浪费严重,快手可灵等团队提出OmniSIFT框架。它利用音视频非对称依赖关系,通过时空联合剪枝压缩视频、视觉引导筛选音频Token,大幅减少Token数量,提升性能和推理效率。

量子位
开源动态8

社区供稿 | Hugging Face x 北京中关村学院等机构联合发布生成式基因组大模型Carbon:一场关于“生命语言”的范式革命

北京中关村学院等联合发布生成式基因组大模型Carbon并开源。Carbon家族有三个版本,旗舰模型Carbon - 3B在多任务匹敌70亿参数的Evo2 - 7B,运行速度快275倍。它在数据、分词、训练上有创新,还实现技术普惠,有多种应用场景。

Hugging Face
开源动态8

真6,上线几天,轻松斩获10k,首款开源通用AI智能体Suna:一句话自动处理Excel/爬数据/写报告,程序员私人助理诞生!

Suna是Kortix推出的全球首个开源通用型AI Agent,核心突破是“执行力”,能像人类员工操作数字工具。它开源透明,是全能数字员工,已落地多场景,有五大核心功能。还给出部署方法和同类对比。

小华同学ai
算法论文8

为什么自监督永远学不到语义?

《Visual Language Hypothesis》论文用纤维丛理论审视视觉表征学习,指出只做连续变换难触达语义。分析现有无监督学习不足,提出“Expand - and - Snap”机制,还通过实验验证,提供审视AI架构新视角。

深度学习自然语言处理
新闻资讯8

刚刚,Figure 03惊天登场!四年狂造10万台,人类保姆集体失业

通用机器人曙光来临,Figure 03正式亮相,专为Helix「大脑」打造,手掌心有摄像头,指尖能感知3克力。其进化亮点多,未来四年将量产十万台,适用于家庭和商用场景。

新智元