「应用视觉团队」共找到 5632 篇相关文章

开源动态8

社区供稿 | 开源多模态大模型新突破,书生·万象3.5发布,通用能力、推理能力与部署效率全面升级

2025年8月26日上海AI实验室开源发布书生·万象InternVL3.5,通过创新技术实现推理、部署和通用能力全面升级。它有多种尺寸模型,多项性能领先,还加强了智能体核心能力,应用场景广泛。

Hugging Face
算法论文8

真实场景也能批量造「险」!VLM+扩散模型打造真实域自动驾驶极限测试

浙江大学与哈工大(深圳)联合推出SafeMVDrive,将VLM关键车辆选择器与两阶段轨迹生成结合,可在真实域批量制造高保真安全关键视频,用于端到端自动驾驶系统安全性测试。

新智元
算法论文8

清华校友出手,8B硬刚GPT-4o!单一模型无限工具调用,终结多智能体

MIT等机构推出TIM和TIMRUN组合拳,突破模型token天花板。TIM将推理建模为任务树,TIMRUN优化内存管理。二者结合支持长程推理,实现单模型高效推理,简化智能体构建,在多方面表现出色。

新智元
新闻资讯7

Cloudflare 如何将 Quicksilver 迁移到多级缓存并处理数十亿个请求

Cloudflare 工程团队分享将全局键值存储 Quicksilver 过渡到分层缓存架构的故事。从 V1 到 V2 迁移,采用多级缓存策略,解决存储、一致性等问题,提升性能,多数请求可在短时间内响应。

InfoQ
新闻资讯8

奥特曼神秘晚宴讲话曝出!OpenAI的CEO或将是个AI,Chrome我也想买

OpenAI的奥特曼在晚宴勾勒宏大愿景,要颠覆搜索、社交等领域,斥资数万亿打造数据中心和新硬件,还探索脑机接口。他认为AI潜力大但处于泡沫期,也谈到GPT-5、算力融资等问题。

新智元
开源动态8

40.9K Star 数据可视化神器!Json数据处理领域的“瑞士军刀”!

在数据驱动场景中,解析复杂嵌套JSON结构费时费力。GitHub上标星40.9K的开源工具JSONCrack,能将JSON数据可视化为交互式节点图,还有转换、格式化等功能,使用简单,应用场景广。

开源星探
新闻资讯7

WRC 观察丨VLA 叙事能带来融资,但不能带来收入

本文聚焦2025年WRC展会,揭示具身智能行业现状。厂商展品增多强化‘量产元年’信号,但销售焦虑弥漫,包括销售人员扩招、渠道搭建难等。还分析不同类型机器人销售情况、应用场景及市场前景。

AI科技评论
开源动态8

腾讯开源Stand-In!轻量级身份保留视频生成新突破

生成符合指定身份的高保真视频挑战大,现有方法依赖大参数且兼容性不足。腾讯开源轻量级、即插即用的Stand - In框架,在身份保留文本生成视频任务中性能先进,兼容性强,有广阔应用潜力。

带你学AI
算法论文7

4D空间智能:AI如何一步步「看懂」时空结构?一篇综述解析通往四维世界的五大层次

4D空间智能重建整合静态场景与时空变化,构建含时间维度的空间表征系统。南洋理工等高校研究者调研该领域,提出按建构深度分五层的新视角,展现AI认知从基础到高阶的进化路径。

机器之心
开源动态8

扣子官宣开源,掀桌大动作背后如何决策?扣子负责人独家披露

7月26日,字节将AI Agent平台「扣子(Coze)」旗下Coze Studio与Coze Loop开源至GitHub,采用Apache 2.0许可证。文章披露开源决策背后故事,探讨开源版目标、定位,以及团队对Agent开发未来的思考。

InfoQ