视觉-语言生成」共找到 3510 篇相关文章

新闻资讯8

黄仁勋CES最新演讲:Rubin 今年上市,计算能力是 Blackwell 5 倍、Cursor 彻底改变了英伟达的软件开发方式、开源模型落后先进模型约6个月

英伟达CEO黄仁勋在CES 2026演讲宣告AI转折,披露‘物理AI’路线图。提到开源模型突破但落后先进约6个月,还发布多款成果,如AlphaMayo、GROOT 1.6等,以及AI超算Vera Rubin,展现全栈式AI布局。

AI前线
算法论文8

三维空间太难懂?RoboTracer让机器人理解复杂空间指令,推理3D空间轨迹,开放世界也能精确行动

家庭环境复杂,让机器人理解空间指令难,现有VLM多聚焦2D推理。北航、北大等联合推出多模态大模型RoboTracer,能精准生成3D轨迹,在多项评测中领先,还能直接集成到机器人,完成复杂任务。

机器之心
开源动态8

RDSAI-CLI - 用AI重塑数据库终端CLI体验

阿里云RDS团队在发布「RDS AI助手」后,推出智能终端工具RDSAI-CLI。它融合大语言模型能力,将数据库命令行操作升级为意图式交互。该工具已开源,有基础与高级功能,未来还会持续优化。

阿里云开发者
新闻资讯7

记忆罗盘:大模型智能体记忆的表征、操作与演进航向 | 直播预约

记忆对基于大语言模型的智能体迈向通用人工智能至关重要。来自多所高校及华为的研究团队分析超30000篇论文,提出记忆表征与操作分类坐标系,绘制记忆罗盘指明演进航向。2025.12.24有相关直播。

深度学习自然语言处理
产品应用8

Lovart:设计界的Cursor,NanoBanana Pro遇上真正的Design Agent

Google的Nano Banana Pro能力亮眼,但作为设计工具商用不足。Lovart像设计界的Cursor,提供专业化设计工作流,是可用的Design Agent。文中通过案例展示其编辑能力,还介绍了PPT生成等功能及圣诞活动。

花叔
算法论文8

SIGGRAPH Asia 2025|30FPS普通相机恢复200FPS细节,4D重建方案来了

3D视觉领域难题是用普通摄像机将高速世界转为数字化4D时空。受限于成本和带宽,现有方法有局限。本文提出“异步采集 + 视频扩散模型修复”方案,用30 FPS相机恢复100 - 200 FPS动态细节。

机器之心
产品应用8

GPT-5.2 发布:做表格、写 PPT、敲代码 | 打工人的生产力利器

GPT - 5.2发布,在GDPval评测等众多基准测试中刷新行业水平。GPT - 5.2 Thinking适合真实场景与专业工作,在知识型任务、编码、长上下文处理、视觉理解、工具调用等方面表现出色,部分功能需付费使用。

AI进修生
算法论文8

全图与切片并非等价?LLaVA-UHD-v3揭示差异推出高效全图建模方案

随着多模态大模型发展,处理高分辨率图像成关键。主流视觉编码范式难兼顾性能与效率,清华和中科院团队发布 LLaVA-UHD v3,提出 PVC 框架,对比 SBE 和 GNE,验证其在提升效率同时保留模型能力。

机器之心
算法论文8

303页年度最佳AI Code综述:阿里、字节、快手30家顶级机构出品

分享303页《从代码基础模型到智能体与应用:代码智能实践指南》,由近30家顶尖机构出品。介绍2021 - 2025年代码大型语言模型发展,分析通用与代码专用LLM能力,阐明研究 - 实践差距,还开展实验。

PaperAgent
产品应用7

SpecKit 在成熟 Java 项目中的 AI 编码实践

文章分享SpecKit在成熟Java项目的AI编码实践,引入其作为规范管理工具,按标准化流程操作。介绍选型、环境准备、执行步骤,分析优缺点,还提及Qwen - Image解决AI绘画文字问题。

阿里云开发者