图像重建」共找到 568 篇相关文章

产品应用7

用最简单的大模型技术打造一个迁云专家有多难?

文章探讨在云迁移领域用大模型技术“复制”专家80%核心能力。分析标准化方案不足及简单RAG局限,介绍“LX0.1”AI专家助手构建,还提及分层评测、人机协同等优化,最后展望AI在云迁移的未来方向。

阿里云开发者
开源动态7

Ultralytics & lightly-train:简化计算机视觉模型训练,无需标签

在计算机视觉领域,获取带标签数据成本高、耗时长。开源项目 lightly-train 用未标记图像和视频自监督预训练,减少标注成本与时间,可集成到现有训练管道,支持多种模型架构和应用场景。

机器学习AI算法工程
算法论文8

无需NeRF/高斯点后处理,视频秒变游戏模型成现实!新方法平均每帧仅需60秒 | ICCV 2025

KAUST团队提出全新方法V2M4,能从单目视频直接生成高质量、显式的4D网格动画资源。该方法构建多阶段流程,涵盖相机轨迹恢复等关键步骤,平均每帧约60秒,比现有方法显著提速,论文已被ICCV 2025接收。

量子位
开源动态8

无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab

图像、长视频让大型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。

量子位
Product Application7

PDF难点解析:处理复杂表格、水印、印章、复选框、信息抽取等7项任务,6大能力

文章介绍Nanonets - OCR - s可处理关键信息提取、视觉问答等7项任务,具备LaTeX方程识别、图像描述等6项能力,还给出体验链接。但测试发现英文体验优于中文,模型有重复输出、幻觉严重问题。

CourseAI
产品应用8

拳打可灵,脚踢 Veo 3,谁是物理世界的「懂王」?

多模态视频生成大模型是复杂系统工程,多为巨头游戏。MiniMax的Hailuo 02发布,ELO得分超谷歌Veo 3和快手Kling 2.0。它能呈现复杂运动,处理物理关系,提升训练推理效率,成本低,后续还将更新。

AI科技评论
开源动态8

自定义轨迹驱动AI视频生成,ATI无需训练适配多种生成模型

字节提出视频生成运动控制统一框架ATI,通过轻量级运动注入器将用户定义轨迹投影至预训练图像 - 视频生成模型潜在空间,实现协调控制。用户指定关键点及路径控制运动,无需重新训练,适配不同架构。

带你学AI
产品应用7

实测惊艳全球的Veo3!音画同步无敌,贵是有原因的

谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。

机器之心
产品应用8

Meta首个Agent生图模型登场,空降竞技场第二

Meta超智能实验室推出图像生成模型Muse Image,引入智能体机制,能编写代码、网络搜索,有自主修正能力,支持算力扩展、多轮编辑与画面合成。还预览了Muse Video,两模型均与Meta产品深度整合。

AI寒武纪
新闻资讯8

Altman 亲自坐镇发布 ChatGPT Image 2,小编实测:风格、画质、叙事感全都夯爆了

OpenAI CEO Sam Altman 亲自发布 ChatGPT Images 2.0,这是该公司迄今功能最强的图像生成模型。它有思考能力,可直出 8 张连贯图片,支持多语言、多种画幅与分辨率,能精准执行复杂指令,直接商用也没问题。

InfoQ