图像到三维」共找到 2523 篇相关文章

开源动态7

一键式训练端端Agent,Qwen3+MCP工具集高效集成!

RLFactory是开源的端端RL后训练框架,将环境与RL后训练解耦,有极致易用、高效训练等特点。它让用户专注奖励逻辑和工具配置,还能提升训练效率,用Qwen3和MCP工具可快速训练DeepSearch模型。

GiantPandaLLM
算法论文8

效果、性能双突破,快手OneSug端端生成式框架入选AAAI 2026

查询推荐是电商搜索关键功能,传统方法有局限。快手提出OneSug端端生成式框架,统一多阶段,提升效果与效率,成果入选AAAI 2026,已在快手电商全量推广,显著提升多项指标。

机器之心
算法论文8

一键开关灯!谷歌用扩散模型,将电影级光影控制玩极致

Google推出LightLab项目,可从单张图像精准控制光影,解决传统光影控制难题。其通过特殊数据集微调扩散模型,让模型学会控制光照,还介绍了方法、后处理流程等,实验显示表现优,有多种应用。

机器之心
算法论文8

从「找视频」「产视频」:快手RaG推动推荐系统迈向完全生成时代

快手最新论文提出的 Recommendation-as-Generation(RaG),把推荐系统从「在已有视频里找答案」推进「根据用户兴趣生成答案」,已在快手大规模广告系统中部署,带来广告收入提升。

机器之心
产品应用7

不做手机缩小版:AI 健康记录迁手腕,要跨过哪些工程鸿沟?

文章聚焦HarmonyOS穿戴应用,如「小卡健康」将健康记录入口移手表,还介绍「开练」「凯格尔运动」应用。阐述了从接口产品需解决权限、断连等问题,强调要为用户提供合适体验。

AI前线
开源动态8

阿里重磅开源:端端VLM文档解析模型,图片直出结构化HTML!

在AI文字识别类应用中,文档解析常不尽人意。阿里开源端端文档解析模型Logics - Parsing,基于VLM,能图片直出结构化HTML,有统一、智能、精细等亮点,还给出使用步骤。

开源星探
推荐文章8

Loop Engineering 实战:实现从日志扫描预发部署的全自主闭环

文章分享 Loop Engineering 实战经验,指出传统维护循环存在看不见、记不住、没闭环问题。介绍了从 Prompt Loop 的四代 AI 工程化范式,阐述 Loop 原理、组件及落地实践,还提及范式迁移和踩坑教训。

阿里云开发者
算法论文8

一张照片,一个3D「你」:计算所等提出HumanLift,实现高保真数字人重建

中国科学院计算技术研究所等机构研究人员提出 HumanLift 技术,基于单张参考图像重建高斯网数字人全身。该技术融合三维视频扩散模型和人脸增强,仅需单张人体图片就能重建高逼真三维数字人。

机器之心
算法论文8

端GUI智能体首次实现“犯错-反思-修正”闭环,模拟人类认知全过程

南洋理工大学MMLab团队提出框架GUI - Reflection,让端端多模态GUI智能体有“自我反思”能力。它在各训练阶段引入“反思与纠错”机制,实验证明该框架能提升智能体能力。

量子位
新闻资讯7

传奇黑客首次造出“透明芯片”,从硬件代码全部公开可验证

8月初第34届Defcon黑客大会,主办方发放美籍华裔黑客黄欣国设计的徽章,核心是开源微控制器Baochip - 1x。该芯片从设计制造全开放可验证,用红外原位检测,还集成硬件加固手段,安全性能对标商用元件。

DeepTech深科技