「多图像空间推理」共找到 2775 篇相关文章
一键开关灯!谷歌用扩散模型,将电影级光影控制玩到极致
Google推出LightLab项目,可从单张图像精准控制光影,解决传统光影控制难题。其通过特殊数据集微调扩散模型,让模型学会控制光照,还介绍了方法、后处理流程等,实验显示表现优,有多种应用。
GPT-5.4发布,AI的最强之争已经结束了!
GPT-5.4发布,作者对比OpenAI、Anthropic、Google三家模型数据发现它们不在同赛道。GPT-5.4适合白领工作,Claude擅编程,Gemini重推理与性价比,且OpenAI因合同问题流失用户。
马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1
谷歌Gemini 3将上线消息正热时,马斯克旗下xAI的Grok 4.1凌晨上线。它有两个“形态”,免费开放且有APP版。在LMArena测试中表现优异,事实稳定性、情商、创意写作等能力提升,实测也有不错表现。
Omni-Effects:首个统一多特效生成框架
Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。
【万字长文】大模型开源开发全景与趋势解读
本文以蚂蚁开源团队视角,基于OpenDigger数据,分析大模型开源开发生态。呈现2025年全景图,涵盖135项目。指出训练、推理、应用侧主导领域,还探讨生态趋势、项目兴衰及近期厂商动态。
Day0迁移、一键部署,华为开源的昇思MindSpore成为大模型开发的“万能钥匙”
在大模型无法一统天下的背景下,开发者面临在一个框架、生态体验众多主流大模型和AI技术的难题。华为开源的昇思MindSpore可实现训练Day0迁移、推理一键部署,还介绍了其相关技术和实测效果。
刚刚,OpenAI新Transformer火了!Astra架构首次曝光
OpenAI下一代Astra采用「循环深度」推理方法,思考Token减少但性能提升,不过其思考过程难监控。此前业界已对「循环Transformer」有研究,该架构适合数学编程任务,Astra实力获验证,GPT - 6或即将发布。
商汤SenseNova U1深度拆解,原生统一架构终结缝合时代
文章深度拆解商汤科技开源的新一代模型「日日新 SenseNova U1」,介绍其基于 NEO - Unify 原生统一架构,在数据、训练与推理深度协同,多维度测试成绩亮眼,代表多模态从拼接走向原生建模新方向。
开源即登榜!登顶全球前十AI编程智能体,UCL初创团队开源Prometheus
UCL初创团队EuniAI开源AI软件智能体Prometheus,在SWE - bench Verified上Pass@1达71.2%,成绩入官方主榜。它有图结构推理设计,能理解代码,成本低,官网有Demo展示其工程化能力。
基于DINOv2和SAM2改进的U-Net模型
DSU-Net是基于DINOv2和SAM2改进的U-Net模型,通过多尺度跨模型特征协作和轻量级适配器模块,解决现有图像分割模型在特定下游任务表现不足问题,提升分割精度,降低训练成本。