「结构化图像」共找到 1539 篇相关文章
RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑
北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。
刚刚!Kimi Linear横空出世,全新注意力架构:1M长文本解码速度飙升6.3倍,KV缓存砍掉75%
月之暗面推出全新注意力架构Kimi Linear,有望成下一代Agent LLM基石技术。它解决了LLMs处理长序列任务的瓶颈,性能超传统机制,还开源了核心代码。Kimi Linear的KDA模块提升了表达和硬件效率,实验表现佳。
后端架构新范式!阿里云专家亲揭:用RocketMQ彻底搞定多Agent异步协同难题
文章整理自阿里云专家演讲,介绍基于 Apache RocketMQ 新特性构建异步化 Multi - Agent 系统,探讨 Agent 间异步通信等机制,指出 Multi - Agent 协同关键,还讲了 RocketMQ 新特性及如何构建异步系统。
谷歌痛失王座?港科大贾佳亚团队DreamOmni2开源,超强P图暴击Nano Banana
港科大贾佳亚团队开源DreamOmni2,该模型基于FLUX Kontext,能处理多参考图像,在多模态编辑与生成上表现出色,超越谷歌Nano Banana等模型,还构建了新测试集与数据构建范式。
一张照片,一个3D「你」:计算所等提出HumanLift,实现高保真数字人重建
中国科学院计算技术研究所等机构研究人员提出 HumanLift 技术,基于单张参考图像重建高斯网数字人全身。该技术融合三维视频扩散模型和人脸增强,仅需单张人体图片就能重建高逼真三维数字人。
提效软件研发,AI Agent好用吗?
InfoQ直播邀请多位专家探讨AI4SE,提及前端知识库特点、Agent自学习等。专家认为AI目前多辅助人类,落地要重视“人”因素,还探讨了应用挑战、衡量维度、未来趋势等,QCon上海站将设专题。
瑞能半导体王越:汽车发展浪潮中,国产SiC器件机遇何在?
瑞能半导体王越在大会演讲,剖析碳化硅器件汽车应用前景,介绍瑞能车规级SiC产品布局。电动汽车电气架构集成化、电压平台高压化,为SiC器件带来机遇,瑞能技术积累深厚,产品布局全面。
Codex 和 Claude Code,用哪个?
文章探讨 Codex 和 Claude Code 的使用,建议有条件用最好的模型工具。介绍二者特点,给出文件同步、记忆文件更新、项目目录结构添加等使用方法,还强调写好 Prompt 及明确 AI 能力边界的重要性。
Karpathy泼冷水:AGI要等10年!根本没有「智能体元年」
在《Dwarkesh Podcast》访谈中,AI大佬Andrej Karpathy谈AI核心问题。他认为「智能体元年」说法过度,真正能用要十年;AGI也需十年,未来十年AI架构或基于Transformer;还分析了大模型、强化学习等现状与问题。
NeurIPS 2025 Spotlight | 条件表征学习:一步对齐表征与准则
文章指出传统表征学习处理图片和商品信息时存在局限,针对性有监督训练成本高,多模态大模型使用成本也需考虑。为此提出即插即用的条件表征学习方法 CRL,实验显示其在下游任务表现优异。