图像结构纹理」共找到 939 篇相关文章

新闻资讯7

十万美元的机械狗,正在“排泄”你的肖像!

迈阿密巴塞尔艺术展上,售价十万美元的《普通动物》由三只戴扎克伯格、马斯克和安迪·沃霍尔面具的机械狗组成,内置摄像头捕捉观众与环境,AI生成图像后“排泄”出实体作品,引发不同评价。

搜狐看展
产品应用8

硬刚Sora2,万相2.6轻松定制角色、控制分镜,普通人也能当导演

2025 年视频生成领域发展迅猛,OpenAI 的 Sora 2 带来新玩法,商业落地加速,但普通用户体验门槛高。12 月 16 日阿里发布万相 2.6 系列模型,功能全面升级,实测效果惊人,标志 AI 视频生成迈向精准可控新阶段。

机器之心
产品应用8

阿里电影级视频模型万相2.6系列上线,功能比Sora2还全,人人都能当导演

12月16日,阿里发布通义万相2.6系列模型,5款新模型同时上线,覆盖图像到视频多环节。它是国内首个支持角色扮演的视频模型,功能比Sora2全,已上线阿里云百炼和万相官网。

AI前线
算法论文7

预测下一个像素还需要几年?谷歌:五年够了

谷歌DeepMind研究者分析下一像素预测在图像识别与生成任务中的扩展特性。实验显示其扩展趋势与文本类似但效率低,最优策略因任务和分辨率而异,预计未来五年逐像素建模可行。

机器之心
开源动态8

2M大小模型定义表格理解极限,清华大学崔鹏团队开源LimiX-2M

大语言模型在结构化表格数据处理上表现不佳,清华大学崔鹏团队开源的 LimiX-2M 模型,仅 2M 参数,却能同时支持分类、回归等任务,性能超越经典模型,且训练、运行成本低,科研友好。

机器之心
算法论文8

别再只关注KV Cache了! LLM稀疏性新洞察:为何模型越深越稀疏?UNCOMP从矩阵熵给出答案

团队论文UNCOMP获EMNLP 2025主会接收,它提出高效推理框架,从截断矩阵熵视角解释LLM深层稀疏现象。还能识别关键结构、找到最优压缩策略,设计的UNCOMP框架优化KV Cache,实验效果佳。

深度学习自然语言处理
新闻资讯7

中国算力芯片的“新十年”

文章指出过去40年处理器芯片发展呈“否定之否定”,近年整机和平台厂商重归自研,异构计算成趋势。未来中国算力芯片突破口在指令系统结构统一,可把RISC - V作统一指令系统开发各类芯片。

芯师爷
算法论文8

登上NeurIPS,Genesis开创无需OCC引导的多模态生成新范式,在视频与激光雷达指标上达到SOTA水平

华中科技大学与小米汽车提出多模态图像 - 点云联合生成框架Genesis,采用两阶段架构和DataCrafter模块。在nuScenes数据集实验显示,其在视频与激光雷达指标达SOTA水平,还提升了下游感知任务效果。

机器之心
算法论文8

Apple发布新SOTA Manzano:混合Tokenizer破解多模态统一难题,理解与生成双翼齐飞

多模态AI前景广,但现有模型在理解和生成任务上存在性能冲突。苹果提出Manzano模型,用混合视觉标记器降低任务冲突,结构简单可扩展,在多基准测试达SoTA水平,还展示图像编辑潜力。

深度学习自然语言处理
产品应用8

字节Seedream 4.0将全量开放!抢先评测来了,我们摸索出AI生图20种「邪修」玩法

近日,字节跳动内测豆包・图像创作模型 Seedream 4.0,支持多模态生图,核心能力显著提升。它将全量上线并开放给企业客户。实测显示其多模态融合出色,还与谷歌 Nano Banana 对比,各有优势。

机器之心