「多模态图像生成」共找到 3049 篇相关文章
咖啡机变聪明后,我连咖啡都喝不上了
一位科技记者用升级到Alexa Plus的博世咖啡机煮咖啡遭拒,社区也有诸多类似吐槽。生成式AI助手虽能力提升,但因LLM随机性,在控制场景易翻车,新旧技术切换引发混乱,边界待明确。
深度讨论 Gemini 3 :Google 王者回归,LLM 新一轮排位赛猜想|Best Ideas
近期,OpenAI、Google、Anthropic 先后发布新模型,引发大模型竞赛。本文聚焦 Google 发布的 Gemini 3,从算力、数据、架构等维度剖析其强大原因,探讨大模型竞争新格局,还涉及多模态、硬件、商业化及产品形态等方面。
将导游装在口袋里:AI 对景区游览新赋能
同程旅行研发的“同程伴游”AI助理,能为景区游客答疑解惑,实现原生数字化导览。它可按需讲解、避免走回头路,还能生成数字旅行日记。其基于高精度定位和大语言模型,未来还将持续升级。
刚刚,Qwen3.8-Max首发上岗!「千问办公」正式开测
8月,阿里「千问办公」开启公测,它整合三款产品,还接入最新旗舰Qwen3.8 - Max。该产品交付成果可用,可一站生成多模态内容和Office产物,与钉钉打通且有组织级Skill,优势明显。
西湖大学提出RDPO强化学习框架,实现扩散模型并行推理加速
扩散模型“顺序去噪”特性成速度提升瓶颈。西湖大学AGI Lab提出RDPO框架,不必改动模型本身,优化其“采样导航系统”,在多基准测试中取得领先图像生成效果,解决加速问题并提供RLHF对齐新范式。
从CLI原理出发,如何做好AI Coding
文章从CLI原理出发探讨AI Coding,介绍CLI产品美学、技术原理,比较Single Agent与Multi Agent,还给出用好CLI写代码的建议,如正确认识AI、学习Prompt工程等,最后提及利用通义万相AIGC实现图像生成。
腾讯混元世界模型1.1开源:单卡秒级重建3D世界成为现实
腾讯混元团队开源混元世界模型1.1,它是混元3D世界模型1.0升级版。新增多视图及视频输入,单卡可部署,秒级创造3D世界。有核心突破,能处理多任务,经训练策略优化,多测试表现佳。
吞下17亿图片,Meta最强巨兽DINOv3开源!重新定义CV天花板
Meta训出70亿参数「视觉巨兽」DINOv3并完全开源。它用自监督学习,无需人工标注,可生成强大图像特征,在多任务超专用方案,NASA已用其探索火星,还能推动多行业进步。
实测Perplexity Pro平替模型,免费开源仅4B
一款仅4B大小的开源模型Jan-v1,声称能平替Perplexity Pro,且完全免费、支持本地部署。实测发现,它在检索增强生成、上下文深度分析等能力上表现不错,入门级显卡即可带动本地部署。
李飞飞World Labs双模齐发,能「造」超复杂大场景,一手实测
李飞飞的 World Labs 推出 Marble 1.1 和 Marble 1.1-Plus 两款模型。Marble 1.1 提升视觉效果,Marble 1.1-Plus 能生成更大更复杂场景。官方建议初用选 Marble 1.1,创建大场景用 1.1-Plus,还给出了实测和网友案例。