多模态生成模型」共找到 8962 篇相关文章

新闻资讯7

硅谷8巨头夜会遭「宿管阿姨」驱散?AI造假首次让「肉眼死亡」

新智元报道,一张谷歌Nano Banana Pro生成的AI合影疯传,效果乱真。该模型在LMArena榜单屠榜,玩法多样,如按坐标出图等。谷歌全栈优势明显,OpenAI感受到压力正酝酿反击。

新智元
新闻资讯7

劈柴哥玩得上头!Nano Banana Pro 真杀疯了,但谷歌没接住用户的付费热情?

谷歌推出新图像生成与编辑模型 Nano Banana Pro,它基于 Gemini 3 Pro,能力提升,获大量好评。不过付费流程繁琐遭吐槽。此外,谷歌 CEO 回应了 AI 泡沫、岗位影响等问题。

AI前线
开源动态7

8秒极速生成!复杂场景图像定制低成本轻松驾驭,已开源丨字节北大联合发布

字节跳动与北大联合推出支持多条件组合的统一图像定制化生成框架DreamO,能实现主体、身份等多样化定制。与商业大模型比,它开源、成本低、速度快,8 - 10秒可完成图片定制。

量子位
开源动态8

V4Flash 的价格、Opus4.8的能力,Ox Alpha (牛来)正式开源!

Ox Alpha 匿名模型上线 OpenRouter 后表现亮眼,消耗大量 tokens 并终结 DeepSeek 霸榜纪录。官方揭晓其为智谱 GLM - 5.3 Flash,价格低、能力强,经多场景测试,多模态理解等维度达顶尖水平。

歸藏的AI工具箱
新闻资讯7

The Batch: 973|Claude 的水印如何运作

Anthropic将在2026年8月2日后发布的Claude模型全球部署肉眼不可见、机器可读的水印,用于表明文本和图像由其生成。该技术基于Google的SynthID - Text,不过此公告引发广泛争议。

DeeplearningAI
产品应用7

让小爱音箱超越「指令-响应」模式,开启真正智能交互新时代

2017年智能音箱诞生,却被困于「指令 - 响应」模式。此次Open - XiaoAI进化,接管小爱音箱“耳朵”和“嘴巴”,通过多模态模型和AI Agent释放其潜力,还给出项目运行教程等。

GitHubStore
产品应用8

教机器人干活,光“刷课时”可不够!灵初这次较真数据质量

本文聚焦机器人学习人类操作的数据痛点,灵初智能提出逆向生成强配对数据的新思路,升级Psi-R2.5模型,提升数据可用性,降低新任务适配成本,方案已落地客户现场。

量子位
新闻资讯8

请回答2026:38位中国AI关键人物的Magic Moment和趋势判断|甲子光年

甲子光年与38位中国AI关键人物对话,总结2025年Magic Moment,展望2026年技术趋势。2025年是中国AI关键年,2026年大家不再聚焦大模型,更关注多模态、智能体等‘系统级智能’突破。

甲子光年
产品应用7

首发丨手机的『魔法挂件』,实测钉钉dingtalk A1,有用的好帮手

2025年基于大模型的AI硬件焕发生机,钉钉dingtalk A1是其中代表。它厚度仅3.8mm,使用方便,具备会议录音转写、纪要生成、通话分析等功能,还能用于学习和生活场景。

鲸选AI
开源动态7

15.1k,谷歌Notebook LM本地开源替代!

Open Notebook是开源、本地化且重隐私的Google Notebook LM替代方案。它支持超16家供应商,能整理多模态内容、生成专业播客,在多方面比Google Notebook LM更具优势。

PaperAgent