多模态条件控制」共找到 1472 篇相关文章

产品应用7

Nano Banana Pro或将引爆新安全危机

基于Gemini 3的图像生成模型Nano Banana Pro昨日上线,支持2K/4K分辨率生成,排版和文字控制能力提升。它展现出复杂推理能力,能理解反光、推理指纹,但这或带来隐私危机。

AI工程化
开源动态8

“零人”搞医学研究:清华AI智能体从灵感到论文全程自主

清华大学自动化系索津莉课题组发布全自主AI研究框架OpenLens AI,实现医学研究全链条自动化闭环,解决医疗信息学研究效率困局,将科研周期从“月级”缩至“小时级”,还在质量控制上设新标杆。

量子位
新闻资讯7

GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉

清华教授、智谱唐杰在𝕏征集GLM下个版本意见,浏览量达40w+。此前他有求必应,网友热情参与。这次评论区多要视觉能力,因GLM-5.2是纯文本模型,而对手多为多模态

量子位
开源动态8

突然猛涨7K+ star!阿里开源的前端增强项目火了!

阿里开源的前端增强项目 PageAgent 火了,在 GitHub 获 8k+ star。它是纯前端 JavaScript GUI 智能体框架,可让网页拥有 AI Agent,通过自然语言控制界面,有自动填表单等功能,使用简单。

开源先锋
产品应用8

阿里 Qwen3-TTS 两大更新直接封神!支持跨物种音色克隆,3 秒复刻!

阿里通义上线 Qwen3-TTS 两大核心能力,VoiceDesign 支持全文本控制音色特征,VoiceClone 能 3 秒音频跨语言、跨物种克隆音色。更新指标亮眼,如 0.1 秒级生成速度等,还可上手体验。

开源星探
推荐文章7

从 Shopify 构建 Agent 的经验中可以学到的

Shopify 分享构建 Agent 经验,采用主流 Agentic Loop 架构。给出4条打造 AI 智能体核心建议,还指出工具控制在20个内,可用 SubAgent 分摊上下文;用人类标记结果作基准让 LLM 评估 Agent 生成结果。

宝玉AI
算法论文8

LeCun发布最新世界模型:首次实现16秒连贯场景预测,具身智能掌握第一视角!还打脸用了VAE

LeCun团队推出PEVA模型,让具身智能体学会人类“预判能力”,首次实现16秒连贯场景预测。它结合结构化动作表示与条件扩散Transformer,用真实数据训练,解决长时序问题,还能筛选最优动作。

量子位
产品应用7

千问办公初体验:“三合一”更好用吗?

作者体验阿里千问办公内测版,它是三合一AI产品Qwenwork。虽系统设计距Codex有差距,但整合优势对普通用户有意义,具备CLI化、生态打通、多模态、拓展生态等特点,不过还需打磨。

鲸选AI
新闻资讯7

大模型低价趋势延续!智象未来姚霆:B端、C端界限模糊,API不够、逼出 “按结果付费”

InfoQ 采访智象未来联合创始人姚霆,探讨多模态大模型发展。他指出深度 Scaling up 收益放缓,广度 Scaling up 有惊喜;2025 年模型价格战倒逼厂商加速,低价趋势 2026 年将延续,商业模式转向“按结果付费”。

InfoQ
推荐文章8

YC 编写的 《Vibe Coding 指南》

本文是 YC 编写的《Vibe Coding 指南》,采访多位创始人总结出 AI 协作编程指南,涵盖规划流程、版本控制、测试框架等多方面,还提及 AI 在编码外的应用及持续改进方法。

宝玉AI