多尺度生成」共找到 5707 篇相关文章

算法论文7

3D-R1重塑三维视觉语言推理!让三维交互更智能

近年来,视觉 - 语言模型在2D图像理解有突破,但3D视觉语言模型面对复杂场景不足。为此上海大学团队提出3D - R1模型,它基于新数据集和策略构建,有强任务三维理解能力,不过也存在进步空间。

带你学AI
新闻资讯7

Google 发布 Gemini 3.8 Flash:6 周内第 3 次升级

Google DeepMind 官宣发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两个新模型。3.8 Flash 在软件工程等方面有显著提升,跑分成绩亮眼,价格实惠,性价比高;3.8 Flash Cyber 面向网络安全场景。目前 3.8 Flash 已在平台上线。

AGI Hunt
产品应用7

最强协作模型?MiniMax M2.7 实测:AI开始更会合作了 | Claude Teams

MiniMax M2.7模型发布,强调模型自我进化、Agent Harness和Agent Teams。它能构建复杂Agent Harness,完成高难度生产力任务。其能力达国际一线水平,在测试中成绩优异。还介绍了Harness、Agent Teams等概念及应用场景。

AI进修生
推荐文章7

为什么我用了那么提示词模板甚至用了 AI 帮忙还是写不好提示词?

现在很人觉得模型强大,提示词工程没必要,但复杂需求仍需它。作者以写雷军演讲提示词和YouTube字幕生成提示词为例,介绍迭代创作过程,指出写不好提示词根源是难评估差距和调整。

宝玉AI
新闻资讯7

老黄刚投的具身智能公司:三个华人创办

Dyna Robotics获1.2亿美元A轮融资,英伟达是新晋股东。该公司由三个华人创立,决定先将具身AGI带入商用场景,今年4月发布可落地商业场景的灵巧操作基础模型DYNA - 1,已在场景应用。

量子位
产品应用7

新鲜出炉!谷歌nano banana模型刷屏背后技术揭秘

谷歌Nano Banana模型刷屏,其项目负责人等揭秘技术。它有场景一致性、文本渲染等特性,团队用文本渲染能力作评估指标,还靠原生模态、交错式生成等技术,结合用户反馈实现方面进步,图像模型做PPT尚处起步。

AI寒武纪
新闻资讯7

当AI接管70%代码审查工作,剩下的30%才是 “地狱模式”

2024年初“Vibe Coding”成热词,其虽能快速验证想法,但在大型企业项目中“不可控性”凸显。亚马逊云科技研发的Kiro,尝试解决“从提示词到生产”的断裂问题。目前代码审查采用混合模式,AI仅处初级阶段。

InfoQ
推荐文章8

AI 智能体实战:100+次迭代后的意图识别提升之道

文章围绕AI智能体意图识别与槽位抽取展开,介绍初级到高阶四种方案。初级方案简单高效但意图易出错;中级解耦架构,适用于复杂场景;进阶用RAG召回解决意图识别不准;高阶应对轮对话挑战,各有优劣。

阿里云开发者
新闻资讯7

「流匹配」成ICML 2025超热门主题!网友:都说了学物理的不准转计算机

第42届国际机器学习大会(ICML)2025年7月将在加拿大举行,生成式AI前沿热点转向高质量、稳定、简洁、通用模型形态,流匹配技术踩中热点。它源于流体力学,能将噪声转化为数据,与扩散模型有紧密联系。

机器之心
8

AI 陪伴赛道,会诞生下一个「泡泡玛特」吗? | GAIR Live

AI科技评论组织“AI陪伴”线上圆桌,位从业者探讨AI陪伴是否伪命题、不同人群接受度、产品核心价值等,还讨论IP对AI硬件的重要性、硬件与软件优势、是否出海等问题。

AI科技评论