场景图」共找到 2134 篇相关文章

开源动态7

这张信息,居然是8B开源模型做的??

商汤新开源的 8B 多模态模型 SenseNova U1,架构独特,像评测表现好,信息生成能力强、延迟低。它具备文交错能力,适合自媒体、敏感行业等,有在线体验和开源代码入口。

花叔
开源动态8

救命! Canvas?3.1k Star Mind Elixir ,真丝滑!!!!

Mind Elixir是可嵌入的JavaScript脑内核,零依赖、框架无关。它能将JSON数据变成可交互节点,有拖拽、编辑等功能。适合知识库等场景,不适合只需不可编辑宣传场景

小华同学ai
算法论文7

多模态模型挑战北京杭州地铁!o3成绩显著,但跟人类有差距

近年来,多模态大模型在多种场景取得进展,但能否‘看懂’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。

量子位
新闻资讯7

视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出仅需4秒

谷歌开放Gemini Omni Flash API,将多模态推理与视频生成编辑结合,有4项关键能力,也有局限。Nano Banana 2 Lite出快且便宜。二者串联使用,像生成与视频创作可无缝衔接。

量子位
产品应用8

揭秘!腾讯如何训练多智能体像专家一样设计游戏场景

腾讯游戏提出游戏场景自动布局生成系统IntelliScene 2.0,利用像引导生成3D场景。它构建多智能体工作流,结合高质量数据集,经模型微调、视觉解析等步骤生成场景,经评估效果良好,为AI生成三维信息提供新路径。

腾讯技术工程
算法论文8

VLM会描述视频,却未必用对参考:RefCaptioner让参考与视频语义精准对应

多模态大模型处理多参考与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。

机器之心
产品应用7

从业务场景到组织体系,“龙虾” 如何走进企业

“龙虾”火了后,从个人工具走向企业业务场景时问题不同。阿里云“虾友会”传递其进入企业的逻辑,包括解决业务场景接入,经历身份权限、岗位能力、持续运营三重门,回归运行时,最终送进企业工作流。

InfoQ
算法论文8

妙笔生维:线稿驱动的三维场景视频自由编辑

研究人员提出基于线稿的三维场景视频编辑方法Sketch3DVE,相关论文发表于SIGGRAPH 2025。它能让用户基于线稿重塑三维场景视频,解决了现有方法个性化不足、真实感差等问题,支持单目像三维视频合成和二次编辑。

机器之心
新闻资讯8

刚刚,全场景L4全球第一股诞生!市值百亿

驭势科技今日登陆港股,成全场景L4自动驾驶全球第一股。它致力于为全球交付‘AI司机’,公开发售获6777.29倍超额认购。其U - Drive®系统能力强,还将推动AI司机订购模式成熟。

新智元
推荐文章8

Anthropic长文:多智能体协作模式,五种方法及其适用场景

Anthropic官方长文总结5种多智能体协作模式及适用场景,指出何时用多智能体或单智能体更好,还分析各模式工作机制、适用场景、易翻车点,给出架构选择和新手操作建议。

AI寒武纪