「视觉语义场景补全」共找到 2626 篇相关文章
「百万级」视频推理数据集!30+顶尖高校联合发布
AI视频生成已能「画得像」,但不会「想得对」。VBVR推出百万级视频推理数据集,首次系统评测模型对空间、物理、逻辑和抽象的推理能力,发现顶尖模型通过率仅68%,推动视频AI从「视觉模仿」迈向「智能推理」。
从「北纬社区龙虾大赛」到「中关村论坛人工智能主题日」:海淀AI的新叙事
3月22日「中关村・北纬龙虾大赛决赛」举办,展现AI走向「生活化」场景。3月25 - 29日将进行「第三届中关村论坛人工智能主题日系列活动」。海淀京张遗址公园AI创新带串联多方资源,推动AI发展,北京正构建城市级AI操作系统。
李诞的虾,把搞 AI 的都看沉默了
飞书「玩虾大会」直播中,李诞现场教呼兰在飞书上养虾。诞虾能理解意图建边界、实事求是判断合作、犀利评价呼兰虾,还能依场景调整表达。李诞养虾好因重表达和思考,AI可照见灵魂。
OpenClaw 最新必装10个Skills实战教程,真正做到养智能"小龙虾"
本文介绍2026年爆火的开源AI智能体OpenClaw,它能通过自然语言指令接管电脑执行复杂工作流。文章整理出10个必装Skills,涵盖实时搜索、网页自动化等场景,还给出安装方法、实战案例及常见问题解答,助用户搭建稳定环境。
年前看到最有深度的AI下半场Agents记忆机制综述
本文是一篇83页的基础智能体记忆机制综述,由27家机构联合发表。提出AI研究范式转变,记忆是填补理想与现实差距的关键。构建三维统一分类框架,介绍记忆操作、学习策略、评估体系、应用场景及未来方向。
为什么微信不直接在群里加AI?
2026年春节档互联网竞争激烈,腾讯携元宝入局。元宝派脱胎于腾讯会议AI探索,旨在打造AI社交空间。微信内测在群里用元宝,但仅自己可见。腾讯选择体外循环路径,让元宝派重新定义社交场景。
前端同事看走眼了,这个“游戏网页”其实全是AI写的!
Kimi K2.5上新,集视觉理解、代码生成等能力于一体,提供四种使用模式,其中Agent集群模式提效显著。实测显示其网页生成、动效理解能力出色,下一代K3模型或用新架构KDA降低计算成本。
千问接入淘宝、闪购、飞猪,意味着什么?
2026 年初千问升级,上线任务助理并接入淘宝、闪购等。其能处理常见任务,但更重要的是可解决用户衣食住行等实际问题,虽目前部分场景待优化,但阿里有优势,不过千问也面临体验、协同和商业化挑战。
原生3D-VAEs,1536³三维分辨率,清华与微软TRELLIS 2开启3D全能生成新纪元
清华与微软团队推出TRELLIS 2系统,用全新O-Voxel表示法,1分钟生成1536³分辨率3D资产。它解决拓扑灵活性与存储效率矛盾,结合SC-VAE和流匹配模型,在多方面超越现有模型,还能适应不同场景。
GPT-5.2果然反超谷歌Gemini 3 Pro!北大数院校友核心贡献
OpenAI在成立十周年推出GPT - 5.2,相比GPT - 5.1在多实用领域更强,视觉理解等能力提升。ARC - AGI测试中得分超谷歌Gemini 3 Pro。拆解其多方面能力,还介绍核心团队多为数学专业新面孔。