「3D空间智能」共找到 5415 篇相关文章
微信技术架构部斩获CVPR 2025大赛冠军,攻克AI图文匹配评估难题
微信WXG技术架构部IH-VQA团队在CVPR2025大赛夺冠,首创iMatch图文匹配质量评估方案。文中介绍赛事背景、规则,团队通过双模型驱动等策略获胜,还构建iMatch-Benchmark评估主流T2I模型。
统一框架下的具身多模态推理:自变量机器人让AI放下海德格尔的锤子
当前先进机器人无法像人类自如用工具,现有多模态系统有局限。自变量机器人提出端到端统一架构,以统一表示学习和多任务多模态生成解锁具身多模态推理能力,实现范式转换。
MCP实战|从0到1构建异步 DeepResearch 工具,支持进度推送与超时控制
本文借助开源项目,构建可在MCP Server中异步运行的DeepResearch,支持任务进度推送与超时控制。介绍项目架构、构建步骤、任务管理器实现要点及效果测试,还提及优化方向并给出源码。
AI又来带货了!字节推出DreamActor-H1自动对齐手势和商品
在电商和数字营销领域,现有框架呈现效果不佳。字节推出DreamActor - H1框架,基于扩散变换器,集成Seaweed - 7B模型,能生成高保真人机交互视频,有效果突破但也存在局限。
Yann LeCun放出憋了20年的大招:Meta开源V-JEPA 2世界模型
Meta发布V-JEPA 2世界模型,参数高达10亿,推理速度比英伟达Cosmos快30倍。它基于Vision Transformer架构,是Yann LeCun倡导多年的JEPA路线成果,仅需62小时机器人数据训练就能执行任务,打脸质疑者。
DeepSeek们越来越聪明,却也越来越不听话了。
论文《When Thinking Fails: The Pitfalls of Reasoning for Instruction - Following in LLMs》用实验验证,模型推理能力变强时,提示词遵循能力变差。研究团队对15个模型测试,发现用CoT推理后执行准确率下降,还提出4种提升指令遵循效果的方案。
2025年哪款模型最受欢迎?Poe最新报告:DeepSeek降温、可灵成黑马
AI工具聚合平台Poe发布2025年1 - 5月人工智能模型使用趋势报告。显示模型市场份额消长明显,推理模型势头正劲,图像、视频、音频生成领域各有竞争态势,如DeepSeek降温,可灵成视频生成黑马。
AI无限生成《我的世界》,玩家动动键盘鼠标自主控制!国产交互式世界模型来了
昆仑万维带来交互式世界模型Matrix - Game,可让用户用键鼠探索创作虚拟内容。它发布了Matrix - Game - MC数据集、主模型和GameWorld Score评测体系,在多项评测中领先,还能在多领域发挥作用。
用AI把一段视频变成可视化网页,Google的新模型又卷飞了。
Google将Gemini 2.5 Pro更新为05 - 06版,此版代码能力在WebDev Arena盲测竞技场登顶,还提升视频理解能力,可将视频变成可视化网页,虽产品有不足,但模型进步值得肯定。
Claude MCP封印解除,支持对接网络工具,重磅发布应用集成和深高级研究模式
Anthropic Claude迎来重大更新,包括应用集成和高级研究模式,放开连接限制,可连接常用工具及构建自定义连接,融入工作流程,高级研究模式更智能,新功能已向部分用户开放Beta体验。