潜在空间」共找到 563 篇相关文章

新闻资讯7

独家 | 开普勒联合创始人胡德波成立「索塔无界」,聚焦通用基座模型+海外市场

AI科技评论独家消息,开普勒机器人联合创始人胡德波2026年4月成立索塔无界。该公司聚焦通用基座模型,以统一潜空间世界动作模型为核心,提出物理智能大脑技术路线,已与欧美企业达成合作意向。

AI科技评论
产品应用8

谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...

谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能超越现有领先模型,开发者可快速接入。

AI寒武纪
新闻资讯7

The Batch: 936 |Claude Code 内部揭秘

广受欢迎的编码智能体Claude Code近期版本意外暴露底层代码。Anthropic称是人为失误,未泄露用户数据。工程师分析发现其架构似小型专用操作系统,还揭示了潜在功能和未来规划。

DeeplearningAI
7

1.4亿宝可梦玩家,都在给AI免费打工…

1.4亿《精灵宝可梦Go》玩家10年拍300亿张实景图,为Niantic免费收集数据。Niantic用此数据训练VPS视觉定位系统,提升机器人配送效率,还获巨额投资,剥离游戏业务专注空间AI。

量子位
算法论文8

比思维链准43%!逻辑脑+大模型直觉,推理可靠性大幅提升

中德研究团队发布成果,给大模型外挂「逻辑脑」,结合答案集编程与LLM,构建神经 - 符号框架,提升空间推理准确率,让AI能说清逻辑、跨任务迁移,迈向更可靠的通用推理。

新智元
产品应用7

Omni-Effects:首个统一多特效生成框架

Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。

带你学AI
算法论文8

LeCun出手,造出视频世界模型,挑战英伟达COSMOS

训练有效世界模型面临数据、任务难度、算力消耗和评估等难题。Meta研究者提出通用视频世界模型DINO - world,可预测未来帧,在多方面有优势,实验显示其性能显著,能降低对标注数据需求。

机器之心
新闻资讯8

刚刚,谷歌摊牌:Genie 3让你1秒「进入」名画,人人可造交互世界!

谷歌新发布Genie 3世界模型,能从文本生成交互式AI空间世界,操控图像和视频。用户可进入《苏格拉底之死》《夜游者》等名画探索,还能利用它训练3D模型,实现沉浸式体验。

新智元
算法论文8

SIGIR 2025 | 视频检索新范式!北邮、北大等联合提出AV-NAS:首个音视频哈希搜索架构,让Mamba与Transformer自动“组队”

北邮、北大等团队提出 AV-NAS,在多模态视频哈希领域引入 NAS,构建含 Transformer 与 Mamba 的统一搜索空间。该方法能自动发现最优跨模态融合机制,揭示音频时序建模中“CNN + FFN”结构更优,代码已开源。

AI前线
算法论文8

打破显存墙:谢赛宁团队提出CLM,单卡RTX 4090「撬动」1亿高斯点

3D Gaussian Splatting (3DGS) 是流行的新视角合成方法,但显存容量限制其应用于大型复杂场景。谢赛宁团队提出 CLM 系统,基于 3DGS 稀疏性和空间局部性,减少通信开销,可在单卡 RTX 4090 渲染大型场景。

机器之心