「3D空间理解」共找到 3059 篇相关文章
闹玩呢!首届大模型对抗赛,DeepSeek、Kimi第一轮被淘汰了
谷歌发起首届大模型国际象棋对抗赛,为期三天。参赛模型众多,首轮中 Gemini 2.5 Pro、o4 - mini、Grok 4 和 o3 以 4 - 0 战绩晋级半决赛,DeepSeek、Kimi 首轮被淘汰,目前 Grok 4 是夺冠热门。
构建会“说话”和“行动”的 AI:生成式数字人技术与 EchoMimic 实践
在 QCon 全球软件开发大会上,支付宝李宇明围绕 EchoMimic 介绍生成式数字人进展、技术、应用及研究思路。对比传统数字人,生成式数字人成本低、易控制,但也有技术新、推理成本高的问题。EchoMimic 两版本已开源,经优化推理速度可提升。
ICCV 2025|UV-CoT:无监督视觉推理新突破,偏好优化重塑图像级思维链
随着文本领域思维链推理机制成功应用,研究者将其引入视觉理解任务。现有模型有局限,本文提出UV - CoT新框架,设计无监督数据生成与偏好优化机制,提升模型能力,摆脱对人工标注依赖。
吴恩达YC演讲:AI创业如何快人一步?
吴恩达在YC演讲为AI创业者建议,强调执行速度是衡量创业公司成功的重要指标。他探讨AI技术加速工程和产品反馈等,还谈及AI创业机会在应用层,给出提升创业公司速度的方法等。
下一代AI需要「思想微积分」!华人团队重磅揭秘,AI方法论三连发
来自美国两所大学的华人团队发布「AI方法论三部曲」,提出「能力实现率(CRR)」模型、「认知几何学」框架,指出处于AI的「元语言时刻」,未来迈向「思想微积分」时代,从多维度构建理解AI的世界观。
「Tokens是胡扯」,Mamba作者抛出颠覆性观点,揭露Transformer深层缺陷
Mamba作者Albert Gu在博客中探讨状态空间模型(SSM)和Transformer权衡,抛出‘Tokens是胡扯’观点,揭露Transformer深层缺陷,如分词问题、处理噪声能力弱等,还分析两类模型特点及结合优势。
7B小模型超越DeepSeek-R1:模仿人类教师,弱模型也能教出强推理LLM | Transformer作者团队
Transformer作者之一创立的Sakana AI带来新方法,让教师模型像人类教师一样做启发式教学,根据已知解决方案输出解释。用此方法训练的7B小模型在传授推理技能上比671B的DeepSeek - R1更有效。
突破视频时长限制!Manus上架视频生成功能,网友:比Sora更好
Manus上架视频生成功能,可通过连续拼接突破时长限制。它按“拍电影”方式,根据提示词生成片段再合成故事。网友评价是新创作方式,但效果有提升空间,部分人认为比Sora好。
ETT:打破原生多模态学习视觉瓶颈,重塑视觉tokenizer优化范式
本文由多机构联合完成,针对传统视觉 tokenization 方法优化与下游任务训练割裂问题,提出 ETT 调优方法。它实现联合优化,在多模态理解、生成、重构任务表现出色,虽有局限但带来新突破。
LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%
最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试集考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。